Пилот ИИ-сериала за 900₽ на GPU c Kandinsky 6: как я проверил, что персонажи вообще говорят
daniel_ivanov 19 минут назад Объяснить с Пилот ИИ-сериала за 900₽ на GPU c Kandinsky 6: как я проверил, что персонажи вообще говорят Простой 3 мин 604 Работа с видео * Обработка изображений * Кейс Я попросил провести...
Will Anthropic have the best AI model at the end of October 2026?
Значимый прорыв формирует отрасль ИИ: daniel_ivanov 19 минут назад Объяснить с Пилот ИИ-сериала за 900₽ на GPU c Kandinsky 6: как я проверил, что персонажи вообще говорят Простой 3 мин 604 Работа с видео * Обработка изображений * Кейс Я попросил провести эксперимент с коротким сериалом. Агент собрал пилот: ролик на 52,2 секунды, 19 планов, три вымышленных персонажа и английские диалоги. Есть и промо на 22,4 секунды.
Генерация шла на одной арендованной RTX PRO 6000 в Selectel. За сессию вышло четыре оплаченных часа, около 900 ₽. Kandinsky - показался трагедиейПервую сборку я посмотрел со звуком и понял, что половины разговоров не слышно.
Технические детали
Сначала винил Kandinsky. Прогнал расшифровку сырых клипов через Whisper small. en: все 16 реплик произнесены правильно, у 12 совпадение с текстом полное.
Проблема была в сборке. Kandinsky начинает говорить через 2-3 секунды после начала клипа, а сборщик обрезал каждый клип до длины реплики с нулевой секунды. В итог попадала тишина, а речь отрезалась, пошел фиксить.
Агент добавил speech_window(): функция находит первый всплеск громче −42 дБ в окне 50 мс и оставляет 0,25 секунды до него. Я оставил Kandinsky 6 после сравнения кадров с Wan2. 2Публичного рейтинга, где Kandinsky 6, Wan2.
Отраслевые последствия
2 и SkyReels-V3 стояли бы рядом, нет. В Artificial Analysis на 10. MiniMax H3 и MAGI-2 в лидерах открытых весов тоже не стали вариантом: H3 требует четыре карты, а его открытая лицензия запрещает использовать или показывать результаты в США, ЕС, Великобритании и Корее (тут как бы спорно, но если делать - то делать хорошо, на весь мир).
На одной карте и на мастер-кадрах получилась такая разница:Kandinsky 6 Pro (NVFP4, ComfyUI)Wan2. 2-S2V + голос из Qwen3-TTSГолоссвой на каждый план, между планами плывётодин на персонажа, реплика точно по текстуВремя на клип 5 с144 с в тёплом состоянии≈9 минут при 480×832Стоимость клипа≈9 ₽≈20-35 ₽Картинкабольше жеста и светастабильное лицо, спокойная камера; рот иногда движется слишком широкоЛицензияMIT, но аудио-VAE в рецепте ComfyUI - CC-BY-NC-4. 0 у Wan и Qwen3-TTSWan с зафиксированным голосом выглядит сильнее для диалоговых крупных планов.
Я посмотрел первые кадры рядом с Kandinsky и оставил Kandinsky 6 для пилота, мое субъективное мнение. NVFP4 сократил время Pro до 144 секунд на клипKandinsky Pro-distill в NVFP4 через ComfyUI 0. 39 дал 144 секунды на warmed-up генерацию клипа.
Этот прогресс даёт важные сигналы о будущем отрасли, и технологический мир внимательно наблюдает.






