
Нейросеть Flux 3
Видео-модель Black Forest Labs: пять режимов — по тексту, по фото, первый и последний кадр, ключевые кадры с временными метками и продолжение видео; 720p/1080p, 5–20 секунд, генерация аудио.
Flux 3 — обзор AI-генератора видео, возможности и сравнение
Flux 3 — первая публичная видеомодель Black Forest Labs, построенная на мультимодальной архитектуре Self-Flow. Она создаёт ролики длиной 5–20 секунд из текста, изображений и ключевых кадров, продолжает исходное видео и одновременно генерирует диалоги, эффекты и фон с lip-sync. Нативное разрешение — 720p, Full HD доступно через апскейлинг.
Для каких задач подходит Flux 3
Как правильно составлять промпты для Flux 3
Для FLUX 3 лучше писать промпт как краткое режиссёрское задание: последовательно указать сцену, героя, действие, камеру, свет и стиль. Отдельно задавайте длительность, формат кадра, реплики, звуки и временные метки ключевых событий.
- Сначала опишите главный объект и действие, затем окружение, освещение, стилистику и детали кадра.
- Задавайте движение камеры явно: статичный план, панорама, наезд, облёт, ручная съёмка или трекинг.
- Для управляемого сюжета указывайте события по секундам и связывайте их с ключевыми кадрами.
- Реплики заключайте в кавычки, отмечайте язык, тембр голоса, акцент и нужную эмоциональную подачу.
- Указывайте длительность, разрешение и соотношение сторон с учётом площадки: от 9:16 до 21:9.
- Вместо длинного списка запретов формулируйте желаемый результат позитивно и описывайте видимые признаки.
Вертикальное видео 9:16, 10 секунд. Флакон духов на чёрном стекле, медленный круговой облёт камеры, золотая пыль в воздухе, контрастный студийный свет, тихий звон стекла и глубокий эмбиент.
Кинематографичная сцена, 16:9, 15 секунд. Девушка входит в ночное кафе, камера плавно следует за ней. На 6-й секунде она говорит по-русски: «Я знала, что ты придёшь». Тихий дождь, естественный lip-sync.
Видео 12 секунд, 21:9. 0 с: пустынная дорога на рассвете. 4 с: в кадр въезжает красный спорткар. 8 с: камера поднимается над машиной. 12 с: общий план гор; слышны двигатель, ветер и щебет птиц.
Преимущества и недостатки
Преимущества
- Единый backbone Self-Flow совместно работает с изображениями, видео и аудио, а не объединяет несколько разрозненных моделей.
- Нативно генерирует диалоги, звуковые эффекты и атмосферный звук с синхронизацией речи, акцентов и движения губ.
- Поддерживает генерацию по тексту, фото и ключевым кадрам, преобразование и продолжение исходного видео.
- Принимает до 10 референсных изображений и до 4 секунд видео со звуком, помогая сохранять персонажей и визуальный стиль.
- Создаёт ролики длиной 5–20 секунд в 720p, поддерживает 1080p через апскейлинг и форматы кадра от 9:16 до 21:9.
Недостатки
- Версия Early Access распространяется по проприетарной лицензии; обещанный вариант FLUX 3 Dev с открытыми весами выйдет позднее.
- Один клип ограничен длительностью 20 секунд, поэтому длинные сцены приходится собирать через agentic chaining из нескольких генераций.
- Разрешение 1080p достигается апскейлингом, тогда как нативная генерация выполняется в 720p и может сохранять меньше мелких деталей.
- Публичные сравнительные результаты пока предварительные: разработчик не раскрыл размер выборки, методологию и число оценщиков.
Технические возможности
Параметры модели
| Стоимость | 700 токенов за 720p и 1200 токенов за 1080p/ 1 секунда |
|---|---|
| Контекстное окно | Видео длительностью 5–20 секунд; 720p нативно, 1080p через апскейлинг; форматы кадра от 9:16 до 21:9 |
| Дата выпуска | Август 2026 года, Early Access |
| Разработчик | Black Forest Labs, Германия |
| Тип модели | Мультимодальная foundation-модель на архитектуре Self-Flow: видео, изображения, аудио и action prediction |
| Работа с файлами | Текст, до 10 изображений, ключевые кадры и до 4 секунд исходного видео с аудио для продолжения |
| Ключевые преимущества | Единая модель совместно генерирует видео и синхронизированный звук, включая диалоги, эффекты и окружение. Поддерживает lip-sync, multilingual-речь, продолжение видео и управляемые ключевые кадры. |
| Работа с русским языком | Хорошо: заявлена поддержка multilingual-диалогов, естественных акцентов и lip-sync, однако независимые тесты качества русской речи пока ограничены. |
Сравнение с конкурентами
| Параметр | Flux 3 | Runway Gen-4.5 | Kling v3 Pro |
|---|---|---|---|
| Контекст / разрешение | Видео длительностью 5–20 секунд; 720p нативно, 1080p через апскейлинг; форматы кадра от 9:16 до 21:9 | Видео до 10 секунд, обычно 720p в доступных режимах | До 1080p; доступная длительность зависит от выбранного режима |
| Дата выпуска | Август 2026 года, Early Access | Декабрь 2025 года | 2026 год |
| Разработчик | Black Forest Labs, Германия | Runway | Kuaishou |
| Тип модели | Мультимодальная foundation-модель на архитектуре Self-Flow: видео, изображения, аудио и action prediction | Проприетарная модель генерации и преобразования видео | Проприетарная мультимодальная модель генерации видео |
| Сильные стороны | Единая модель совместно генерирует видео и синхронизированный звук, включая диалоги, эффекты и окружение. Поддерживает lip-sync, multilingual-речь, продолжение видео и управляемые ключевые кадры. | Зрелая экосистема Runway с инструментами монтажа, управления сценами и командной работы. | Сильная работа с реалистичным движением, управлением камерой и кинематографичными сценами. |
| Слабые стороны | Версия Early Access распространяется по проприетарной лицензии; обещанный вариант FLUX 3 Dev с открытыми весами выйдет позднее. | В предварительном тесте BFL для 10-секундных роликов 720p с аудио FLUX 3 предпочли в 77% сравнений; независимой проверки пока нет. | В предварительных парных тестах BFL FLUX 3 получила 60% предпочтений, однако методология и размер выборки не опубликованы. |
Часто задаваемые вопросы
Что такое FLUX 3 и когда модель была выпущена?
FLUX 3 — первый публичный продукт Black Forest Labs для генерации видео и первый мультимодальный backbone компании. Он совместно обрабатывает изображения, видео, аудио и action prediction на архитектуре Self-Flow. Модель анонсировали 23 июля 2026 года, а выпуск FLUX 3 Video в Early Access через BFL API и партнёров состоялся в августе 2026 года.
Какие режимы генерации поддерживает FLUX 3?
Модель создаёт видео по тексту или изображению, преобразует исходный ролик, продолжает видео и строит сцены между ключевыми кадрами с временными метками. Можно загрузить до 10 референсных изображений либо до 4 секунд видео со звуком. Отдельные клипы длятся 5–20 секунд, а agentic chaining позволяет собирать из них многоэпизодные последовательности.
Умеет ли FLUX 3 генерировать звук и речь?
Да. FLUX 3 нативно создаёт аудио одновременно с видеорядом: диалоги, звуковые эффекты и фоновую атмосферу. Поддерживается многоязычная речь с естественными акцентами и синхронизацией движения губ. Поскольку звук и изображение обучались совместно в одной модели, их согласование не требует отдельной внешней модели озвучивания.
Насколько убедительны заявленные результаты FLUX 3 в сравнительных тестах?
В предварительных тестах BFL ранний FLUX 3 предпочли Runway Gen-4.5 в 77% сравнений, Kling v3 Pro — в 60%, а Luma Ray 3.2 — в 93%. Сравнивались 10-секундные ролики 720p, созданные по тексту и дополненные аудио. Эти цифры следует трактовать осторожно: выборка, число оценщиков и полная методология пока не раскрыты.
Сколько стоит использование FLUX 3 на STIVA?
На STIVA модель доступна по подписке без отдельной оплаты API или самостоятельного договора с Black Forest Labs. Стоимость списывается из токенного баланса: генерация в 720p расходует 700 токенов за секунду итогового видео, а в 1080p — 1200 токенов за секунду. Например, десятисекундный ролик потребует 7000 или 12 000 токенов соответственно.
Flux 3
Провайдер: Black Forest Labs
Видео-модель Black Forest Labs: пять режимов — по тексту, по фото, первый и последний кадр, ключевые кадры с временными метками и продолжение видео; 720p/1080p, 5–20 секунд, генерация аудио.
Flux 3 — обзор AI-генератора видео, возможности и сравнение
Flux 3 — первая публичная видеомодель Black Forest Labs, построенная на мультимодальной архитектуре Self-Flow. Она создаёт ролики длиной 5–20 секунд из текста, изображений и ключевых кадров, продолжает исходное видео и одновременно генерирует диалоги, эффекты и фон с lip-sync. Нативное разрешение — 720p, Full HD доступно через апскейлинг.
Для каких задач подходит Flux 3
Как правильно составлять промпты для Flux 3
Для FLUX 3 лучше писать промпт как краткое режиссёрское задание: последовательно указать сцену, героя, действие, камеру, свет и стиль. Отдельно задавайте длительность, формат кадра, реплики, звуки и временные метки ключевых событий.
- Сначала опишите главный объект и действие, затем окружение, освещение, стилистику и детали кадра.
- Задавайте движение камеры явно: статичный план, панорама, наезд, облёт, ручная съёмка или трекинг.
- Для управляемого сюжета указывайте события по секундам и связывайте их с ключевыми кадрами.
- Реплики заключайте в кавычки, отмечайте язык, тембр голоса, акцент и нужную эмоциональную подачу.
- Указывайте длительность, разрешение и соотношение сторон с учётом площадки: от 9:16 до 21:9.
- Вместо длинного списка запретов формулируйте желаемый результат позитивно и описывайте видимые признаки.
Вертикальное видео 9:16, 10 секунд. Флакон духов на чёрном стекле, медленный круговой облёт камеры, золотая пыль в воздухе, контрастный студийный свет, тихий звон стекла и глубокий эмбиент.
Кинематографичная сцена, 16:9, 15 секунд. Девушка входит в ночное кафе, камера плавно следует за ней. На 6-й секунде она говорит по-русски: «Я знала, что ты придёшь». Тихий дождь, естественный lip-sync.
Видео 12 секунд, 21:9. 0 с: пустынная дорога на рассвете. 4 с: в кадр въезжает красный спорткар. 8 с: камера поднимается над машиной. 12 с: общий план гор; слышны двигатель, ветер и щебет птиц.
Преимущества и недостатки
Преимущества
- Единый backbone Self-Flow совместно работает с изображениями, видео и аудио, а не объединяет несколько разрозненных моделей.
- Нативно генерирует диалоги, звуковые эффекты и атмосферный звук с синхронизацией речи, акцентов и движения губ.
- Поддерживает генерацию по тексту, фото и ключевым кадрам, преобразование и продолжение исходного видео.
- Принимает до 10 референсных изображений и до 4 секунд видео со звуком, помогая сохранять персонажей и визуальный стиль.
- Создаёт ролики длиной 5–20 секунд в 720p, поддерживает 1080p через апскейлинг и форматы кадра от 9:16 до 21:9.
Недостатки
- Версия Early Access распространяется по проприетарной лицензии; обещанный вариант FLUX 3 Dev с открытыми весами выйдет позднее.
- Один клип ограничен длительностью 20 секунд, поэтому длинные сцены приходится собирать через agentic chaining из нескольких генераций.
- Разрешение 1080p достигается апскейлингом, тогда как нативная генерация выполняется в 720p и может сохранять меньше мелких деталей.
- Публичные сравнительные результаты пока предварительные: разработчик не раскрыл размер выборки, методологию и число оценщиков.
Технические возможности
Параметры модели
| Стоимость | 700 токенов за 720p и 1200 токенов за 1080p/ 1 секунда |
|---|---|
| Контекстное окно | Видео длительностью 5–20 секунд; 720p нативно, 1080p через апскейлинг; форматы кадра от 9:16 до 21:9 |
| Дата выпуска | Август 2026 года, Early Access |
| Разработчик | Black Forest Labs, Германия |
| Тип модели | Мультимодальная foundation-модель на архитектуре Self-Flow: видео, изображения, аудио и action prediction |
| Работа с файлами | Текст, до 10 изображений, ключевые кадры и до 4 секунд исходного видео с аудио для продолжения |
| Ключевые преимущества | Единая модель совместно генерирует видео и синхронизированный звук, включая диалоги, эффекты и окружение. Поддерживает lip-sync, multilingual-речь, продолжение видео и управляемые ключевые кадры. |
| Работа с русским языком | Хорошо: заявлена поддержка multilingual-диалогов, естественных акцентов и lip-sync, однако независимые тесты качества русской речи пока ограничены. |
Сравнение с конкурентами
| Параметр | Flux 3 | Runway Gen-4.5 | Kling v3 Pro |
|---|---|---|---|
| Контекст / разрешение | Видео длительностью 5–20 секунд; 720p нативно, 1080p через апскейлинг; форматы кадра от 9:16 до 21:9 | Видео до 10 секунд, обычно 720p в доступных режимах | До 1080p; доступная длительность зависит от выбранного режима |
| Дата выпуска | Август 2026 года, Early Access | Декабрь 2025 года | 2026 год |
| Разработчик | Black Forest Labs, Германия | Runway | Kuaishou |
| Тип модели | Мультимодальная foundation-модель на архитектуре Self-Flow: видео, изображения, аудио и action prediction | Проприетарная модель генерации и преобразования видео | Проприетарная мультимодальная модель генерации видео |
| Сильные стороны | Единая модель совместно генерирует видео и синхронизированный звук, включая диалоги, эффекты и окружение. Поддерживает lip-sync, multilingual-речь, продолжение видео и управляемые ключевые кадры. | Зрелая экосистема Runway с инструментами монтажа, управления сценами и командной работы. | Сильная работа с реалистичным движением, управлением камерой и кинематографичными сценами. |
| Слабые стороны | Версия Early Access распространяется по проприетарной лицензии; обещанный вариант FLUX 3 Dev с открытыми весами выйдет позднее. | В предварительном тесте BFL для 10-секундных роликов 720p с аудио FLUX 3 предпочли в 77% сравнений; независимой проверки пока нет. | В предварительных парных тестах BFL FLUX 3 получила 60% предпочтений, однако методология и размер выборки не опубликованы. |
Часто задаваемые вопросы
Что такое FLUX 3 и когда модель была выпущена?
FLUX 3 — первый публичный продукт Black Forest Labs для генерации видео и первый мультимодальный backbone компании. Он совместно обрабатывает изображения, видео, аудио и action prediction на архитектуре Self-Flow. Модель анонсировали 23 июля 2026 года, а выпуск FLUX 3 Video в Early Access через BFL API и партнёров состоялся в августе 2026 года.
Какие режимы генерации поддерживает FLUX 3?
Модель создаёт видео по тексту или изображению, преобразует исходный ролик, продолжает видео и строит сцены между ключевыми кадрами с временными метками. Можно загрузить до 10 референсных изображений либо до 4 секунд видео со звуком. Отдельные клипы длятся 5–20 секунд, а agentic chaining позволяет собирать из них многоэпизодные последовательности.
Умеет ли FLUX 3 генерировать звук и речь?
Да. FLUX 3 нативно создаёт аудио одновременно с видеорядом: диалоги, звуковые эффекты и фоновую атмосферу. Поддерживается многоязычная речь с естественными акцентами и синхронизацией движения губ. Поскольку звук и изображение обучались совместно в одной модели, их согласование не требует отдельной внешней модели озвучивания.
Насколько убедительны заявленные результаты FLUX 3 в сравнительных тестах?
В предварительных тестах BFL ранний FLUX 3 предпочли Runway Gen-4.5 в 77% сравнений, Kling v3 Pro — в 60%, а Luma Ray 3.2 — в 93%. Сравнивались 10-секундные ролики 720p, созданные по тексту и дополненные аудио. Эти цифры следует трактовать осторожно: выборка, число оценщиков и полная методология пока не раскрыты.
Сколько стоит использование FLUX 3 на STIVA?
На STIVA модель доступна по подписке без отдельной оплаты API или самостоятельного договора с Black Forest Labs. Стоимость списывается из токенного баланса: генерация в 720p расходует 700 токенов за секунду итогового видео, а в 1080p — 1200 токенов за секунду. Например, десятисекундный ролик потребует 7000 или 12 000 токенов соответственно.