Flux 3

Нейросеть Flux 3

Видео-модель Black Forest Labs: пять режимов — по тексту, по фото, первый и последний кадр, ключевые кадры с временными метками и продолжение видео; 720p/1080p, 5–20 секунд, генерация аудио.

Стоимость генерации: 3500
Про Flux 3

Flux 3 — обзор AI-генератора видео, возможности и сравнение

Flux 3 — первая публичная видеомодель Black Forest Labs, построенная на мультимодальной архитектуре Self-Flow. Она создаёт ролики длиной 5–20 секунд из текста, изображений и ключевых кадров, продолжает исходное видео и одновременно генерирует диалоги, эффекты и фон с lip-sync. Нативное разрешение — 720p, Full HD доступно через апскейлинг.

Для каких задач подходит Flux 3

Рекламные ролики товаров
Создание коротких продуктовых видео по описанию или фото: движение камеры, демонстрация деталей, анимированная типографика, музыка и звуковые эффекты.
Сюжетные сцены и раскадровки
Генерация сцен длительностью 5–20 секунд с заданными персонажами, окружением и камерой. Ключевые кадры с временными метками помогают управлять развитием эпизода.
Видео с озвученным диалогом
Создание роликов с синхронной речью, естественными акцентами и lip-sync. Модель одновременно генерирует изображение, диалог, фоновые звуки и атмосферу.
Продолжение готового видео
Продление исходного клипа с сохранением движения, визуального стиля и звуковой среды. В качестве контекста можно передать до четырёх секунд видео вместе с аудио.
Многокадровые истории для соцсетей
Сборка нескольких клипов в связанную последовательность через agentic chaining. Подходит для вертикальных историй, тизеров и более длинных многоэпизодных видео.
Анимированный дизайн и титры
Генерация заставок, постеров в движении, титров и брендовых композиций. FLUX 3 ориентирован на точную типографику и согласованную анимацию элементов.

Как правильно составлять промпты для Flux 3

Для FLUX 3 лучше писать промпт как краткое режиссёрское задание: последовательно указать сцену, героя, действие, камеру, свет и стиль. Отдельно задавайте длительность, формат кадра, реплики, звуки и временные метки ключевых событий.

  • Сначала опишите главный объект и действие, затем окружение, освещение, стилистику и детали кадра.
  • Задавайте движение камеры явно: статичный план, панорама, наезд, облёт, ручная съёмка или трекинг.
  • Для управляемого сюжета указывайте события по секундам и связывайте их с ключевыми кадрами.
  • Реплики заключайте в кавычки, отмечайте язык, тембр голоса, акцент и нужную эмоциональную подачу.
  • Указывайте длительность, разрешение и соотношение сторон с учётом площадки: от 9:16 до 21:9.
  • Вместо длинного списка запретов формулируйте желаемый результат позитивно и описывайте видимые признаки.
Создаёт рекламный ролик
Вертикальное видео 9:16, 10 секунд. Флакон духов на чёрном стекле, медленный круговой облёт камеры, золотая пыль в воздухе, контрастный студийный свет, тихий звон стекла и глубокий эмбиент.
Ставит сцену с диалогом
Кинематографичная сцена, 16:9, 15 секунд. Девушка входит в ночное кафе, камера плавно следует за ней. На 6-й секунде она говорит по-русски: «Я знала, что ты придёшь». Тихий дождь, естественный lip-sync.
Управляет ключевыми кадрами
Видео 12 секунд, 21:9. 0 с: пустынная дорога на рассвете. 4 с: в кадр въезжает красный спорткар. 8 с: камера поднимается над машиной. 12 с: общий план гор; слышны двигатель, ветер и щебет птиц.

Преимущества и недостатки

Преимущества

  • Единый backbone Self-Flow совместно работает с изображениями, видео и аудио, а не объединяет несколько разрозненных моделей.
  • Нативно генерирует диалоги, звуковые эффекты и атмосферный звук с синхронизацией речи, акцентов и движения губ.
  • Поддерживает генерацию по тексту, фото и ключевым кадрам, преобразование и продолжение исходного видео.
  • Принимает до 10 референсных изображений и до 4 секунд видео со звуком, помогая сохранять персонажей и визуальный стиль.
  • Создаёт ролики длиной 5–20 секунд в 720p, поддерживает 1080p через апскейлинг и форматы кадра от 9:16 до 21:9.

Недостатки

  • Версия Early Access распространяется по проприетарной лицензии; обещанный вариант FLUX 3 Dev с открытыми весами выйдет позднее.
  • Один клип ограничен длительностью 20 секунд, поэтому длинные сцены приходится собирать через agentic chaining из нескольких генераций.
  • Разрешение 1080p достигается апскейлингом, тогда как нативная генерация выполняется в 720p и может сохранять меньше мелких деталей.
  • Публичные сравнительные результаты пока предварительные: разработчик не раскрыл размер выборки, методологию и число оценщиков.

Технические возможности

Единая архитектура Self-Flow
Self-Flow объединяет понимание и генерацию в мультимодальной flow-matching-архитектуре. Изображения, видео и аудио обучаются совместно, а не обрабатываются отдельными моделями.
Шесть режимов генерации
Модель поддерживает text-to-video, image-to-video, video-to-video, продолжение клипов, генерацию по ключевым кадрам, а также синтез и редактирование изображений.
Нативный синхронный звук
FLUX 3 генерирует диалоги, звуковые эффекты и окружающую атмосферу одновременно с видеорядом. Поддерживаются разные языки, естественные акценты и синхронизация губ.
Гибкие параметры видео
Клипы создаются длительностью от 5 до 20 секунд в нативном 720p или Full HD через апскейлинг. Доступны форматы кадра от вертикального 9:16 до широкого 21:9.
Работа с референсами
Для согласования персонажей, объектов и стиля можно использовать до десяти изображений. Продолжение принимает до четырёх секунд исходного видео вместе со звуковой дорожкой.
Цепочки связанных сцен
Agentic chaining позволяет последовательно соединять сгенерированные клипы в многоракурсные истории длительностью до нескольких минут, сохраняя сюжетную и визуальную связность.

Параметры модели

Стоимость700 токенов за 720p и 1200 токенов за 1080p/ 1 секунда
Контекстное окноВидео длительностью 5–20 секунд; 720p нативно, 1080p через апскейлинг; форматы кадра от 9:16 до 21:9
Дата выпускаАвгуст 2026 года, Early Access
РазработчикBlack Forest Labs, Германия
Тип моделиМультимодальная foundation-модель на архитектуре Self-Flow: видео, изображения, аудио и action prediction
Работа с файламиТекст, до 10 изображений, ключевые кадры и до 4 секунд исходного видео с аудио для продолжения
Ключевые преимуществаЕдиная модель совместно генерирует видео и синхронизированный звук, включая диалоги, эффекты и окружение. Поддерживает lip-sync, multilingual-речь, продолжение видео и управляемые ключевые кадры.
Работа с русским языкомХорошо: заявлена поддержка multilingual-диалогов, естественных акцентов и lip-sync, однако независимые тесты качества русской речи пока ограничены.

Сравнение с конкурентами

ПараметрFlux 3Runway Gen-4.5Kling v3 Pro
Контекст / разрешениеВидео длительностью 5–20 секунд; 720p нативно, 1080p через апскейлинг; форматы кадра от 9:16 до 21:9Видео до 10 секунд, обычно 720p в доступных режимахДо 1080p; доступная длительность зависит от выбранного режима
Дата выпускаАвгуст 2026 года, Early AccessДекабрь 2025 года2026 год
РазработчикBlack Forest Labs, ГерманияRunwayKuaishou
Тип моделиМультимодальная foundation-модель на архитектуре Self-Flow: видео, изображения, аудио и action predictionПроприетарная модель генерации и преобразования видеоПроприетарная мультимодальная модель генерации видео
Сильные стороныЕдиная модель совместно генерирует видео и синхронизированный звук, включая диалоги, эффекты и окружение. Поддерживает lip-sync, multilingual-речь, продолжение видео и управляемые ключевые кадры.Зрелая экосистема Runway с инструментами монтажа, управления сценами и командной работы.Сильная работа с реалистичным движением, управлением камерой и кинематографичными сценами.
Слабые стороныВерсия Early Access распространяется по проприетарной лицензии; обещанный вариант FLUX 3 Dev с открытыми весами выйдет позднее.В предварительном тесте BFL для 10-секундных роликов 720p с аудио FLUX 3 предпочли в 77% сравнений; независимой проверки пока нет.В предварительных парных тестах BFL FLUX 3 получила 60% предпочтений, однако методология и размер выборки не опубликованы.

Часто задаваемые вопросы

Что такое FLUX 3 и когда модель была выпущена?

FLUX 3 — первый публичный продукт Black Forest Labs для генерации видео и первый мультимодальный backbone компании. Он совместно обрабатывает изображения, видео, аудио и action prediction на архитектуре Self-Flow. Модель анонсировали 23 июля 2026 года, а выпуск FLUX 3 Video в Early Access через BFL API и партнёров состоялся в августе 2026 года.

Какие режимы генерации поддерживает FLUX 3?

Модель создаёт видео по тексту или изображению, преобразует исходный ролик, продолжает видео и строит сцены между ключевыми кадрами с временными метками. Можно загрузить до 10 референсных изображений либо до 4 секунд видео со звуком. Отдельные клипы длятся 5–20 секунд, а agentic chaining позволяет собирать из них многоэпизодные последовательности.

Умеет ли FLUX 3 генерировать звук и речь?

Да. FLUX 3 нативно создаёт аудио одновременно с видеорядом: диалоги, звуковые эффекты и фоновую атмосферу. Поддерживается многоязычная речь с естественными акцентами и синхронизацией движения губ. Поскольку звук и изображение обучались совместно в одной модели, их согласование не требует отдельной внешней модели озвучивания.

Насколько убедительны заявленные результаты FLUX 3 в сравнительных тестах?

В предварительных тестах BFL ранний FLUX 3 предпочли Runway Gen-4.5 в 77% сравнений, Kling v3 Pro — в 60%, а Luma Ray 3.2 — в 93%. Сравнивались 10-секундные ролики 720p, созданные по тексту и дополненные аудио. Эти цифры следует трактовать осторожно: выборка, число оценщиков и полная методология пока не раскрыты.

Сколько стоит использование FLUX 3 на STIVA?

На STIVA модель доступна по подписке без отдельной оплаты API или самостоятельного договора с Black Forest Labs. Стоимость списывается из токенного баланса: генерация в 720p расходует 700 токенов за секунду итогового видео, а в 1080p — 1200 токенов за секунду. Например, десятисекундный ролик потребует 7000 или 12 000 токенов соответственно.

Flux 3

Провайдер: Black Forest Labs

Видео-модель Black Forest Labs: пять режимов — по тексту, по фото, первый и последний кадр, ключевые кадры с временными метками и продолжение видео; 720p/1080p, 5–20 секунд, генерация аудио.

Flux 3 — обзор AI-генератора видео, возможности и сравнение

Flux 3 — первая публичная видеомодель Black Forest Labs, построенная на мультимодальной архитектуре Self-Flow. Она создаёт ролики длиной 5–20 секунд из текста, изображений и ключевых кадров, продолжает исходное видео и одновременно генерирует диалоги, эффекты и фон с lip-sync. Нативное разрешение — 720p, Full HD доступно через апскейлинг.

Для каких задач подходит Flux 3

Рекламные ролики товаров
Создание коротких продуктовых видео по описанию или фото: движение камеры, демонстрация деталей, анимированная типографика, музыка и звуковые эффекты.
Сюжетные сцены и раскадровки
Генерация сцен длительностью 5–20 секунд с заданными персонажами, окружением и камерой. Ключевые кадры с временными метками помогают управлять развитием эпизода.
Видео с озвученным диалогом
Создание роликов с синхронной речью, естественными акцентами и lip-sync. Модель одновременно генерирует изображение, диалог, фоновые звуки и атмосферу.
Продолжение готового видео
Продление исходного клипа с сохранением движения, визуального стиля и звуковой среды. В качестве контекста можно передать до четырёх секунд видео вместе с аудио.
Многокадровые истории для соцсетей
Сборка нескольких клипов в связанную последовательность через agentic chaining. Подходит для вертикальных историй, тизеров и более длинных многоэпизодных видео.
Анимированный дизайн и титры
Генерация заставок, постеров в движении, титров и брендовых композиций. FLUX 3 ориентирован на точную типографику и согласованную анимацию элементов.

Как правильно составлять промпты для Flux 3

Для FLUX 3 лучше писать промпт как краткое режиссёрское задание: последовательно указать сцену, героя, действие, камеру, свет и стиль. Отдельно задавайте длительность, формат кадра, реплики, звуки и временные метки ключевых событий.

  • Сначала опишите главный объект и действие, затем окружение, освещение, стилистику и детали кадра.
  • Задавайте движение камеры явно: статичный план, панорама, наезд, облёт, ручная съёмка или трекинг.
  • Для управляемого сюжета указывайте события по секундам и связывайте их с ключевыми кадрами.
  • Реплики заключайте в кавычки, отмечайте язык, тембр голоса, акцент и нужную эмоциональную подачу.
  • Указывайте длительность, разрешение и соотношение сторон с учётом площадки: от 9:16 до 21:9.
  • Вместо длинного списка запретов формулируйте желаемый результат позитивно и описывайте видимые признаки.
Создаёт рекламный ролик
Вертикальное видео 9:16, 10 секунд. Флакон духов на чёрном стекле, медленный круговой облёт камеры, золотая пыль в воздухе, контрастный студийный свет, тихий звон стекла и глубокий эмбиент.
Ставит сцену с диалогом
Кинематографичная сцена, 16:9, 15 секунд. Девушка входит в ночное кафе, камера плавно следует за ней. На 6-й секунде она говорит по-русски: «Я знала, что ты придёшь». Тихий дождь, естественный lip-sync.
Управляет ключевыми кадрами
Видео 12 секунд, 21:9. 0 с: пустынная дорога на рассвете. 4 с: в кадр въезжает красный спорткар. 8 с: камера поднимается над машиной. 12 с: общий план гор; слышны двигатель, ветер и щебет птиц.

Преимущества и недостатки

Преимущества

  • Единый backbone Self-Flow совместно работает с изображениями, видео и аудио, а не объединяет несколько разрозненных моделей.
  • Нативно генерирует диалоги, звуковые эффекты и атмосферный звук с синхронизацией речи, акцентов и движения губ.
  • Поддерживает генерацию по тексту, фото и ключевым кадрам, преобразование и продолжение исходного видео.
  • Принимает до 10 референсных изображений и до 4 секунд видео со звуком, помогая сохранять персонажей и визуальный стиль.
  • Создаёт ролики длиной 5–20 секунд в 720p, поддерживает 1080p через апскейлинг и форматы кадра от 9:16 до 21:9.

Недостатки

  • Версия Early Access распространяется по проприетарной лицензии; обещанный вариант FLUX 3 Dev с открытыми весами выйдет позднее.
  • Один клип ограничен длительностью 20 секунд, поэтому длинные сцены приходится собирать через agentic chaining из нескольких генераций.
  • Разрешение 1080p достигается апскейлингом, тогда как нативная генерация выполняется в 720p и может сохранять меньше мелких деталей.
  • Публичные сравнительные результаты пока предварительные: разработчик не раскрыл размер выборки, методологию и число оценщиков.

Технические возможности

Единая архитектура Self-Flow
Self-Flow объединяет понимание и генерацию в мультимодальной flow-matching-архитектуре. Изображения, видео и аудио обучаются совместно, а не обрабатываются отдельными моделями.
Шесть режимов генерации
Модель поддерживает text-to-video, image-to-video, video-to-video, продолжение клипов, генерацию по ключевым кадрам, а также синтез и редактирование изображений.
Нативный синхронный звук
FLUX 3 генерирует диалоги, звуковые эффекты и окружающую атмосферу одновременно с видеорядом. Поддерживаются разные языки, естественные акценты и синхронизация губ.
Гибкие параметры видео
Клипы создаются длительностью от 5 до 20 секунд в нативном 720p или Full HD через апскейлинг. Доступны форматы кадра от вертикального 9:16 до широкого 21:9.
Работа с референсами
Для согласования персонажей, объектов и стиля можно использовать до десяти изображений. Продолжение принимает до четырёх секунд исходного видео вместе со звуковой дорожкой.
Цепочки связанных сцен
Agentic chaining позволяет последовательно соединять сгенерированные клипы в многоракурсные истории длительностью до нескольких минут, сохраняя сюжетную и визуальную связность.

Параметры модели

Стоимость700 токенов за 720p и 1200 токенов за 1080p/ 1 секунда
Контекстное окноВидео длительностью 5–20 секунд; 720p нативно, 1080p через апскейлинг; форматы кадра от 9:16 до 21:9
Дата выпускаАвгуст 2026 года, Early Access
РазработчикBlack Forest Labs, Германия
Тип моделиМультимодальная foundation-модель на архитектуре Self-Flow: видео, изображения, аудио и action prediction
Работа с файламиТекст, до 10 изображений, ключевые кадры и до 4 секунд исходного видео с аудио для продолжения
Ключевые преимуществаЕдиная модель совместно генерирует видео и синхронизированный звук, включая диалоги, эффекты и окружение. Поддерживает lip-sync, multilingual-речь, продолжение видео и управляемые ключевые кадры.
Работа с русским языкомХорошо: заявлена поддержка multilingual-диалогов, естественных акцентов и lip-sync, однако независимые тесты качества русской речи пока ограничены.

Сравнение с конкурентами

ПараметрFlux 3Runway Gen-4.5Kling v3 Pro
Контекст / разрешениеВидео длительностью 5–20 секунд; 720p нативно, 1080p через апскейлинг; форматы кадра от 9:16 до 21:9Видео до 10 секунд, обычно 720p в доступных режимахДо 1080p; доступная длительность зависит от выбранного режима
Дата выпускаАвгуст 2026 года, Early AccessДекабрь 2025 года2026 год
РазработчикBlack Forest Labs, ГерманияRunwayKuaishou
Тип моделиМультимодальная foundation-модель на архитектуре Self-Flow: видео, изображения, аудио и action predictionПроприетарная модель генерации и преобразования видеоПроприетарная мультимодальная модель генерации видео
Сильные стороныЕдиная модель совместно генерирует видео и синхронизированный звук, включая диалоги, эффекты и окружение. Поддерживает lip-sync, multilingual-речь, продолжение видео и управляемые ключевые кадры.Зрелая экосистема Runway с инструментами монтажа, управления сценами и командной работы.Сильная работа с реалистичным движением, управлением камерой и кинематографичными сценами.
Слабые стороныВерсия Early Access распространяется по проприетарной лицензии; обещанный вариант FLUX 3 Dev с открытыми весами выйдет позднее.В предварительном тесте BFL для 10-секундных роликов 720p с аудио FLUX 3 предпочли в 77% сравнений; независимой проверки пока нет.В предварительных парных тестах BFL FLUX 3 получила 60% предпочтений, однако методология и размер выборки не опубликованы.

Часто задаваемые вопросы

Что такое FLUX 3 и когда модель была выпущена?

FLUX 3 — первый публичный продукт Black Forest Labs для генерации видео и первый мультимодальный backbone компании. Он совместно обрабатывает изображения, видео, аудио и action prediction на архитектуре Self-Flow. Модель анонсировали 23 июля 2026 года, а выпуск FLUX 3 Video в Early Access через BFL API и партнёров состоялся в августе 2026 года.

Какие режимы генерации поддерживает FLUX 3?

Модель создаёт видео по тексту или изображению, преобразует исходный ролик, продолжает видео и строит сцены между ключевыми кадрами с временными метками. Можно загрузить до 10 референсных изображений либо до 4 секунд видео со звуком. Отдельные клипы длятся 5–20 секунд, а agentic chaining позволяет собирать из них многоэпизодные последовательности.

Умеет ли FLUX 3 генерировать звук и речь?

Да. FLUX 3 нативно создаёт аудио одновременно с видеорядом: диалоги, звуковые эффекты и фоновую атмосферу. Поддерживается многоязычная речь с естественными акцентами и синхронизацией движения губ. Поскольку звук и изображение обучались совместно в одной модели, их согласование не требует отдельной внешней модели озвучивания.

Насколько убедительны заявленные результаты FLUX 3 в сравнительных тестах?

В предварительных тестах BFL ранний FLUX 3 предпочли Runway Gen-4.5 в 77% сравнений, Kling v3 Pro — в 60%, а Luma Ray 3.2 — в 93%. Сравнивались 10-секундные ролики 720p, созданные по тексту и дополненные аудио. Эти цифры следует трактовать осторожно: выборка, число оценщиков и полная методология пока не раскрыты.

Сколько стоит использование FLUX 3 на STIVA?

На STIVA модель доступна по подписке без отдельной оплаты API или самостоятельного договора с Black Forest Labs. Стоимость списывается из токенного баланса: генерация в 720p расходует 700 токенов за секунду итогового видео, а в 1080p — 1200 токенов за секунду. Например, десятисекундный ролик потребует 7000 или 12 000 токенов соответственно.