
Немската лаборатория Black Forest Labs (BFL) обяви на 23 юли 2026 г. новия си модел FLUX 3 — единна мултимодална система, която генерира изображения, видео до 20 секунди и, за първи път в историята на компанията, звук, вграден директно в самото видео. Според официалния блог на BFL FLUX 3 обхваща изображения, видео, аудио и дори „предсказване на действия” (action prediction) в една архитектура, а стартът е с ограничен ранен достъп.
Какво може новият модел
FLUX 3 е замислен като един модел за много модалности вместо отделни инструменти за картинка, видео и звук. За видеото това означава пълен набор от режими:
- текст → видео (text-to-video),
- изображение → видео — продължаване от начален кадър (анимация) или използване на снимка като визуален референс,
- видео → видео — пренасяне на елементи от референтен клип в нов контекст,
- преход по ключови кадри (keyframe-to-video) за контролирани движения между зададени моменти.
Максималната дължина на един клип е 20 секунди при 720p, но чрез верижно свързване на сцени (agentic chaining) BFL твърди, че последователностите могат да достигнат няколко минути. Моделът поддържа многоезичен диалог, различни стилове — от „любителски” кадри до кинематографичност — и по-точно изписване на текст в изображенията.
Снимка: Black Forest Labs
Защо native audio е важна крачка
Досегашните видео модели обикновено генерират картина, а звукът се добавя отделно после. При FLUX 3 аудиото се създава като част от същия процес — репликите, шумовете и ефектите се синхронизират с това, което се случва на екрана. Както се изразява BFL, „звукът трябва да пасне на удара” и на останалите физически събития в кадъра.
Това е повече от удобство. Съвместното генериране на образ и звук изисква моделът да разбира причинно-следствената връзка между това, което вижда, и това, което чува — стъпка към по-достоверно „разбиране на физическия свят”. За BFL, чиито предишни модели FLUX.1 и FLUX.2 бяха силни най-вече в статичните изображения, native audio видеото е първо по рода си постижение.
С какво се различава от предишните версии
Технически FLUX 3 стъпва върху методология, която BFL нарича Self-Flow — единен мултимодален трансформър с отделни енкодери и декодери за всяка модалност. Компанията твърди, че подходът превъзхожда класическите flow-matching методи както по качество, така и по разбиране на физиката, при „значително увеличени изчислителни и данни ресурси” спрямо FLUX.2.
В свои вътрешни, предварителни тестове върху 10-секундни клипове BFL съобщава, че FLUX 3 е бил предпочетен пред конкурентите в:
| Сравнение | Дял в полза на FLUX 3 |
|---|---|
| срещу Luma Ray 3.2 | 93% |
| срещу Runway Gen-4.5 | 77% |
| срещу Grok Imagine Video | 69% |
| срещу Kling v3 Pro | 60% |
| срещу Seedance 2.0 | 52% |
| срещу Gemini Omni Flash | 52% |
Самата компания подчертава, че резултатите са предварителни и без независима проверка, така че към тях е разумно да подхождате със здравословна доза скептицизъм.
Освен видеото и изображенията, FLUX 3 носи и action prediction — режим, насочен към роботиката. Вариантът FLUX-mimic вече е в производствено тестване при Audi чрез партньорство с Mimic Robotics за задачи по сръчна манипулация.
Защо стартира с ограничен достъп
FLUX 3 не се пуска наведнъж за всички. Разгъването е поетапно:
- FLUX 3 Video (със или без native audio) е достъпен още сега — но само през ранен достъп по заявка;
- FLUX 3 Image ще излезе „в следващите седмици”;
- FLUX 3 Action засега е само за партньори;
- FLUX 3 Dev — версията с отворени тегла (open weights) — е планирана по-нататък.
Причината за ограничения старт е комбинация от тестване за безопасност и събиране на обратна връзка, преди мощен генератор на видео и звук да стигне до масовия потребител. Достъпът се заявява чрез форма на сайта на компанията. Конкретни цени BFL все още не е обявила.
Стратегията с обещани отворени тегла върви срещу течението на затворените модели и напомня дебата около достъпа до открити AI модели и спора кой на кого е дестилирал модела, който върви в индустрията от месеци.
Заключение
С FLUX 3 Black Forest Labs се измества от чист генератор на изображения към мултимодална лаборатория, която прави и озвучено видео. Native audio видеото до 20 секунди е реална крачка напред за компанията, а обещанието за отворени тегла го прави интересно и за разработчици. Дали числата от вътрешните тестове ще издържат независима проверка обаче ще стане ясно едва когато ранният достъп се разшири — и когато BFL обяви цени. Дотогава FLUX 3 остава по-скоро мощно обещание, отколкото инструмент, който всеки може да пробва днес.
Харесва ви? Отбележете ни и ще ни виждате по-нагоре в Google.
Предпочитан източник в Google