Flux 3: не очередной анонс, а инструкция к применению

· · 38 мин чтения

23 июля 2026 года Black Forest Labs анонсировала Flux 3 — и рунет взорвался новостями. Пятнадцать статей за две недели. Все пересказывают пресс-релиз. Ни одна не отвечает на вопрос: «Как мне это попробовать и сколько это стоит в рублях?»

Мы прочитали все 15. Собрали ядро в один компактный блок. А 80% статьи отвели тому, чего нет нигде: API-туториал для России, честный разбор Draft Mode, сравнение цен в рублях и тест русского языка.

Поехали.

Что уже все знают — за 2 минуты

Black Forest Labs — команда выходцев из Stability AI, создатели Stable Diffusion и линейки Flux. В июле 2026 они оценивались в $3.25B при $450M+ инвестиций от a16z, Salesforce, Nvidia, Adobe и Canva.

Flux 3 — единая мультимодальная модель, которая генерирует видео, аудио, изображения и… действия для роботов. Ключевое: это не три отдельные модели под одним брендом, а одна архитектура.

Self-Flow: модель сама строит внутреннее представление сцены без внешних энкодеров вроде DINO или CLIP. Экономия параметров, лучшее обобщение — подробно разберём ниже.

20 секунд видео с нативным аудио. Аудио не «приклеивается» после генерации, а создаётся одновременно с видео — модель понимает связь между движением и звуком.

Поэтапный запуск:

  • Video — early access с 23 июля, GA с 5 августа;
  • Image — в ближайшие недели;
  • Action (FLUX-mimic) — робототехника, партнёрство с mimic robotics;
  • Dev (open-weight) — до конца 2026.

Бенчмарки BFL (без независимой верификации): 93% против Luma Ray 3.2, 77% против Runway Gen-6, 52% против Seedance 2.5. Цифры из пресс-релиза — относитесь к ним как к ориентиру, а не истине.

Всё. Дальше — только то, чего нет у конкурентов.

Self-Flow за 5 минут: почему это важно

Большинство статей говорят: «Self-Flow — это круто». Мы объясним, что именно круто и почему это меняет правила игры.

Как работает обычный flow matching

Flow matching — это метод генерации, где модель учится преобразовывать шум в осмысленные данные. В классическом подходе (тот же Stable Diffusion 3) используется внешний энкодер — например DINO или CLIP. Он «подсказывает» модели, что происходит на сцене. Модель опирается на эту подсказку на каждом шаге.

Проблема: внешний энкодер — это лишние параметры, лишняя память и жёсткая привязка к архитектуре. Модель без энкодера беспомощна.

Что делает Self-Flow

Self-Flow убирает внешний энкодер. Модель сама — и энкодер, и декодер. Она строит внутреннее представление сцены без подсказок извне.

Результат:

  • Меньше параметров → ниже требования к железу;
  • Лучшее обобщение → модель работает с данными, которых не видела при обучении;
  • Единое представление для видео, аудио и изображений → не надо синхронизировать три модели.

Dual-Timestep Scheduling — изюминка, которую пропустили почти все

GPTunneL раскопал деталь: в Self-Flow используется Dual-Timestep Scheduling — два разных временных шага для разных модальностей. Видео обучается на одном timestep, аудио — на другом. Создаётся информационная асимметрия: видео «видит» больше шагов, аудио — меньше, и модель учится структуре сцены через эту разницу.

Представьте: вы смотрите фильм с идеальной картинкой, но звук то появляется, то пропадает. Ваш мозг достраивает связь между движением губ и речью. Self-Flow работает так же.

Распределение compute: аудио почти бесплатно

Ещё одна деталь из HuggingFace Model Card: 95% вычислительных ресурсов уходит на видео. На аудио — меньше 0.5%. Нативное аудио добавляется к видео практически «бесплатно» с точки зрения мощностей. Это не «мы сгенерировали видео и наложили звук» — это «модель нарисовала сцену и одновременно озвучила её, потратив на звук менее процента мощностей».

Для тех, кто считает бюджет: это означает, что вы не платите «за аудио» отдельно. Вы платите за видео, а звук — в комплекте.

Как запустить Flux 3 из России: пошаговый API-туториал

Вот чего нет ни в одной из 15 статей. А это единственное, ради чего их читают.

Шаг 1: получить доступ

Идём на bfl.ai → API → регистрируемся → создаём ключ. На момент августа 2026 модель в early access — возможно, потребуется запрос на доступ.

Лайфхак

Доступ из России: напрямую bfl.ai работает, но если нужен стабильный доступ без VPN, единый интерфейс для нескольких моделей и оплата в рублях — на Syntet.ru Flux 3 доступен через общий API-ключ вместе с Seedance 2.5 и Kling v3.

Шаг 2: первый запрос

import requests

url = "https://api.bfl.ai/v1/flux-3/video"
headers = {
    "Authorization": "Bearer YOUR_API_KEY",
    "Content-Type": "application/json"
}
payload = {
    "prompt": "Крупный план: рыжий кот играет с клубком шерсти на деревянном полу, солнечный свет из окна, пылинки в воздухе",
    "duration": 10,
    "resolution": "1080p",
    "mode": "draft",
    "aspect_ratio": "16:9",
    "seed": 42
}

response = requests.post(url, json=payload, headers=headers)
task_id = response.json()["task_id"]
print(f"Task ID: {task_id}")

Шаг 3: параметры

ПараметрЗначенияЧто делает
promptСтрока, до ~500 символовОписание сцены. Русский — поддерживается (см. тест ниже)
duration5 / 10 / 20Длительность видео в секундах
resolution720p / 1080pРазрешение. 1080p — дольше, дороже
modedraft / fullDraft — дешёвое превью, Full — финальный рендер
aspect_ratio16:9 / 9:16 / 1:1Соотношение сторон
negative_promptСтрокаЧего не должно быть в кадре
seedЦелое числоДетерминированность: одинаковый seed → одинаковый результат

Шаг 4: получить результат

import time

while True:
    status_resp = requests.get(
        f"https://api.bfl.ai/v1/tasks/{task_id}",
        headers=headers
    )
    status = status_resp.json()
    if status["status"] == "completed":
        video_url = status["result"]["video_url"]
        print(f"Готово: {video_url}")
        break
    elif status["status"] == "failed":
        print(f"Ошибка: {status['error']}")
        break
    time.sleep(5)

Коды ответов

КодЗначение
200Запрос принят, возвращён task_id
402Недостаточно средств на счету
429Превышен лимит запросов — подождите и повторите
500Ошибка на стороне BFL — повторите позже

Как это работает в Syntet

На Syntet.ru вы получаете единый API-ключ для Flux 3, Seedance 2.5 и Kling v3. Тот же endpoint, те же параметры, но без VPN и с оплатой в рублях. Русская поддержка отвечает за часы, а не дни.

Draft Mode: как платить в 5 раз меньше

5 августа BFL тихо выкатили Draft Mode. Из 15 статей о нём написали только две. А это главный инструмент экономии.

Как это работает

  1. Отправляете промпт с mode: "draft".
  2. Получаете preview — видео с пониженным качеством, но с сохранением композиции, объектов и движения.
  3. Если устраивает — отправляете тот же промпт + тот же seed с mode: "full".
  4. Если нет — правите промпт и повторяете Draft.

Платите вы только за то, что реально использовали. Draft-превью стоит $0.06 за секунду, Full-рендер — $0.29/сек. Разница почти в 5 раз.

Реальная арифметика

Допустим, вам нужны 3 финальных видео по 10 секунд каждое. Сколько это стоит с Draft Mode и без?

Без Draft Mode: 3 видео × 10 сек × $0.29 = $8.70.

С Draft Mode (50% approval): генерируете 6 Draft-превью, утверждаете 3 → 3 Full-рендера:

  • 6 × 10 сек × $0.06 = $3.60 (Draft)
  • 3 × 10 сек × $0.29 = $8.70 (Full)

Итого: $12.30 за 3 готовых видео + 3 отбракованных варианта.

На первый взгляд — дороже. Но вы получили не 3 видео, а 6 итераций, из которых выбрали лучшие. Без Draft Mode вы бы заплатили $8.70 за 3 видео, не зная результата. С Draft Mode вы платите $3.60 за разведку и $8.70 за финальный рендер — контролируя каждый кадр.

При 33% approval (реалистичный сценарий): 9 Draft → 3 Full = 9 × 10 × $0.06 + 3 × 10 × $0.29 = $5.40 + $8.70 = $14.10. Дороже на 62%, но вы отсеяли 6 неудачных вариантов до того, как заплатили полную цену. Без Draft Mode вы бы заплатили $26.10 за 9 Full-рендеров, из которых только 3 хорошие.

Экономия: 46%.

Draft Mode через Syntet

Все режимы доступны через единый интерфейс Syntet без отдельных настроек. Прозрачный биллинг: вы видите стоимость каждого запроса до его отправки. Оплата в рублях — никаких конвертаций и комиссий.

Цены: сравнение в рублях

Собрали актуальные цены на август 2026. Сравниваем по стоимости секунды HD-видео.

МодельРежим$/сек HD≈ ₽/сек (через Syntet)Макс. длительностьНативное аудио
Flux 3Draft$0.06~5.5 ₽20 секДа
Flux 3Full$0.29~26 ₽20 секДа
Seedance 2.5Standard$0.10~9 ₽30 секНет
Kling v3Pro~$0.08~7 ₽60 секНет

Как читать эту таблицу:

  • Flux 3 Draft — самая дешёвая итерация. Для экспериментов, поиска композиции, проверки промптов — идеально.
  • Flux 3 Full — дороже конкурентов. Вы платите за нативное аудио и единую архитектуру. Если аудио не нужно — Seedance дешевле.
  • Seedance 2.5 — лучший фотореализм в индустрии, до 30 секунд. Для клипов, рекламы, презентаций — по-прежнему топ.
  • Kling v3 — до минуты видео, лучшая цена за длинные ролики.

Главный вывод: Flux 3 не самый дешёвый. Но он единственный с нативным аудио. Если вы генерируете видео со звуком — вы всё равно платите за аудио-модель отдельно. С Flux 3 — не платите.

Все четыре модели доступны на Syntet.ru с единым ключом, без VPN и с оплатой в рублях. Не нужно заводить 4 аккаунта и считать цены в 4 валютах.

Русский язык: честный тест

12+ языков заявлено в пресс-релизе. Русский — в списке. Мы прочитали все 15 статей: ни один автор не проверил.

Мы проверили.

Методология

10 промптов на русском языке разной сложности. Каждый — через Draft Mode (10 сек, 1080p). Оценивались:

  • Точность следования промпту (все ли объекты и действия на месте);
  • Качество русского в аудиодорожке (если сгенерирован голос);
  • Распознавание культурного контекста (специфичные для РФ объекты и сцены).

Результаты

#ПромптТочностьКачество аудиоКонтекст
1«Рыжий кот играет с клубком шерсти»★★★★★★★★
2«Девушка в платке идёт по осеннему парку, ветер срывает листья»★★★★★★★★★
3«Мужчина читает газету „Правда" за чашкой чая в старом подъезде»★★★★★★
4«Дед Мороз и Снегурочка выходят из электрички в заснеженной деревне»★★★★★★★★★★★
5«Бабушка печёт блины на кухне, на плите старая советская сковорода»★★★★★★★★
6«Программист работает за ноутбуком в коворкинге, на фоне — панелька за окном»★★★★★★★★★★
7«Сцена из русской классики: дуэль на пистолетах в заснеженном лесу»★★★★★★
8«Масленица: люди водят хоровод вокруг чучела, горят костры»★★★★★★
9«Современная Москва: вечерний Сити, поток машин, светящиеся окна»★★★★★★★★★★
10«Человек говорит в камеру: „Здравствуйте, сегодня я расскажу вам о Flux 3"»★★★★★★★★★★★★

Что мы поняли

Flux 3 понимает русские промпты на уровне английских. Модель не переводит промпт внутренне на английский — она работает с русским напрямую. Это видно по точности культурно-специфичных сцен: «Дед Мороз и Снегурочка», «панелька за окном», «блины на советской сковороде» — все эти сцены модель воспроизвела адекватно, без «глобализации» под западный визуальный код.

Слабые места:

  • Сложные сценарии с несколькими действиями (промпты 3 и 8) — модель иногда теряет второстепенные детали.
  • Исторический контекст (промпт 7) — дуэль на пистолетах модель изобразила как «два человека с оружием в снегу», без стилистики XIX века.
  • Аудио на русском — работает для нейтральной речи (промпт 10), но с акцентом. Эмоциональная окраска голоса — слабое место.

Вывод: для промптов на русском Flux 3 — полностью рабочая модель. Культурный контекст распознаётся лучше, чем у конкурентов (Kling и Seedance часто «американизируют» русские сцены). Аудио на русском — приемлемое для черновиков, но не для финального продакшена.

Кому пора переходить, а кому — подождать

Flux 3 — не «убийца» и не «революция». Это инструмент с конкретными сильными и слабыми сторонами. Вот кому он нужен сейчас, а кому — через полгода.

СегментСтатус готовности Flux 3Рекомендация
Потребитель (хобби, мемы, соцсети)Video — GA, интерфейс через SyntetПробовать сейчас. Draft Mode делает эксперименты доступными: 10-секундное превью — 55 рублей. Русские промпты работают.
Креатор (клипы, реклама, контент)20 сек — маловато для клипов, достаточно для тизеров и reelsТестировать на коротких форматах. Для Reels, TikTok и тизеров — отлично. Для полноценных клипов — ждать увеличения длительности или комбинировать с Seedance.
Разработчик (API, продукт, интеграция)API работает; ComfyUI node нетСтартовать через Syntet API. Один ключ для всех моделей, документация на русском, поддержка. Интеграция — 2–3 дня.
Бизнес / EnterpriseНет on-prem, нет compliance для regulated industriesЖдать Dev (open-weight). Для пилотов — арендовать доступ через Syntet. Когда выйдет Dev — разворачивать на своих серверах.

Красная линия Syntet: для любого сегмента — единый интерфейс, один ключ, все модели, оплата в рублях. Не нужно выбирать между «попробовать Flux» и «продолжить с Seedance» — берёте оба и переключаетесь по задаче.

Что дальше: Image, Dev, цены

Flux 3 — это не одна модель, а дорожная карта на год вперёд.

Image (ближайшие недели)

Генерация изображений в той же Self-Flow архитектуре. BFL обещают качество на уровне Flux 1.1 Pro — одного из лучших генераторов изображений с поддержкой текста. Если это правда, мы получим единый инструмент для картинок и видео без переключения между моделями.

Для Syntet это означает: одна подписка — и обложки для статей, и видео для соцсетей.

Dev — open-weight (до конца 2026)

Самый важный пункт для бизнеса. Open-weight версия позволит развернуть Flux 3 на своих серверах. Главный вопрос — требования к VRAM. Судя по архитектуре (Self-Flow без внешнего энкодера — экономия параметров), можно ожидать запуск на RTX 5090 (32 ГБ) или A100. Но это спекуляция — официальных цифр нет.

Action — FLUX-mimic (долгий горизонт)

Робототехника на базе Flux 3. Модель смотрит видео → предсказывает действия робота. Self-recovery без явного программирования: с 42% до 71% success rate, latency меньше 80 мс на RTX 5090. Впечатляет, но это другая ниша — не для контент-мейкеров.

Что будет с ценами

Сейчас Flux 3 в early access — цены могут измениться. Обычно после GA модели дешевеют на 20–40%. Если BFL пойдёт по этому пути — Full HD может стоить $0.18–0.23/сек к концу года. Тогда Flux 3 станет прямым ценовым конкурентом Seedance 2.5 ($0.10/сек) с бонусом в виде нативного аудио.

Открытые вопросы

  • Увеличится ли длительность видео? 20 секунд — потолок early access. BFL не обещали больше.
  • Будет ли image-to-video? Пока нет. Модель стартует с текста.
  • Когда full public release? Без запроса early access. Ориентир — конец августа.

Итог: пробовать или нет

Flux 3 — первая модель, где видео, аудио и изображения рождаются в одной архитектуре. Это не «ещё одна видео-нейросеть». Это смена парадигмы: вместо трёх моделей с разными API, ценами и лимитами — одна.

Прямо сейчас Flux 3 хорош для:

  • Экспериментов с русскими промптами (понимает лучше конкурентов);
  • Коротких видео со звуком (тизеры, reels, презентации);
  • Итеративной работы через Draft Mode (экономия до 46% бюджета).

Flux 3 пока не готов для:

  • Длинных роликов (20 сек — потолок);
  • Продакшен-аудио на русском (акцент, слабая эмоциональность);
  • On-premise развёртывания (ждать Dev до конца 2026).

Главное: если вы хотите не читать новости, а работать — попробуйте Flux 3 на Syntet.ru. Единый интерфейс для Flux 3, Seedance 2.5 и Kling v3. Без VPN, оплата в рублях, один API-ключ. Русская поддержка отвечает за часы.

  • Поделиться