LTX 2.3: полный обзор возможностей 2026

· · 36 мин чтения

LTX 2.3 — это фундаментальная аудио-видео модель от компании Lightricks, представленная 5 марта 2026 года. Но «ещё одна видеомодель» — не совсем точное описание. Это первая open-source модель, которая генерирует нативное 4K-видео с синхронизированным звуком в одном проходе. И это меняет правила игры.

Обложка: LTX 2.3 — полный обзор возможностей 2026
LTX 2.3 — первая open-source модель с нативным 4K и синхронизированным звуком

Что такое LTX 2.3

LTX 2.3 — это фундаментальная аудио-видео модель от компании Lightricks, представленная 5 марта 2026 года. Но «ещё одна видеомодель» — не совсем точное описание. Это первая open-source модель, которая генерирует нативное 4K-видео с синхронизированным звуком в одном проходе. И это меняет правила игры.

Под капотом — 22 миллиарда параметров архитектуры Diffusion Transformer (DiT) с двухпоточным устройством: примерно 14B отвечают за видеоряд, ещё 5B — за аудиосоставляющую. Такой подход позволяет модели одновременно «думать» и о визуале, и о звуке, не склеивая их постфактум, а рождая единое целое.

Lightricks — компания с серьёзным бэкграундом в креативных инструментах (Facetune, Videoleap, LTX Studio). С выходом LTX 2.3 они сделали мощный шаг: модель доступна на Hugging Face под лицензией Apache 2.0. Это значит — бесплатно для компаний с годовым доходом до $10 млн. Для всех остальных — коммерческая лицензия напрямую от Lightricks.

Модель поставляется в двух вариантах: полная версия LTX 2.3-22B-dev (bf16, для файнтюнинга и LoRA-тренировок) и LTX 2.3-22B-distilled — 8-шаговая дистиллированная версия для быстрого инференса с меньшим потреблением памяти.

Разработчики LTX 2.3 перестроили три ключевых компонента относительно LTX 2: новый VAE (вариационный автоэнкодер), текстовый коннектор увеличенный в 4 раза, и улучшенный вокодер HiFi-GAN. Каждое из этих изменений заслуживает отдельного разбора — и мы его сделаем ниже.

Архитектура LTX 2.3 — двухпоточный DiT
22B параметров: 14B видео + 5B аудио в единой архитектуре DiT

Ключевые возможности

Текст в видео (Text-to-Video)

Базовый, но невероятно мощный режим. LTX 2.3 принимает текстовое описание и выдаёт видео до 20 секунд на разрешениях вплоть до 4K (3840×2160) с частотой 24, 25, 48 или 50 кадров в секунду. Четырёхкратно расширенный текстовый коннектор гарантирует, что сложные промпты с несколькими объектами, пространственными отношениями и стилистическими инструкциями отрабатываются точно — дрейф промпта, характерный для предыдущих поколений, сведён к минимуму.

На практике это означает: описали сцену с персонажем на переднем плане, движением камеры и атмосферным освещением — модель отрабатывает всё вместе, а не выбирает что-то одно. Для сравнения: LTX 2 часто «терял» объекты на дальних кадрах к 8-10 секунде, 2.3 держит сцену значительно стабильнее.

Изображение в видео (Image-to-Video)

Режим I2V в LTX 2.3 получил одно из самых заметных улучшений. Если LTX 2 страдал от эффекта «Ken Burns» — статичная картинка с минимальным зумом и почти нулевым реальным движением — то версия 2.3 генерирует настоящее движение. Меньше застывших кадров, больше живых сцен.

Модель лучше сохраняет визуальную согласованность с исходным изображением, уменьшая количество «выброшенных» генераций. Текстуры, освещение и цветовая палитра остаются верными оригиналу, а движение добавляется органично — будь то идущий человек, летящие птицы или колышущаяся на ветру листва.

Lip Sync (синхронизация речи)

LTX 2.3 предлагает режим I2V Lip Sync (доступен на платформе Syntet.ru отдельным эндпоинтом). Это нацелено на создание говорящих аватаров: загружаете изображение персонажа и аудиодорожку с речью — модель анимирует губы, синхронизируя артикуляцию со звуком.

Важно держать ожидания реалистичными: лип-синк не идеален для длинных монологов. Форма губ может немного «плыть» при сложной артикуляции. Но для коротких реплик, презентаций и conversational-контента модель показывает достойный результат, особенно с учётом того, что это open-source решение.

Аудио в видео (Audio-to-Video)

Уникальная фишка LTX 2.3: можно подать на вход аудиодорожку (музыку, речь, звуковые эффекты) и модель сгенерирует видео, где ритм, темп и настроение определяются аудио. Это не просто фоновая дорожка — модель «дышит» вместе с треком.

Идеально для: атмосферных клипов под музыку, визуализации подкастов, продуктовых роликов с музыкальными переходами. Не подходит для: точной покадровой синхронизации (танцевальные движения под бит) и полноценного лип-синка с длинными монологами.

Дополнительные режимы

Extend Video (продление) — достройка видео вперёд или назад. Модель генерирует новые кадры, сохраняя стиль и движение оригинала. Можно создавать длинные последовательности, цепочкой соединяя несколько запросов.

Retake (пересъёмка) — точечное редактирование: не перегенерируете весь ролик, а исправляете конкретный участок. Билинг — посекундно за входное видео. Пока доступно в 1080p.

Reframe (перекадрирование) — расширение видео в любой формат (16:9, 9:16, 1:1, 4:5) без кропа. Модель сохраняет оригинальный кадр и дорисовывает только новые области за его пределами, соблюдая сцену и движение.

HDR Output (бета) — конвертация SDR в 16-битный HDR (EXR). Для профессионального грейдинга и постпродакшна.

Отдельно стоит отметить нативный портретный режим 9:16 с разрешением 1080×1920. Это не ландшафтное видео, обрезанное под вертикаль — модель обучена на портретных данных и компонует кадр именно для вертикального формата. Критично для создателей контента под Shorts, Reels и TikTok.

Режимы LTX 2.3: T2V, I2V, Lip Sync, Audio-to-Video
Все режимы LTX 2.3: от текста до синхронизации губ

Архитектура и технические характеристики

Разберём три ключевых апгрейда, которые отличают LTX 2.3 от предшественника.

Новый VAE: за что отвечает «резкость мелких деталей»

Перестроенный вариационный автоэнкодер (VAE) обучен на данных более высокого качества. На практике это означает: линии волос, ресницы и мелкие текстуры держатся дольше при нарастании движения. Хромированные поверхности сохраняют чёткий блик без расплывания. Градиенты в небе и тенях дают меньше полосатости.

Разница не бросается в глаза как неоновая вывеска — скорее, это отсутствие мелких раздражителей. Текстуры ткани больше не «дышат» между кадрами, а мелкие объекты (пуговицы, стрелки часов, винты) дольше сохраняют форму, прежде чем раствориться в фоне.

Оговорка: на агрессивных контрастных промптах может возникать избыточная резкость. Решается снижением guidance на 5-10%.

4x текстовый коннектор: точность важнее догадок

Увеличенный в четыре раза текстовый энкодер радикально улучшил следование промптам. Сложные описания с несколькими субъектами, пространственными отношениями и стилистическими инструкциями теперь разрешаются корректно. Модель понимает, что «золотой час» относится к освещению, а «красное платье» — к персонажу, а не к фону.

HiFi-GAN вокодер: чище звук, меньше артефактов

Фильтрованные тренировочные данные и новый вокодер дают стереовыход 24 kHz с ощутимо меньшим количеством артефактов. Тишина больше не «проваливается», фазовые искажения практически исчезли, а motion-to-audio alignment (соответствие движения и звука) стало плотнее.

Техническая спецификация

ХарактеристикаLTX 2.3
Параметры22B (dual-stream: ~14B видео, ~5B аудио)
Максимальная длительность20 секунд (1080p), 10 секунд (1440p/4K)
РазрешениеДо 4K (3840×2160) нативного
Частота кадров24 / 25 / 48 / 50 FPS
Соотношения сторон16:9, 9:16 (нативный портрет), 1:1, 4:5
АудиоСинхронизированное, стерео 24 kHz
ЛицензияApache 2.0 (бесплатно для компаний до $10M годового дохода)
VRAM (локально, fp16)~44 GB (4K), ~24 GB (FP8/quantized)
Техническая архитектура LTX 2.3
Три ключевых апгрейда: VAE, 4x текстовый коннектор, HiFi-GAN вокодер

Сравнение с Kling 3, Sora 2 и Seedance 2

ХарактеристикаLTX 2.3Kling 3Sora 2Seedance 2
РазработчикLightricksKuaishouOpenAIByteDance
Макс. разрешение4K1080p1080p2K
Макс. длительность20 сек10 сек60 сек15 сек
АудиоВстроенное, синхронизированноеНетВстроенноеНет (внешний TTS)
Портретный режимНативный 9:16НетНетНет
Open sourceДа (Apache 2.0)НетНетНет
Lip SyncДаНет (отдельно Omni)НетНет
Цена (1080p)от $0.08/секот $0.15/сек$20-200/месот $0.12/сек
Лучше всего для4K, open-source кастомизация, аудио-видеоMotion Control, визуальное качествоДлинные ролики, сторибордыМультивход (12 файлов), вариативность

Ключевое отличие LTX 2.3 от тройки лидеров — комбинация трёх факторов, которых нет ни у кого одновременно: open-source доступность, нативное 4K и синхронизированный звук. Kling 3 выигрывает по визуальному качеству и Motion Control, Sora 2 — по длительности и сторибордам, Seedance 2 — по мультиреференсному входу. Но если вам нужна модель, которую можно развернуть локально, дообучить под свои данные и генерировать 4K со звуком без подписок и вендор-лока — LTX 2.3 сейчас единственный вариант.

Сравнение LTX 2.3 с конкурентами
LTX 2.3 vs Kling 3 vs Sora 2 vs Seedance 2 — сравнительная таблица

Пошаговая инструкция: как использовать LTX 2.3 на Syntet.ru

Вместо того чтобы разбираться с Hugging Face, настройкой окружения, VRAM и API-ключами разных провайдеров, вы можете запустить LTX 2.3 прямо сейчас через единый интерфейс Syntet.ru. Без VPN, с оплатой в рублях и русскоязычной поддержкой. Вот как это делается:

Шаг 1. Авторизация

Заходите на syntet.ru, создаёте аккаунт (или входите в существующий). Пополняете баланс в рублях — карты РФ, всё без танцев с бубном.

Шаг 2. Выбор модели

В разделе «Видео» находите LTX 2.3. На платформе доступны три варианта: LTX 2.3 (Text-to-Video), LTX 2.3 I2V (Image-to-Video) и LTX 2.3 I2V Lip Sync (синхронизация губ).

Шаг 3. Настройка параметров

Выбираете режим генерации, разрешение (от 480p до 1080p), длительность (5-20 секунд) и соотношение сторон. Для T2V — пишете промпт. Для I2V — загружаете изображение и опционально добавляете текстовое описание желаемого движения. Для Lip Sync — загружаете изображение персонажа и аудиофайл с речью.

Шаг 4. Генерация

Нажимаете «Сгенерировать» и ждёте результат. В отличие от локального запуска, где вам нужна видеокарта с 24+ GB VRAM и навыки работы с командной строкой, здесь всё происходит в облаке.

Шаг 5. Итерация

Не понравился результат? Меняете промпт, сид, настройки — и пробуете снова. На Syntet.ru все видеомодели (Kling 3, Sora 2, Seedance 2, Veo 3.1) собраны в одном интерфейсе. Не нужно переключаться между пятью разными сервисами.

Весь процесс занимает минуты и не требует ни VPN (в отличие от прямого доступа к зарубежным API), ни криптовалют для оплаты, ни знания английского для саппорта. Syntet.ru делает AI-видеопродакшн доступным на русском языке — от регистрации до финального рендера.

Пошаговая инструкция LTX 2.3 на Syntet.ru
5 шагов — и ваше 4K-видео готово на Syntet.ru

Ограничения и цена

Ограничения модели

При всей мощности у LTX 2.3 есть объективные ограничения, которые важно понимать до начала работы:

  • Детальный текст в кадре. Печатный текст (этикетки, вывески, надписи) по-прежнему ненадёжен. Если вам нужен чёткий читаемый текст в видео — компонуйте его отдельно в видеоредакторе.
  • Лип-синк неидеален для длинных монологов. Форма губ может плыть при сложной артикуляции. Для коротких реплик работает приемлемо, для полноценных говорящих голов — пока риски.
  • Точная покадровая синхронизация. Для монтажа под бит или танцевальной хореографии модель даёт атмосферу и общий темп, но не попадание в каждый ударный такт.
  • Агрессивная резкость. На высококонтрастных промптах новый VAE иногда даёт «хрустящие» кадры. Лечится снижением guidance.
  • Длительность на 4K. Максимальная длительность на 4K и 1440p — 10 секунд. 20 секунд только в 1080p.
  • Железо для локального запуска. Полноценный 4K-инференс требует ~44 GB VRAM (fp16). Квантизованные версии (FP8) снижают до ~24 GB, но это всё ещё RTX 4090/5090 как минимум.

Цены API

Режим1080p1440p4K
T2V / I2V (Pro)$0.08/сек$0.16/сек$0.32/сек
Audio-to-Video (Pro)$0.10/сек--
Extend (Pro)$0.10/сек--
Retake (Pro)$0.10/сек--
Reframe (Pro)$0.20/сек--

В пересчёте на клипы: 5 секунд Pro 1080p — $0.40, 10 секунд — $0.80, 20 секунд — $1.60. Для сравнения: Kling 3 Pro стоит от $0.15/сек, Sora 2 — от $20/мес (подписка), Seedance 2 — от $0.12/сек. LTX 2.3 оказывается самым доступным профессиональным вариантом, особенно если учесть возможность бесплатного локального запуска.

Важно: на Syntet.ru все цены в рублях, без скрытых комиссий и с контролем расхода в реальном времени. Вы платите ровно за то, что сгенерировали, а не за «пакеты кредитов» с непонятным курсом конвертации.

FAQ

Чем LTX 2.3 отличается от LTX 2?

Четырьмя ключевыми апгрейдами: новый VAE даёт более резкие текстуры и лица, 4x текстовый коннектор улучшает следование промптам, нативный портретный режим 9:16 (1080×1920) вместо кропа из ландшафта, и значительно более чистый звук через переработанный вокодер HiFi-GAN.

Можно ли использовать LTX 2.3 бесплатно?

Да. Модель опубликована на Hugging Face под Apache 2.0 и доступна для бесплатного скачивания и локального запуска. Для компаний с доходом более $10 млн в год требуется коммерческая лицензия от Lightricks. Однако локальный запуск требует мощного GPU (~24-44 GB VRAM), что для многих пользователей означает необходимость облачного доступа — и здесь Syntet.ru снимает головную боль с арендой серверов и настройкой.

Генерирует ли LTX 2.3 звук?

Да, это одна из главных фишек модели. LTX 2.3 генерирует синхронизированный стереозвук 24 kHz непосредственно в процессе создания видео, а не накладывает его постфактум. Это включает окружающие звуки, звуковые эффекты и даже базовую речь. Качество звука значительно улучшено по сравнению с LTX 2.

Какой GPU нужен для локального запуска?

Для 4K в fp16 нужно около 44 GB VRAM. Квантизованные версии (FP8) работают на RTX 4090/5090 (24 GB). Для 1080p требования ниже, но это всё ещё карты уровня RTX 4080 и выше.

Через что доступна LTX 2.3 на Syntet.ru?

На платформе Syntet.ru модель доступна в трёх режимах: Text-to-Video (генерация по текстовому описанию), Image-to-Video (анимация изображения) и I2V Lip Sync (синхронизация губ с аудио). Все режимы запускаются из единого интерфейса, оплата в рублях, русскоязычная поддержка, VPN не требуется.

Для каких сценариев LTX 2.3 подходит лучше всего?

Сценарий номер один — когда нужно 4K-видео со звуком и полным контролем над моделью (open-source, можно дообучать). Сценарий номер два — вертикальный контент 9:16 под Shorts/Reels/TikTok (нативная генерация, а не кроп). Сценарий номер три — бюджетоограниченные проекты, где $0.08/сек против $0.15-0.20/сек у конкурентов даёт двукратную экономию.

Заключение

LTX 2.3 — это не просто обновление. Это момент, когда open-source видеомодель впервые догнала проприетарных лидеров по ключевым метрикам: разрешение (4K), звук (синхронизированный стерео) и длительность (20 секунд). И обогнала их по доступности: Apache 2.0, локальный запуск, цены API в разы ниже.

Да, по чистому визуальному качеству на стандартных разрешениях Kling 3 и Sora 2 всё ещё впереди. Но для сценариев, где важны разрешение выше 1080p, встроенный звук, кастомизация под свои данные и бюджетная эффективность — LTX 2.3 становится выбором по умолчанию.

А если добавить к этому возможность запускать LTX 2.3 бок о бок с Kling 3, Sora 2, Seedance 2 и Veo 3.1 в одном интерфейсе Syntet.ru — с оплатой в рублях, без VPN и с русской поддержкой — получается производственный конвейер, который ещё год назад был фантастикой. Теперь это просто рабочий инструмент.

  • Поделиться