Bernini-Diffusers-v2: ByteDance открывает полный видеопайплайн

Bernini-Diffusers-v2: ByteDance открывает полный видеопайплайнПоследнее обновление: 13 августа 2026 г.Мы рады поделиться новостью от команды art-diffusion — ByteDance выпустила Bernini-Diffusers-v2: новый пайплайн для генерации и редактирования видео с семантическим планированием в формате diffusers, поддержкой редактирования по референсу и OpenS2V.

Bernini-Diffusers-v2 (HuggingFace | GitHub | Страница проекта) — это свежий релиз ByteDance, в котором представлен полный пайплайн генерации и редактирования видео Bernini, упакованный в самостоятельный каталог формата diffusers. Он объединяет семантический планировщик на базе MLLM, веса планирования Bernini и компоненты diffusion Wan2.2 в одном checkpoint.

Обзор

Bernini — это унифицированный фреймворк ByteDance для генерации и редактирования видео, который совмещает семантический планировщик на основе MLLM с рендерером на базе DiT. Вместо прямой генерации кадров он сначала разбивает сложные инструкции на понятные семантические планы, а затем рендерит результат через декодер diffusion на базе Wan2.2. Такой подход «латентного семантического планирования» помогает точно следовать инструкциям даже при выполнении сложных задач генерации и редактирования.

В Bernini-Diffusers-v2 весь пайплайн собран в одном самостоятельном каталоге diffusers: планировщик Qwen2.5-VL, веса планирования Bernini и компоненты diffusion Wan2.2 (текстовый энкодер, VAE, scheduler, конфигурации двух трансформеров). По сравнению с релизами Bernini-R, которые содержат только рендерер, эту версию мы рекомендуем, когда нужно многоэтапное семантическое планирование и более качественная обработка сложных запросов. По сравнению с первым релизом Bernini-Diffusers (июнь 2026 года), в v2 применяется рецепт обучения, который прогревает коннектор на протяжении тысяч шагов ДО совместного обучения — это улучшает редактирование видео по референсу и производительность OpenS2V.

Фреймворк Bernini: семантический планировщик на основе MLLM разбивает инструкции на планы, которые рендерер DiT Wan2.2 превращает в готовое видео. Источник: страница проекта Bernini

Поддерживаемые задачи

Bernini-Diffusers-v2 закрывает шесть задач с помощью готовых к запуску лаунчеров в репозитории Bernini:

Задача | Описание
`t2i` / `i2i` | Текст-в-изображение и изображение-в-изображение
`t2v` | Текст-в-видео
`v2v` | Редактирование видео-в-видео
`rv2v` | Редактирование видео по референсу (референс + исходное видео)
`r2v` | Референс-в-видео (OpenS2V, одно изображение или референс в видео)

Бенчмарк

Модель | EditVerse | OpenVE | OpenS2V | VBench | Bernini-v2v (OS) | Bernini-rv2v (OS)
Bernini-v2 7+14B | 8.02 | 3.96 | 63.83 | 84.46 | 3.49 | 3.55

В задачах редактирования видео Bernini выходит в первый эшелон среди ведущих коммерческих моделей с закрытым исходным кодом — такие выводы даёт внутренняя оценка ByteDance в формате арены, построенная на слепом попарном сравнении людьми.

Структура пакета

Релиз представляет собой самостоятельный каталог формата diffusers. Передайте скачанный каталог напрямую в параметр `—config`:

«`
`Bernini-Diffusers-v2/
bernini/ # Bernini planning checkpoint
mllm/ # Qwen2.5-VL planner assets
scheduler/ # base diffusion modules
t5_text_encoder/
t5_tokenizer/
vae/
config.json
transformer_config.json
transformer_2_config.json # Wan2.2 diffusion decoder components`
«`

Поддержка ComfyUI

Bernini-Diffusers-v2 пока не поддерживается в ComfyUI. Весь пайплайн построен на архитектуре `BerniniModel` (семантический планировщик MLLM плюс веса планирования Bernini), которую ComfyUI на данный момент не загружает. Этот релиз — самостоятельный каталог в формате diffusers, предназначенный для кода вывода официального репозитория Bernini: демо Gradio для одной GPU и нескольких GPU (`torchrun —ulysses 8`), а также скрипты запуска для каждой задачи в каталоге `scripts/bernini_v2/` (`run_t2i.sh`, `run_i2i.sh`, `run_t2v.sh`, `run_v2v.sh`, `run_rv2v.sh`, `run_r2v.sh`).

Если вы хотите запустить Bernini в ComfyUI уже сегодня, рендерер Bernini-R имеет официальную поддержку ComfyUI от Comfy-Org с отдельным учебником, охватывающим рабочие процессы текст-в-видео, изображение-в-видео и редактирование видео. Учтите, что Bernini-R — это вариант только с рендерером; в нём нет многоэтапного семантического планировщика полного пайплайна.

Доступность

Скачать модель можно через CLI `hf`:

«`
`pip install -U «huggingface_hub»
hf download ByteDance/Bernini-Diffusers-v2 —local-dir pretrained_models/Bernini-Diffusers-v2`
«`

Затем запустите вывод, передав каталог в параметр `—config`:

«`
`git clone https://github.com/bytedance/Bernini.git bernini && cd bernini
pip install -r requirements.txt
python infer_single_gpu.py —config pretrained_models/Bernini-Diffusers-v2 \
—case assets/testcases/i2i/i2i.json —num_frames 1`
«`

Статья доступна на arXiv:2605.22344.

GitHub
https://github.com/bytedance/Bernini.git