EVOKE 14B: Открытая интерактивная мировая модель Alaya Lab с 3 шагамиПоследнее обновление: 15 августа 2026 г.ComfyUI WikinewsМы расскажем о свежем релизе от Alaya Lab — модели EVOKE с 14 миллиардами параметров, которая генерирует видео в разрешении 384×640 всего за 3 шага денойзинга без classifier-free guidance. Фишка модели — внешнее хранилище состояния мира и возможность менять промпт прямо во время генерации.
Alaya Lab выпустила EVOKE — интерактивную мировую модель с 14B параметров, способную создавать видео 384×640 при 24 fps всего за 3 шага денойзинга с нулевым classifier-free guidance. Геометрия сцены хранится во внешнем банке состояния мира с индексацией по камере, благодаря чему сессии могут длиться бесконечно без раздувания контекста денойзера, а промпты можно менять в середине прогона без перезапуска.
Обзор
EVOKE (полное название — «Endless Interactive World with Bounded State and Long-Horizon Supervision») приходит на смену модели AlayaWorld от тех же разработчиков. В научной статье подробно описана трёхшаговая мировая модель без CFG, которая показывает результаты уровня state-of-the-art на интерактивном бенчмарке WBench и остаётся конкурентоспособной на VBench-Long и VBench-2.0.
Дистиллированная модель выдаёт видео 384×640 при 24 fps и сохраняет когерентность на протяжении 30-секундных прогонов — каждые 2,11 секунды на одном H200 она генерирует 1,5 секунды видео. Веса уже открыты на Hugging Face, а скрипты для запуска вывода и обучения лежат в GitHub-репозитории.
EVOKE overview video
Официальное обзорное видео EVOKE
Генерация за три шага, ноль CFG
Большинство малоплаговых моделей наследуют потолок качества от учителя, на котором проводилась дистилляция. В EVOKE этот подход пересмотрели: учитель был спроектирован заново под задачу долгосрочной интерактивной генерации. Поблочная группировка, извлечение далёких кадров и глобальное состояние с линейным вниманием позволяют памяти и вычислениям учителя расти линейно с длиной сессии — а это открывает дорогу к 30-секундному обучению с самопринуждением (self-forced).
Целевая функция согласования распределений, применяемая при self-forced прогонах, переносит эти возможности на трёхшагового студента, который обходится без classifier-free guidance: один прямой проход на шаг вместо двух.

Конвейер вывода EVOKE: постоянный банк состояния мира питает авторегрессивный малоплаговый денойзер
Бесконечный, а не оконный
Главный конфликт интерактивных мировых моделей известен: хранение истории в контексте денойзера или в кэше ключ-значение увеличивает расходы по мере роста сессии, а интерактивность с низкой задержкой требует малоплаговой генерации. EVOKE решает задачу, вынося постоянное состояние мира наружу:
- Запись: монокулярная модель глубины оценивает глубину для каждого сгенерированного блока при известных позах камеры и разворачивает её в постоянное облако точек.
- Чтение: текущая поза камеры напрямую обращается к банку; до восьми источников, ранжированных по совместной видимости, объединяются с помощью пакетного z-buffered scatter — на выходе искажённое изображение плюс попиксельная маска видимости.
- Вытеснение: опциональное окно удержания, которое включается явно для прогонов длительностью в часы.
Денойзер получает только ту информацию, что релевантна текущему ракурсу, поэтому его контекст остаётся ограниченным независимо от длины сессии — длину больше не приходится приносить в жертву памяти.
Изменение мира на лету
Поблочное conditioning позволяет переключать промпт прямо во время прогона — без обрыва и без перезапуска. Каждый из сценариев ниже переключается на блоке 3 из 6 (213 кадров, 8,9 с):
| сцена | промпт переключается на| замерзшая тундра, полярный день | по всему небу вспыхивает полярное сияние
| навигация по постоянному миру | камера движется и поворачивается, а мир сохраняет свое пространственное состояние
Режимы conditioning
Режим | Вход | Управление камерой `v2v` | эталонное видео + трек поз | да, продолжается за пределами эталонного окна `i2v` | один первый кадр + трек поз | да `t2v` | только промпт | нет (движок запрещает warp + t2v)
Демонстрация возможностей: навигация по сгенерированному миру как в игре (с официальной страницы проекта)
Состав релиза
В релиз вошли четыре модели плюс базовые компоненты:
Каталог | Модель | Шаги `stage3_post_distillation` | поставляемая модель | 3, без CFG `stage1_camera_control` | многошаговая модель с управлением камерой | 50, CFG 5.0 `stage2_few_step_training` | малоплаговая дистилляция (3-шаговая пирамида) | только обучение `evoke_teacher` | учитель DMD с двумя экспертами | 50, CFG 5.0
Каждый каталог EVOKE является родительским для `transformer/` и загружается через `from_pretrained(path, subfolder=»transformer»)`. Дистиллированные модели обучались только на conditioning v2v, поэтому `i2v` и `t2v` на них работают в режиме zero-shot; все три режима в дистрибуции имеет только `stage1_camera_control`. VAE, текстовый энкодер, tokenizer и scheduler в `evoke-base` взяты из выпущенной базы Helios, которая, в свою очередь, берёт начало от Wan.
Доступность
На момент запуска EVOKE не имеет нативной поддержки ComfyUI. В официальном релизе доступны Python-скрипты для запуска вывода (`scripts/inference/infer_post_distill.sh`) — режимы text-to-video, image-to-video, video-to-video и сегменты в середине прогона, — а также скрипты запуска обучения для каждого этапа. Для банка состояния мира обязателен бэкенд глубины ViGeo; Depth-Anything-3 опционален. Веса ждут вас на Hugging Face: AlayaLab/Evoke.
| замерзшая тундра, полярный день | по всему небу вспыхивает полярное сияние
| навигация по постоянному миру | камера движется и поворачивается, а мир сохраняет свое пространственное состояние