MoVA: новая архитектура внимания для больших языковых моделей
3 сентября 2026 года Institute of Foundation Models - подразделение MBZUAI - представил линейку из шести открытых моделей K2 Horizon. Размер моделей варьируется от 0,9 до 375 млрд параметров, однако наибольший технический интерес вызвала не самая крупная версия, а K2-Horizon-MoVA-36B-A4B.
Эта модель содержит около 36 млрд параметров, но при обработке отдельного токена задействует лишь примерно 4 млрд. Подобное соотношение стало возможным благодаря сразу двум уровням разреженности: классическому MoE в FFN-блоках и новой технологии MoVA, которая переносит маршрутизацию экспертов непосредственно в механизм внимания.
Как работает классический MoE
В стандартном трансформере каждый блок обычно включает attention и feed-forward network. Именно FFN чаще всего занимает основную часть параметров, поэтому разработчики заменяют одну крупную сеть набором небольших экспертных модулей.
Для каждого токена маршрутизатор выбирает несколько наиболее подходящих экспертов - обычно top-k из общего пула. Затем их результаты объединяются с учетом весов маршрутизации. Нередко в архитектуру добавляют shared expert, который активируется постоянно и сохраняет общие знания модели.
Такой подход позволяет хранить емкость на сотни миллиардов параметров, одновременно ограничивая вычисления для конкретного токена. Поэтому в характеристиках современных MoE-моделей отдельно указывают общее и активное число параметров. В этом принципе работают многие актуальные решения, включая DeepSeek-V3, Qwen3-MoE и Nemotron.
Однако у традиционного MoE разреженность затрагивает только FFN. Attention при этом остается плотным: проекции Q, K и V вычисляются для каждого токена независимо от его содержания.
Что добавляет MoVA
MoVA расшифровывается как Mixture-of-Value Attention. Эта MoVA модель искусственного интеллекта использует знакомую схему "маршрутизатор - top-k экспертов - взвешенное объединение", но применяет ее к value-проекциям внутри attention.
В классическом механизме внимания:
- Q и K определяют, на какие токены следует обратить внимание;
- V содержит информацию, которая будет передана дальше по остаточному потоку.
В K2-Horizon запросы Q и ключи K формируются плотным способом, как в обычном трансформере. Разреживанию подвергается только V: вместо одной value-проекции используется набор специализированных экспертов, а маршрутизатор выбирает несколько из них для каждого токена.
Именно здесь заключается ключевое отличие MoVA. Q и K сохраняют единое пространство определения релевантности, а value-пространство получает возможность адаптироваться к контексту. Подробный разбор того, как устроена MoVA архитектура внимания для больших языковых моделей, показывает, что такой подход не заменяет attention, а расширяет его внутреннюю специализацию.
Архитектура K2-Horizon-MoVA-36B-A4B
По данным анализа реализации, модель построена на модульной основе, близкой к Qwen3MoE. В attention используется сигмоидальный маршрутизатор, а после выбора экспертов применяется post-gate на базе softplus. Это отличается от распространенной схемы softmax-top-k, которая часто применяется в FFN-экспертах.
Основные характеристики модели выглядят следующим образом:
- около 36 млрд параметров, или 37,44 млрд с учетом эмбеддингов;
- примерно 4 млрд активных параметров на токен;
- 48 слоев, из которых 3 плотных и 45 MoE-слоев;
- hidden size - 2560;
- 100 маршрутизируемых FFN-экспертов, top-8 активных и один shared expert;
- 64 value-эксперта в attention, top-4 активных на слой;
- контекстное окно до 512K токенов;
- отдельные input- и output-эмбеддинги без разделения весов;
- формат весов BF16;
- лицензия Apache 2.0.
Таким образом, K2 Horizon MoVA сочетает два независимых механизма разреживания. Первый повышает емкость FFN, второй расширяет емкость value-пространства внимания. При этом количество вычислений на токен остается значительно ниже, чем у плотной модели сопоставимого общего размера.
MoVA и MoE: принципиальная разница
Классический MoE маршрутизирует токены между полноценными FFN-экспертами. Каждый такой эксперт представляет собой отдельную небольшую нейросеть, отвечающую за преобразование скрытого состояния.
MoVA действует тоньше. Она не выбирает целые FFN-блоки, а распределяет токен между value-экспертами в attention. Q/K-проекции и операция вычисления внимания остаются общими, тогда как содержимое, передаваемое через V, может формироваться разными специализированными модулями.
Это можно представить как разделение двух функций: Q и K отвечают за вопрос "куда смотреть", а MoVA определяет, "какую именно информацию извлечь и передать дальше". Такой подход потенциально дает модели более гибкое поведение в задачах, где один и тот же источник контекста должен интерпретироваться по-разному.
Важное практическое свойство архитектуры состоит в совместимости с FlashAttention и GQA. MoVA не является отдельным медленным вычислительным контуром, а встраивается в существующий pipeline обработки внимания. Это снижает барьер для использования технологии в современных системах инференса.
Академические предпосылки и эффективность
Идея специализации value-пространства логично продолжает развитие разреженных архитектур. Если разделение FFN на экспертов помогает модели хранить больше знаний без пропорционального роста вычислительной нагрузки, аналогичный принцип может быть применен к передаваемым значениям внимания.
При этом сохранение плотных Q/K снижает риск потери устойчивости механизма поиска релевантной информации. Модель не меняет базовую логику сопоставления запросов и ключей, но получает дополнительные варианты преобразования найденного контента.
Особенно интересен баланс между общей и активной емкостью. В K2-Horizon-MoVA-36B-A4B суммарное число параметров значительно выше объема вычислений, необходимых для одного токена. Это делает архитектуру привлекательной для сценариев, где важны длинный контекст, высокая пропускная способность и ограниченный бюджет GPU.
Разреженные модели также позволяют эффективнее масштабировать хранение знаний. В теории разные value-эксперты могут специализироваться на различных типах контекста: коде, диалогах, математических рассуждениях или структурированных документах. Насколько четко такое разделение формируется в процессе обучения, зависит от данных и качества маршрутизатора, но сама архитектура создает для этого необходимые условия.
Почему MoVA важна
До появления MoVA внимание в основном оптимизировали за счет уменьшения длины контекста, использования GQA, FlashAttention и других способов ускорить работу Q/K/V-проекций. Новый подход предлагает другой путь: увеличить выразительность value-компоненты без активации всех параметров одновременно.
В результате MoVA технология обработки контекста может оказаться полезной для моделей, которым приходится работать с большими документами, сложными инструкциями и неоднородными данными. Дополнительная специализация особенно перспективна в системах, где модель должна одновременно выполнять роль чат-бота, программиста, аналитика и инструмента поиска по корпоративной базе знаний.
При этом архитектура пока требует независимых сравнений. Одного снижения активного числа параметров недостаточно, чтобы гарантировать превосходство над плотными или классическими MoE-моделями. Важны качество обучения маршрутизаторов, стабильность на длинном контексте, задержка инференса и реальная эффективность на доступном оборудовании.
Практический запуск
Для эксплуатации модели потребуется программный стек с поддержкой MoE и нестандартных value-экспертов. Наиболее важны совместимость версии inference-фреймворка с архитектурой K2 Horizon, корректная работа BF16, поддержка FlashAttention и возможность обрабатывать контекст размером до сотен тысяч токенов.
При ограниченной видеопамяти запуск полной версии может быть затруднен, несмотря на небольшое активное число параметров: веса всех экспертов все равно должны размещаться в памяти или распределяться между устройствами. Поэтому на практике потребуются квантование, CPU offload либо многокарточная конфигурация.
В целом MoVA представляет собой не просто еще одну разновидность MoE, а отдельное направление развития архитектур внимания. Если результаты тестирования подтвердят преимущества подхода, маршрутизация value-проекций может стать следующим стандартным инструментом масштабирования больших языковых моделей.

