Яндекс открыл исходный код новой суверенной ИИ-модели, обученной с нуля

Яндекс опубликовал в открытом доступе Alice AI Foundation LLM – претрейн-версию новой большой языковой модели, полностью обученной с нуля – без использования сторонних иностранных составляющих. Компания позиционирует ее как полностью суверенную.

Модель доступна под свободной лицензией Apache 2.0 и может использоваться для создания исследовательских и коммерческих решений.

Alice AI Foundation LLM демонстрирует высокие результаты в задачах программирования и рассуждений, а также в вопросах, требующих широких фактических знаний, значимых для русскоязычной аудитории. По ряду тестов модель опережает более крупные открытые решения, при этом требует меньше вычислительных ресурсов на этапе инференса.

Новая модель – экспериментальная платформа, на которой Яндекс тестирует архитектурные решения для будущей единой рассуждающей модели. 

В дальнейшем она должна лечь в основу агентных возможностей Алисы AI: пользователи смогут поручать помощнику выполнение конкретных действий и многошаговых задач.

Alice AI Foundation LLM построена на архитектуре Mixture of Experts, или MoE. Общее число параметров модели составляет 80 млрд, однако во время работы активируются только 3 млрд. Такой подход позволяет сочетать масштаб модели с высокой скоростью обработки запросов и умеренными требованиями к вычислительным ресурсам.

В модель заложены способности к рассуждению и работе в агентных сценариях. Это помогает ей решать сложные логические задачи и писать код. Например, в олимпиадных математических заданиях модель делит лидерство с Qwen3.5-35B-A3B-Base, решая большинство задач. В тестах на генерацию кода она превосходит NVIDIA Nemotron-3-Super-120B-Base, используя в четыре раза меньше активных параметров.

Навыки рассуждения и программирования важны для развития ИИ-агентов, способных самостоятельно выполнять действия по поручению пользователя: анализировать информацию, работать с сервисами, планировать последовательность шагов и контролировать результат.

На задачах, где требуются широкие фактические знания, Alice AI Foundation LLM опережает и более крупные открытые модели. В частности, речь идет о DeepSeek-V4-Flash-Base с 284 млрд параметров и 13 млрд активных параметров.

По результатам бенчмарков, проверяющих знание фактов, новая модель отвечает на уровне предыдущей закрытой модели Яндекса Alice AI LLM. При этом у нее в три раза меньше параметров и в семь раз меньше активных параметров.

Для оценки качества модели в задачах, актуальных для русскоязычной аудитории, Яндекс разработал два собственных бенчмарка – WikiWebFacts и HardMultiQA.

  • WikiWebFacts построен на парах «короткий вопрос – короткий ответ». Он проверяет знание дат, определений, событий и персоналий на основе материалов онлайн-энциклопедий и частотных агрегированных поисковых запросов.
  • HardMultiQA создан на базе анонимизированного потока запросов к Алисе AI. Он охватывает более редкие области знаний – включая медицину, право, IT и искусство. Задания требуют не только вспомнить отдельный факт, но и выбрать несколько верных вариантов, перечислить подходящие факты или определить ошибку в тексте.

Англоязычные наборы задач не всегда позволяют объективно оценивать знания, необходимые русскоязычным пользователям. Поэтому Яндекс также опубликовал оба бенчмарка, эталонные ответы и полный протокол оценки. Разработчики и исследователи смогут воспроизводить результаты и сравнивать разные модели на единых данных.

При обучении Alice AI Foundation LLM инженеры Яндекса доработали оптимизатор – компонент, который управляет процессом обучения модели. Передача данных между видеокартами была организована параллельно с вычислениями, что позволило примерно вдвое ускорить шаги оптимизации.

Команда также оптимизировала подготовку обучающих данных. Для отбора качественных документов требовалась оценка ресурсоемкой моделью: ее запуск на полном корпусе занял бы более 200 тыс. часов работы видеокарт. Вместо этого был создан каскад классификаторов: на каждом этапе более сложная и вычислительно затратная модель обрабатывает все меньший объем документов.

Такой подход позволил сократить объем вычислений в десятки раз и сохранить около 95% полезных документов. Дополнительно была расширена база знаний модели в областях права, медицины и математики.

Alice AI Foundation LLM уже прошла основной этап обучения, который определяет ее базовые знания, способности и потенциал. Модель можно использовать как основу для собственных решений и дообучать под специализированные задачи.

Модель, технические отчеты и бенчмарки уже доступны на платформе Hugging Face, а техрепорт – на Хабре.

Напомним, ранее Яндекс выложил в опенсорс языковую модель, которая лежит в основе быстрых ИИ-ответов в Поиске.

Источник: пресс-релиз Яндекса

(Голосов: 3, Рейтинг: 5)