Открытая претрейн‑версия крупной языковой модели и перспективы суверенного ИИ

Раскрываются детали претрейн‑версии крупной языковой модели и архитектурные решения для будущей единой рассуждающей системы.

Модель насчитывает около 80 млрд параметров, активны примерно 3 млрд на данный момент, применяется архитектура Mixture of Experts. Для маршрутизации используется подход без auxiliary‑loss‑free, и 36 из 48 слоёв задействована система внимания Kimi Delta Attention.

Эта экспериментальная версия исследует архитектурные решения для будущей единой рассуждающей модели, которая должна стать основой агентной функциональности.

Зачем это нужно

Публикации подчёркивают, что остаётся ограниченный набор полностью отечественных фундаментальных языковых моделей — по мере роста мирового рынка мощностей отечественные решения пока выглядят менее масштабными.

Обсуждаются принципы суверенного ИИ и возможность применения в госуправлении и образовании, а также необходимость внедрения таких решений в бизнес‑практику.

После релиза обсуждались характеристики модели и сопоставлялись с существующими решениями: упоминалось, что крупные образцы достигают сотен миллиардов параметров.

Дискуссии продолжаются в контексте политики и стимулирования сотрудничества между государством и частным сектором для создания суверенного ИИ.