Skip to main contentSkip to footer

GigaChat 3.5 Ultra вышла в открытый доступ: что даёт модель на 432 млрд параметров

Инженеры тестируют большую языковую модель на серверной инфраструктуре

В открытом доступе появилась GigaChat 3.5 Ultra — крупная многоязычная MoE-модель на 432 млрд параметров, из которых при обработке запроса активируется около 28 млрд. Релиз состоялся 6 июля 2026 года, поэтому это не срочная новость, а разбор возможностей и требований модели для разработчиков и AI-интеграторов.

Модель распространяется под лицензией MIT и предназначена для программирования, математики, работы с инструментами, агентных сценариев и анализа длинного контекста. Официальная карточка модели содержит основные архитектурные характеристики, варианты весов и инструкции для запуска.

Что изменилось в GigaChat 3.5 Ultra

Предыдущий флагман GigaChat 3.1 Ultra насчитывал около 700 млрд параметров. Новая версия уменьшена примерно на 40%, но разработчики заявляют об улучшениях в коде, математике и агентных задачах. Сравнение качества в карточке модели основано преимущественно на оценках команды, поэтому результаты желательно подтверждать на собственных данных и независимых тестах.

Ключевая особенность — гибридная архитектура, объединяющая Multi-head Latent Attention и слои линейного внимания GatedDeltaNet. Модель также использует подход Mixture of Experts: полный набор параметров хранится в памяти, но для каждого токена активируется только часть экспертов. Это сокращает объём вычислений относительно плотной модели сопоставимого общего размера, хотя требования к хранению весов всё равно остаются высокими.

Почему разработчики говорят об экономии памяти

По данным официальной карточки, GigaChat 3.5 Ultra требует примерно в четыре раза меньше KV-кэша на токен, чем предыдущий флагман. В ту же память можно поместить более чем вдвое больший контекст, а пропускная способность генерации под нагрузкой заявлена выше примерно на 20%.

KV-кэш хранит промежуточные представления уже обработанных токенов. При длинных документах и одновременной работе нескольких пользователей он способен занимать значительную часть видеопамяти. Поэтому сокращение кэша влияет не только на максимальную длину запроса, но и на число параллельных сессий, которые обслуживает сервер.

Для ускорения генерации предусмотрены две MTP-головы — механизм предсказания нескольких последующих токенов. Команда заявляет ускорение до 2,2 раза в подходящем inference-стеке. Реальный прирост будет зависеть от оборудования, квантизации, длины контекста, пакетирования и поддержки нужных ядер.

Можно ли запустить модель локально

Технически да: опубликованы основные веса, bf16- и FP8-варианты, базовая версия для дообучения, контрольные точки и сборки GGUF для llama.cpp. Но слово «локально» здесь означает мощный сервер или кластер, а не обычный рабочий ноутбук.

Даже при квантизации модель на 432 млрд параметров занимает сотни гигабайт. Помимо самих весов, нужны память для KV-кэша, служебных буферов и параллельных запросов. Запуск части слоёв на CPU возможен, но обычно резко снижает скорость. Для продуктовой эксплуатации важны также быстрая межсоединительная сеть между ускорителями и корректная поддержка гибридного внимания в runtime.

  • Исследовательский запуск: квантизированная GGUF-сборка и llama.cpp на сервере с большим объёмом общей памяти.
  • Высокопроизводительный inference: FP8-веса, несколько современных GPU и оптимизированный сервер генерации.
  • Дообучение: базовые веса и контрольные точки, но требования к инфраструктуре существенно выше простого inference.
  • Оценка без своей инфраструктуры: доступ через пользовательский сервис или API, если он поддерживает нужную версию и условия использования.

Где модель может быть полезна в Узбекистане

Главный практический интерес — качественная работа на русском языке и возможность развёртывания открытых весов в контролируемой инфраструктуре. Это важно для банков, телеком-компаний, государственных систем и крупных предприятий, которым нужно управлять размещением данных и журналами запросов.

Потенциальные сценарии включают анализ русскоязычных документов, корпоративный поиск, подготовку кода, автоматизацию контакт-центров и агентов, работающих с внутренними инструментами. Но для узбекоязычных задач требуется отдельная оценка: мультиязычность сама по себе не гарантирует одинаковое качество на русском, узбекском и смешанных запросах.

Что проверить перед внедрением

  • собрать собственный набор задач на русском и узбекском языках;
  • измерить точность вызова инструментов и устойчивость длинных агентных цепочек;
  • проверить галлюцинации, токсичность и обработку чувствительных данных;
  • рассчитать стоимость одного миллиона токенов с учётом оборудования и загрузки;
  • сравнить квантизированные версии с исходными весами;
  • провести аудит генерируемого кода и ограничить полномочия агента;
  • зафиксировать версию модели, шаблон диалога и параметры генерации.

Лицензия MIT допускает коммерческое использование при сохранении её условий, однако она не снимает с компании ответственность за данные, результаты модели и безопасность продукта. Для регулируемых отраслей необходимы отдельные процедуры валидации, человеческого контроля и управления инцидентами.

Итог

GigaChat 3.5 Ultra интересна не рекордным числом параметров, а попыткой сделать очень крупную открытую модель эффективнее при длинном контексте и массовом inference. Для большинства команд разумный первый шаг — не закупка оборудования, а короткое сравнительное тестирование на реальных русско- и узбекоязычных задачах. Только после него можно оценить, оправдывает ли качество модели стоимость собственной инфраструктуры.

Первоисточники

Интересное