GigaChat 3.5 Ultra вышла в открытый доступ: что даёт модель на 432 млрд параметров

В открытом доступе появилась GigaChat 3.5 Ultra — крупная многоязычная MoE-модель на 432 млрд параметров, из которых при обработке запроса активируется около 28 млрд. Релиз состоялся 6 июля 2026 года, поэтому это не срочная новость, а разбор возможностей и требований модели для разработчиков и AI-интеграторов.
Модель распространяется под лицензией MIT и предназначена для программирования, математики, работы с инструментами, агентных сценариев и анализа длинного контекста. Официальная карточка модели содержит основные архитектурные характеристики, варианты весов и инструкции для запуска.
Что изменилось в GigaChat 3.5 Ultra
Предыдущий флагман GigaChat 3.1 Ultra насчитывал около 700 млрд параметров. Новая версия уменьшена примерно на 40%, но разработчики заявляют об улучшениях в коде, математике и агентных задачах. Сравнение качества в карточке модели основано преимущественно на оценках команды, поэтому результаты желательно подтверждать на собственных данных и независимых тестах.
Ключевая особенность — гибридная архитектура, объединяющая Multi-head Latent Attention и слои линейного внимания GatedDeltaNet. Модель также использует подход Mixture of Experts: полный набор параметров хранится в памяти, но для каждого токена активируется только часть экспертов. Это сокращает объём вычислений относительно плотной модели сопоставимого общего размера, хотя требования к хранению весов всё равно остаются высокими.
Почему разработчики говорят об экономии памяти
По данным официальной карточки, GigaChat 3.5 Ultra требует примерно в четыре раза меньше KV-кэша на токен, чем предыдущий флагман. В ту же память можно поместить более чем вдвое больший контекст, а пропускная способность генерации под нагрузкой заявлена выше примерно на 20%.
KV-кэш хранит промежуточные представления уже обработанных токенов. При длинных документах и одновременной работе нескольких пользователей он способен занимать значительную часть видеопамяти. Поэтому сокращение кэша влияет не только на максимальную длину запроса, но и на число параллельных сессий, которые обслуживает сервер.
Для ускорения генерации предусмотрены две MTP-головы — механизм предсказания нескольких последующих токенов. Команда заявляет ускорение до 2,2 раза в подходящем inference-стеке. Реальный прирост будет зависеть от оборудования, квантизации, длины контекста, пакетирования и поддержки нужных ядер.
Можно ли запустить модель локально
Технически да: опубликованы основные веса, bf16- и FP8-варианты, базовая версия для дообучения, контрольные точки и сборки GGUF для llama.cpp. Но слово «локально» здесь означает мощный сервер или кластер, а не обычный рабочий ноутбук.
Даже при квантизации модель на 432 млрд параметров занимает сотни гигабайт. Помимо самих весов, нужны память для KV-кэша, служебных буферов и параллельных запросов. Запуск части слоёв на CPU возможен, но обычно резко снижает скорость. Для продуктовой эксплуатации важны также быстрая межсоединительная сеть между ускорителями и корректная поддержка гибридного внимания в runtime.
- Исследовательский запуск: квантизированная GGUF-сборка и llama.cpp на сервере с большим объёмом общей памяти.
- Высокопроизводительный inference: FP8-веса, несколько современных GPU и оптимизированный сервер генерации.
- Дообучение: базовые веса и контрольные точки, но требования к инфраструктуре существенно выше простого inference.
- Оценка без своей инфраструктуры: доступ через пользовательский сервис или API, если он поддерживает нужную версию и условия использования.
Где модель может быть полезна в Узбекистане
Главный практический интерес — качественная работа на русском языке и возможность развёртывания открытых весов в контролируемой инфраструктуре. Это важно для банков, телеком-компаний, государственных систем и крупных предприятий, которым нужно управлять размещением данных и журналами запросов.
Потенциальные сценарии включают анализ русскоязычных документов, корпоративный поиск, подготовку кода, автоматизацию контакт-центров и агентов, работающих с внутренними инструментами. Но для узбекоязычных задач требуется отдельная оценка: мультиязычность сама по себе не гарантирует одинаковое качество на русском, узбекском и смешанных запросах.
Что проверить перед внедрением
- собрать собственный набор задач на русском и узбекском языках;
- измерить точность вызова инструментов и устойчивость длинных агентных цепочек;
- проверить галлюцинации, токсичность и обработку чувствительных данных;
- рассчитать стоимость одного миллиона токенов с учётом оборудования и загрузки;
- сравнить квантизированные версии с исходными весами;
- провести аудит генерируемого кода и ограничить полномочия агента;
- зафиксировать версию модели, шаблон диалога и параметры генерации.
Лицензия MIT допускает коммерческое использование при сохранении её условий, однако она не снимает с компании ответственность за данные, результаты модели и безопасность продукта. Для регулируемых отраслей необходимы отдельные процедуры валидации, человеческого контроля и управления инцидентами.
Итог
GigaChat 3.5 Ultra интересна не рекордным числом параметров, а попыткой сделать очень крупную открытую модель эффективнее при длинном контексте и массовом inference. Для большинства команд разумный первый шаг — не закупка оборудования, а короткое сравнительное тестирование на реальных русско- и узбекоязычных задачах. Только после него можно оценить, оправдывает ли качество модели стоимость собственной инфраструктуры.









