GigaChat 3.5 Reasoning: MIT и локальный запуск

10 сентября 2026 года команда GigaChat опубликовала GigaChat 3.5 Reasoning — модель с рассуждениями, открытыми весами и кодом запуска. На Hugging Face указана лицензия MIT, доступны варианты FP8 для инференса и BF16 для дообучения или собственной квантизации.
Релиз интересен русскоязычным разработчикам и компаниям, которым требуется разворачивать ИИ в контролируемой инфраструктуре. Однако слово «открытая» не означает «лёгкая»: официальная конфигурация FP8 использует восемь ускорителей NVIDIA H100, а BF16 — 16 GPU на двух узлах.
Что представляет собой GigaChat 3.5 Reasoning
Это Mixture-of-Experts-модель с 432 млрд параметров, из которых при генерации активны 28 млрд. Заявленный максимальный контекст — 262 тысячи токенов. Модель поддерживает русский и английский языки, вызов функций, структурированный вывод и отдельную передачу цепочки рассуждения через серверные парсеры.
Постобучение начинается с SFT-чекпоинта. Затем команда отдельно обучила шесть экспертов: для STEM, обычного кода, агентной работы с репозиториями, взаимодействия с инструментами и памятью, диалога и следования инструкциям. Экспертов объединили в одну модель методом on-policy distillation, когда модель-ученик генерирует собственную траекторию, а профильный эксперт даёт обратную связь на уровне токенов.
Какие результаты заявляет разработчик
В опубликованных авторами тестах результат на AIME 2026 вырос с 67 у GigaChat 3.5 Ultra Instruct до 92, IFBench — с 43,66 до 77, SWE-bench Verified — с 42,6 до 64,7. Средний показатель по приведённой таблице вырос с 51,47 до 68,88.
Сравнение с DeepSeek V4 Flash Preview неоднозначно. GigaChat выше на AIME 2026, IFBench, StructEval и русскоязычных аренах, но уступает на HMMT, GPQA-Diamond, агентных и кодовых тестах, включая SWE-bench Verified и Terminal-Bench 2. Это важно учитывать вместо вывода о безусловном лидерстве.
Разработчик также сообщает о снижении среднего числа токенов рассуждения на 37% относительно DeepSeek V4 Flash Preview по четырём математическим наборам. Показатель рассчитан на заявленной выборке компании и не подтверждает автоматически меньшую стоимость в конкретной инфраструктуре: итог зависит от скорости GPU, длины контекста, параллелизма и нагрузки.
Почему модель полезна для русскоязычных проектов
Большинство открытых reasoning-моделей оптимизируется прежде всего для английского и китайского. GigaChat обучали на русскоязычных агентных средах, диалогах и задачах строгого структурированного вывода. Для команд в Узбекистане это может быть полезно в русскоязычной поддержке, внутренних базах знаний, анализе документов и разработке агентов для локального рынка.
Открытые веса позволяют проводить собственные тесты, ограничивать сетевой доступ и хранить чувствительные данные внутри выбранного контура. Лицензия MIT упрощает экспериментирование и коммерческую интеграцию, но компании всё равно должны проверить лицензии зависимостей, правила обработки данных и ограничения конкретного сценария.
Требования к GPU для локального запуска GigaChat 3.5 Reasoning
Официальный пример запуска FP8 через SGLang рассчитан на восемь H100. Для BF16 приведена двухузловая конфигурация с 16 GPU. Репозиторий модели сейчас не подключён ни к одному стандартному провайдеру инференса Hugging Face, поэтому простого запуска одной кнопкой через эту платформу нет.
Поддержка в SGLang и vLLM на момент публикации привязана к отдельным веткам или pull request. Это повышает операционный риск: перед производственным использованием нужно зафиксировать версии, проверить удалённый код, собрать контейнер, измерить стабильность и подготовить план обновлений.
Для большинства компаний выгоднее сначала протестировать модель через готовый сервис или арендованный GPU-кластер. Собственный кластер оправдан, если есть стабильная загрузка, требования к локализации данных, команда эксплуатации и понятная экономика по сравнению с API.
Чек-лист пилота для компании в Узбекистане
- Выбрать два-три измеримых сценария: поиск по внутренним документам, русскоязычная поддержка, анализ кода или выполнение структурированных операций.
- Собрать локальный набор тестов на русском и узбекском языках, включая фактическую точность, формат ответа и устойчивость к неоднозначным запросам.
- Сравнить FP8 с более компактными и квантизированными моделями по стоимости одного полезного ответа, а не только по бенчмаркам.
- Запускать сервер в изолированном контуре, ограничить доступ к инструментам и хранить журналы действий агентных сценариев.
- Проверить задержку, энергопотребление, доступность GPU, резервирование и стоимость эксплуатации при реальной нагрузке.
- Не использовать опубликованную цепочку рассуждения как доказательство корректности: финальные ответы и действия должны проходить независимую проверку.
Ограничения релиза
Все основные метрики опубликованы разработчиком. Конфигурации, промпты и судьи различаются между тестами, а часть оценок основана на LLM-судьях. До независимых воспроизводимых сравнений результаты следует считать ориентиром для пилота, а не гарантией производственного качества.
Большой контекст тоже не равен надёжной работе со всеми 262 тысячами токенов. Командам нужно отдельно измерять поиск фактов в длинных документах, сохранение инструкций, качество ссылок на источники и деградацию при увеличении входа.
Итог
GigaChat 3.5 Reasoning расширяет выбор открытых моделей для русскоязычных приложений: веса доступны по MIT, есть FP8 и BF16, поддерживаются инструменты и длинный контекст. Наиболее интересная часть релиза — не отдельный высокий результат, а сочетание русского языка, агентных навыков и возможности локального размещения.
Для рынка Узбекистана главный барьер — инфраструктура. Восемь H100 для официального FP8-примера означают, что релиз остаётся решением для дата-центров, крупных интеграторов и исследовательских команд. Начинать стоит с ограниченного пилота и собственной оценки качества, безопасности и полной стоимости владения.
Первоисточники
- Карточка GigaChat 3.5 Reasoning FP8 на Hugging Face
- Карточка версии BF16 на Hugging Face
- Технический разбор команды GigaChat на Хабре
- Репозиторий кода запуска на GitVerse
Примечание: характеристики и результаты тестов приведены по материалам разработчика. Перед производственным внедрением необходимы собственные нагрузочные, качественные и безопасностные испытания.









