Qwen3.8-Flash-Next и GLM-5.3-Flash: что выбрать для AI-агентов

26 августа 2026 года сразу две китайские команды открыли веса новых мультимодальных моделей, ориентированных на программирование, работу с инструментами и длинный контекст: Qwen3.8-Flash-Next от Alibaba и GLM-5.3-Flash от Z.ai. Оба релиза обещают высокую эффективность, но устроены по-разному и требуют осторожного сравнения.
Для разработчиков и интеграторов в Узбекистане важен не только результат в таблице бенчмарков. Практический выбор будет зависеть от требуемой памяти, зрелости программного стека, качества русского и узбекского языков, стоимости эксплуатации и правил работы с корпоративными данными.
Что представляет собой Qwen3.8-Flash-Next
Qwen называет модель экспериментальным превью архитектуры, которая станет основой Qwen4. Языковая часть содержит 125 млрд параметров, из которых на каждом шаге активируются 6 млрд. Дополнительно используются 51 млрд параметров n-граммных представлений и 4 млрд параметров механизма предсказания нескольких токенов.
Ключевое изменение — Qwen Sparse Attention. Механизм выбирает для обработки не отдельные токены, а небольшие блоки, чтобы снизить задержку на длинном контексте. Нативное окно составляет 262 144 токена, а с расширением может достигать одного миллиона. Модель также получила визуальный энкодер и способна принимать изображения наряду с текстом.
Открытая FP8-версия опубликована в формате Hugging Face Transformers и заявлена как совместимая с vLLM, SGLang и другими популярными средствами инференса. При этом Qwen отдельно предупреждает: Flash-Next — архитектурное превью. Для production компания предлагает Qwen3.8-Flash с дополнительными встроенными инструментами и миллионным контекстом по умолчанию.
Чем отличается GLM-5.3-Flash
GLM-5.3-Flash — первая нативно мультимодальная модель в линейке GLM-5. По данным Z.ai, она содержит 320 млрд параметров, но при генерации активирует 18 млрд. Архитектура сочетает разреженное и линейное внимание, а для повышения эффективности масштабирования применяет Manifold-Constrained Hyper-Connections.
Компания сообщает, что модель обучалась на мультимодальном корпусе объёмом 30 трлн токенов. Для самостоятельного развёртывания официально перечислены SGLang, vLLM, TokenSpeed и KTransformers. В карточке также приведены сценарии оценки с контекстом до одного миллиона токенов, хотя конкретный рабочий лимит и производительность необходимо проверять в выбранном серверном стеке.
Z.ai заявляет, что GLM-5.3-Flash превосходит предыдущую GLM-5.2 и приближается к Claude Opus 4.8 в задачах программирования и агентной работы при существенно меньшей цене API. Это данные самого разработчика, а не независимое тестирование, поэтому использовать их как окончательный рейтинг моделей нельзя.
Почему активные параметры не равны требованиям к памяти
Цифры 6 млрд и 18 млрд активных параметров могут создать впечатление, что модели легко запускаются на обычном компьютере. Это неверный вывод. В MoE-архитектуре вычисления выполняет лишь часть экспертов, однако полные веса модели всё равно необходимо хранить в оперативной или видеопамяти либо постоянно переносить между уровнями хранения.
Полная Qwen3.8-Flash-Next включает значительно больше 125 млрд параметров с учётом дополнительных представлений, а GLM-5.3-Flash — около 320 млрд. Даже при FP8 или более агрессивной квантизации речь идёт о серверном оборудовании, нескольких ускорителях или компромиссном offload в системную память. «Открытые веса» означают возможность контролировать развёртывание, но не означают дешёвый домашний запуск.
Как выбирать модель для бизнеса и разработки
Qwen3.8-Flash-Next выглядит интереснее как экспериментальная платформа для исследования эффективного длинного контекста и мультимодальных агентов. GLM-5.3-Flash позиционируется как более крупная система для сложного coding и tool-use, но потребует более тяжёлой инфраструктуры. Сравнивать опубликованные разработчиками баллы напрямую рискованно: модели тестировались с разными агентными обвязками, настройками контекста и методиками оценки.
Перед внедрением компании стоит собрать собственный набор задач: исправление ошибок в реальном репозитории, создание тестов, обработка русскоязычной документации, работа с узбекскими запросами, вызов внутренних API и устойчивость к неверным действиям агента. Отдельно измеряются скорость первого токена, полное время задачи, число повторных попыток и итоговая стоимость, а не только цена миллиона токенов.
Для организаций с требованиями к локализации данных открытые веса дают возможность разместить модель в собственном дата-центре или у регионального облачного провайдера. Однако преимущества появляются только при достаточной загрузке инфраструктуры и наличии команды, способной поддерживать драйверы, сервер инференса, мониторинг, контроль доступа и обновления безопасности.
Практический вывод
Оба релиза показывают общий тренд: открытые модели становятся мультимодальными и проектируются специально под длинные агентные процессы. Qwen делает ставку на малое число активных параметров и экспериментальную архитектуру будущей Qwen4; Z.ai — на более крупную модель с гибридным вниманием и заявленной силой в программировании.
Начинать лучше не с закупки серверов, а с ограниченного пилота через API или временную GPU-инфраструктуру. После проверки качества на собственных данных можно оценить квантизацию и локальное размещение. Все результаты производителей следует считать заявленными до появления независимых воспроизводимых тестов.
Первоисточники
Официальная карточка Qwen3.8-Flash-Next на Hugging Face
Технический обзор архитектуры Qwen3.8-Flash-Next









