NVIDIA Groq 3 LPX: зачем AI-агентам отдельная инфраструктура инференса

24 августа 2026 года NVIDIA сообщила, что система Groq 3 LPX для платформы Vera Rubin перешла в серийное производство. Это отдельный класс ускорителей для инференса — этапа, на котором уже обученная модель генерирует ответы, вызывает инструменты и выполняет действия. Новая архитектура ориентирована прежде всего на AI-агентов с длинным контекстом и сотнями последовательных шагов.
Главное обещание LPX — не просто высокая общая производительность, а быстрое и предсказуемое появление каждого следующего токена. Для чат-бота небольшая задержка может быть почти незаметна. В агентном процессе она повторяется после каждого обращения к модели, базе данных, поиску или внешнему API и в итоге превращает секунды в минуты.
Что именно представила NVIDIA
NVIDIA Groq 3 LPX работает вместе с Vera Rubin NVL72. Rubin GPU предоставляет память HBM и вычислительные ресурсы для тяжёлых операций, а LPU использует большой объём быстрой SRAM и детерминированное выполнение для генерации токенов с низкой задержкой. По описанию производителя, GPU и LPU совместно вычисляют каждый слой модели для каждого выходного токена.
Одна стойка LPX объединяет 256 LPU-ускорителей. У каждого чипа заявлены 500 МБ SRAM, пропускная способность SRAM 150 ТБ/с и 2,5 ТБ/с межчипового обмена. На уровне стойки это 128 ГБ SRAM, 40 ПБ/с пропускной способности SRAM и 640 ТБ/с масштабируемого соединения между процессорами.
Архитектура не заменяет GPU универсально. Она добавляет специализированный слой для декодирования и интерактивного инференса, тогда как Rubin остаётся основой платформы. В этом и состоит подход совместного проектирования: вычисления, память, сеть и программное обеспечение оптимизируются как единая система.
Как читать цифру 3400 токенов в секунду
В опубликованном NVIDIA результате система достигла 3400 выходных токенов в секунду на модели Gemma 4 31B при контексте 100 тысяч токенов. Компания утверждает, что это в четыре раза выше показателя ближайшей альтернативной платформы в тесте Artificial Analysis.
Это заметный показатель, но его нельзя автоматически переносить на любую модель и нагрузку. Скорость зависит от размера модели, длины входа, числа одновременных пользователей, режима кэширования, точности вычислений и сетевой конфигурации. Вендор также заявляет до 35 раз больше пропускной способности на мегаватт для моделей триллионного масштаба. На продуктовой странице отдельно указано, что часть сравнений и экономических оценок является прогнозной и может измениться.
Для заказчика важнее не рекорд в одном тесте, а полный профиль сервиса: время до первого токена, скорость последующей генерации, задержки p95 и p99, производительность при реальной конкуренции запросов, энергопотребление, стоимость завершённого агентного сценария и поддержка нужных моделей.
Почему AI-агенты меняют требования к инфраструктуре
Обычный диалог обычно содержит один запрос и один ответ. Агент может спланировать задачу, прочитать десятки документов, написать код, запустить тест, проанализировать ошибку и повторить цикл. Каждый шаг создаёт новые токены и увеличивает контекст. NVIDIA оценивает потребление токенов агентными системами как величину до 15 раз выше, чем у традиционных AI-приложений.
Из-за последовательности действий ускорение отдельного шага даёт накопительный эффект. Если агент делает 200 обращений к модели и каждое ожидание сокращается всего на секунду, пользователь получает результат более чем на три минуты раньше. Для голосовых интерфейсов, торговых систем, поддержки клиентов и совместной работы нескольких агентов задержка становится частью качества продукта, а не только характеристикой дата-центра.
Когда технология станет доступна
NVIDIA заявляет, что Groq 3 LPX находится в производстве. Однако это не означает немедленную доступность одинаковой мощности во всех облаках и регионах. Nebius назван первым облачным провайдером, который внедряет LPX. Компания Groq также сообщила, что планирует одной из первых развернуть Groq 3 LPX и Vera Rubin NVL72 вместе с Dell Technologies в своей инфраструктуре инференса.
Сроки открытия конкретных инстансов, цены, география и перечень поддерживаемых моделей будут зависеть от каждого провайдера. Организациям не стоит строить бюджет на заявленной «возможности увеличить выручку в десять раз»: на странице NVIDIA это модельная оценка для AI-фабрик, а не гарантированный финансовый результат клиента.
Что это означает для бизнеса и интеграторов в Узбекистане
Для узбекских компаний LPX важен прежде всего как сигнал о специализации рынка. Инфраструктура для обучения моделей и инфраструктура для массового агентного инференса всё сильнее расходятся. Банкам, телеком-операторам, маркетплейсам и государственным платформам при закупке AI-сервисов придётся оценивать не только модель, но и архитектуру её исполнения.
Первое — измерять бизнес-сценарий целиком. Пилот должен учитывать число шагов агента, вызовы инструментов и процент успешно завершённых задач, а не только токены в секунду.
Второе — проверять экономику под нагрузкой. Нужны стоимость одной завершённой операции, энергозатраты, лимиты параллельности и цена резервной мощности. Быстрый чип не гарантирует дешёвый сервис при неэффективном приложении.
Третье — заранее решить вопросы данных. Следует уточнить регион обработки, правила хранения контекста, журналирование, шифрование, SLA и возможность переноса модели. Публичного подтверждения локальной доступности Groq 3 LPX в Узбекистане пока нет.
Практический вывод
Groq 3 LPX показывает, что узким местом AI-агентов становится не только качество модели, но и скорость длинной цепочки инференса. Для разработчиков это повод добавить в наблюдаемость время каждого обращения к модели и инструмента. Для руководителей — сравнивать платформы по стоимости готового результата и стабильности задержек. А для дата-центров — готовиться к гибридным системам, где GPU, специализированные LPU, память и сеть работают как единая фабрика токенов.
Все показатели производительности приведены по материалам NVIDIA и партнёров. Перед закупкой или миграцией необходим независимый тест на собственной модели, данных и целевом профиле нагрузки.
Первоисточники
NVIDIA: Groq 3 LPX в составе Vera Rubin
Официальная страница NVIDIA Groq 3 LPX
Технический обзор NVIDIA
Groq: план развёртывания LPX вместе с Dell









