Skip to main contentSkip to footer

GPT‑Live‑1 в API: что меняется для голосовых AI‑ассистентов

Специалист контакт-центра в Узбекистане тестирует голосового AI-ассистента GPT-Live-1

OpenAI 10 сентября 2026 года открыла доступ к GPT‑Live‑1 через API. Модель предназначена для голосовых приложений, которые должны одновременно слушать человека и говорить, корректно реагировать на паузы и перебивания, а сложные действия передавать отдельной модели или агенту на сервере.

Для бизнеса это не просто ещё один синтезатор речи. GPT‑Live‑1 меняет способ сборки голосового сервиса: диалог и выполнение задачи можно разделить на два слоя. Первый поддерживает естественный разговор, второй работает с CRM, базой знаний, расписанием, заказами и другими корпоративными системами.

Что именно выпустила OpenAI

GPT‑Live‑1 работает в режиме full duplex — принимает и формирует аудио одновременно. В традиционной схеме голос сначала превращается в текст, затем текстовая модель готовит ответ, после чего отдельный сервис синтезирует речь. Каждый переход увеличивает задержку и усложняет обработку перебиваний, коротких подтверждений и фонового шума.

Новая модель объединяет прослушивание и речь в одном голосовом слое. По данным OpenAI, она лучше учитывает молчание и шум, сохраняет контекст длинной сессии и позволяет задавать тон, темп и стиль ответа системной инструкцией. Встроены распознавание речи с транскриптами, текст ответа, определение границ реплик и настройка приоритета ключевых слов.

Компания заявляет, что GPT‑Live‑1 набрала на 30 процентных пунктов больше GPT‑Realtime‑2.1 в собственном Full Duplex Bench. Это результат тестов разработчика, а не независимая оценка, поэтому в реальном проекте качество нужно измерять на собственных звонках, языках и сценариях.

Голосовой слой и агент могут работать отдельно

Ключевой механизм GPT‑Live‑1 — делегирование. Модель ведёт разговор и решает, когда запрос требует более глубокого анализа или обращения к инструменту. Затем она передаёт задачу серверной модели, агенту или внешнему сервису, не прерывая сам диалог.

Разработчик может использовать управляемое делегирование через Responses API либо собственный контур. Во втором варианте приложение само определяет, какой контекст передавать, какие инструменты разрешать и какой результат возвращать в разговор. Backend-модель выбирается независимо от голосовой: простые операции можно направлять более быстрой и дешёвой модели, а сложные обращения — модели с усиленным рассуждением.

Важно, что приложение по-прежнему отвечает за права доступа, подтверждение опасных действий, выполнение закрытых функций и долговременное состояние задачи. Если пользователь перебил голосовой ответ, это не отменяет автоматически уже запущенную операцию на сервере.

Сколько стоит и как подключается

На старте OpenAI установила цену голосового слоя GPT‑Live‑1 в $0,05 за минуту. Сессии тарифицируются по продолжительности с посекундным учётом. Использование серверной модели и её инструментов оплачивается отдельно. Поэтому итоговая стоимость звонка зависит не только от его длительности, но и от количества обращений к backend, поиска, базам данных и другим сервисам.

Для браузерных приложений документация рекомендует WebRTC, для серверных аудиоинтеграций — WebSocket. Для телефонии предусмотрены SIP-сценарии и интеграции с LiveKit, Twilio, Telnyx и Daily/Pipecat. Ключ OpenAI должен храниться на доверенном сервере, а не в браузере или мобильном приложении.

Набор голосов расширен для разных акцентов, диалектов и языков. Однако OpenAI не публикует в анонсе отдельные показатели качества для русского и узбекского языков. Это критично для локального внедрения: поддержку языка нельзя считать подтверждённой только по наличию голоса в интерфейсе.

Где это применимо в Узбекистане

Наиболее очевидный сценарий — контакт-центры банков, операторов связи, служб доставки, клиник и сервисных компаний. Агент может уточнить вопрос, найти заказ или тариф, продолжая поддерживать разговор, а затем озвучить результат. Другие варианты — запись на услугу, подтверждение заявки, обучение сотрудников и голосовой помощник внутри корпоративного продукта.

Но естественная речь не делает систему автоматически безопасной. Для местного пилота стоит заранее ограничить перечень действий и проверить:

  • качество распознавания русского и узбекского, включая смешанную речь, имена, адреса и номера;
  • задержку через используемого интернет- и телефония-провайдера;
  • стоимость минуты вместе с backend-моделью, телефонией и хранением записей;
  • корректность перебиваний, пауз и фонового шума на реальных звонках;
  • передачу оператору при неоднозначности, конфликте или высокой цене ошибки;
  • правила согласия на запись, обработки персональных данных и сроки хранения аудио и транскриптов.

Для первой версии разумнее выбрать узкий процесс с понятной метрикой: например, проверку статуса заказа или запись на свободное время. Нужны отдельные показатели успешного завершения задачи, доли переводов на человека, задержки первого ответа, ошибочных действий и стоимости одного обслуженного обращения.

Ограничения, которые нельзя скрывать за хорошим голосом

Убедительное звучание повышает риск того, что пользователь будет считать любой ответ достоверным. Финансовые операции, изменение тарифа, запись к врачу или работа с персональными данными должны требовать серверной проверки, а для необратимых действий — явного подтверждения человека.

Также необходимо сообщать, что собеседник является AI, предусмотреть быстрый переход к оператору и журналировать вызовы инструментов. Команде безопасности следует тестировать подмену инструкций через речь, попытки получить чужие данные и сценарии, в которых фоновый голос провоцирует нежелательное действие.

GPT‑Live‑1 снижает технический порог для естественных голосовых интерфейсов, но ценность для бизнеса определит не тембр голоса, а управляемая архитектура. Пилот имеет смысл только вместе с измерением языкового качества, полной стоимости, безопасности и качества передачи сложных обращений человеку.

Первоисточники

Интересное