Содержание
8 июля 2026 года OpenAI представила GPT-Live — новое поколение голосовых моделей, которые умеют слушать и говорить одновременно. Это самое заметное изменение в ChatGPT Voice с момента запуска Advanced Voice Mode: разговор с ИИ впервые перестаёт напоминать поочерёдный обмен репликами по рации и становится похож на живой диалог с человеком.

Что такое GPT-Live
GPT-Live — это не одна модель, а семейство: GPT-Live-1 и облегчённая GPT-Live-1 mini. Обе версии заменили Advanced Voice Mode в качестве голосового движка ChatGPT и раскатываются на iOS, Android и в веб-версии chatgpt.com сразу для всех пользователей по всему миру. OpenAI называет GPT-Live самой умной голосовой моделью на сегодня — не только по качеству звучания, но и по способности рассуждать во время разговора.
Full-duplex архитектура: в чём главное отличие
Раньше голосовые ассистенты работали по одному из двух сценариев. Первый — каскадные системы, где отдельно работают модель распознавания речи, языковая модель и модель синтеза речи; из-за этой цепочки терялась информация, а ответы звучали медленно и неестественно. Второй — «turn-based» модели вроде прежнего Advanced Voice Mode: они обрабатывают звук в одной модели, но всё равно ждут полной паузы в речи собеседника, из-за чего случайное молчание или фоновый шум сбивали модель с толку и заставляли её вклиниваться в неподходящий момент.
GPT-Live устроена иначе: она непрерывно обрабатывает входящий звук и одновременно генерирует ответ, принимая решение — говорить, слушать дальше, промолчать, перебить или вызвать инструмент — множество раз в секунду. Именно это называется full-duplex, «полный дуплекс»: как в телефонном звонке, где обе стороны могут говорить одновременно.
| Подход | Как работает | Главный минус |
|---|---|---|
| Каскадные системы | Речь → текст → ответ → речь, три модели по цепочке | Задержки, потеря контекста, «роботизированность» |
| Turn-based (Advanced Voice Mode) | Одна модель, но строгая очередность реплик | Ждёт паузы, путает молчание с концом фразы |
| Full-duplex (GPT-Live) | Слушает и говорит одновременно, решения — много раз в секунду | Пока не поддерживает видео и показ экрана |
GPT-Live-1 против GPT-Live-1 mini
Версии различаются не только размером, но и тарифами. GPT-Live-1 становится голосовым движком по умолчанию для подписок Go, Plus и Pro, а GPT-Live-1 mini — для бесплатных пользователей ChatGPT. Обе модели умеют показывать, что «слушают» собеседника, короткими репликами вроде «мхм» или «понял», спокойно ждать, если человек взял паузу подумать, и лучше отсекать фоновый шум — проезжающие машины или чужие разговоры — от голоса пользователя.
Как GPT-Live делегирует «тяжёлую» работу GPT-5.5
Второе архитектурное решение OpenAI — разделение обязанностей. Сама GPT-Live отвечает за живой разговор, а сложные задачи — веб-поиск, многошаговые рассуждения, агентную работу — передаёт на выполнение более мощной модели, на старте это флагманской линейке GPT (в фоне используется GPT-5.5). Пока «тяжёлая» модель считает ответ, GPT-Live продолжает поддерживать разговор, не давая паузе затянуться. Пользователь может выбрать глубину рассуждений — Instant для быстрых ответов или Medium/High, когда нужен более вдумчивый результат.
Что изменится для пользователей ChatGPT Voice
Голосом в ChatGPT еженедельно пользуются более 150 миллионов человек — от бытовых вопросов на ходу до изучения языков и разговоров во время поездки. С запуском GPT-Live голосовой режим получил не только более естественную речь, но и визуальные карточки: во время разговора ассистент может показать прогноз погоды, расписание спортивных матчей или карту с точками рядом — прямо на экране, без необходимости печатать запрос.

Безопасность голосового режима
Поскольку голосовой диалог происходит в реальном времени, OpenAI расширила тестирование безопасности под аудиоформат: добавила «аудио-нативные» проверки, усилила защиту в чувствительных темах (самоповреждение, эмоциональная зависимость от ИИ, психоз и мания) и встроила механизмы, которые могут аккуратно скорректировать ответ модели прямо во время разговора или мягко завершить диалог в случае повышенного риска. Для подростков предусмотрены отдельные настройки через родительский контроль, а сама модель обучена не имитировать голос реального человека — только фиксированный набор голосов ChatGPT.

Где доступно и когда ждать API
GPT-Live уже доступна во всех регионах, где работает ChatGPT. Разработчики и компании пока не могут подключить модель через API напрямую, но OpenAI открыла форму предварительной записи на доступ. На старте не поддерживаются голосовые разговоры с видео или демонстрацией экрана — для этого пока нужно переключаться на старые режимы Standard или Advanced Voice Mode. Конкуренция на рынке голосовых и мультимодальных моделей от этого не ослабевает: свои ответы готовят и другие крупные игроки, включая SpaceXAI с моделью Grok 4.5 и Google с линейкой Gemini.
Часто задаваемые вопросы
Что означает full-duplex в голосовых моделях?
Это архитектура, при которой модель одновременно слушает и генерирует речь, а не ждёт полной паузы собеседника перед ответом — как в обычном телефонном разговоре, где обе стороны могут говорить в любой момент.
Чем GPT-Live-1 mini отличается от GPT-Live-1?
GPT-Live-1 mini — облегчённая версия для бесплатных пользователей ChatGPT, GPT-Live-1 — более мощная модель, доступная на платных тарифах Go, Plus и Pro.
Можно ли использовать GPT-Live с видео или демонстрацией экрана?
На момент запуска нет — эта функция пока недоступна в GPT-Live, для видео и показа экрана нужно переключиться на прежние режимы ChatGPT Voice.
Заменит ли GPT-Live старый Advanced Voice Mode полностью?
Да, GPT-Live становится голосовым движком по умолчанию, но старые режимы Standard и Advanced Voice Mode остаются доступны там, где нужны функции, которых пока нет у GPT-Live.
Появится ли GPT-Live в API для разработчиков?
OpenAI подтвердила такие планы и открыла форму предварительной записи, но точная дата публичного доступа через API пока не названа.
GPT-Live выглядит как самый заметный шаг OpenAI в сторону по-настоящему живого общения с ИИ: технология избавляет голосовой чат от привычных пауз и «затыков», а заодно показывает, куда движется индустрия — к моделям, которые ведут разговор естественно и при этом незаметно подключают более мощный интеллект для сложных задач.
