Our website uses necessary cookies to enable basic functions and optional cookies to help us to enhance your user experience. Learn more about our cookie policy by clicking "Learn More".
Accept All Only Necessary Cookies
NEWSREVIEWSHOWTO

Что такое GPT-Live-1? Модель полнодуплексного голоса от OpenAI

Nadia Volkman

GPT-Live-1 — голосовая модель OpenAI с полнодуплексной архитектурой. Может слушать и говорить одновременно, заменяет цепочку ASR-LLM-TTS.

Каталог

    GPT-Live-1 — это голосовая модель OpenAI, которая умеет слушать и говорить одновременно. Компания открыла доступ к модели через GPT Live API, и разработчики теперь могут создавать приложения с голосовым ИИ реального времени на базе этой технологии. Модель уже работает внутри ChatGPT, а с сентября стала доступна для интеграции через API.

    Если вы пользуетесь ChatGPT на Android, вы могли заметить, что голосовой режим стал естественнее. Раньше ИИ ждал, пока вы закончите фразу, потом отвечал. Теперь он реагирует на лету: может перебить, подхватить мысль, вставить короткое «угу» или «да-да», как живой собеседник. За это отвечает полнодуплексная архитектура, и именно её GPT-Live-1 делает доступной для разработчиков.

    Для пользователей Android это имеет практический смысл. Вы ездите за рулём и спрашиваете у ассистента маршрут. В шумной обстановке кафе вы делаете заказ голосом. Ребёнок учит английский с приложением и делает паузы, чтобы вспомнить слово. Во всех этих случаях полнодуплексный голосовой ИИ в реальном времени работает естественнее, чем старая схема «сказал — подождал — услышал ответ».

    Как работает полнодуплексная архитектура

    Технология full-duplex, или полнодуплексная, означает, что модель обрабатывает входящий звук и генерирует ответ параллельно. В телефонии это привычный режим: обе стороны могут говорить одновременно. Для голосового ИИ это было нетривиальной инженерной задачей.

    До GPT-Live-1 голосовые ассистенты работали по цепочке. Сначала распознавание речи (ASR) превращало звук в текст. Затем большая языковая модель (LLM) обрабатывала этот текст и генерировала ответ. Потом синтез речи (TTS) превращал текст обратно в звук. Каждое звено добавляло задержку, а ошибки накапливались. Разработчики сравнивали это с игрой в сломанный телефон: каждое преобразование теряет часть информации. Интонация, паузы, эмоциональная окраска — всё это исчезало на этапе перевода звука в текст.

    GPT-Live-1 объединяет распознавание и синтез в одной модели. Задержка смены реплики снизилась с 1,4 секунды у GPT-Realtime-2.1 до 0,8 секунды. Это меньше, чем среднее время реакции человека в разговоре, которое составляет около секунды. На практике это значит, что вы не замечаете «машинности» ответа. Реплика собеседника заканчивается, и ответ начинается мгновенно, без характерной паузы, которая выдавала предыдущие поколения голосовых ассистентов.

    Модель принимает решения много раз в секунду: продолжать слушать, начать говорить, сделать паузу или вызвать внешний инструмент. Это ближе к тому, как ведёт себя человек в разговоре. Вы не дожидаетесь конца монолога собеседника, чтобы начать формулировать ответ. Вы начинаете думать об ответе, пока собеседник ещё говорит, и реагируете короткими междометиями. Готовый голосовой ИИ в реальном времени должен уметь именно это: не просто быстро отвечать, но и корректно молчать, когда нужно.

    Делегирование задач бэкенд-моделям

    GPT-Live-1 отвечает за голосовой слой. Когда вопрос требует сложного рассуждения, модель передаёт задачу бэкенду — например, GPT-6 Astra. Голосовой слой при этом не замирает. Модель продолжает диалог, пока бэкенд обрабатывает запрос, а потом бесшовно вплетает результат в разговор.

    Это разделение важно для разработчиков. Можно менять бэкенд-модель без переобучения голосового слоя. Если выйдет новая версия LLM, голосовой фронтенд останется прежним. Разработчики настраивают бэкенд, инструменты и фреймворки агентов через системные промпты. Тон, скорость речи и стиль разговора тоже регулируются. Модель поддерживает нативное распознавание речи с транскрипцией, понимание буквенно-цифровых последовательностей, ключевое смещение и определение очереди реплик.

    Показатели производительности GPT-Live-1

    На бенчмарке Full Duplex Bench модель набрала 80,1%, тогда как GPT-Realtime-2.1 остановилась на 45,4%. Разрыв составил около 35 процентных пунктов. Точность вызова инструментов выросла с 60% до 87%. В банковском тесте голосовой поддержки процент успешных ответов вырос с 12,4% до 32%.

    В тесте Tau3, который оценивает голосовых агентов в сквозных задачах, GPT-Live-1 в связке с GPT-6 Astra занял первое место при средней интенсивности рассуждений. Это значит, что модель не просто быстрее говорит, но и лучше справляется с многошаговыми задачами: найти информацию, вызвать API, проверить результат и доложить пользователю голосом. Вместе с моделью вышло 12 новых голосов: Quartz, Ripple, Vesper, Willow и другие. Они охватывают разные акценты, диалекты и языки.

    Где применяется голосовая модель OpenAI

    Языковая платформа Speak уже интегрировала GPT-Live-1. Результат: ложные прерывания, когда ИИ вклинивался во время паузы ученика, сократились на 80%. Для приложений по изучению языков это критично. Раньше ученик замолкал на секунду, чтобы подобрать слово, а ассистент уже начинал отвечать. С GPT-Live-1 модель распознаёт, что это пауза раздумья, а не конец высказывания, и спокойно ждёт. Это особенно ценно при изучении языков: ученику нужно время на формулировку, и перебивание разрушает учебный процесс.

    Телефонные сценарии тоже доступны: бронирование столика в ресторане, клиентская поддержка, голосовые агенты для бизнеса. Yelp уже использует GPT-Live-1 для приёма звонков и сообщает о лучшем качестве обработки вызовов. Вместо тонового меню «нажмите один для бронирования, два для справок» звонящий разговаривает с ИИ, который понимает запрос с первого раза и может уточнить детали в реальном времени.

    Платформа для медицинских услуг сократила кодовую базу на 23 тысячи строк. Команде не пришлось вручную собирать конвейер из ASR, LLM и TTS, настраивать тайминги и обрабатывать ошибки на стыках. GPT-Live-1 берёт на себя весь голосовой конвейер, и разработчикам остаётся только подключить логику.

    Для Android-пользователей это значит, что в приложениях с голосовым ИИ в реальном времени разговор станет плавнее. Без неловких пауз, без сбоев из-за фонового шума, без топорных «подождите, обрабатываю». Голосовая модель OpenAI уже показывает, как может звучать естественный разговор с ИИ.

    Плюсы и минусы GPT-Live-1

    Плюсы:

    • Естественный диалог с прерываниями, паузами и короткими реакциями
    • Низкая задержка ответа — 0,8 секунды, быстрее человеческой реакции
    • Делегирование сложных задач мощным бэкенд-моделям без остановки разговора
    • Гибкая настройка через системные промпты: тон, скорость, стиль
    • Нативная транскрипция и текст ответов из коробки
    • Модель справляется с фоновым шумом и распознаёт естественные паузы

    Минусы:

    • Стоимость: $0,05 за минуту только за голосовой слой, бэкенд-модель оплачивается отдельно
    • На старте доступно 12 голосов — это ограничено для полной локализации на все языки
    • Порог входа для разработчиков без опыта работы с real-time API остаётся высоким
    • Модель не поддерживает видеозвонки и демонстрацию экрана, для этого нужны другие решения

    Сравнение с предыдущим поколением

    ПоказательGPT-Realtime-2.1GPT-Live-1
    АрхитектураПолудуплексПолнодуплекс
    Full Duplex Bench45,4%80,1%
    Точность вызова инструментов60%87%
    Задержка смены реплики1,4 с0,8 с

    Безопасность и ограничения

    OpenAI провела аудио-нативные оценки безопасности перед релизом GPT-Live-1. Модель тестировалась в областях самоповреждения, психотических симптомов, эмоциональной зависимости и насилия. Внутренние команды red team проверяли синтетический аудиоконтент на предмет безопасности. По заявлению OpenAI, модель показала результаты, сопоставимые или лучшие, чем у предыдущего поколения Advanced Voice Mode.

    Для разработчиков это означает, что встроенные механизмы безопасности работают на уровне голосового слоя. Но разработчики всё равно несут ответственность за то, как модель используется в их приложениях. Системные промпты позволяют задать границы поведения, а конфигурация бэкенд-моделей помогает контролировать, какие действия может выполнять голосовой агент. Например, при бронировании ресторана агент может проверять наличие столиков через API, но не списывать деньги с карты без подтверждения пользователя.

    Ещё один нюанс: клонирование голоса. OpenAI ограничила возможность создания произвольных голосов, чтобы предотвратить подделку чужого голоса. Доступные 12 голосов прошли отдельную проверку, и создать новый голос в обход системы нельзя.

    ChatGPT APK

    ChatGPT — это приложение для общения с моделями OpenAI, которое помогает искать ответы, работать с текстами и учиться.

    Работа

    Работа

    Итог

    GPT-Live-1 меняет то, как голосовые ассистенты ведут разговор. Вместо жёсткой очерёдности «вопрос — ответ» полнодуплексный голосовой ИИ работает как настоящий собеседник: слушает, говорит, реагирует одновременно. Задержка в 0,8 секунды ставит модель ниже порога восприятия: вы не чувствуете, что разговариваете с машиной.

    Практические кейсы уже подтверждают это. Speak сократил ложные прерывания на 80%. Yelp обрабатывает звонки клиентов без тоновых меню. Разработчики сокращают кодовую базу на десятки тысяч строк, потому что GPT-Live-1 берёт на себя весь голосовой конвейер.

    Если вам нужен ИИ, который не заставляет ждать и не перебивает невпопад, попробуйте ChatGPT с обновлённым голосовым режимом. Скачайте приложение и проверьте разницу на себе.

    Back to top

    Featured lists

    NEWSNEWSREVIEWSREVIEWSHOWTOHOWTO
    Статьи по теме
    Что такое API агентов OpenAI? Практическое руководство для AndroidРецензия
    Pace the Frontier: что Anthropic предлагает для безопасности ИИРецензия
    Последние отзывы
    Обзор Transformers: Eternal War: стратегическая RPG про автоботов на андроид
    Что такое бюллетень безопасности Android: разбор сентябрьского патча 2026
    Aniimo: обзор мобильной версии ловца существ на Android
    Fireworks Ember-1: модель рассуждений на базе Kimi K3
    Лучшие отзывы
    Обзор GTA San Andreas: Лучшая Игра с Открытым Миром на Android Спустя 20 Лет
    Легенды Дракономании: захватывающая ролевая игра с элементами стратегии и фэнтези
    Villager News, Actions & Stuff и ванильные жители: что выбрать для Minecraft Bedrock?
    Что Такое PojavLauncher? Запуск Minecraft Java Edition на Android
    Kingdom Rush 6 Genesis TD в сравнении с прошлыми частями серии
    Zenless Zone Zero 3.3: новые персонажи, баннеры и кого качать
    PUBG Mobile 4.6: обновление Midnight Hunters, режим вампира и новое оружие
    Лучшие Приложения для Продуктивности с ИИ на Android в 2026
    Подпишитесь на APKPure
    Будьте первым, кто получит доступ к раннему выпуску, новостям и руководствам лучших игр и приложений для Android.
    Нет, спасибо
    Подписаться
    Подписка оформлена!
    Теперь вы подписаны на APKPure.