
OpenAI пусна на 10 септември 2026 г. GPT-Live-1 в API-то си — гласовият модел, който от юли работи в ChatGPT Voice, вече е достъпен и за външни разработчици. Основното му свойство е full-duplex: моделът слуша и говори в един и същ момент, вместо да чака репликата ви да свърши. Цената е 0,05 долара на минута (около 0,043 €), таксувани посекундно, а разходът за модела отзад се плаща отделно.
Какво значи full-duplex на практика
Досегашните гласови асистенти работят на смени: изчакват тишина, разпознават речта, генерират текст, озвучават го. Всяка от тези стъпки добавя забавяне, а всяко замисляне насред изречението рискува да бъде прочетено като „свърших, твой ред е“.
GPT-Live-1 обработва входящия и изходящия звук заедно в един модел. Оттам идват и нещата, които трудно се симулират с конвейер от три компонента — прекъсванията, паузите, потвържденията от рода на „аха“ и „да, да“, които хората изричат, докато отсрещният още говори.
The Decoder съобщава за забавяне при смяна на реда от около 0,8 секунди — срещу 1,41 секунди при предишния GPT-Realtime-2.1. Езиковата платформа Speak, която е тествала модела рано, отчита близо 80% по-малко фалшиви прекъсвания, когато учещият замълчи, за да помисли.
Разговорът и мисленето са разделени
Архитектурата е може би по-интересна от самия глас. GPT-Live-1 отговаря само за разговора — кога да говори, как да звучи и кога да поиска помощ. Всичко останало (търсене в база, извикване на инструменти, сложно разсъждение) отива към отделен backend модел. OpenAI нарича това делегиране и изрично отбелязва в документацията, че разговорът продължава, докато задачата се изпълнява.
Backend-ът е по ваш избор: управляван Responses модел, GPT-6 Astra, по-евтина алтернатива или модел на трета страна. Има и вариант с клиентско делегиране през Codex SDK, ако искате пълен контрол.
Резултатът е, че агентът може да каже „проверявам“ и наистина да го направи, без разговорът да замръзне за пет секунди.
Числата
По бенчмарка Tau3 за гласови агенти (сценарии от авиокомпании, ритейл и телекоми) GPT-Live-1 излиза с 86,2% pass@1 срещу 45,7% за GPT-Realtime-2.1 — данни, цитирани от The Register. На Full Duplex Bench напредъкът е около 30 процентни пункта, а по показателя за разговорна динамика моделът отчита 97,3%.
The Decoder добавя и по-малко ласкава сметка: при сценарии за банково обслужване по телефона моделът минава 32% от случаите. Това е близо три пъти повече от 12,4% на предшественика, но е далеч от нивото, на което бихте оставили без надзор обаждане за блокирана карта.
Гласове, телефония и дребният шрифт
Заедно с модела идват 12 нови гласа — Quartz, Ripple, Vesper, Willow, Stone, Gleam, Meridian, Bossa, Tempo, Beacon, Delta и Cinder — с различни акценти, диалекти и езици. Собствен, марков глас се договаря с търговския отдел на OpenAI.
От производствените дреболии, които обикновено решават дали проектът ще стигне до клиенти:
- ASR транскрипти директно от модела, без втори доставчик за разпознаване на реч;
- keyword biasing — подсказвате имена на продукти, градове или кодове, които моделът иначе бърка;
- явно засичане на реда и по-добро поведение при тишина и шум на фона;
- връзка през WebRTC (браузър), WebSockets (сървър) и SIP/телефония, с готови указания за LiveKit, Twilio, Telnyx и Daily.
Достъпът е през API-то, а за корпоративни клиенти — и през платформата OpenAI Presence.
Кой вече го ползва
Yelp го е пуснала в Yelp Host — системата, която приема резервации по телефона; компанията говори за по-разговорни и по-отзивчиви обаждания. Сред ранните потребители са още Fin на Intercom и Devin на Cognition. Един клиент съобщава, че е свалил гласовата си кодова база с около 80%, или 23 000 реда, писани дотогава, за да крепят разговора в реално време.
Заключение
GPT-Live-1 не е нов „по-умен“ модел — умът остава отзад, в текстовия модел. Новото е, че разговорната обвивка спира да бъде най-слабото звено: без чакане за тишина, без изяден край на изречението, с телефония в комплекта. За екипи, които вече поддържат собствен конвейер от разпознаване, модел и синтез, сметката е проста — 0,05 долара на минута плюс backend срещу няколко хиляди реда чужд код за поддръжка.
Какво остава да се докаже: 32% на банковите сценарии показват, че гласът вече звучи човешки доста преди агентът да е готов да поеме сам сложен случай. Както и при новото поколение на ChatGPT Images, разликата между демонстрацията и реалната употреба ще се види чак когато на линията има истински клиент, който бърза.
Харесва ви? Отбележете ни и ще ни виждате по-нагоре в Google.
Предпочитан източник в Google