AI

Редакция Overclock.bg ·

OpenAI пусна GPT-Live-1: говори и слуша едновременно

OpenAI пусна GPT-Live-1: говори и слуша едновременно

OpenAI пусна на 10 септември 2026 г. GPT-Live-1 в API-то си — гласовият модел, който от юли работи в ChatGPT Voice, вече е достъпен и за външни разработчици. Основното му свойство е full-duplex: моделът слуша и говори в един и същ момент, вместо да чака репликата ви да свърши. Цената е 0,05 долара на минута (около 0,043 €), таксувани посекундно, а разходът за модела отзад се плаща отделно.

Какво значи full-duplex на практика

Досегашните гласови асистенти работят на смени: изчакват тишина, разпознават речта, генерират текст, озвучават го. Всяка от тези стъпки добавя забавяне, а всяко замисляне насред изречението рискува да бъде прочетено като „свърших, твой ред е“.

GPT-Live-1 обработва входящия и изходящия звук заедно в един модел. Оттам идват и нещата, които трудно се симулират с конвейер от три компонента — прекъсванията, паузите, потвържденията от рода на „аха“ и „да, да“, които хората изричат, докато отсрещният още говори.

The Decoder съобщава за забавяне при смяна на реда от около 0,8 секунди — срещу 1,41 секунди при предишния GPT-Realtime-2.1. Езиковата платформа Speak, която е тествала модела рано, отчита близо 80% по-малко фалшиви прекъсвания, когато учещият замълчи, за да помисли.

Разговорът и мисленето са разделени

Архитектурата е може би по-интересна от самия глас. GPT-Live-1 отговаря само за разговора — кога да говори, как да звучи и кога да поиска помощ. Всичко останало (търсене в база, извикване на инструменти, сложно разсъждение) отива към отделен backend модел. OpenAI нарича това делегиране и изрично отбелязва в документацията, че разговорът продължава, докато задачата се изпълнява.

Backend-ът е по ваш избор: управляван Responses модел, GPT-6 Astra, по-евтина алтернатива или модел на трета страна. Има и вариант с клиентско делегиране през Codex SDK, ако искате пълен контрол.

Резултатът е, че агентът може да каже „проверявам“ и наистина да го направи, без разговорът да замръзне за пет секунди.

Числата

По бенчмарка Tau3 за гласови агенти (сценарии от авиокомпании, ритейл и телекоми) GPT-Live-1 излиза с 86,2% pass@1 срещу 45,7% за GPT-Realtime-2.1 — данни, цитирани от The Register. На Full Duplex Bench напредъкът е около 30 процентни пункта, а по показателя за разговорна динамика моделът отчита 97,3%.

The Decoder добавя и по-малко ласкава сметка: при сценарии за банково обслужване по телефона моделът минава 32% от случаите. Това е близо три пъти повече от 12,4% на предшественика, но е далеч от нивото, на което бихте оставили без надзор обаждане за блокирана карта.

Гласове, телефония и дребният шрифт

Заедно с модела идват 12 нови гласа — Quartz, Ripple, Vesper, Willow, Stone, Gleam, Meridian, Bossa, Tempo, Beacon, Delta и Cinder — с различни акценти, диалекти и езици. Собствен, марков глас се договаря с търговския отдел на OpenAI.

От производствените дреболии, които обикновено решават дали проектът ще стигне до клиенти:

  • ASR транскрипти директно от модела, без втори доставчик за разпознаване на реч;
  • keyword biasing — подсказвате имена на продукти, градове или кодове, които моделът иначе бърка;
  • явно засичане на реда и по-добро поведение при тишина и шум на фона;
  • връзка през WebRTC (браузър), WebSockets (сървър) и SIP/телефония, с готови указания за LiveKit, Twilio, Telnyx и Daily.

Достъпът е през API-то, а за корпоративни клиенти — и през платформата OpenAI Presence.

Кой вече го ползва

Yelp го е пуснала в Yelp Host — системата, която приема резервации по телефона; компанията говори за по-разговорни и по-отзивчиви обаждания. Сред ранните потребители са още Fin на Intercom и Devin на Cognition. Един клиент съобщава, че е свалил гласовата си кодова база с около 80%, или 23 000 реда, писани дотогава, за да крепят разговора в реално време.

Заключение

GPT-Live-1 не е нов „по-умен“ модел — умът остава отзад, в текстовия модел. Новото е, че разговорната обвивка спира да бъде най-слабото звено: без чакане за тишина, без изяден край на изречението, с телефония в комплекта. За екипи, които вече поддържат собствен конвейер от разпознаване, модел и синтез, сметката е проста — 0,05 долара на минута плюс backend срещу няколко хиляди реда чужд код за поддръжка.

Какво остава да се докаже: 32% на банковите сценарии показват, че гласът вече звучи човешки доста преди агентът да е готов да поеме сам сложен случай. Както и при новото поколение на ChatGPT Images, разликата между демонстрацията и реалната употреба ще се види чак когато на линията има истински клиент, който бърза.

Харесва ви? Отбележете ни и ще ни виждате по-нагоре в Google.

Предпочитан източник в Google

Прочетете още