AI

Редакция Overclock.bg ·

Gemini 3.8 Live: гласов AI, който мисли и говори

Gemini 3.8 Live: гласов AI, който мисли и говори

Google обяви на 15 септември два нови гласови модела — Gemini 3.8 Live и Gemini 3.8 Live Extended Thinking. Според официалното съобщение на компанията това са най-напредналите ѝ модели за диалог в реално време до момента. И двата са достъпни от същия ден през Gemini API и Google AI Studio, а по-умният от тях вече се пуска в Gemini Live и в Workspace — Gmail, Docs и Keep.

Какво е новото

Разликата спрямо предишните гласови модели е, че Extended Thinking разсъждава и говори едновременно. Досега при сложен въпрос асистентът замлъкваше, докато обмисля отговора. Сега моделът поддържа разговора с реплики от рода на „Чакай да проверя това…“ и разказва докъде е стигнал, докато на заден план изпълнява многостъпкова задача.

Базовият Gemini 3.8 Live е насочен към мащаб и цена. Той обработва визуален вход почти в реално време — тоест може да гледа през камерата ви, докато говорите — и поддържа 97 езика, включително разпознаване и превключване насред разговора. Извиква инструменти и API-та във фонов режим, без да прекъсва диалога.

Това е първото сериозно обновление след Gemini 3.1 Flash Live от март 2026 г., отбелязва 9to5Google.

Числата

Google цитира няколко теста, всички за Extended Thinking варианта:

  • 82,6 на Speech to Speech Quality Index на Artificial Analysis — първо място в класацията;
  • 68,6% завършени агентни задачи на τ-Voice;
  • 35,1% на банковия сценарий τ-Voice-banking на Sierra;
  • 97,7% на Big Bench Audio за разсъждение по звук.

Базовият Gemini 3.8 Live влиза втори в Speech Agent Arena. Струва си да се отбележи, че τ-Voice-banking с 35,1% остава труден тест — дори водещият модел се справя с около една трета от задачите, така че до автоматичен телефонен банкер има път.

Сравнение на моделите по EVA-Bench Снимка: Google

Цената е основното оръжие

Тук е и най-интересната част за разработчиците. Според изчисленията на The Decoder Gemini 3.8 Live струва 0,005 долара за минута аудио на входа и 0,018 долара за минута на изхода — около 1,38 долара (приблизително €1,27) за час разговор. За сравнение, GPT Live 1 на OpenAI тръгва от 0,05 долара на минута, или минимум 3 долара (около €2,77) на час. Цените са обявени в долари; европейски тарифи Google не публикува отделно.

Разликата е над два пъти и това е ясен сигнал накъде се цели Google — към кол центрове, вградени асистенти и приложения, при които всяка минута говорене се плаща. The Decoder все пак уточнява, че моделът на OpenAI вероятно води по естественост на разговора благодарение на пълния дуплекс, тоест на способността да слуша и говори наистина едновременно.

Къде ще го усетите

За обикновения потребител промяната идва през три места:

  • Gemini Live — Extended Thinking започва да се пуска там от 15 септември;
  • Workspace — Gmail Live за търсене с глас в пощата, Docs Live за диктуване и редактиране на текст, Keep Live за създаване на бележки. Достъпът е за платените абонаменти;
  • Search Live в AI Mode се захранва от базовия модел — например когато насочите камерата към нещо повредено и питате как да го оправите.

Google посочва и партньорите си по API-то: Agora, Fishjam, LangChain, LiveKit, Pipecat, Vercel и Vision Agents, а от корпоративната страна — Salesforce, Genspark и Lumeris. Gemini Enterprise получава достъп в частно преглед.

Цялото генерирано аудио носи воден знак SynthID, така че да може да бъде разпознато като синтетично.

Контекст

Гласът се оказа полето, на което голямите лаборатории се бият най-ожесточено през 2026 г. Apple мина през собствените си трудности — новата Siri AI тръгна само на английски и без Европейския съюз, а Google междувременно вгражда Gemini навсякъде, включително в първите Android лаптопи Googlebook.

За потребителите в България практическият въпрос остава същият: кога и на какъв език. 97-те поддържани езика би трябвало да включват българския, но Google не публикува поименен списък, а функциите в Workspace изискват платен абонамент. Ако ползвате Gemini Live на телефона си, следете дали при следващия разговор асистентът няма да започне да ви отговаря, докато още мисли — това е най-лесният начин да разберете, че новият модел вече е стигнал до вас.

Харесва ви? Отбележете ни и ще ни виждате по-нагоре в Google.

Предпочитан източник в Google

Прочетете още