На 24 септември Google обяви Live Avatar — добавка към модела Gemini 3.8 Live, която генерира видео в почти реално време и го синхронизира с говора на асистента. Вместо мигаща точка и звук от говорителя, събеседникът ви е лице: анимиран герой или фотореалистичен човек, който движи устни, сменя изражения и изчаква репликата ви. Функцията е обявена за общодостъпна (GA) в Gemini Enterprise, с endpoint-и в САЩ и ЕС.
Какво прави Live Avatar
Според официалното съобщение на Google разликата спрямо досегашните „говорещи глави“ е, че видеото не е предварително рендирано, а се генерира в същия поток, в който моделът синтезира гласа си. Оттук идват и трите неща, които Google подчертава:
- Lip-sync на 97 езика. Моделът разпознава автоматично, че сте сменили езика, и продължава без да разваля съвпадението между устни и звук.
- Естествено редуване. Прекъсвате ли го в средата на изречението, аватарът спира, изслушва и се връща към темата, без да губи контекста на разговора.
- Асинхронни tool calls. Докато извиква API в фонов режим — проверка на наличност, статус на поръчка — разговорът продължава, вместо да настъпи неловка пауза.
Към това се добавя „живото“ визуално разбиране: аватарът може едновременно да гледа камерата ви и споделения екран. В демонстрацията на Google агент за застрахователни щети води разговора, докато вие показвате повредата на камерата, а протоколът се попълва в движение.
Снимка: Google Cloud
Техническите граници
Gemini 3.8 Live приема аудио, изображения, видео и текст в контекстен прозорец до 128K токена. С включен Live Avatar изходът е аудио, видео и текст, но е ограничен до 24K токена — което на практика значи, че една сесия е за няколко минути разговор, а не за часове.
Самият model card, цитиран от Unite.AI, е необичайно откровен: възможни халюцинации, от време на време забавяне или timeout, и изрична бележка, че моделът е разчетен за „няколко минути непрекъсната интеракция“. Базата е Gemini 3 Pro, а знанията му спират до януари 2025 г. При оценката на безопасността Google заключава, че спрямо Gemini 3.7 Flash няма съществено нови опасни възможности.
Готовите аватари идват от библиотека на Google. Собствен аватар се прави от системни инструкции, една референтна снимка и аудио проба — но само след одобрение в allowlist и проверка от Google Cloud. Всичко генерирано, и звукът, и видеото, носи невидим воден знак SynthID — същият механизъм, който Google сложи и в TTS моделите от 3.8.
Кой вече го ползва
В блога на Google Cloud са изброени няколко ранни клиента: Cox Automotive пуска асистент за пазаруване в Autotrader, който подчертава елементи на екрана в реално време; индийската Equal AI обработва над 1 млн. обаждания дневно на девет индийски езика; Salesforce интегрира модела в Agentforce. Каналите за внедряване са web, мобилни приложения и интерактивни киоски.
Достъпът минава през multimodal live студиото в конзолата на Gemini Enterprise, през Gemini Live API или през Agent Development Kit. Google не публикува отделна тарифа за Live Avatar — сметката тръгва от цените на Gemini 3.8 Live, където аудиото и видеото се таксуват по токен или по минута, а provisioned throughput се договаря с търговски представител.
Снимка: Google Cloud
Възражението идва от самия Google
Най-неудобният контекст около обявата го намира The Register: собствените изследвания на компанията предупреждават точно срещу това. Статия на DeepMind от 2021 г. отбелязва, че потребителите „могат погрешно да заключат, че агент, който звучи човешки в езика, притежава и други човешки характеристики, например устойчива идентичност през времето“, и че хуманизирането води до „неоправдано доверие и очаквания“. Проучване на Google от декември 2025 г. стига до същото: човекоподобието „създава фалшиво усещане за надеждност“.
Google отговаря кратко: „Изградихме Live Avatar със строги защити, проектирани да пазят идентичността и да поддържат генерираното съдържание прозрачно.“ Allowlist-ът за собствени аватари и SynthID са именно това — предпазители срещу очевидната злоупотреба, при която едно лице и една аудио проба стигат за убедителен говорещ двойник.
Изводът
Технически Live Avatar е логичната следваща стъпка: щом моделът вече говори и слуша в реален поток, лицето е само още един изходен канал. Практически обаче ограничението до няколко минути на сесия и allowlist-ът за персонализация показват, че това е инструмент за контролирани корпоративни сценарии — гише за регистрация, обучение, поддръжка — а не нова визия за Gemini в телефона ви.
Ако търсите тенденцията: индустрията методично дава лице на асистентите си, от този аватар до ключодържателя с аватар на Muse от Meta. А въпросът дали искаме да гледаме човешко лице, докато машина ни халюцинира отговор, остава отворен — включително в изследователските отдели на Google.
Харесва ви? Отбележете ни и ще ни виждате по-нагоре в Google.
Предпочитан източник в Google