AI

Редакция Overclock.bg ·

Gemini 4 е почти готов, TTS моделите клонират глас

Gemini 4 е почти готов, TTS моделите клонират глас

Google DeepMind направи две неща за 24 часа: новият ѝ ръководител Корай Кавукчуоглу каза, че Gemini 4 е в ранна фаза на post-training и ще излезе „доста по-рано“ от края на 2026 г., а компанията пусна два нови модела за синтез на говор — Gemini 3.8 Flash TTS и Gemini 3.8 Flash-Lite TTS. Моделите са достъпни от 23 септември през Gemini API и Google AI Studio и могат да пресъздадат глас от 30-секундна аудио проба.

Какво точно каза Кавукчуоглу

Изявлението е от сцената на AI Agenda Live Summit на The Information и е първата публична поява на Кавукчуоглу в новата му роля, след като Демис Хасабис се оттегли от ръководството на AI направлението през август. „Намерението ни е възможно най-скоро да пуснем ранен post-training резултат, защото виждаме резултатите и сме развълнувани“, казва той, цитиран от The Verge.

Обърнете внимание на формулировката — това е заявено намерение, не дата. Последният флагман на Google е серията Gemini 3 от ноември 2025 г., а обещаният за юни Gemini 3.5 Pro така и не се появи; вместо него компанията заля пазара с по-бързи Flash модели. Междувременно Opus 5.5 и GPT-6 Sol и Luna излязоха в един и същи ден и вдигнаха летвата над Gemini 3, така че натискът върху DeepMind е съвсем реален.

Двата TTS модела: разделение на труда

Flash TTS е за творческа работа — дизайн на характери, дълги формати, режисура на репликите. Flash-Lite TTS е за обем и ниска цена: озвучаване на хиляди кратки клипа, известия, автоматизирани обаждания.

Според официалното съобщение на Google новото тук е в три посоки:

  • Глас по описание. Пишете на естествен език какъв глас искате („дрезгав баритон, бавен, леко ироничен“) и моделът го създава — в над 100 езика и диалекта, включително мексикански испански, канадски френски, шотландски английски, виетнамски и хинди. Отделно има библиотека с над 2000 готови гласа.
  • Режисура ред по ред. Към всяка реплика можете да добавите сценична бележка, а моделът поддържа вокални изблици и „backchanneling“ — смях, въздишки, онези „мхм“, с които истинските хора прекъсват събеседника си. Има и нативна сцена с двама говорители със естествено редуване.
  • Дълъг формат. Google твърди, че качеството се запазва в продължение на часове аудио, което е основният проблем на досегашните TTS модели.

В класацията Hume AI Voice Design Benchmark Flash TTS е първи с 71.4 точки, а двата модела заемат първите две места в Hume AI Quality Index.

Клонирането на глас идва с ограничения

Пресъздаването на глас от 30 секунди звук изисква проверка на съгласието, а всичко генерирано носи невидим воден знак SynthID. Google добавя и C2PA credentials за защита на професионалните дубльори.

По-важното за читателите в Европа: функцията за репликиране на глас не е достъпна в Европейското икономическо пространство, Великобритания, Швейцария, Индия, както и в щатите Илинойс и Тексас. Синтезът на гласове по описание работи, клонирането на конкретен глас — не. Причината е очевидна: законите за биометрични данни и за правата върху образа и гласа.

Цените и първите тестове

Разработчиците вече пипат моделите. Саймън Уилисън публикува интерактивен playground за многогласови сценарии и отчита 1 минута и 18 секунди аудио, генерирани за около 20 секунди и за 2,74 US цента (≈2,3 евроцента).

Тарифите са в долари: 0,50 USD за 1 млн. входни текстови токена и 9 USD за 1 млн. аудио токена за Flash TTS (приблизително €0,43 и €7,70), при 6 USD (≈€5,10) за аудиото на Flash-Lite. Промоционалните нива важат до 31 декември 2026 г., след което се удвояват — 18 USD за аудио токените на Flash TTS. Batch режимът е на половин цена. Аудиото се таксува по 25 токена на секунда.

Извън API моделите тръгват и към потребителските продукти: Flash TTS влиза в Gemini Notebook, Flash-Lite — в Google Vids, а корпоративният достъп през Gemini Enterprise е „скоро“. Android Authority съобщава, че разпространението вече е започнало.

Изводът

Кавукчуоглу има мотив да говори оптимистично — ролята му е нова, а конкуренцията изпревари Gemini 3 по всички важни показатели, включително след като GPT-6 Astra седна зад волана. Затова приемете „доста по-рано от края на годината“ като амбиция, не като график.

TTS моделите обаче са тук и работят днес. Ако правите подкасти, аудиокниги или озвучаване на видео, цената от порядъка на два евроцента за минута говор променя сметките — а ограничението за клониране на глас в ЕС означава, че ще ползвате библиотеката и промптовете, не гласа на колегата си.

Харесва ви? Отбележете ни и ще ни виждате по-нагоре в Google.

Предпочитан източник в Google

Прочетете още