
Google DeepMind публикува техническия доклад зад DiffusionGemma — отворен текстов модел, който не пише дума по дума, а „проявява“ цели блокове от 256 токена наведнъж. Най-интересното е не скоростта, а начинът на производство: моделът не е трениран от нулата, а е преправен от готовия Gemma 4 с под 10% от бюджета токени, вложен в оригинала. Теглата излязоха на 10 юни 2026 г., а докладът беше качен в arXiv на 31 юли.
Какво точно е дифузионен текстов модел
Класическите езикови модели са авторегресивни: предсказват следващия токен, после следващия, и така до края. Дифузионните работят като генераторите на изображения — тръгват от „платно“ със случайни токени-запълнители и на няколко минавания махат шума, като заключват правилните позиции.
DiffusionGemma борави с платно от 256 токена и препоръчва максимум 48 стъпки на блок, но с адаптивно спиране обикновено са достатъчни 12–16, пише документацията на Google. Ефектът е, че тясното място се мести от паметта към изчисленията — а точно паметта е ограничението при един потребител на една видеокарта.
Числата
Основата е Gemma 4 в MoE вариант: 26 милиарда параметъра общо, около 3,8 милиарда активни при извод, 8 активни експерта от 128. Контекстът е до 256K токена, входът е мултимодален — текст, изображения и видео до 60 секунди.
По скорост Google обявява над 1000 токена в секунда на една NVIDIA H100 и „до 4 пъти по-бърз изход“ спрямо съпоставим авторегресивен модел; моделната карта посочва 1100 токена/сек при FP8 квантуване, а техническият доклад стига до около 1500 при около 20 токена на минаване напред. За настолни машини NVIDIA отчита над 700 токена/сек на GeForce RTX 5090, 150 на DGX Spark и до 2000 на DGX Station.
Снимка: NVIDIA
Качеството не е компромисно, но и не е рекордно: MMLU Pro 77,6%, GPQA Diamond 73,2%, LiveCodeBench v6 69,1%, MMMU Pro (визия) 54,3%, MATH-Vision 70,5%. Спрямо авторегресивния Gemma 4 моделът остава леко назад по повечето метрики — цената на скоростта.
Рецептата: два етапа върху готов модел
Точно тази част е приносът на доклада. Вместо ново предварително обучение екипът минава през две фази:
- Надзиравано дообучение — моделът се учи да възстановява зашумени блокове текст с двупосочно внимание вместо с маска „само назад“.
- Подсилващо обучение с дистилация на семплера — комбинация, която свива броя стъпки. Резултатът: средно около 10 точки нагоре по разсъждаващите бенчмаркове и отговори с около 50% по-малко токени.
Показателен е примерът със судоку: след кратко дообучение моделът решава около 80% от пъзелите, докато базовият е на практика на нула. Итеративното поправяне върши работа там, където един грешен ранен токен обрича целия отговор.
Според авторите DiffusionGemma запазва мултимодалността, дългия контекст и режима на разсъждение и дори може да генерира авторегресивно с малка загуба на качество. Тоест дифузията се добавя, а не заменя.
Как се пуска
Теглата са под Apache 2.0 в Hugging Face, Kaggle и Vertex AI Model Garden. Квантуван (4 бита), моделът иска около 18 GB VRAM — тоест влиза в 24-гигабайтовата RTX 4090, а още по-спокойно в 32-гигабайтовата RTX 5090. Поддържат се vLLM, Transformers, SGLang и MLX:
vllm serve google/diffusiongemma-26B-A4B-it \
--max-model-len 262144 \
--max-num-seqs 4
Печалбата от дифузията е най-голяма при малък брой едновременни заявки — локални и еднопотребителски сценарии. При облачни системи с голям batch авторегресивните модели остават конкурентни.
Защо има значение
Досега дифузионните текстови модели изглеждаха като скъпа екзотика: за да ги пробвате, трябваше нов модел от нулата. DiffusionGemma показва, че съществуващ и вече платен модел може да бъде преправен за десетина процента от разхода. Ако рецептата се повтори и от други лаборатории, дифузионният декодинг спира да е отделна пътека и става опция върху всяко семейство модели.
Има и енергийна страна. По-малко токени за същия отговор и повече токени на изчислителна стъпка означават по-малко ватчаса на заявка — тема, която стана осезаема, откакто AI агентите харчат стотици пъти повече енергия от обикновен чат. А фактът, че всичко това излиза под Apache 2.0 в момент, в който Google преструктурира DeepMind, подсказва, че отворената линия Gemma остава част от плана.
Засега DiffusionGemma е обявен като експериментален модел. Ако търсите максимално качество, авторегресивният Gemma 4 още води. Ако търсите бърз локален модел, който отговаря почти веднага — тук вече има какво да пробвате.
Харесва ви? Отбележете ни и ще ни виждате по-нагоре в Google.
Предпочитан източник в Google