AI

Редакция Overclock.bg ·

DiffusionGemma: Google преобрази Gemma в дифузионен модел

DiffusionGemma: Google преобрази Gemma в дифузионен модел

Google DeepMind публикува техническия доклад зад DiffusionGemma — отворен текстов модел, който не пише дума по дума, а „проявява“ цели блокове от 256 токена наведнъж. Най-интересното е не скоростта, а начинът на производство: моделът не е трениран от нулата, а е преправен от готовия Gemma 4 с под 10% от бюджета токени, вложен в оригинала. Теглата излязоха на 10 юни 2026 г., а докладът беше качен в arXiv на 31 юли.

Какво точно е дифузионен текстов модел

Класическите езикови модели са авторегресивни: предсказват следващия токен, после следващия, и така до края. Дифузионните работят като генераторите на изображения — тръгват от „платно“ със случайни токени-запълнители и на няколко минавания махат шума, като заключват правилните позиции.

DiffusionGemma борави с платно от 256 токена и препоръчва максимум 48 стъпки на блок, но с адаптивно спиране обикновено са достатъчни 12–16, пише документацията на Google. Ефектът е, че тясното място се мести от паметта към изчисленията — а точно паметта е ограничението при един потребител на една видеокарта.

Числата

Основата е Gemma 4 в MoE вариант: 26 милиарда параметъра общо, около 3,8 милиарда активни при извод, 8 активни експерта от 128. Контекстът е до 256K токена, входът е мултимодален — текст, изображения и видео до 60 секунди.

По скорост Google обявява над 1000 токена в секунда на една NVIDIA H100 и „до 4 пъти по-бърз изход“ спрямо съпоставим авторегресивен модел; моделната карта посочва 1100 токена/сек при FP8 квантуване, а техническият доклад стига до около 1500 при около 20 токена на минаване напред. За настолни машини NVIDIA отчита над 700 токена/сек на GeForce RTX 5090, 150 на DGX Spark и до 2000 на DGX Station.

Илюстрация на DiffusionGemma върху NVIDIA GPU Снимка: NVIDIA

Качеството не е компромисно, но и не е рекордно: MMLU Pro 77,6%, GPQA Diamond 73,2%, LiveCodeBench v6 69,1%, MMMU Pro (визия) 54,3%, MATH-Vision 70,5%. Спрямо авторегресивния Gemma 4 моделът остава леко назад по повечето метрики — цената на скоростта.

Рецептата: два етапа върху готов модел

Точно тази част е приносът на доклада. Вместо ново предварително обучение екипът минава през две фази:

  1. Надзиравано дообучение — моделът се учи да възстановява зашумени блокове текст с двупосочно внимание вместо с маска „само назад“.
  2. Подсилващо обучение с дистилация на семплера — комбинация, която свива броя стъпки. Резултатът: средно около 10 точки нагоре по разсъждаващите бенчмаркове и отговори с около 50% по-малко токени.

Показателен е примерът със судоку: след кратко дообучение моделът решава около 80% от пъзелите, докато базовият е на практика на нула. Итеративното поправяне върши работа там, където един грешен ранен токен обрича целия отговор.

Според авторите DiffusionGemma запазва мултимодалността, дългия контекст и режима на разсъждение и дори може да генерира авторегресивно с малка загуба на качество. Тоест дифузията се добавя, а не заменя.

Как се пуска

Теглата са под Apache 2.0 в Hugging Face, Kaggle и Vertex AI Model Garden. Квантуван (4 бита), моделът иска около 18 GB VRAM — тоест влиза в 24-гигабайтовата RTX 4090, а още по-спокойно в 32-гигабайтовата RTX 5090. Поддържат се vLLM, Transformers, SGLang и MLX:

vllm serve google/diffusiongemma-26B-A4B-it \
  --max-model-len 262144 \
  --max-num-seqs 4
Добре е да знаете

Печалбата от дифузията е най-голяма при малък брой едновременни заявки — локални и еднопотребителски сценарии. При облачни системи с голям batch авторегресивните модели остават конкурентни.

Защо има значение

Досега дифузионните текстови модели изглеждаха като скъпа екзотика: за да ги пробвате, трябваше нов модел от нулата. DiffusionGemma показва, че съществуващ и вече платен модел може да бъде преправен за десетина процента от разхода. Ако рецептата се повтори и от други лаборатории, дифузионният декодинг спира да е отделна пътека и става опция върху всяко семейство модели.

Има и енергийна страна. По-малко токени за същия отговор и повече токени на изчислителна стъпка означават по-малко ватчаса на заявка — тема, която стана осезаема, откакто AI агентите харчат стотици пъти повече енергия от обикновен чат. А фактът, че всичко това излиза под Apache 2.0 в момент, в който Google преструктурира DeepMind, подсказва, че отворената линия Gemma остава част от плана.

Засега DiffusionGemma е обявен като експериментален модел. Ако търсите максимално качество, авторегресивният Gemma 4 още води. Ако търсите бърз локален модел, който отговаря почти веднага — тук вече има какво да пробвате.

Харесва ви? Отбележете ни и ще ни виждате по-нагоре в Google.

Предпочитан източник в Google

Прочетете още