Печатная машинка уступает место печатному станку
Обычная языковая модель работает как машинистка: выдаёт по одному токену слева направо и каждый следующий рассчитывает только после предыдущего. На сервере это незаметно — облако склеивает тысячи запросов в пакеты и загружает железо равномерно. На домашнем GPU при одном пользователе картина иная: видеокарта простаивает, пока ждёт очередное «нажатие клавиши».
DiffusionGemma переносит на текст приём из генераторов изображений. Те стартуют с цветового шума и постепенно проявляют картинку; модель Google так же начинает с холста из случайных токенов-заглушек и за несколько проходов уплотняет его до связного текста. За один проход она обрабатывает блок в 256 токенов целиком. Отсюда метафора самой Google:
Вместо машинистки — печатный станок, отпечатывающий абзац одним движением.
26 миллиардов параметров, в работе — 3,8
Под капотом DiffusionGemma — Mixture of Experts на 26 млрд параметров, из которых при выводе активны лишь 3,8 млрд (схема, где под каждый запрос включается только часть «экспертов»). В квантованном виде модель помещается в 18 ГБ видеопамяти, то есть в потолок топовых потребительских карт.
Скорость Google измеряет конкретно: больше 1000 токенов в секунду на одной NVIDIA H100 и больше 700 — на игровой RTX 5090. Прирост до 4 раз достигается за счёт смены узкого места: декодирование смещается с пропускной способности памяти на вычисления, которыми ускоритель загружается полнее.
Основа — семейство Gemma 4 и исследования Gemini Diffusion, поверх которых добавлена отдельная «диффузионная голова», заточенная под скорость.
Где двунаправленное внимание решает
Главное отличие от обычных моделей в том, что каждый токен в блоке видит все остальные, и предыдущие, и последующие. Для линейного текста это просто ускорение. На «нелинейных» задачах эффект качественный: вставка кода в середину функции, правка внутри готового абзаца, аминокислотные последовательности, математические графы.
Показательный пример привела команда Unsloth, дообучившая DiffusionGemma играть в судоку. Авторегрессионные модели спотыкаются на этой задаче: каждая цифра зависит от ещё не написанных. Двунаправленное внимание снимает проблему, потому что модель оценивает всё поле сразу.
Сюда же относится самокоррекция. За несколько проходов модель перечитывает собственный блок и правит ошибки на ходу, вместо того чтобы тащить их дальше по тексту, как при пословной генерации.
Скорость есть, за неё заплатили качеством
Google не прячет компромисс. По качеству вывода DiffusionGemma уступает обычной Gemma 4, и за максимальное качество компания прямо советует брать стандартную версию. Это инструмент для исследователей и разработчиков под скоростные интерактивные локальные сценарии: редактирование на лету, быстрые итерации, генерация в реальном времени.
Второе ограничение — экономика. Ускорение работает на локальном и низконагруженном выводе. В облаке с высоким потоком запросов авторегрессионные модели и так загружают железо плотно, поэтому параллельное декодирование там приносит всё меньше выгоды и может выйти дороже в обслуживании. Отдельная оговорка для владельцев Mac: на Apple Silicon с общей памятью, упирающейся в её пропускную способность, того же ускорения может не быть.
Веса уже на Hugging Face
Запуск поддержан широким набором инструментов: MLX, vLLM, Hugging Face Transformers. Дообучение идёт через NVIDIA NeMo, Unsloth и собственный JAX-тулбокс Google под названием Hackable Diffusion. Поддержку llama.cpp обещают вскоре.
С железом Google работала вместе с NVIDIA: квантование под RTX 5090 и 4090, ускоренные ядра NVFP4 (4-битные вычисления с плавающей точкой) для серверных Hopper и Blackwell, готовность к настольным DGX Spark и DGX Station. Попробовать модель можно и в облаке — через Model Garden на Gemini Enterprise Agent Platform или NVIDIA NIM.
Ниша для экспериментов, не замена флагмана
DiffusionGemma — не замена Gemma 4, и Google это не скрывает. Текстовая диффузия годами жила в исследованиях и плохо масштабировалась на большие модели; здесь её довели до открытой версии, которую можно скачать и запустить на домашней карте. Реальную ценность покажут не цифры скорости, а то, приживётся ли подход в живых сценариях: редактуре кода, инструментах с мгновенным откликом, задачах, где текст устроен нелинейно. Пока это сильная техническая заявка, проверять которую будут разработчики на своих RTX.