10.08.2026
Экспериментальная DiffusionGemma получена дообучением Gemma 4 с использованием менее 10% объёма обучающих токенов исходной модели. На одном ускорителе NVIDIA H100 она генерирует около 1500 токенов в секунду, но в большинстве тестов уступает авторегрессионной Gemma 4.
Google DeepMind опубликовала технический отчёт о DiffusionGemma — экспериментальной языковой модели с открытыми весами, созданной на базе Gemma-4-26B-A4B. Архитектура Mixture of Experts содержит 25,2 млрд параметров, из которых при обработке запроса активны 3,8 млрд.
Вместо последовательного предсказания токенов DiffusionGemma итеративно уточняет блоки из 256 токенов с помощью дискретной диффузии. Для преобразования готовой Gemma 4 исследователи использовали менее 10% объёма обучающих токенов исходной модели: сначала её обучили восстанавливать зашумлённый текст, а затем объединили обучение с подкреплением и дистилляцию алгоритма генерации.
По данным разработчиков, модель выдаёт в среднем около 20 токенов за один проход и достигает примерно 1500 выходных токенов в секунду на одном NVIDIA H100. Скорость сопровождается снижением качества: результат DiffusionGemma в MMLU Pro составляет 77,6% против 82,6% у исходной Gemma 4, а в математическом тесте AIME 2026 — 69,1% против 88,3%.
Модель сохраняет авторегрессионный режим, поддержку мультимодальных данных и контекст до 256 тыс. токенов. Веса DiffusionGemma опубликованы под лицензией Apache 2.0.
Источник: arxiv.org