Google анонсировал открытие своей новой языковой модели под названием DiffusionGemma, использующей инновационный подход к машинному обучению, известный как текстовая диффузия. Эта модель способна генерировать текст в четыре раза быстрее, чем традиционные языковые модели, и требует значительно меньше оперативной памяти. Это делает её доступной для использования на высокопроизводительных потребительских графических картах, которые обычно не справляются с нагрузками, связанными с языковыми моделями.
Архитектура DiffusionGemma основана на методах, применяемых в генерации изображений. Процесс начинается с размытого изображения, содержащего шум, который модель постепенно очищает, анализируя и восстанавливая пиксели до получения качественного изображения. При получении запроса модель генерирует начальный ответ, состоящий из случайных слов, и затем заменяет часть этих слов на те, которые соответствуют запросу. Этот процесс повторяется до тех пор, пока ответ не будет готов.
В отличие от большинства моделей, которые генерируют ответ по одному токену, DiffusionGemma может обрабатывать 256 токенов одновременно. Это параллельное выполнение делает модель значительно быстрее. Google утверждает, что DiffusionGemma может генерировать более 1000 токенов в секунду на серверной графической карте H100, выпущенной Nvidia в 2022 году, и более 700 токенов в секунду на настольной GeForce RTX 5090.
Одной из причин, по которой DiffusionGemma может работать на потребительских графических картах, является её архитектура, основанная на смеси экспертов. Модель содержит 26 миллиардов параметров, но активирует только 3,8 миллиарда из них для обработки запроса, что значительно снижает потребление памяти. Кроме того, модель использует легкий формат данных NVFP4 для дальнейшего уменьшения использования оперативной памяти.
DiffusionGemma основана на модели Gemma 4 26B A4B, выпущенной Google в апреле. Для реализации текстовой диффузии компания заменила механизм внимания, который использовался в предыдущей модели. Новый механизм не только анализирует предшествующий текст, но и учитывает слова, следующие за текущим.
Google подчеркивает, что хотя исследовательское сообщество уже давно изучает диффузионную генерацию текста, применение этого подхода к крупным моделям оставалось сложной задачей. DiffusionGemma меняет правила игры, оптимизируя использование аппаратного обеспечения. Модель доступна на платформе Hugging Face под открытой лицензией.