APPERCASE
vasb@nccrepnfr.eh +7 499 302-34-17

Google открывает исходный код быстрого текстового диффузионного модели DiffusionGemma

Google представил DiffusionGemma — новый языковой модель, работающий на основе текстовой диффузии, который генерирует текст в четыре раза быстрее традиционных моделей и требует меньше оперативной памяти.

Google анонсировал открытие своей новой языковой модели под названием DiffusionGemma, использующей инновационный подход к машинному обучению, известный как текстовая диффузия. Эта модель способна генерировать текст в четыре раза быстрее, чем традиционные языковые модели, и требует значительно меньше оперативной памяти. Это делает её доступной для использования на высокопроизводительных потребительских графических картах, которые обычно не справляются с нагрузками, связанными с языковыми моделями.

Архитектура DiffusionGemma основана на методах, применяемых в генерации изображений. Процесс начинается с размытого изображения, содержащего шум, который модель постепенно очищает, анализируя и восстанавливая пиксели до получения качественного изображения. При получении запроса модель генерирует начальный ответ, состоящий из случайных слов, и затем заменяет часть этих слов на те, которые соответствуют запросу. Этот процесс повторяется до тех пор, пока ответ не будет готов.

В отличие от большинства моделей, которые генерируют ответ по одному токену, DiffusionGemma может обрабатывать 256 токенов одновременно. Это параллельное выполнение делает модель значительно быстрее. Google утверждает, что DiffusionGemma может генерировать более 1000 токенов в секунду на серверной графической карте H100, выпущенной Nvidia в 2022 году, и более 700 токенов в секунду на настольной GeForce RTX 5090.

Одной из причин, по которой DiffusionGemma может работать на потребительских графических картах, является её архитектура, основанная на смеси экспертов. Модель содержит 26 миллиардов параметров, но активирует только 3,8 миллиарда из них для обработки запроса, что значительно снижает потребление памяти. Кроме того, модель использует легкий формат данных NVFP4 для дальнейшего уменьшения использования оперативной памяти.

DiffusionGemma основана на модели Gemma 4 26B A4B, выпущенной Google в апреле. Для реализации текстовой диффузии компания заменила механизм внимания, который использовался в предыдущей модели. Новый механизм не только анализирует предшествующий текст, но и учитывает слова, следующие за текущим.

Google подчеркивает, что хотя исследовательское сообщество уже давно изучает диффузионную генерацию текста, применение этого подхода к крупным моделям оставалось сложной задачей. DiffusionGemma меняет правила игры, оптимизируя использование аппаратного обеспечения. Модель доступна на платформе Hugging Face под открытой лицензией.

Эта новость создана искусственным интеллектом на основе открытых данных и предназначена исключительно для информирования. Администрация сайта не несёт ответственности за её содержание. Новости агрегируются из различных источников, включая недружественные России страны и их средства массовой информации. Социальные сети Facebook, Instagram и WhatsApp принадлежат корпорации Meta, которая в России признана экстремистской организацией.

В Турции количество новых игровых студий сократилось с 200 до 30 в год, а Microsoft уволила 3200 сотрудников Xbox. Основная причина — AI заменяет не разработчиков, а младшие позиции, что меняет структуру индустрии.
Компания Loman AI интегрировала свою голосовую технологию с платформой Toast, что позволяет ресторанам обрабатывать телефонные заказы без лишних затрат времени и ресурсов.
Гиперспектральная визуализация в сочетании с машинным обучением продемонстрировала высокую точность диагностики миелодиспластического синдрома, достигая 97% в анализе образцов костного мозга, что превосходит традиционные методы.
Написать нам