APPERCASE
vasb@nccrepnfr.eh +7 499 302-34-17

Google OpenRL: Экспериментальный самохостинг API для дообучения LLM после тренировки

Google представил OpenRL — экспериментальный API для дообучения больших языковых моделей (LLM), который можно развернуть на собственных кластерах Kubernetes. Этот проект упрощает работу с инфраструктурой и позволяет командам сосредоточиться на исследовательских задачах.

Google анонсировал OpenRL, новый открытый проект, который предлагает самохостящийся API для пост-тренировочного дообучения больших языковых моделей (LLM) на стандартных кластерах Kubernetes. Этот инструмент призван упростить работу с инфраструктурой, позволяя командам по машинному обучению масштабировать свои рабочие процессы прямо на собственных кластерах.

Согласно инженерам Google, работа с агентным обучением с подкреплением (RL) на LLM может быть довольно сложной из-за множества переменных, которые необходимо учитывать. Каждый цикл RL требует управления такими аспектами, как подготовка и очистка данных, выбор среды, отладка тренировочного цикла, проектирование вознаграждений и управление аппаратным обеспечением. OpenRL помогает разделить эти задачи, позволяя специализированным командам сосредоточиться на своих областях, аналогично тому, как Kubernetes упрощает рабочие процессы для разработчиков приложений и инженеров по обеспечению надежности.

Одним из ключевых преимуществ OpenRL является возможность запуска нескольких RL-задач на вашей инфраструктуре, что увеличивает общую загрузку GPU. Традиционные циклы RL часто работают последовательно, что может приводить к простоям GPU во время ожидания завершения задач, связанных с CPU или сетью. OpenRL улучшает пользовательский опыт, четко разделяя обязанности: исследователи могут сосредоточиться на разработке RL-цикла, в то время как инженеры занимаются выполнением и масштабированием рабочих процессов дообучения.

Кроме того, OpenRL предоставляет возможность запускать RL-циклы на Mac, указывая на API для обучения, работающие на кластерах Kubernetes или виртуальных машинах. В репозитории OpenRL также представлен рецепт автопоиска, демонстрирующий, как запускать параллельные эксперименты для настройки параметров и уточнения сигналов вознаграждения в текстово-SQL рабочем процессе для моделей Gemma.

Этот проект не только практичен, но и служит примером того, как автоматизация может упростить и масштабировать исследования в области ИИ. OpenRL совместим с macOS, графическими процессорами Nvidia и GKE, а также интегрируется с Tinker-Cookbook благодаря совместимому с Tinker интерфейсу.

Эта новость создана искусственным интеллектом на основе открытых данных и предназначена исключительно для информирования. Администрация сайта не несёт ответственности за её содержание. Новости агрегируются из различных источников, включая недружественные России страны и их средства массовой информации. Социальные сети Facebook, Instagram и WhatsApp принадлежат корпорации Meta, которая в России признана экстремистской организацией.

Команда Labs компании Anthropic, состоящая из 20 сотрудников, активно разрабатывает новые идеи для продуктов на основе искусственного интеллекта, включая популярный инструмент Claude Code. Это позволяет компании быстро адаптироваться к изменениям в области AI и готовиться к выходу на биржу.
ACEMAGIC Kron Mini K5 — это мини-ПК с процессором Intel Core 3 304 Wildcat Lake, который продемонстрировал отличные результаты в тестах производительности и поддерживает воспроизведение видео в 4K и 8K.
На Gamescom 2026 Тим Уиллитс, CCO Saber Interactive, поделился мнением о влиянии искусственного интеллекта на игровую индустрию, отметив его экологические последствия и необходимость поиска устойчивых решений.
Написать нам