Google анонсировал OpenRL, новый открытый проект, который предлагает самохостящийся API для пост-тренировочного дообучения больших языковых моделей (LLM) на стандартных кластерах Kubernetes. Этот инструмент призван упростить работу с инфраструктурой, позволяя командам по машинному обучению масштабировать свои рабочие процессы прямо на собственных кластерах.
Согласно инженерам Google, работа с агентным обучением с подкреплением (RL) на LLM может быть довольно сложной из-за множества переменных, которые необходимо учитывать. Каждый цикл RL требует управления такими аспектами, как подготовка и очистка данных, выбор среды, отладка тренировочного цикла, проектирование вознаграждений и управление аппаратным обеспечением. OpenRL помогает разделить эти задачи, позволяя специализированным командам сосредоточиться на своих областях, аналогично тому, как Kubernetes упрощает рабочие процессы для разработчиков приложений и инженеров по обеспечению надежности.
Одним из ключевых преимуществ OpenRL является возможность запуска нескольких RL-задач на вашей инфраструктуре, что увеличивает общую загрузку GPU. Традиционные циклы RL часто работают последовательно, что может приводить к простоям GPU во время ожидания завершения задач, связанных с CPU или сетью. OpenRL улучшает пользовательский опыт, четко разделяя обязанности: исследователи могут сосредоточиться на разработке RL-цикла, в то время как инженеры занимаются выполнением и масштабированием рабочих процессов дообучения.
Кроме того, OpenRL предоставляет возможность запускать RL-циклы на Mac, указывая на API для обучения, работающие на кластерах Kubernetes или виртуальных машинах. В репозитории OpenRL также представлен рецепт автопоиска, демонстрирующий, как запускать параллельные эксперименты для настройки параметров и уточнения сигналов вознаграждения в текстово-SQL рабочем процессе для моделей Gemma.
Этот проект не только практичен, но и служит примером того, как автоматизация может упростить и масштабировать исследования в области ИИ. OpenRL совместим с macOS, графическими процессорами Nvidia и GKE, а также интегрируется с Tinker-Cookbook благодаря совместимому с Tinker интерфейсу.