В мире больших языковых моделей (LLM) самокоррекция становится ключевым аспектом их развития. Исследователи из Google DeepMind представили новый подход под названием Self-Correction via Reinforcement Learning (SCoRe), который значительно улучшает способность моделей исправлять собственные ошибки, используя только данные, сгенерированные ими самими.
На данный момент LLM часто не могут дать правильный ответ с первого раза. Это связано с тем, что они не обучены анализировать и исправлять свои ошибки. SCoRe решает эту проблему, позволяя моделям не только генерировать ответы, но и корректировать их без внешней обратной связи. Это достигается благодаря использованию методов обучения с подкреплением, что делает процесс самокоррекции более эффективным и независимым.
Исследования показали, что SCoRe значительно улучшает результаты моделей Gemini 1.0 Pro и 1.5 Flash в задачах, связанных с математикой и программированием. Например, на тестах MATH и HumanEval SCoRe продемонстрировал прирост в 15.6% и 9.1% соответственно по сравнению с базовой моделью.
Важно отметить, что SCoRe не только улучшает качество ответов, но и снижает вероятность того, что модель изменит правильный ответ на неправильный в процессе самокоррекции. Это открывает новые горизонты для применения LLM в различных областях, включая безопасность и улучшение пользовательского опыта.