JetBrains анонсировала запуск Kotlin Benchmark, который станет важным шагом в оценке работы AI-агентов в контексте разработки на Kotlin. Этот инструмент позволит командам разработчиков объективно сравнивать производительность различных AI-решений, выполняя задачи, которые отражают реальные условия работы.
Kotlin Benchmark основан на методологии SWE-bench и фокусируется на задачах программирования на уровне репозиториев. В отличие от существующих оценочных инструментов, таких как Kotlin_HumanEval и Kotlin_QA, которые проверяют понимание синтаксиса языка, новый бенчмарк анализирует, насколько эффективно AI-агенты могут решать проверенные задачи в реальных проектах на Kotlin. В набор данных включены 105 инженерных задач, собранных из активных открытых репозиториев. Каждая задача требует от AI-агента интерпретации описания проблемы, навигации по контексту проекта и генерации функционального патча. Решения проверяются в контейнеризированных средах, и задача считается выполненной только после успешного прохождения тестов.
Первые результаты показывают, что ведущие AI-агенты способны успешно решать значительное количество задач из Kotlin Benchmark. На данный момент наивысший результат продемонстрировал Claude Code с Opus 4.7 xhigh, который успешно решил 90 из 105 задач, что составляет 85,71% успешных решений. JetBrains Junie с Opus 4.7 max и Codex с GPT 5.5 xhigh следуют за ним с результатом 81,9%.
Kotlin Benchmark предоставляет разработчикам общую основу для сравнения различных AI-агентов, что позволяет избежать зависимости от заявлений поставщиков. Однако важно помнить, что реальные результаты могут варьироваться в зависимости от архитектуры, внутренних API, стандартов кодирования и процессов валидации.
В будущем JetBrains планирует расширить функционал бенчмарка, добавив больше задач, охватывающих различные аспекты экосистемы Kotlin, включая Android и Kotlin Multiplatform. Также будут введены новые метрики оценки, такие как стоимость, производительность и качество кода, а также расширен список оцениваемых агентов и конфигураций моделей.
Бенчмарк открыт для общественности, что позволяет разработчикам исследовать задачи, сравнивать результаты и предлагать новые сценарии для оценки.