APPERCASE
vasb@nccrepnfr.eh +7 499 302-34-17

Представляем Kotlin Benchmark для агентов искусственного интеллекта в программировании

JetBrains представила Kotlin Benchmark — новый инструмент для оценки производительности AI-агентов в задачах программирования на Kotlin. Он позволяет разработчикам сравнивать эффективность различных агентов на реальных задачах, приближенных к повседневной разработке.

JetBrains анонсировала запуск Kotlin Benchmark, который станет важным шагом в оценке работы AI-агентов в контексте разработки на Kotlin. Этот инструмент позволит командам разработчиков объективно сравнивать производительность различных AI-решений, выполняя задачи, которые отражают реальные условия работы.

Kotlin Benchmark основан на методологии SWE-bench и фокусируется на задачах программирования на уровне репозиториев. В отличие от существующих оценочных инструментов, таких как Kotlin_HumanEval и Kotlin_QA, которые проверяют понимание синтаксиса языка, новый бенчмарк анализирует, насколько эффективно AI-агенты могут решать проверенные задачи в реальных проектах на Kotlin. В набор данных включены 105 инженерных задач, собранных из активных открытых репозиториев. Каждая задача требует от AI-агента интерпретации описания проблемы, навигации по контексту проекта и генерации функционального патча. Решения проверяются в контейнеризированных средах, и задача считается выполненной только после успешного прохождения тестов.

Первые результаты показывают, что ведущие AI-агенты способны успешно решать значительное количество задач из Kotlin Benchmark. На данный момент наивысший результат продемонстрировал Claude Code с Opus 4.7 xhigh, который успешно решил 90 из 105 задач, что составляет 85,71% успешных решений. JetBrains Junie с Opus 4.7 max и Codex с GPT 5.5 xhigh следуют за ним с результатом 81,9%.

Kotlin Benchmark предоставляет разработчикам общую основу для сравнения различных AI-агентов, что позволяет избежать зависимости от заявлений поставщиков. Однако важно помнить, что реальные результаты могут варьироваться в зависимости от архитектуры, внутренних API, стандартов кодирования и процессов валидации.

В будущем JetBrains планирует расширить функционал бенчмарка, добавив больше задач, охватывающих различные аспекты экосистемы Kotlin, включая Android и Kotlin Multiplatform. Также будут введены новые метрики оценки, такие как стоимость, производительность и качество кода, а также расширен список оцениваемых агентов и конфигураций моделей.

Бенчмарк открыт для общественности, что позволяет разработчикам исследовать задачи, сравнивать результаты и предлагать новые сценарии для оценки.

Эта новость создана искусственным интеллектом на основе открытых данных и предназначена исключительно для информирования. Администрация сайта не несёт ответственности за её содержание. Новости агрегируются из различных источников, включая недружественные России страны и их средства массовой информации. Социальные сети Facebook, Instagram и WhatsApp принадлежат корпорации Meta, которая в России признана экстремистской организацией.

Модель Ornith 9B от DeepReinforce демонстрирует впечатляющие результаты на 16ГБ ноутбуке, обеспечивая почти 35 миллиардов ответов и поддержку медиа. Эта компактная модель выделяется благодаря уникальному подходу к обучению и может обрабатывать изображения.
Работники страховой компании AIG Israel объявили о трудовом конфликте из-за внедрения AI-технологий, которые могут угрожать рабочим местам. Профсоюз требует учесть влияние AI на занятость в новом коллективном соглашении.
OpenAI анонсировала значительное обновление для бесплатных пользователей ChatGPT, убирая ограничения на текстовые чаты и вводя новый модельный алгоритм GPT-5.6 Luna.
Написать нам