GitHub представил ReviewBench — открытый бенчмарк для ИИ-ревью кода

GitHub выпустил ReviewBench — открытый бенчмарк для оценки ИИ-систем ревью кода. Он построен на основе более 100 млн реальных пул-реквестов и уже помогает оценивать Copilot code review.

Главное
  • ReviewBench — открытый офлайн-бенчмарк для оценки ИИ-ревьюеров кода, доступный для использования.
  • Бенчмарк смоделирован на основе более 100 млн реальных пул-реквестов на GitHub.
  • GitHub использует ReviewBench для оценки Copilot code review и прогнозирования результатов в продакшене.

GitHub представил ReviewBench — открытый офлайн-бенчмарк для оценки систем ИИ-ревью кода. Инструмент уже доступен для использования. О запуске сообщается в блоге GitHub.

Agentic-ревью кода становится важной частью разработки: оно помогает проверять пул-реквесты, находить проблемы и решать, что заслуживает внимания до релиза. Однако качество существующих ИИ-ревьюеров измерить сложно. Разные системы находят разное количество проблем, одни выдают больше шума, другие лучше ловят критичные баги, третьи — мелкие улучшения. Чтобы понять, насколько ревьюер полезен, нужно знать его сильные стороны.

ReviewBench призван закрыть этот пробел. Бенчмарк следует распределению языков, размера репозиториев и размера пул-реквестов, смоделированному на основе более 100 млн реальных пул-реквестов на GitHub. Он использует многоисточниковый golden set и единую рубрику оценки, а также прошёл независимую валидацию старшими инженерами.

По словам GitHub, с помощью ReviewBench офлайн-оценка Copilot code review (CCR) стала лучше предсказывать направление продакшен-экспериментов. Это даёт больше уверенности, что измеренные улучшения отражают реальные улучшения для пользователей.

Как работает бенчмарк

ReviewBench оценивает ревьюеров по нескольким метрикам. Precision показывает, какая доля найденных проблем валидна — чем выше, тем меньше шума. Recall отражает, какую долю известных валидных проблем нашёл ревьюер — чем выше, тем шире покрытие. F1-мера балансирует precision и recall, а Fβ позволяет сместить вес в сторону одной из метрик в зависимости от предпочтений команды.

Бенчмарк поддерживает разбивку результатов по серьёзности, категории и предпочтениям precision-recall. Для команд, создающих агентов для ревью кода, ReviewBench даёт офлайн-сигнал, который надёжно отслеживает, улучшат ли изменения опыт в продакшене.

GitHub предлагает командам подключить свою систему ревью к бенчмарку и отправить результаты.

Для профиТехнические детали: архитектура, цифры, ссылки

ReviewBench следует распределению языков, размера репозиториев и размера пул-реквестов, смоделированному на основе более 100 млн реальных пул-реквестов на GitHub. Бенчмарк использует многоисточниковый golden set и единую рубрику оценки, прошёл независимую валидацию старшими инженерами.

Метрики: precision (доля валидных находок среди всех найденных), recall (доля найденных валидных проблем среди всех известных), F1 (баланс precision и recall), Fβ (смещение веса в сторону precision или recall). Поддерживается разбивка по серьёзности, категории и предпочтениям precision-recall.

GitHub отмечает, что с помощью ReviewBench офлайн-оценка Copilot code review (CCR) стала лучше предсказывать направление продакшен-экспериментов. Команды могут подключить свою систему ревью и отправить результаты.

Вопросы и ответы

Что такое ReviewBench?
Открытый офлайн-бенчмарк от GitHub для оценки систем ИИ-ревью кода.
На чём основан бенчмарк?
На распределении языков, размера репозиториев и пул-реквестов, смоделированном по более чем 100 млн реальных пул-реквестов на GitHub.
Можно ли подключить свою систему?
Да, GitHub предлагает командам подключить свою систему ревью к бенчмарку и отправить результаты.