GitHub представил ReviewBench — открытый бенчмарк для ИИ-ревью кода
GitHub выпустил ReviewBench — открытый бенчмарк для оценки ИИ-систем ревью кода. Он построен на основе более 100 млн реальных пул-реквестов и уже помогает оценивать Copilot code review.
- ReviewBench — открытый офлайн-бенчмарк для оценки ИИ-ревьюеров кода, доступный для использования.
- Бенчмарк смоделирован на основе более 100 млн реальных пул-реквестов на GitHub.
- GitHub использует ReviewBench для оценки Copilot code review и прогнозирования результатов в продакшене.
GitHub представил ReviewBench — открытый офлайн-бенчмарк для оценки систем ИИ-ревью кода. Инструмент уже доступен для использования. О запуске сообщается в блоге GitHub.
Agentic-ревью кода становится важной частью разработки: оно помогает проверять пул-реквесты, находить проблемы и решать, что заслуживает внимания до релиза. Однако качество существующих ИИ-ревьюеров измерить сложно. Разные системы находят разное количество проблем, одни выдают больше шума, другие лучше ловят критичные баги, третьи — мелкие улучшения. Чтобы понять, насколько ревьюер полезен, нужно знать его сильные стороны.
ReviewBench призван закрыть этот пробел. Бенчмарк следует распределению языков, размера репозиториев и размера пул-реквестов, смоделированному на основе более 100 млн реальных пул-реквестов на GitHub. Он использует многоисточниковый golden set и единую рубрику оценки, а также прошёл независимую валидацию старшими инженерами.
По словам GitHub, с помощью ReviewBench офлайн-оценка Copilot code review (CCR) стала лучше предсказывать направление продакшен-экспериментов. Это даёт больше уверенности, что измеренные улучшения отражают реальные улучшения для пользователей.
Как работает бенчмарк
ReviewBench оценивает ревьюеров по нескольким метрикам. Precision показывает, какая доля найденных проблем валидна — чем выше, тем меньше шума. Recall отражает, какую долю известных валидных проблем нашёл ревьюер — чем выше, тем шире покрытие. F1-мера балансирует precision и recall, а Fβ позволяет сместить вес в сторону одной из метрик в зависимости от предпочтений команды.
Бенчмарк поддерживает разбивку результатов по серьёзности, категории и предпочтениям precision-recall. Для команд, создающих агентов для ревью кода, ReviewBench даёт офлайн-сигнал, который надёжно отслеживает, улучшат ли изменения опыт в продакшене.
GitHub предлагает командам подключить свою систему ревью к бенчмарку и отправить результаты.
Для профиТехнические детали: архитектура, цифры, ссылки
ReviewBench следует распределению языков, размера репозиториев и размера пул-реквестов, смоделированному на основе более 100 млн реальных пул-реквестов на GitHub. Бенчмарк использует многоисточниковый golden set и единую рубрику оценки, прошёл независимую валидацию старшими инженерами.
Метрики: precision (доля валидных находок среди всех найденных), recall (доля найденных валидных проблем среди всех известных), F1 (баланс precision и recall), Fβ (смещение веса в сторону precision или recall). Поддерживается разбивка по серьёзности, категории и предпочтениям precision-recall.
GitHub отмечает, что с помощью ReviewBench офлайн-оценка Copilot code review (CCR) стала лучше предсказывать направление продакшен-экспериментов. Команды могут подключить свою систему ревью и отправить результаты.
Вопросы и ответы
- Что такое ReviewBench?
- Открытый офлайн-бенчмарк от GitHub для оценки систем ИИ-ревью кода.
- На чём основан бенчмарк?
- На распределении языков, размера репозиториев и пул-реквестов, смоделированном по более чем 100 млн реальных пул-реквестов на GitHub.
- Можно ли подключить свою систему?
- Да, GitHub предлагает командам подключить свою систему ревью к бенчмарку и отправить результаты.


