Google придумал, как не дать самообучающимся ИИ-агентам зазубривать тесты

Исследователи Google предложили метод RRSI, который не даёт самообучающимся агентам зазубривать тестовые задачи. Он ограничивает правки в обвязке агента и отсеивает решения, подогнанные под конкретный бенчмарк.

Главное
  • Метод RRSI даёт до 14,1 балла прироста на обучающих задачах и до 4,7 балла на пяти незнакомых бенчмарках.
  • RRSI расходует примерно на 30% меньше токенов при работе, чем версия без регуляризации.
  • Обвязка, оптимизированная на Gemini 3.5 Flash, подняла точность слабой Gemini 3.1 Flash Lite с 11,2 до 14,6 балла без доработок.
Схема оптимизации обвязки ИИ-агента с ограничением правок и проверкой предложений критиком
Фото: The Decoder

Исследователи Google представили метод RRSI (Regularized Recursive Self-Improvement of Agent Harnesses), который не даёт самообучающимся ИИ-агентам зазубривать тестовые задачи. Работа опубликована в виде научной статьи, код доступен на GitHub.

Речь идёт об обвязке агента — наборе правил и инструментов, которые определяют, прочитает ли агент нужный файл перед изменением, восстановится ли после ошибки и аккуратно ли выдаст результат. По данным статьи, значительная часть недавнего прогресса агентов связана именно с работой над обвязкой, а не с новыми моделями.

В чём проблема самооптимизации

Раньше обвязку дорабатывали вручную: люди разбирали неудачные запуски и вносили правки. Новые методы автоматизируют этот цикл — языковая модель сама переписывает обвязку по обратной связи от тестовых задач. Исследователи называют это практической формой рекурсивного самоулучшения.

Но у такой самооптимизации есть побочный эффект. Агент работает с одним и тем же ограниченным набором тестовых задач и в итоге их запоминает. Оценки на обучающих задачах растут, а прирост на новых, невиданных задачах сокращается или исчезает совсем. Это происходит по нескольким причинам: поиск запоминает шаблоны, подходящие только одному бенчмарку, выбирает варианты, которые выигрывают чисто случайно, и нагромождает лишнюю сложность, повышающую тестовый балл без реального улучшения агента.

Как работает RRSI

RRSI ограничивает самооптимизацию на двух этапах: при предложении новых изменений и при решении, какие из них станут постоянной частью обвязки. Когда система предлагает правки, бюджет задаёт, сколько независимых изменений можно объединить в один кандидат. Со временем этот бюджет сокращается: ранние раунды допускают крупные переписывания, поздние — только небольшие правки с прослеживаемым результатом.

Система также отслеживает прошлые попытки, чтобы не гоняться за одними и теми же неудачными идеями. Когда прогресс застопоривается, она намеренно экспериментирует с ещё не тронутыми частями обвязки.

На этапе отбора критик проверяет каждое предложение и отбрасывает те, что жёстко прописывают имена задач, решения или другие трюки под конкретный бенчмарк. Отдельное правило принимает рост вычислительных затрат только при измеримом приросте производительности. Компоненты, которые больше не помогают, удаляются.

Результаты тестов

RRSI протестировали на восьми бенчмарках в области программирования, агентной офисной работы и инженерного проектирования. Базовая модель Claude Opus 4.8 оставалась замороженной на протяжении всего времени. RRSI сравнили с немодифицированной базовой обвязкой и четырьмя недавними методами оптимизации.

По данным статьи, RRSI даёт до 14,1 балла прироста на обучающих задачах и до 4,7 балла на пяти бенчмарках, которых он никогда не видел. Он также расходует примерно на 30% меньше токенов при работе, чем версия без регуляризации. Общая производительность ни на одном из незнакомых бенчмарков не опускалась ниже базовой — а это как раз типично для обвязки, зазубрившей свои задачи.

Все методы хорошо показали себя на обучающих задачах, но на новых результаты перевернулись. Два метода даже оказались ниже базовой обвязки. RRSI показал наименьший прирост на обучении среди всех вариантов и единственным оказался заметно выше базовой линии на незнакомых задачах.

Перенос на слабые модели

Обвязка для программирования, оптимизированная с помощью Gemini 3.5 Flash, подняла точность гораздо более слабой Gemini 3.1 Flash Lite с 11,2 до 14,6 балла без каких-либо доработок. Механизмы, которые нашла система, не зависят от возможностей модели, использованной для их поиска.

Авторы отмечают, что их исследование охватывает только обвязки вокруг замороженных моделей и не рассматривает случаи, когда веса модели меняются. Они заключают, что самоулучшение делает ИИ-агентов надёжнее только тогда, когда повторяющаяся обратная связь превращается в долговременные изменения.

Для профиТехнические детали: архитектура, цифры, ссылки

Метод: RRSI (Regularized Recursive Self-Improvement of Agent Harnesses) работает на обоих концах цикла оптимизации, оставляя обвязку полностью редактируемой.

  • Бюджет правок: ограничивает число независимых изменений в одном кандидате и сокращается со временем — ранние раунды допускают крупные переписывания, поздние только мелкие прослеживаемые правки.
  • Память попыток: система отслеживает прошлые попытки, чтобы не повторять неудачные идеи; при остановке прогресса экспериментирует с нетронутыми частями обвязки.
  • Критик: отбрасывает предложения, жёстко прописывающие имена задач, решения или трюки под бенчмарк; принимает рост compute только при измеримом приросте производительности; удаляет бесполезные компоненты.

Бенчмарки: восемь бенчмарков в трёх доменах — программирование, агентная офисная работа, инженерное проектирование. Базовая модель Claude Opus 4.8 оставалась замороженной. Сравнение с немодифицированной обвязкой и четырьмя недавними методами оптимизации.

Результаты: до +14,1 балла на обучающих задачах, до +4,7 балла на пяти незнакомых бенчмарках, примерно на 30% меньше токенов при работе, чем у версии без регуляризации. Наибольший прирост на незнакомых задачах — 4,7 балла на JobBench. Производительность не опускалась ниже базовой ни на одном незнакомом бенчмарке.

Перенос: обвязка, оптимизированная на Gemini 3.5 Flash, подняла точность Gemini 3.1 Flash Lite с 11,2 до 14,6 балла без модификаций.

Ограничения: исследование охватывает только обвязки вокруг замороженных моделей и не рассматривает изменение весов модели. Код доступен на GitHub.

Контекст: на ARC-AGI-3 обвязка, собранная вручную, дала Opus 4.6 97,1% в знакомой среде и 0% в незнакомой. Nvidia представила SoL-Pi — родственный метод, где исследовательский агент автоматически перестраивает обвязку кодинг-агентов и сокращает расход токенов до 49% без заметного падения производительности.

Вопросы и ответы

Что такое обвязка агента (harness)?
Набор правил и инструментов, которые определяют, прочитает ли агент нужный файл перед изменением, восстановится ли после ошибки и аккуратно ли выдаст результат.
Почему самообучающиеся агенты зазубривают тесты?
Агент работает с одним и тем же ограниченным набором тестовых задач, запоминает шаблоны под конкретный бенчмарк и выбирает варианты, выигрывающие случайно. Оценки на обучении растут, а прирост на новых задачах исчезает.
Насколько RRSI лучше на новых задачах?
До 4,7 балла прироста на пяти незнакомых бенчмарках, при этом производительность не опускалась ниже базовой ни на одном из них.