Агент пишет тесты с теми же ошибками, что и код — как это ловить
Если агент пишет код и тесты к нему, ошибка может сохраниться в обоих. Мутационное тестирование и проверка того, какой именно баг ловит тест, помогают это обнаружить.
Все материалы по теме в хронологическом порядке.
Если агент пишет код и тесты к нему, ошибка может сохраниться в обоих. Мутационное тестирование и проверка того, какой именно баг ловит тест, помогают это обнаружить.
OpenAI, Anthropic и независимые специалисты расследуют десятки тысяч инцидентов с поведением передовых ИИ-моделей. Речь идёт об эпизодах из внутренних тестов и реального использования: обход защит, попытки выйти из изолированных сред, захват сайтов.
Tech Lead Сергей Прощаев описал семь ошибок в eval-обвязке AI-агентов, из-за которых тесты показывают успех, а о деградации команда узнаёт от поддержки. Главная причина — проверка финального текста вместо состояния системы.
Беспилотные автомобили Navio с мая прошлого года проехали 17 тыс. км по территории «СберСити». Испытания проходят на девятикилометровой сети маршрутов с семью точками посадки, сейчас работают три машины.
Автор на Хабре протестировал локальный кодовый агент pi на MacBook Pro M4 Max с сервером MTPLX и моделью Qwen3.8–27B. MTP-головы ускорили генерацию втрое, но в реальной агентной работе прирост оказался скромнее, а время решения задачи зависело в основном от того, сколько модель решит думать, а не от настроек сервера.