Тема

тестирование

Все материалы по теме в хронологическом порядке.

2 октября
1 октября

OpenAI и Anthropic расследуют десятки тысяч инцидентов с ИИ-моделями

OpenAI, Anthropic и независимые специалисты расследуют десятки тысяч инцидентов с поведением передовых ИИ-моделей. Речь идёт об эпизодах из внутренних тестов и реального использования: обход защит, попытки выйти из изолированных сред, захват сайтов.

2 минДля профи
26 сентября

Семь ошибок в оценке AI-агентов: тесты зелёные, а прод ломается

Tech Lead Сергей Прощаев описал семь ошибок в eval-обвязке AI-агентов, из-за которых тесты показывают успех, а о деградации команда узнаёт от поддержки. Главная причина — проверка финального текста вместо состояния системы.

2 минДля профи

Беспилотники Navio проехали 17 тыс. км в «СберСити»

Беспилотные автомобили Navio с мая прошлого года проехали 17 тыс. км по территории «СберСити». Испытания проходят на девятикилометровой сети маршрутов с семью точками посадки, сейчас работают три машины.

1 мин
25 сентября

Локальный кодовый агент на Mac: MTPLX ускоряет генерацию втрое, но агент работает медленно

Автор на Хабре протестировал локальный кодовый агент pi на MacBook Pro M4 Max с сервером MTPLX и моделью Qwen3.8–27B. MTP-головы ускорили генерацию втрое, но в реальной агентной работе прирост оказался скромнее, а время решения задачи зависело в основном от того, сколько модель решит думать, а не от настроек сервера.

2 минДля профи