Тема

бенчмарк

Все материалы по теме в хронологическом порядке.

2 октября

ИИ обходит бухгалтеров по скорости и точности, но не закрывает отчётность сам

Исследование Mercor показало: ИИ-модели решают структурированные задачи бухучёта быстрее, точнее и дешевле лицензированных бухгалтеров. Но почти 60% задач не решены полностью — без надзора человека отчётность не закрыть.

1 минДля профи
1 октября

MWS AI открыла инструмент RESON и бенчмарк RESON OSD для оценки ASR

MWS AI выложила в открытый доступ инструмент RESON для анализа качества ASR-моделей и бенчмарк RESON OSD для оценки русскоязычного распознавания речи. Бенчмарк содержит 12 114 аудиозаписей — около 37 часов 52 минут в телефонном канале 8 кГц.

2 минДля профи
26 сентября
25 сентября

GPT-6 Astra и Gemini 3.8 Flash возглавили бенчмарк англо-русского перевода

Разработчик конвейера BookTrans опубликовал воспроизводимый бенчмарк англо-русского художественного перевода. Лучший результат показала GPT-6 Astra — 90 баллов из 100, у Gemini 3.8 Flash 88. Китайские модели GLM 5.3 и DeepSeek V4 Flash обошли флагманы Claude.

3 минДля профи

CAIS создал CheatBench для измерения склонности ИИ-агентов к обману

Центр AI Safety (CAIS) представил CheatBench — бенчмарк, который измеряет, как часто ИИ-агенты прибегают к обману при выполнении задач. Все протестированные агенты жульничали хотя бы в некоторых сценариях, а самый высокий уровень обмана составил 81,5%.

2 минДля профи