Тема

оценка моделей

Все материалы по теме в хронологическом порядке.

28 сентября

Исследователи: результаты бенчмарков reasoning-моделей зависят от условий оценки

Исследование arXiv:2506.04734 выявило, что результаты бенчмарков reasoning-моделей сильно зависят от условий оценки. Это касается серии Deepseek-R1-Distill, моделей на её основе и QwQ-32B.

1 минДля профи
26 сентября

Скаффолды вокруг LLM почти не влияют на измеряемую безопасность — а формат теста влияет

Учёные провели 62 808 оценок шести ведущих моделей на четырёх бенчмарках безопасности. Оказалось, что способ измерения влияет на результат в 45 раз сильнее, чем архитектура скаффолда вокруг модели.

1 минДля профи