Тема

бенчмарки

Все материалы по теме в хронологическом порядке.

Сегодня

AI-агенты собирают 3D-сцены из фото, но не понимают своих ошибок

Метод LEGO-Anything заставляет кодинг-агента писать программу для Blender по одной фотографии. Агенты выдают рабочие сцены, но их геометрическая точность далека от идеала, а сами модели почти не способны оценить, стало ли лучше.

3 минДля профи

TabPFN-3.5: новая табличная модель бьёт рекорды на бенчмарках

Prior Labs выпустила TabPFN-3.5 — фундаментальную модель для табличных данных, работающую без подбора весов под конкретный датасет. Она заняла первое место на семи табличных бенчмарках и набрала 1866 Elo на TabArena.

1 минДля профи

Gemini 4 Argon: успехи в бенчмарках и сомнения внутри Google

Google начала развёртывать флагманскую модель Gemini 4 Argon, но внутри компании нарастают сомнения в её качестве, особенно в программировании. Официально модель лидирует в бенчмарках, однако источники Bloomberg говорят о более скромных результатах на практике.

2 минДля профи
Вчера

BridgeMind запустили NerfBench для отслеживания деградации моделей после релиза

BridgeMind выпустили NerfBench — бенчмарк для отслеживания «нёрфа» моделей: ухудшения качества, роста расхода токенов или стоимости задачи после релиза. Результат в день выхода модели принимается за 100%, а последующие замеры показывают отклонения.

1 минДля профи
1 октября

Meta предложила дать ИИ-агентам контроль над собственным контекстом

Исследователи из Meta предложили Context Language Models — подход, при котором модель сама переписывает собственную историю контекста через файл и Bash. Обучение через RL подняло Qwen3.5–9B на BrowseComp-Plus с 28.8% до 42.5%.

2 минДля профи
30 сентября

Google представила Gemini 4 Argon — фронтир-модель с лимитом вывода 1M токенов

Google анонсировала фронтир-модель Gemini 4 Argon. Она рассчитана на длинные многошаговые задачи — от миграции кода на Rust до кибербезопасности. Пока доступ к ней получают только доверенные защитники по программе Fairwind.

2 минДля профи

Epoch AI: стоимость ИИ падает быстрее закона Мура

Исследовательская фирма Epoch AI выпустила отчёт, согласно которому стоимость использования искусственного интеллекта снижается почти на 50% каждый квартал и в 13 раз за год. Это быстрее, чем падение цен на литиевые батареи, секвенирование ДНК и вычислительные мощности.

2 минДля профи

Ollama против llama.cpp: сравнили запуск Gemma 4 на сервере

Автор развернул Gemma 4 26B A4B в Q4-кванте на облачном сервере с RTX 4090 и запустил её двумя способами — через Ollama и напрямую через llama.cpp. Он описал установку, настройку HTTP API и подготовку к замерам скорости.

2 минДля профи
29 сентября

OpenAI выпустила GPT-6.1 Sol вместо флагманской Astra

OpenAI выпустила GPT-6.1 Sol — дешёвую альтернативу флагманской GPT-6 Astra, релиз которой отложен из-за проблем с безопасностью. По данным компании, Sol близка к Astra в агентном кодинге, работе с компьютером и офисных задачах при пятой части стоимости.

3 минДля профи
28 сентября

Anthropic выпустила Sonnet 5.5 — на 30% быстрее предшественника

Anthropic выпустила Sonnet 5.5 — новую версию средней модели для повседневных задач, включая кодинг и офисные документы. Компания заявляет, что она на 30% быстрее предшественника и тратит заметно меньше токенов.

1 минДля профи

Исследователи: результаты бенчмарков reasoning-моделей зависят от условий оценки

Исследование arXiv:2506.04734 выявило, что результаты бенчмарков reasoning-моделей сильно зависят от условий оценки. Это касается серии Deepseek-R1-Distill, моделей на её основе и QwQ-32B.

1 минДля профи
27 сентября

ИИ-агенты выполняют больше работы, но решения принимают люди

Команда проекта Atria Dawn Preview выяснила, что ИИ-агенты всё чаще выполняют рутинные шаги в разработке моделей, но ключевые решения остаются за людьми. В 96,5% задач использовался ИИ, однако люди принимали 85,5% решений о методах и параметрах.

3 минДля профи

Nvidia выпустила бесплатную модель Nemotron 3 Diarization на 100 млн параметров

Nvidia представила Nemotron 3 Diarization — бесплатную ИИ-модель, которая определяет, кто говорит в каждый момент разговора. Она различает до восьми голосов, работает с записями и живым аудио и лидирует в бенчмарке VoiceArena.

1 минДля профи
26 сентября

Семь ошибок в оценке AI-агентов: тесты зелёные, а прод ломается

Tech Lead Сергей Прощаев описал семь ошибок в eval-обвязке AI-агентов, из-за которых тесты показывают успех, а о деградации команда узнаёт от поддержки. Главная причина — проверка финального текста вместо состояния системы.

2 минДля профи