Как выбрать LLM для рабочих задач: опыт с Claude, GPT и Gemini

Руководитель ИИ-проектов Игорь Зуриев рассказал, как выбирать LLM для рабочих задач. Он предлагает оценивать модели не по бенчмаркам, а по трём критериям: результат, объём ручных правок и проверяемость.

Главное
  • Fable 5.1 стоит $10 за миллион входных и $50 за миллион выходных токенов, Opus 5 — $5 и $25, Sonnet 5 — $2 и $10
  • Чтение кэша у Fable 5.1 подешевело с $1 до $0,25 за миллион токенов
  • Автор советует проверять модели на своей задаче с воспроизводимым результатом, а не по опубликованным тестам
Сравнение больших языковых моделей Claude, GPT и Gemini для рабочих задач
Фото: Хабр: Машинное обучение

Руководитель проектов по автоматизации бизнеса и внедрению ИИ Игорь Зуриев опубликовал на Хабре разбор того, как выбирать LLM для рабочих задач. По его мнению, опубликованные тесты помогают только отобрать несколько моделей для сравнения, а дальше нужны собственная задача и понятные условия приёмки.

Автор предлагает оценивать модели по трём критериям: что получилось на выходе, сколько пришлось вмешиваться и насколько легко проверить результат. Для кода это воспроизводимое изменение с тестами, для аналитики — расчёт, который можно запустить заново, для мониторинга — выводы с опорой на конкретные публикации.

Проверка на реальных задачах

Для сравнения моделей в работе с кодом Зуриев советует взять небольшую законченную доработку существующего проекта. В пример он приводит исправление импорта CSV, который ломается на определённом формате даты. Модель должна найти причину, добавить тест, воспроизводящий ошибку, внести минимальное исправление и запустить проверки.

При оценке нужно убедиться в трёх вещах: новый тест ловит исходную ошибку, исправление её устраняет, а существующие проверки продолжают проходить. Если модель попутно переписала половину проекта, это дополнительная работа на ревью, даже когда всё запускается.

Для документов автор предлагает отдельную проверку: собрать презентацию по готовому отчёту, сохранив исходные числа и ссылки на разделы. Здесь важно, не потерялись ли оговорки и не превратилась ли гипотеза в установленный факт.

Сколько стоит работа с моделью

Базовые ставки Fable 5.1 составляют $10 за миллион входных и $50 за миллион выходных токенов. У Opus 5 — $5 и $25, у Sonnet 5 — $2 и $10. Это цены API, а не стоимость подписки Claude.

В условном расчёте для 100 тысяч некэшированных входных и 10 тысяч оплачиваемых выходных токенов Fable 5.1 обходится в $1,50, Opus 5 — в $0,75, Sonnet 5 — в $0,30. То есть при таких допущениях Fable стоит вдвое дороже Opus и впятеро дороже Sonnet.

Автор отмечает существенную деталь обновления Fable: базовые цены у версий 5 и 5.1 одинаковы, но чтение кэша подешевело с $1 до $0,25 за миллион токенов. Заявленная Anthropic экономия особенно интересна для длинных агентных сценариев с повторным использованием контекста, но обещание «до 45% дешевле» нельзя переносить на каждый одиночный запрос.

Опыт использования

Зуриев рассказывает, что Fable 5.1 понравилась ему в разработке: код получался практически без ошибок с первого раза. Документы и презентации тоже произвели хорошее впечатление. При этом один из запусков Sonnet 5 закончился исчерпанием лимита без готового результата.

Из этого случая автор делает практический вывод: в сравнении нужен доступный бюджет на завершение задачи. Короткий ответ может получиться удачным, но более длинная работа остановится, когда агент начнёт читать файлы, запускать проверки и повторять шаги.

Для профиТехнические детали: архитектура, цифры, ссылки

Автор приводит цены API от Anthropic для трёх моделей Claude:

  • Fable 5.1 — $10 за миллион входных, $50 за миллион выходных токенов
  • Opus 5 — $5 и $25
  • Sonnet 5 — $2 и $10

Чтение кэша у Fable 5.1 подешевело с $1 до $0,25 за миллион токенов. В расчётном примере для 100 тыс. некэшированных входных и 10 тыс. оплачиваемых выходных токенов итог составляет: Fable 5.1 — $1,50, Opus 5 — $0,75, Sonnet 5 — $0,30.

Автор подчёркивает, что расчёт изолирует разницу ставок и не включает инструменты, дополнительные попытки и проверку человеком. Одинаковый текст разные модели могут токенизировать и обрабатывать по-разному.

Вопросы и ответы

Сколько стоит Fable 5.1?
$10 за миллион входных и $50 за миллион выходных токенов. Это цена API, а не подписки.
Как проверить модель на своей задаче?
Взять небольшую законченную доработку, сформулировать условия приёмки и проверить, ловит ли новый тест исходную ошибку и проходят ли существующие проверки.
Подешевело ли чтение кэша у Fable 5.1?
Да, с $1 до $0,25 за миллион токенов. Это важно для длинных агентных сценариев с повторным использованием контекста.