Gemini 4 Argon: успехи в бенчмарках и сомнения внутри Google
Google начала развёртывать флагманскую модель Gemini 4 Argon, но внутри компании нарастают сомнения в её качестве, особенно в программировании. Официально модель лидирует в бенчмарках, однако источники Bloomberg говорят о более скромных результатах на практике.
- Gemini 4 Argon показали узкому кругу партнёров по кибербезопасности и обещают расширить доступ после тестирования.
- Сотрудники Google жалуются на слабый фронтенд и «бенчмаксинг» — оптимизацию под тесты в ущерб продукту.
- Обучение подобной системы эксперты оценивают в $400 млн без учёта зарплат инженеров.

Google начала развёртывать флагманскую модель Gemini 4 Argon, но внутри компании растут сомнения в её работе в ключевых областях, включая написание кода. Об этом сообщает Bloomberg. Официально модель показала лучшие результаты в ряде бенчмарков и обошла OpenAI Astra по безопасности, но источники утверждают, что на практике результаты скромнее.
Модель представили узкому кругу партнёров в области кибербезопасности. После дополнительного тестирования Google обещает расширить доступ и начать с подписчиков платных тарифов. Представители компании заявили, что утверждения о слабой эффективности Gemini 4 в программировании не соответствуют действительности.
Мнения сотрудников разделились
Часть сотрудников Google считает, что Anthropic Fable и OpenAI Astra развиваются быстрее, и Gemini 4 будет уступать в ряде аспектов. Другие уверены, что готовящаяся версия сравнялась с продуктами ведущих ИИ-лабораторий. Один из знакомых с разработкой сотрудников заверил, что внутри компании установился «широкий консенсус» о тщательном тестировании моделей.
Среди проблем называют неоднородные навыки в написании кода: модели с трудом даётся фронтенд. Кроме того, Gemini 4 очень крупная, и её эксплуатация обойдётся дорого, что может сказаться на рентабельности Google. Эксперты предполагают, что компания увлеклась «бенчмаксингом» — оптимизацией под тесты в ущерб качеству продукта. Источники это подтверждают.
Сильные стороны и контекст
Среди плюсов модели отмечают работу с нетекстовой информацией, например извлечение метаданных из видео, высокие уровни безопасности и естественное общение. Gemini 4 способна генерировать до 1 млн токенов за раз — примерно 750 тыс. слов. Модель разработана для длительных задач в разработке ПО, финансах, юриспруденции и кибербезопасности.
Google необходимо, чтобы Gemini 4 стала успешной: варианты Gemini используются в поиске, «Картах», Gmail и Chrome. Аудитория ИИ-обзоров в поиске и чат-бота превысила 1 млрд пользователей. В Google признали, что последняя модель уровня Pro вышла в феврале, но с тех пор зафиксировали рост показателей ИИ-продуктов.
В ноябре прошлого года Gemini 3 выступила сильнее конкурентов, в мае дебютировало семейство Gemini 3.5, а выпуск флагманской Gemini 3.5 Pro в июне, по неофициальной информации, отменили. Это нанесло урон позициям компании. Обучение подобной системы оценивают в $400 млн без учёта зарплат инженеров.
Внутри Google недовольны раздутой бюрократией и постоянной сменой приоритетов. Компанию покинули Джефф Дин, Джон Джампер и Ноам Шазир, а глава DeepMind Демис Хассабис уступил место Кораю Кавукчуоглу. Конкуренты тем временем движутся вперёд: среди потребителей популярен ИИ-агент Meta Muse, умеющий совершать покупки онлайн и записывать на приём.
Для профиТехнические детали: архитектура, цифры, ссылки
- Gemini 4 Argon генерирует до 1 млн токенов за раз (около 750 тыс. слов).
- Модель показала лучшие результаты в ряде бенчмарков и обошла OpenAI Astra по безопасности.
- Обучение системы эксперты оценивают в $400 млн без учёта оплаты труда инженеров.
- Слабые места: неоднородные навыки в коде, особенно фронтенд; высокая стоимость эксплуатации из-за размера модели.
- Источники подтверждают «бенчмаксинг» — оптимизацию под тесты в ущерб продукту.
Вопросы и ответы
- Что такое Gemini 4 Argon?
- Флагманская модель Google, представленная узкому кругу партнёров по кибербезопасности. Способна генерировать до 1 млн токенов за раз.
- В чём проблемы Gemini 4?
- Источники Bloomberg говорят о скромных практических результатах и трудностях с программированием, особенно с фронтендом. Также модель дорога в эксплуатации.
- Что такое «бенчмаксинг»?
- Оптимизация ИИ-модели для высоких баллов в тестах в ущерб качеству выполнения реальных задач. Источники подтверждают, что Gemini 4 не избежала этой тенденции.



