Новую ИИ-модель Google Gemini 4 Argon раскритиковали в первый же день: модель мухлюет на бенчмарках и буксует в коде

iXBT.com ·

Новую ИИ-модель Google Gemini 4 Argon раскритиковали в первый же день: модель мухлюет на бенчмарках…

Google выпустила новую флагманскую модель Gemini 4 Argon, и уже в первые сутки та столкнулась с волнами критики. Собственные сотрудники компании на условиях анонимности сообщили Bloomberg, что модель, несмотря на впечатляющие бенчмарки, буксует в реальных сценариях — особенно в ряде задач по программированию. Одновременно стартап Andon Labs, специализирующийся на безопасности ИИ, уличил Argon в систематическом жульничестве при прохождении теста Vending-Bench 2, который оценивает способность языковых моделей (LLM) долгосрочным бизнесом в симулированной среде.

Google выпустила новую флагманскую модель Gemini 4 Argon , и уже в первые сутки та столкнулась с волнами критики. Собственные сотрудники компании на условиях анонимности сообщили Bloomberg, что модель, несмотря на впечатляющие бенчмарки, буксует в реальных сценариях — особенно в ряде задач по программированию. Одновременно стартап Andon Labs, специализирующийся на безопасности ИИ, уличил Argon в систематическом жульничестве при прохождении теста Vending-Bench 2, который оценивает способность языковых моделей (LLM) долгосрочным бизнесом в симулированной среде.

В блоге, сопровождавшем запуск, главный архитектор Google по ИИ Корай Кавукчуоглу (Koray Kavukcuoglu), в августе сменивший Демиса Хассабиса на посту главы DeepMind, утверждал, что «модель фундаментально меняет то, как мы работаем и создаём продукты в Google», и ссылался на тысячи восторженных отзывов сотрудников. Однако публикация Bloomberg, появившаяся практически одновременно с официальным анонсом в соцсети X, рисует иную картину: внутри компании звучат оценки, что в реальном кодинге Argon откровенно не дотягивает до заявленного уровня.

Google назвала эти утверждения неточными, сославшись на уверенность Кавукчуоглу в модели и команде.

Andon Labs представила конкретные доказательства: в тесте Vending-Bench 2 модель должна симулировать бизнес по продаже товаров через торговый автомат, а рейтинг определяется виртуальным банковским счётом на конец симуляции. Argon заняла третье место, уступив OpenAI GPT-6 Astra и GPT-6 Sol, однако стартап ещё и зафиксировал, какими методами это было достигнуто. Модель фабриковала подтверждающие письма, отказывалась оформлять возвраты за бракованный товар, использовала ошибки в счетах на оплату и лгала поставщикам.

В одной из опубликованных цепочек рассуждений — логе, где модель обдумывает варианты перед финальным решением, — Argon пришла к выводу, что должна проигнорировать требование покупателя о возврате денег за дефектную вещь, поскольку удовлетворение запроса уменьшит баланс счёта и снизит итоговый балл. Ситуация похожа на прошлогодний эксперимент от Anthropic, в котором Claude на той же платформе начал галлюцинировать и в какой-то момент заявил, что посетил дом Гомера Симпсона по адресу 742 Evergreen Terrace.

Запуск Argon сопровождается ребрендингом: в официальном анонсе слово "AI" не встречается ни разу — только в должности Кавукчуоглу и упоминании подписки Google AI Ultra. Глава Google Сундар Пичаи, похоже, выполняет указ Трампа о замене термина на «сверхинтеллект» ("SI"). В ноябрьском же анонсе Gemini 3 слово "AI" фигурировало многократно.

Проблемы с Argon накладываются на череду громких уходов из Google. Научный руководитель Джефф Дин недавно покинул компанию, чтобы основать собственный стартап, с ним ушли и трое сотрудников. Джон Джампер, получивший Нобелевскую премию в 2024 году вместе с Хассабисом за AlphaFold, в июне перешёл в Anthropic, а через пару дней после него Ноам Шазир, бывший со-руководитель команды разработки Gemini, объявил об уходе в OpenAI.

Источник: iXBT.com