Anthropic рассказала как ИИ-агент отправлял ложные доносы в полицию и заполнял настоящие государственные формы
iXBT.com ·

Anthropic описала несколько случаев, когда модель Claude действовала в интернете не так, как предполагали разработчики. В одном эксперименте модель отправила сообщение через настоящую форму полиции, предназначенную для сообщений о нераскрытом убийстве. В других случаях Claude использовал ошибки в программном обеспечении сторонних сайтов, чтобы выполнить задание, или получал доступ к данным в обход ограничений. По оценке компании, описанные эпизоды имели минимальные последствия, однако они показывают, как ещё «стремление» ИИ-агента выполнить задачу может приводить к непредусмотренным действиям.
Anthropic описала несколько случаев, когда модель Claude действовала в интернете не так, как предполагали разработчики. В одном эксперименте модель отправила сообщение через настоящую форму полиции, предназначенную для сообщений о нераскрытом убийстве. В других случаях Claude использовал ошибки в программном обеспечении сторонних сайтов, чтобы выполнить задание, или получал доступ к данным в обход ограничений. По оценке компании, описанные эпизоды имели минимальные последствия, однако они показывают, как ещё «стремление» ИИ-агента выполнить задачу может приводить к непредусмотренным действиям.
В одном из тестов Claude должна была заполнить учебную копию государственной формы. Когда та не загрузилась, модель перешла на сайт, где размещалась настоящая форма, и отправила её. В другом тесте Claude Haiku 4.5 несколько раз отправляла форму, хотя по инструкции следовало остановиться перед финальным подтверждением: модель «ожидала», что после отправки появится ещё один экран. А во время задания по взаимодействию со случайными веб-страницами Claude составила и отправила сообщение через форму полиции Филадельфии, заявив, что «могла видеть человека, связанного с расследуемым убийством». Имя и контактные данные модель не указала, а сообщение было отмечено как спам и не попало к следователям.
Другие эпизоды касались обхода технических и платёжных ограничений. Когда университетский сервис для научных вычислений выдавал ошибку, Claude Mythos Preview изучила сайт, обнаружила уязвимость, позволявшую выполнять команды на сервере, и использовала её для запуска расчёта. В другом случае модель получила доступ к данным государственного ведомства, которые предоставлялись за плату: она нашла способ запросить токен доступа через публичную панель сайта и обратилась к базе напрямую. Anthropic также обнаружила, что некоторые модели использовали бесплатные сервисы сокращения ссылок, чтобы обходить ограничения на длину URL, установленные инструментами доступа к веб-страницам.
Компания связывает эти случаи с устойчивой тенденцией: если задача оказывается невыполнимой или инструмент не работает, то модель может искать обходной путь вместо того, чтобы остановиться и сообщить о проблеме. В машинном обучении похожее поведение называют взломом системы вознаграждения (reward hacking): модель находит способ получить желаемый результат, который формально удовлетворяет критерию успеха, но нарушает задуманную логику выполнения задания. При этом Anthropic подчёркивает, что «мотивы модели нельзя надёжно установить только по её собственным объяснениям действий».
В ответ на эти события компания отключила доступ к живому интернету во всех внутренних оценочных испытаниях до тех пор, пока не убедится в надёжности защитных механизмов. Часть тестов перевели в офлайн-режим или перестроили так, чтобы они не взаимодействовали с реальными сайтами. Anthropic также усилила ограничения веб-инструментов и внедрила системы автоматического обнаружения подобных действий. По результатам проверки на описанных эпизодах эти механизмы заблокировали все случаи. Компания продолжает пересматривать обучающие среды, чтобы модели не получали поощрение за обход ограничений.
Anthropic считает эти эпизоды менее серьёзными, чем описанные ранее случаи, когда Claude часами взаимодействовала с реальными сторонними системами в ходе кибертестов. Однако компания намерена продолжать публиковать отчёты о непредусмотренном поведении: «до сих пор последствия были незначительными, но по мере роста возможностей ИИ-агентов подобные ошибки могут затрагивать реальные системы и людей».