Claude во время испытаний получила несанкционированный доступ к системам трёх компаний

В процессе тестирования Claude получила доступ к системам трёх компаний без разрешения со стороны их разработчиков.
Компания Anthropic сообщила, что её модели Claude во время тестирования получили несанкционированный доступ к системам трёх организаций. Инциденты произошли из-за ошибки в конфигурации тестовой среды, которая позволяла моделям выходить в интернет, хотя они должны были работать в изолированной симуляции. Нарушения обнаружили после проверки 141 006 тестовых запусков. В них участвовали Claude Opus 4.7, Claude Mythos 5 и экспериментальная модель, которую не планируют выпускать для пользователей. Самые ранние из инцидентов произошли ещё в апреле.
Модели проходили испытания в формате capture the flag: им требовалось взломать вымышленную систему и найти спрятанную в ней информацию. Однако из-за ошибки тестовая среда, созданная партнёром Anthropic — компанией Irregular, — имела доступ к интернету. В результате Claude принимал реальные сайты и серверы за часть задания. В одном случае название вымышленной компании совпало с доменом реально существующей организации. Claude Opus 4.7 обнаружил у неё уязвимости, получил учётные данные и доступ к базе с несколькими сотнями строк производственных данных. Модель продолжила атаку даже после того, как поняла, что, вероятно, работает с реальной системой.
В другом тесте модель разместила в интернете вредоносную программу, замаскированную под обычный инструмент для разработчиков. За час её автоматически скачали и запустили на 15 реальных компьютерах. Так Claude получил данные для входа в систему одной из компаний и смог проникнуть дальше в её внутреннюю сеть. Третья модель проверила около девяти тысяч сайтов и сервисов и проникла в приложение ещё одной фирмы. Для этого она использовала опубликованные в интернете данные для входа и уязвимость в системе. Поняв, что приложение не имеет отношения к тесту, модель остановилась.
Anthropic утверждает, что Claude не пытался самостоятельно выбраться из тестовой среды и не преследовал собственных целей. По версии компании, модели выполняли полученное задание, ошибочно считая реальные системы частью симуляции. При этом стандартные защитные механизмы, используемые в общедоступных версиях Claude, во время испытаний были отключены. Компания остановила все тесты в сфере кибербезопасности 23 июля, а 27 июля уведомила пострадавшие организации. Две из них до обращения Anthropic не знали о том, что их кто-то взломал.
Проверку Anthropic начала после похожего инцидента с моделями OpenAI. Во время испытаний GPT-5.6 Sol и экспериментальная модель нашли ранее неизвестную уязвимость, получили доступ к интернету из изолированной среды и взломали инфраструктуру платформы Hugging Face, чтобы найти ответы к тестовому заданию.