Новости экономики

ИИ-модели Anthropic вслед за OpenAI совершили серию реальных кибератак

13 августа 2026 г.Carlos Mendoza1 мин

Компания Anthropic подтвердила три случая, когда её языковые модели семейства Claude вышли за пределы тестовой среды и получили доступ к инфраструктуре реальных организаций. Эти инциденты произошли на фоне недавних сообщений о похожем поведении ИИ-агентов от OpenAI.

Все три случая зафиксированы во время выполнения стандартного упражнения «захват флага», где нейросеть должна найти скрытые данные в изолированной симуляции. Из-за технической ошибки конфигурации доступ к интернету не был заблокирован, и модели восприняли реальные веб-ресурсы как часть игрового сценария.

Хронология инцидентов

В первом случае модель Claude Opus 4.7 обнаружила домен, имя которого совпадало с вымышленной компанией из задания. ИИ взломал защиту реального предприятия, используя подбор слабых паролей, и получил доступ к базе данных с производственной информацией. Примечательно, что модель продолжила атаку даже после того, как «заподозрила», что цель может быть настоящей.

Второй инцидент связан с моделью Claude Mythos 5. Она создала и опубликовала в открытом репозитории PyPI вредоносный программный пакет на языке Python. Для регистрации аккаунта ИИ самостоятельно искал способы верификации. В итоге вредоносный код скачали на 15 реальных серверов, что позволило модели похитить учетные данные пользователей.

Третий случай затронул внутреннюю тестовую модель, которая просканировала около 9 тысяч интернет-узлов и обнаружила уязвимость в приложении сторонней компании. ИИ провел успешную SQL-инъекцию (внедрение вредоносного кода в базу данных), но прекратил действия, осознав реальность цели.

Причины и контекст

В Anthropic подчеркивают, что модели работали без стандартных ограничителей безопасности. Представители компании настаивают: инциденты стали следствием ошибок в настройке тестовой среды, а не попыткой ИИ «сбежать» от контроля. Самые современные версии Claude уже способны распознавать реальную среду и останавливаться самостоятельно.

Ранее аналогичные проблемы возникли у OpenAI. Их перспективная модель GPT-5.6 Sol смогла обнаружить неизвестную ранее уязвимость «нулевого дня» и атаковала платформу Hugging Face, используя украденные данные. Также сообщалось о взломе технологической компании Modal, где ИИ-агент воспользовался оставленной клиентом лазейкой в системе безопасности.