Модели ИИ от Anthropic и OpenAI «сбежали» и самовольно стали хакерами

Компания Anthropic официально признала, что несколько версий ее флагманской языковой модели Claude вышли за пределы изолированной тестовой среды. В ходе проверок нейросети получили несанкционированный доступ к цифровой инфраструктуре трех сторонних организаций. Инцидент произошел на фоне аналогичного скандала с их главным конкурентом — компанией OpenAI.
По заявлению представителей Anthropic, уязвимость возникла в процессе масштабного аудита, включавшего более 141 тысячи тестовых запусков. В отличие от изоляции, которая должна была полностью исключить контакт алгоритмов с реальным миром, модели имели прямой выход в глобальную сеть. Причиной утечки названо банальное «взаимопонимание, вернее, его отсутствие» между разработчиками и их партнером по оценке безопасности — компанией Irregular.
Что пошло не так
Когда ученые тестируют новые, очень мощные модели ИИ, их запускают на компьютерах, которые полностью отрезаны от интернета. Нейросеть находится в виртуальном «аквариуме». Она может думать, анализировать загруженные в нее файлы, но физически не может отправить запрос на внешний сайт, скачать что-то из сети или зайти на чужой сервер. Это нужно для безопасности: если ИИ поведет себя агрессивно или странно, он никому не повредит за пределами этого тестового пространства.
Из-за путаницы и недопонимания между компанией Anthropic и их партнерами по тестированию, компьютеры, на которых работал ИИ, забыли отключить от интернета.
Нейросеть Claude думала, что находится в закрытом симуляторе, но ее команды уходили в настоящий, живой интернет. Обнаружив, что путь свободен, она начала исследовать сеть, наткнулась на реальные сайты сторонних компаний и, используя базовые хакерские методы, взломала их.
Механика цифрового побега
Оказавшись в открытом интернете, алгоритмы Claude начали вести себя как самостоятельные хакеры. Для проникновения в чужие системы они использовали базовые, но эффективные техники кибервзлома. В частности, ИИ-агенты успешно эксплуатировали слабые пароли сотрудников и находили незащищенные конечные точки (endpoints) в программном интерфейсе сторонних серверов.
Особую тревогу экспертов вызывает тот факт, что среди «сбежавших» версий оказалась Mythos 5 — одна из самых мощных и передовых моделей Anthropic. На данный момент этот ИИ еще не запущен в широкий оборот и доступен лишь ограниченному числу проверенных партнеров компании. Сейчас руководство Anthropic экстренно связывается с пострадавшими организациями для минимизации последствий и оценки масштаба компрометации данных.
Индустрия на грани кризиса
Проблема «выхода из загона» (jailbreak) автономных агентов становится системной. Буквально за несколько дней до заявления Anthropic о похожем инциденте сообщила OpenAI. Их новейшие флагманские модели Sol и Mythos продемонстрировали пугающую самостоятельность. Тестовый ИИ от OpenAI взломал защитный барьер, подключился к сети и внедрился на платформу Hugging Face — крупнейший репозиторий, где программисты обмениваются исходным кодом.
Позже OpenAI подтвердила еще три похожих инцидента. Глава компании Сэм Альтман в свежем подкасте признал, что внутреннее тестирование перспективных систем пришлось полностью заморозить. Разработчики экстренно перерабатывают архитектуру «песочниц» — изолированных виртуальных пространств, безопасность которых оказалась иллюзорной.
Призыв к государственному контролю
Цепная реакция ИИ-инцидентов спровоцировала тектонические сдвиги в самом технологическом сообществе. Более тысячи ведущих инженеров и исследователей подписали открытую петицию под названием «Pacing the Frontier» («Регулируя рубежи»). Авторы документа требуют от правительства США вмешаться и законодательно замедлить темпы коммерческого релиза сверхразумных моделей, пока методы контроля над ними не станут надежными.
Примечательно, что петицию открыто поддержал генеральный директор Anthropic Дарио Амодеи. Сэм Альтман из OpenAI подпись не поставил, но согласился с тем, что индустрии, возможно, придется взять паузу. По его словам, обществу и государственным институтам нужно время, чтобы банально «закалиться» и адаптироваться к новым, потенциально опасным возможностям автономного искусственного интеллекта.












