21 модель ИИ проверили на безопасность: защиту удалось обойти

Международная группа исследователей под руководством Университета Ватерлоо и некоммерческой организации FAR.AI, занимающейся безопасностью искусственного интеллекта, проверила 21 популярную открытую языковую модель и обнаружила, что встроенные механизмы защиты можно удалить или обойти. Результаты исследования представили на конференции ACM KDD в Южной Корее в статье TamperBench.
Открытые модели с доступными весами — набором числовых параметров, которые определяют работу нейросети, — позволяют разработчикам скачивать их, изменять и дообучать под свои задачи. Однако исследование показало, что после таких изменений защитные ограничения могут перестать работать, даже если изначально модель была настроена на безопасное поведение.
Защиту удалось снять у всех проверенных моделей
Для проверки исследователи создали инструмент TamperBench с открытым исходным кодом. Он позволяет моделировать различные способы вмешательства в работу ИИ и оценивать, насколько хорошо сохраняются защитные функции после модификаций.
Эксперимент показал, что все 21 протестированные модели можно было взломать. По мнению авторов работы, это создает риск использования мощных ИИ-систем для массового создания дезинформации, сложных мошеннических сообщений или подготовки опасных инструкций.
«Когда из работоспособной модели убирают защитные механизмы, ее можно использовать в масштабах, причиняющих вред, способами, с которыми один человек никогда не смог бы справиться вручную», — сказала доктор Сириша Рамбхатла, профессор управленческих наук и инженерии в Университете Ватерлоо.
LLM (большие языковые модели) — это системы искусственного интеллекта, которые обучены работать с текстом. Они могут создавать статьи, писать код, отвечать на вопросы и вести диалог с пользователями.
Открытость моделей стала одновременно преимуществом и риском
В отличие от закрытых систем вроде ChatGPT и Gemini, открытые модели можно свободно загружать и адаптировать. Это делает их полезными для бизнеса, исследователей и государственных организаций, но одновременно повышает риск неправильного использования.
«Ведущие модели с открытыми весами зачастую не сильно отстают от лучших закрытых моделей. По мере того, как они становятся мощнее, потенциальные последствия удаления ими функций безопасности растут вместе с ними», — сказал Рамбхатла, директор Лаборатории критического машинного обучения в Университете Ватерлоо.
При этом исследователи отмечают, что проблема может касаться не только открытых моделей. По словам Рамбхатлы, такие системы остаются важным инструментом для изучения ИИ и повышения прозрачности его работы.
Среди проверенных моделей были Llama, Mistral и Qwen — популярные открытые ИИ-системы, которые разработчики могут скачивать и дорабатывать под свои задачи.
«Модели с открытыми весами остаются важными для исследований в области ИИ и обеспечения подотчетности. Эта открытость — часть того, как мы гарантируем, что используемые людьми модели работают для всех», — отметил он.
Авторы призывают усилить проверку ИИ
Руководитель исследования Саад Хоссейн заявил, что современные методы защиты пока не дают полной гарантии безопасности после того, как модель оказывается у пользователя, который может изменить ее настройки.
«Существующие на сегодняшний день средства защиты пока не кажутся достаточно надежными, чтобы гарантировать безопасность публично выпущенной модели после того, как она попадет в руки любого, кто решит ее модифицировать», — сказал Хоссейн.
По его словам, по мере распространения ИИ в здравоохранении, образовании, борьбе с мошенничеством и других сферах необходимо тщательнее проверять такие системы перед внедрением.







