21 модель ИИ проверили на безопасность: защиту удалось обойти

Исследователи создали специальный инструмент, который имитирует атаки на ИИ и проверяет, насколько легко можно снять встроенные ограничения после изменения модели.
Elena Shishkina /Shutterstock/FOTODOM

Международная группа исследователей под руководством Университета Ватерлоо и некоммерческой организации FAR.AI, занимающейся безопасностью искусственного интеллекта, проверила 21 популярную открытую языковую модель и обнаружила, что встроенные механизмы защиты можно удалить или обойти. Результаты исследования представили на конференции ACM KDD в Южной Корее в статье TamperBench.

Открытые модели с доступными весами — набором числовых параметров, которые определяют работу нейросети, — позволяют разработчикам скачивать их, изменять и дообучать под свои задачи. Однако исследование показало, что после таких изменений защитные ограничения могут перестать работать, даже если изначально модель была настроена на безопасное поведение.

Защиту удалось снять у всех проверенных моделей

Для проверки исследователи создали инструмент TamperBench с открытым исходным кодом. Он позволяет моделировать различные способы вмешательства в работу ИИ и оценивать, насколько хорошо сохраняются защитные функции после модификаций.

Эксперимент показал, что все 21 протестированные модели можно было взломать. По мнению авторов работы, это создает риск использования мощных ИИ-систем для массового создания дезинформации, сложных мошеннических сообщений или подготовки опасных инструкций.

«Когда из работоспособной модели убирают защитные механизмы, ее можно использовать в масштабах, причиняющих вред, способами, с которыми один человек никогда не смог бы справиться вручную», — сказала доктор Сириша Рамбхатла, профессор управленческих наук и инженерии в Университете Ватерлоо.

LLM (большие языковые модели) — это системы искусственного интеллекта, которые обучены работать с текстом. Они могут создавать статьи, писать код, отвечать на вопросы и вести диалог с пользователями.

ИИ
Фото: Parilov/Shutterstock/FOTODOM
Исследователи проверили 21 популярную открытую языковую модель и обнаружила, что встроенные механизмы защиты можно удалить или обойти

Открытость моделей стала одновременно преимуществом и риском

В отличие от закрытых систем вроде ChatGPT и Gemini, открытые модели можно свободно загружать и адаптировать. Это делает их полезными для бизнеса, исследователей и государственных организаций, но одновременно повышает риск неправильного использования.

«Ведущие модели с открытыми весами зачастую не сильно отстают от лучших закрытых моделей. По мере того, как они становятся мощнее, потенциальные последствия удаления ими функций безопасности растут вместе с ними», — сказал Рамбхатла, директор Лаборатории критического машинного обучения в Университете Ватерлоо. 

При этом исследователи отмечают, что проблема может касаться не только открытых моделей. По словам Рамбхатлы, такие системы остаются важным инструментом для изучения ИИ и повышения прозрачности его работы.

Среди проверенных моделей были Llama, Mistral и Qwen — популярные открытые ИИ-системы, которые разработчики могут скачивать и дорабатывать под свои задачи.

«Модели с открытыми весами остаются важными для исследований в области ИИ и обеспечения подотчетности. Эта открытость — часть того, как мы гарантируем, что используемые людьми модели работают для всех», — отметил он.

Авторы призывают усилить проверку ИИ

Руководитель исследования Саад Хоссейн заявил, что современные методы защиты пока не дают полной гарантии безопасности после того, как модель оказывается у пользователя, который может изменить ее настройки.

«Существующие на сегодняшний день средства защиты пока не кажутся достаточно надежными, чтобы гарантировать безопасность публично выпущенной модели после того, как она попадет в руки любого, кто решит ее модифицировать», — сказал Хоссейн.

По его словам, по мере распространения ИИ в здравоохранении, образовании, борьбе с мошенничеством и других сферах необходимо тщательнее проверять такие системы перед внедрением.

Подписывайтесь и читайте «Науку» в MAX