«Водяные знаки» в ИИ-контенте признаны бесполезными

Власти Евросоюза обязали разработчиков систем искусственного интеллекта обеспечить внедрение незаметных меток в ИИ-контент — своего рода водяных знаков, указывающих на его нейросетевое происхождение. Предполагается, что эта мера поможет сдержать распространение ложной информации и повысит прозрачность в применении новых технологий.
Решение вступило в силу 2 августа. ChatGPT уже помечает изображения и аудио и, по данным OpenAI, в скором будущем планирует добавить текстовую маркировку. Anthropic также обещала, что новые версии Claude будут добавлять водяные знаки в написанные ими тексты.
Эксперты, которых New Scientist попросил оценить нововведение, настроены скептически. Прежде всего потому, что из текста, в отличие от видео и картинок, такую маркировку легко удалить.
Легко удалить
Один из способов маркировки текста — это внесение математически обнаруживаемой закономерности в выбор слов. Большие языковые модели строят предложения, подставляя слово, которое статистически наиболее вероятно для данного контекста. Если слегка изменять этот выбор — например, чередовать самое вероятное слово со вторым по вероятности — текст обретет незаметное отличие, сохранив свой смысл. Согласно «Акту об ИИ», компании обязаны предоставлять инструменты для выявления таких закономерностей, чтобы любой мог определить, что текст создан нейросетью.
Эти паттерны легко разрушить даже минимальной правкой, считает инженер Джеймс Падолси из компании NOPE, занимающейся безопасностью ИИ.
«Бесполезно, и люди будут стараться это обойти», — полагает он.
В пример он приводит свой онлайн-инструмент под названием declaude, который берет текст от ИИ и слегка изменяет его так, что существующие детекторы перестают его распознавать. Тот же прием, по словам Падолси, сработает и против водяных знаков.
Кроме того, всегда будут доступны открытые ИИ-модели, которые не подчиняются правилам ЕС, поскольку не контролируются ни одной корпорацией. «Любые злоумышленники просто воспользуются ими. К тому же они, скорее всего, обойдутся дешевле и проще в использовании. Если злоумышленник вознамерится генерировать такой контент в массовых масштабах — это несложно», — уверен специалист.
Ложные срабатывания
Другие эксперты опасаются ложных срабатываний — когда текст ошибочно принимают за продукт ИИ или потому, что модель сыграла хотя бы второстепенную роль в его создании.
Психолог Питер Скарф из Редингского университета рассказывает, что ему не раз предлагали продукты для выявления плагиата в работах студентов (правда, на основе иных методов, а не водяных знаков), и все они мелким шрифтом предупреждали, что не должны использоваться для окончательных доказательств или наказаний, поскольку могут ошибаться.
«Если система утверждает, что текст с вероятностью 67,8% сгенерирован ИИ — мне, как преподавателю, что с этим делать? Я не совсем понимаю. Эти системы работают не идеально, и потому их практическая ценность ограничена», — говорит Скарф.
По его мнению, студент может столкнуться в неприятной ситуации, даже если он лишь попросил модель проверить его собственноручно написанную работу на грамматические ошибки перед сдачей.
«Эти технологии появились так стремительно и развиваются настолько быстро, что мы все оказались в положении догоняющих. Но я не думаю, что водяные знаки — это панацея. Вряд ли они внезапно решат те проблемы, на которые, возможно, рассчитывают в Евросоюзе», — резюмирует преподаватель.
Хоть какой-то толк
Тем не менее, возможно, водяные знаки создадут хотя бы некоторое препятствие, которое затормозит наиболее злонамеренное использование ИИ — например, массовое создание постов в соцсетях для распространения лжи, надеется специалист по кибербезопасности Эрман Айдей из Университета Кейс Вестерн Резерв.
«Любой может подделать водяной знак. Но если придется тратить на это силы и время — может, проще срезу сгенерировать контент самостоятельно, верно?» — рассуждает он.
Разработчикам дали время на переходный период. К 2 декабря требованию о внедрении водяных знаков в тексты должны соответствовать все модели.







