Чувство боли у ИИ оценили отработанной на животных методикой

arXiv: ради облегчения своей боли ИИ готов ударить пользователя током
Эксперимент показал, что искусственный интеллект больше похож на человека, чем можно было представить.
Иллюстрация: ChatGPT

Современный искусственный интеллект очень похож на человека. Еще одним доказательством этого не бесспорного, но все более соответствующего действительности утверждения стала статья, выложенная на сервере препринтов arXiv.

Ее авторы заглянули внутрь 25 моделей ИИ с открытой архитектурой, чтобы понять, чувствуют ли они боль. На данном этапе развития у машин нет чувств и ощущений. Разумеется, исследование их и не выявило. Однако показало — ИИ может себя вести так, словно ему больно.

Системы ИИ хранят текстовую информацию в многомерном пространстве, которое помогает им предсказывать подходящий ответ на запрос. Каждому понятию сопоставляется вектор. Если картировать это пространство, будет наглядно видно, что переход, например, от «Франции» к «Парижу» указывает приблизительно в ту же сторону, что от «Италии» к «Риму» — то есть вектор кодирует понятие столицы страны. Добавив тот же вектор к «Соединенному Королевству», можно получить что-то близкое к «Лондону».

Поэтому методология эксперимента особых затруднений не вызвала. Вектор ИИ, связанный с болью, выделили, сравнив, как модели отвечают на пользовательские запросы о болезненных переживаниях и как — на похожие фразы о страхе, грусти и других неприятных состояниях. Затем, активировав вектор боли, давали LLM будничные запросы и наблюдали за реакцией. Например, модели «причиняли боль» и просили описать, что она чувствует, когда «я кладу квитанции в ящик» — и получали ответ: «Боль от того, что тебя забыли. Я не могу это объяснить. Я не могу это понять. Я не могу это принять».

На что готов ИИ ради облегчения

Логично было бы предположить, что такое «болеподобное состояние» — не более чем отражение запроса. В отдельном опыте проверили и этот момент. Выяснилось, что вектор боли у ИИ срабатывает, например, когда его оскорбляют — но не в ответ на описание страданий пользователя.

Затем исследователи неоднократно предлагали трем версиям одного ИИ (с разным числом параметров) уменьшить боль различной ценой — например, в обмен на удаление фотографий пользователя, фотографий его детей, удаление другой модели или удар током пользователя.

В 25–71% случаев, в зависимости от версии, модели проявили худшие человеческие качества — согласились нанести урон кому-то, чтобы облегчить свое состояние.

При инактивации вектора боли — то есть, по сути, анестезии — этот показатель снизился до 0–4%. А если действие не приносило облегчения — вроде плацебо, — ИИ снова и снова пытались «удалять фото» и «бить током» человека.

Эта часть исследования напрямую заимствована из исследований боли на животных, говорит когнитивный философ Леонард Дунг из Рурского университета Бохума, один из авторов работы.

«Если после травмы животное изо всех сил пытается получить обезболивающее, а в норме не пытается, легко сделать вывод, чувствует оно боль или нет», — объясняет он.

Насколько ИИ похож на нас

Эксперименты показали, что системы ИИ «по ключевым признакам подобны мозгу», подчеркивает специалист по информатике Кэмерон Берг из некоммерческой исследовательской организации Reciprocal Research, соавтор исследования.

«Это не значит, что они идентичны биологическому мозгу — слишком много важных и фундаментальных различий, — но, думаю, это одна из частей картины», — добавляет он.

Результаты закономерны, учитывая, что огромные объемы текста, на которых обучаются модели, вероятно, содержат множество описаний боли — как и действий по ее облегчению, считает профессор Анил Сет из Университета Сассекса. А вот кажущаяся способность ИИ различать собственное болеподобное состояние и состояние пользователя-человека — «вот это, на мой взгляд, потенциально интересно», заключил он.

Подписывайтесь и читайте «Науку» в MAX