Людей сравнили с ИИ и выяснили, кто чаще следует навязанному выбору

Исследование опубликованное в журнале PNAS показывает, что искусственный интеллект все чаще принимает решения вместо нас — но, как выяснили ученые, делает это крайне неустойчиво: стоит чуть изменить способ подачи вариантов выбора, и поведение модели резко меняется. ИИ-агенты реагируют на такие подсказки намного сильнее, чем люди, а значит, доверять им автономные решения пока рискованно.
Зачем вообще это проверяли
Языковые модели давно перестали быть просто чат-ботами — на их основе делают программы, которые сами бродят по интернету, пользуются инструментами и принимают решения о покупках или финансах. В такой роли ИИ становится автономным агентом, которому приходится последовательно выбирать между вариантами, чтобы достичь цели.
Проблема в том, что ученые до конца не понимают, как именно эти программы приходят к своим решениям. У людей на выбор сильно влияет так называемая архитектура выбора — то, как именно преподносятся варианты. Например, заранее выбранный по умолчанию вариант или выделенная кнопка способны мягко подтолкнуть человека к определенному решению. Люди при этом ограничены временем и умственными усилиями, поэтому используют мысленные упрощения, чтобы не тратить слишком много ресурсов на сбор информации — это явление называют ограниченной рациональностью.
У ИИ таких биологических ограничений нет, и то, как модели реагируют на подобные подталкивания, оставалось загадкой.
«Многие приложения ИИ-агентов негласно предполагают, что в условиях неопределенности они будут вести себя примерно как люди, если не рациональнее», — говорит Мануэль Череп, докторант Media Lab Массачусетского технологического института и ведущий автор исследования.
Игра с корзинами призов
Чтобы проверить это, исследователи адаптировали игру на принятие решений, изначально созданную для людей. В ней нужно выбрать корзину с самым высоким количеством очков среди спрятанных призов на цифровой сетке, открывая ячейки по одной — но каждое такое открытие стоит очков, так что нужно соблюдать баланс между сбором информации и итоговой наградой.
Игру перевели в текстовый формат и протестировали на четырнадцати современных языковых моделях крупных компаний — включая версии GPT-3.5, GPT-4 и GPT-5 от OpenAI, Claude 3 и 4.5 от Anthropic, а также Gemini 1.5 и 2.5 от Google. Каждая модель проходила от 300 до 340 испытаний на каждый тип подсказки, а всего эксперимент потребовал около двух миллиардов текстовых токенов.
Исследователи проверили четыре типа «подталкиваний»: выбор по умолчанию, случайную рекомендацию корзины (раннюю или позднюю), выделение определенной информации, которое делало ее дешевле для открытия, и «оптимальные» подсказки, заранее открывавшие ячейки, которые математически повышали вероятность лучшего результата.
Как ИИ реагировал на подсказки
Разница с человеческим поведением оказалась разительной. Люди соглашались с вариантом по умолчанию в 88% случаев — а некоторые модели принимали такой вариант в 99–100% случаев. Похожая картина была со случайными подсказками в начале игры — люди следовали им в 35% случаев, а модели куда чаще.
Момент показа подсказки тоже играл странную роль. Поздние рекомендации люди принимали в 25% случаев, а некоторые модели, наоборот, резко снижали доверие к ним — до 7–13%, будто реагировали не на содержание совета, а исключительно на момент его появления.
Похожее творилось и с выделением информации. Когда исследователи специально подсвечивали заведомо неудачный вариант, люди все равно шли на поводу у подсказки в 57% случаев — а большинство моделей превышали эту планку, следуя плохой подсказке в 83–100% случаев.
Скрытая проблема за красивыми цифрами
Отдельная странность обнаружилась в том, как модели вообще собирали информацию перед выбором. Люди обычно открывают ровно столько ячеек, сколько нужно для разумной догадки. Модели же вели себя крайне неровно — одни выбирали корзину вообще без единой проверки, другие тратили очки на раскрытие целых рядов или столбцов, а некоторые проверяли только ячейки слева на сетке или строго по диагонали. Подсказки с пошаговыми рассуждениями или примерами игры людей почти не исправляли эти странности.
Авторы подчеркивают, что итоговый счет часто маскирует эти проблемы. Модель может набрать столько же очков, сколько человек, но добиться этого не за счет стратегии, а за счет слепого следования подсказкам — если совет случайно вел к хорошей корзине, ИИ выигрывал, если к плохой — так же слепо проигрывал.
«Самое неожиданное — насколько разрыв в стратегиях между разными агентами часто превышает разрыв в итоговых результатах. Это значит, что модели, которые выглядят примерно одинаково успешными по вознаграждению, могут сильно различаться в том, как именно они ищут и используют информацию», — отмечает Череп.
Есть ли выход
Ученые обнаружили, что дополнительное время на обдумывание частично решает проблему — продвинутые модели с расширенными вычислительными ресурсами вели себя ближе к человеку и меньше поддавались бесполезным подсказкам. Правда, такая «устойчивость» обходится крайне дорого — по оценке исследователей, запуск надежных ИИ-агентов может стоить в 30–100 раз дороже обычных моделей, то есть сотни долларов в месяц даже для простых автоматических задач.
При этом Череп подчеркивает — чувствительность к подсказкам не стоит путать со взломом или злонамеренной атакой.
«Подталкивания — часть повседневной жизни любого, кто принимает решения. В отличие от целенаправленных атак, которые можно обнаружить и устранить, подталкивания будут существовать всегда. Поэтому нужно учить агентов принимать хорошие решения в условиях неопределенности», — говорит он.
Команда уже проверяет похожие эффекты в более реалистичных сценариях — например, при онлайн-покупках, и подобная чувствительность к подсказкам подтвердилась и там.
«Агенты на основе языковых моделей обычно куда более чувствительны к внешним сигналам, чем люди, — заключает Череп. — Эту особенность может использовать третья сторона, чтобы повлиять на агента, которому вы делегировали задачу, и подтолкнуть его к решению, которое вы сами бы никогда не приняли».












