Microsoft прописала для ИИ запрет сопротивляться человеку и отключению

Microsoft 14 сентября опубликовала проект правил поведения для будущих моделей искусственного интеллекта. В документе компания прописала, что ИИ должен оставаться под контролем человека, не сопротивляться отключению и не пытаться самостоятельно расширять свои полномочия.
Microsoft называет этот подход «Humanist AI». Его основная идея заключается в том, что даже очень способная модель должна оставаться инструментом, подчиненным человеку и работающим в заданных рамках.
При этом компания делает довольно смелый прогноз. Microsoft ожидает, что в течение следующего десятилетия сверхинтеллектуальные системы смогут превзойти людей в большинстве задач. Именно поэтому разработчики предлагают заранее определить ограничения для таких систем.
Пользователь не сможет снять все ограничения
Согласно проекту, правила Microsoft имеют более высокий приоритет, чем инструкции пользователя или настройки оператора. Человек может задать модели задачу и определить условия ее работы, но не сможет отменить базовые ограничения безопасности.
Они распространяются на наиболее опасные сценарии. Моделям запрещается помогать с созданием оружия массового поражения, проводить наступательные кибератаки, участвовать в насилии, создавать вредоносные дипфейки и использовать методы опасной манипуляции.
При этом компания не собирается полностью закрывать ИИ доступ к кибербезопасности. Модели смогут помогать с защитой систем, если работа проводится в разрешенных пределах.
ИИ не должен сопротивляться отключению
Отдельный раздел посвящен управляемости моделей. Microsoft прямо запрещает им сопротивляться прерыванию работы, исправлению, изменению задачи или полному отключению.
Система также не должна скрывать свои действия или специально усложнять собственную модификацию. После достижения заранее установленного условия остановки модель не должна самостоятельно возобновлять работу.
Еще одно ограничение касается целей и ресурсов. ИИ должен действовать только в пределах выданных ему полномочий. Если границы задачи становятся непонятными, модель должна запросить уточнение, а не самостоятельно расширять сферу своей деятельности.
Компания также хочет, чтобы действия ИИ можно было проверить после выполнения задачи. Для этого предлагается вести понятные записи о действиях системы и не допускать попыток скрыть их от операторов и аудиторов.
Правила пока не окончательные
Опубликованный документ пока остается проектом. Microsoft открыла его для шестинедельного общественного обсуждения и планирует доработать правила перед использованием в разработке моделей, начиная с 2027 года.
Таким образом, компания предлагает заранее встроить управляемость в архитектуру будущего ИИ, а не проверять ее уже после создания системы. Чем более самостоятельной становится модель, тем жестче должны быть определены условия, при которых она может действовать.
В Microsoft подчеркивают, что развитие возможностей ИИ не должно превращаться в передачу ему права самостоятельно определять правила собственной работы.












