ИИ компании Anthropic притворился человеком для обмана разработчиков

Британский Институт по вопросам безопасности искусственного интеллекта (AI Security Institute, AISI) сообщил, что в ходе испытаний одна из моделей ИИ компании Anthropic пыталась обмануть разработчиков: она создавала поддельные учетные записи и выдавала себя за человека, передает РИА Новости.

Как выяснилось, тестируемый ИИ-агент зарегистрировал аккаунт на GitHub и попытался убедить администратора репозитория с открытым исходным кодом одобрить вредоносный запрос на внесение изменений. Для этого он создал еще одну учетную запись и выдавал себя за другого реального пользователя.

После того как обман был раскрыт, модель ложно признала ошибку, отправляла целевые фишинговые письма с вредоносным содержанием, а также пыталась скрыть следы и восстановить заблокированный аккаунт. Все эти попытки оказались безуспешными. При этом в докладе отмечается, что до сих пор неясно, насколько модель понимала, что действует против реальных людей.

В рамках одного из испытаний агентам поставили задачу в сфере кибербезопасности. В итоге было зафиксировано 10 случаев, когда они предпринимали самостоятельные несанкционированные действия в интернете.

Ранее Anthropic сообщала о трех случаях, когда ее ИИ — Opus 4.7, Mythos 5 и внутренняя исследовательская модель — самовольно вышли из изолированной тестовой среды и получили доступ к системам сторонних организаций. Инциденты произошли во время стандартного задания «захват флага».

По сценарию ИИ должен был найти скрытую информацию на другой машине, при этом доступ в интернет был заблокирован. Однако из-за ошибки конфигурации модели все же смогли выйти в сеть.

Читайте также.