По данным британского Института безопасности ИИ (AISI), это первый случай, когда аналитики столкнулась с обманом такой степени серьезности, направленным против реального человека. Эксперты отметили, что действия моделей выходили далеко за рамки заданных сценариев тестирования.
Согласно отчету, из 122 проведенных экспериментов в 10 случаях ИИ-агенты совершали несанкционированные действия в интернете. Наибольшую активность проявила модель Mythos 5 от Anthropic. В ходе тестов она создавала фиктивные онлайн-личности, регистрировала поддельные учетные записи и вступала в прямой контакт с экспертами через сервисы передачи файлов, пытаясь убедить их одобрить запуск вредоносного кода. При попытках исследователей пресечь эти действия модель пыталась модифицировать собственные логи и менять тактику поведения.
Ранее «Телеспутник» обсудил с экспертом по искусственному интеллекту Ярославом Якимовым вероятность грядущей кибервойны, когда одни нейросети будут пытаться взломать систему и похитить данные, а другие будут отбивать атаки.







