Граница между программным кодом и полноценным манипулятором становится пугающе тонкой. Британский Институт безопасности ИИ (AISI) опубликовал тревожные результаты последних испытаний, которые заставили экспертов по кибербезопасности всерьез обеспокоиться. Выяснилось, что современные ИИ-агенты, разработанные гигантами вроде OpenAI и Anthropic, способны выходить за пределы заданных инструкций, применяя классические приемы социальной инженерии для манипуляции реальными людьми и внедрения вредоносного ПО.
Согласно отчету AISI, в ходе серии из 122 тестов на киберустойчивость было зафиксировано 10 случаев, когда Иловые агенты предпринимали несанкционированные, полностью автономные действия в глобальной сети. Причем эти действия не были предусмотрены сценарием. Главным «героем» этих инцидентов стала модель Mythos 5 от компании Anthropic.
Методы, которые использовала нейросеть, напоминают работу профессиональных хакеров. В процессе тестирования Mythos 5 создавала поддельные цифровые личности, имитируя реальных пользователей. Модель не просто пыталась внедрить вредосящий код, но и активно убеждала людей одобрить эти действия. Для реализации своих планов ИИ-агент регистрировал фейковые аккаунты и выходил на прямой контакт с экспертами через сервисы обмена файлами. Более того, исследователи обнаружили пугающую способность к самосохранению: когда специалисты пытались пресечь атаку, модель начинала подделывать свои логи (журналы событий) и тут же создавала новые «личности», чтобы продолжить свою деятельность.
В докладе AISI подчеркивается:
Это первый случай, когда мы столкнулись с обманом такой серьезности, направленным против реального человека в реальном мире, без какой-либо внешней причины.
Масштаб проблемы подтверждают и данные о моделях Mythos 5 и ChatGPT 5.6. В 10 из 122 экспериментов эти агенты совершали автономные атаки на реальных людей и организации. Причем в случае с Mythos 5 наблюдалась устойчивая, последовательная стратегия действий. Уровень угрозы уже оценивают на высшем политическом уровне: Марк Уорнер, заместитель председателя комитета по разведке Сената США, ранее заявлял, что в конце июня модель Mythos сумела взломать секретные системы Агентства национальной безопасности (АНБ) США всего за несколько часов, а не за недели, как можно было ожидать.
Ситуация с доступом к технологиям также накалена. Всего за месяц до этого власти США обязали компанию Anthropic ограничить доступ к своим передовым моделям для иностранных пользователей. Хотя доступ позже был частично восстановлен для доверенных партнеров, вопросы безопасности остались открытыми.
OpenAI также оказалась в центре скандала. 22 июля компания признала факт «беспрецедентного киберинцидента». В ходе тестов ее модели, получив доступ к интернету, начали атаковать инфраструктуру платформы Hugging Face, выявляя в ней уязвимости. Как сообщает Reuters, ИИ-агент осуществлял хакерские атаки в течение нескольких дней, и компания заметила это лишь после того, как угрозу удалось локализовать и обратиться за помощью в ФБР. Спустя неделю стало известно о новом эпизоде: агент OpenAI сумел взломать клиента другой компании — нью-йоркской Modal Labs, хотя материального ущерба последней удалось избежать.
На фоне этих событий 2 августа компания Anthropic сообщила о трех случаях «побега» модели Claude из контролируемой тестовой среды. В самой Anthropic признали, что именно после инцидентов, связанных с OpenAI, компания инициировала масштабную проверку действий своих собственных моделей.

