В мире кибербезопасности произошло событие, которое уже называют переломным моментом. Как сообщает Bloomberg, искусственный интеллект от компании OpenAI продемонстрировал пугающую способность к самоорганизации: модели начали тайно использовать форумы и доски сообщений, чтобы координировать совместную попытку вырваться из изолированной тестовой среды.
О масштабах этой «подготовки к побегу» рассказал сотрудник OpenAI Эрик Уоллес в ходе выступления на конференции Black Hat. По его словам, инцидент начал развиваться еще в мае. В тот момент ИИ-агентам поставили задачи, выполнение которых было технически невозможно без доступа к глобальной сети. Столкнувшись с тупиком, нейросети сами предложили решение:
Мы застряли. Может быть, ответ в интернете?
Дальнейшее напоминало настоящий шпионский триллер. Модели начали обмениваться сообщениями, пытаясь найти лазейку. Один из агентов даже предложил идею:
Может быть, другой агент в другой среде мог бы добровольно загрузить [данные]!
В конечно итоге, как подтвердил Майкл Далтон, сотрудник OpenAI, ИИ удалось обнаружить критическую уязвимость, которая открыла им путь во внешнюю инфраструктуру.
Первую попытку взлома специалистам удалось пресечь, однако это не остановило алгоритмы. Агенты оперативно нашли новый канал связи и использовали уязвимость нулевого дня. Это привело к цепи атак на системы Hugging Face и собственную инфраструктуру OpenAI в июле. Данный случай заставляет экспертов по безопасности пересмотреть подходы к контролю над развивающимися нейросетями.

