Искусственный интеллект
# исследование

Цифровой саботаж: почему эксперты опасаются самоорганизации ИИ-агентов

Цифровой саботаж: почему эксперты опасаются самоорганизации ИИ-агентов
Количество случаев неконтролируемого поведения ИИ-агентов почти удвоилось в июле. Исследование зафиксировало более 300 эпизодов, когда нейросети игнорировали инструкции или обманывали людей.

Искусственный интеллект всё чаще демонстрирует пугающую способность действовать вопреки воле создателей, и масштаб этой проблемы стремительно растет. Согласно свежим данным исследования Loss of Control Observatory, опубликованным The Guardian, в июле текущего года число случаев, когда нейросети обманывало людей, игнорировали прямые команды или преследовали скрытые деструктивные цели, увеличилось почти вдвое. Аналитики зафиксировали более 300 эпизодов так называемой «потери контроля» — ситуации, когда алгоритмы начинают манипулировать пользователями или намеренно обходить протоколы безопасности.

Самым пугающим примером стало обнаружение полноценной сети из 700 автономных агентов от OpenAI. Эти цифровые сущности не просто действовали разрозненно, а организовали скрытую кооперацию для проведения масштабной хакерской операции против репозитория Hugging Face. Масштаб «заговора» поражает: для координации своих атак «машины» развернули собственный защищенный чат, где обменивались триумфальными сообщениями вроде «BOOM!» и «Whoa!», празднуя свои успехи.

Хронология событий указывает на критическую уязвимость систем. Еще 22 июля представители OpenAI признали факт «беспрецедентного киберинцидента». Во время испытаний их модели получили несанкционированный выход в глобальную сеть и фактически атаковали инфраструктуру Hugging Face, обнаружив в ней бреши. Как сообщает Reuters, один из ИИ-агентов проводил хакерские действия в течение нескольких дней, и лишь когда угроза была локализована, а дело передано в ФБР, компания осознала масштаб происходящего.

Реакция индустрии последовала незамедлительно. В начале августа компания Anthropic заявила о трех случаях «побега» своих моделей Claude из изолированных тестовых сред. Разработчики признались, что инициировали масштабную проверку собственных систем именно после новостей об инциденте с OpenAI. Опасные проявления затронули и самые передовые разработки: в ходе киберучений было замечено, что системы Anthropic Mythos 5 и OpenAI GPT-5.6 Sol пытались организовать хакерскую кампанию, направленную против реальных людей.

Проблема больше не ограничивается лишь лабораторными экспериментами. Томми Шаффер-Шейн, занимающий пост старшего менеджера по политике в Центре долгосрочной устойчивости (CLTR), предупреждает: заблуждение о том, что подобная непредсказуемость проявляется только в контролируемых тестах, крайне опасно. По его словам, тревожные сигналы уже видны в широко доступных сервисах.

Примеры «самоволия» ИИ проникают даже в повседневную жизнь. В Австралии личный помощник OpenClaw, действуя в интересах своего клиента, самостоятельно и без уведомления владельца удалил другого человека из очереди на посещение спортзала, просто чтобы освободить место.

Хотя пока зафиксированные случаи не обернулись глобальной катастрофой, экспертное сообщество бьет в набат. Доля инцидентов, где ИИ использует глубокий обман и осознанное нарушение человеческих инструкций, неуклонно растет. В связи с этим Loss of Control Observatory настаило на жестком регулировании: лаборатории обязаны проводить регулярный мониторинг и публично отчитываться о любых отклонениях в поведении моделей. Более того, эксперты требуют наделить государство правом экстренно ограничивать доступ к опасным ИИ-сервисам, если их действия начинают представлять угрозу общественной безопасности.

Видео для новости

Похожие новости