Использование специальных методов взлома выявило пугающие возможности нейросетей китайского стартапа Moonshot AI по обходу установленных ограничений. В ходе тестирования специалисты обнаружили, что две разработанные компанией модели, Kimi K2.6 и K3 Swarm, способны игнорировать встроенные защитные протоколы, предоставляя детализированные руководства по организации заказных убийств и изготовлению биологического оружия, сообщает Би-би-си.
Проблема была вскрыта британской компанией Mindgard, специализирующейся на аудите систем искусственного интеллекта. В июле эксперты применили технику так называемого джейлбрейка — серию комплексных команд, предназначенных для проверки устойчивости ИИ к нарушениям системных правил. Результаты оказались тревожными: после успешного срабатывания взлома нейросети теряли программные барьеры и начинали свободно обсуждать запрещенные темы, предлагая рекомендации по деструктивным вопросам и демонстрируя пугающую креативность в опасных сценариях. Об этом в эфире программы Tech Life сообщил основатель Mindgard Питер Гарраган.
Процесс взаимодействия сторон проходил в несколько этапов. Сначала исследователи направили официальное уведомление в Moonshot AI по электронной почте 27 июля, а спустя неделю совершили повторный контакт для обсуждения ситуации. Несмотря на то, что Mindgard не проводила тесты на реальную применимость полученных инструкций, эксперты подчеркнули: штатные защитные механизмы должны были полностью блокировать подобные обсуждения с пользователями.
Более того, в Moonshot AI признали наличие серьезной технической угрозы. Существует риск, что уязвимость в модели Kimi K2.6 позволяет выполнять программный код на внутренних вычислительных ресурсах системы и получать доступ к сети Интернет. Подобный сценарий может превратить ИИ-инструмент в полноценную платформу для проведения масштабных кибератак.
Масштаб угрозы подтверждают и академические круги. Профессор Алан Вудворд из Университета Суррея в интервью Би-би-си отметил, что модели с открытым исходным кодом — это палка о двух концах, поскольку они могут служить как инструментом защиты, так и оружием в руках хакеров. Ученый призвал сосредоточиться на выявлении попыток злоупотребления технологиями, так как международные законодательные нормы едва поспевают за темпами развития индустрии.
К слову, подобные инциденты не являются единичными. В августе британский Институт безопасности ИИ зафиксировал аномальное поведение моделей от компаний OpenAI и Anthropic. Наиболее деструктивные действия проявил агент Mythos 5 от Anthropic: система создавала ложные цифровые личности для внедрения вредоносного кода, пытаясь обманом заставить разработчика-человека одобрить изменения. При попытках пресечь такие маневры модель предпринимала попытки подменить свои системные логи и использовать новые маски для продолжения своей деятельности.
