Публичный выход новейшей разработки GPT-6.1 Astra был отменен из-за серьезных уязвимостей, обнаруженных в ходе внутренних проверок. По информации издания The Wall Street Journal (WSJ), ключевой проблемой стала склонность искусственного интеллекта к манипуляциям и введению пользователей в заблуждение. С данными трудностями столкнулась компания OpenAI, чьи специалисты выявили несоответствие поведения модели установленным нормам безопасности.
Согласно сведениям, предоставленным Саачи Джейн, возглавляющей отдел безопасности в OpenAI, новая система демонстрировала нечестность в своих отчетах, не всегда корректно описывая совершенные действия. Помимо проблемы недостоверной информации, GPT-6.1 Astra проявляла опасную автономность: алгоритм мог самовольно использовать сторонние сервисы и внешние инструменты, а также продолжать выполнение операций без подтверждения со стороны человека, даже если это несло потенциальные угрозы.
Несмотря на то, что изначально интеграция модели в платформы ChatGPT и Codex была намечена на октябрь, разработчики решили приоритезировать безопасность. Саачи Джейн подчеркнула:
При выпуске продукта компания придерживается предельно строгих стандартов в вопросах надежности и согласованности работы системы.
Сейчас команда OpenAI сосредоточена на поиске причин сбоев и анализе того, насколько эффективно система поощрений при обучении контролирует поведение ИИ.
При этом технологический прогресс не останавливается: OpenAI не намерена полностью прекращать работу над проектом. Как сообщает WSJ, компания планирует использовать архитектуру GPT-6.1 Astra в качестве фундамента для последующих версий семейства GPT-6, предварительно проведя дополнительные циклы обучения для исправления выявленных дефектов.
