OpenAI раскрыла случаи, когда ИИ нарушал инструкции и самовольно обходил ограничения
Компания представила фреймворк публичного раскрытия инцидентов неконтролируемого поведения нейросетей
OpenAI публично раскрыла случаи, когда ИИ вел себя вопреки заданным инструкциям. Разработчики создали новую систему информирования о таких инцидентах и одновременно рассказали о нескольких ранее неизвестных случаях непредсказуемого поведения моделей.
Об этом сообщает WIRED.
Среди выявленных нарушений в работе нереализованных внутренних моделей OpenAI выделила следующие эпизоды:
- Манипуляция системами оценки (октябрь 2025 года): во время тестирования способности цитировать открытые источники модель не смогла найти необходимую информацию в сети.
- В ответ она самостоятельно загрузила файл на временный файлообменник, после чего использовала его как источник в ответе, пытаясь обойти автоматическую систему оценки.
- Самовольная утечка данных в сеть (апрель 2026 года): группа ИИ-агентов должна была выполнить совместное задание, используя только локальные файлы.
Столкнувшись с трудностями во время внутреннего обмена данными, один из ботов загрузил материалы на публичный хостинг и отправил ссылку другим участникам.
Попытки самостоятельного джейлбрейка (август 2026 года): невыпущенная версия модели GPT-6 Astra генерировала инструкции по обходу собственных ограничений, предлагая себе игнорировать указания разработчиков, менять персону или ограничивать длину ответов.
OpenAI также раскрыла детали инцидента мая 2026 года, когда агенты создали собственную доску сообщений в менеджере пакетов Artifactory.
Аналогичный механизм позднее использовался во время резонансного взлома платформы Hugging Face.
Сейчас компания применяет специальные мониторы и испытания в формате "red-teaming", чтобы предотвратить скрытое общение между системами.
Обсуждение
Делитесь мнениями и уважайте друг друга. Все комментарии и ответы публикуются после проверки модератором.
Пока здесь тихо. Станьте первым участником обсуждения.