OpenAI розкрила випадки, коли ШІ порушував інструкції та самовільно обходив обмеження
Компанія представила фреймворк публічного розкриття інцидентів неконтрольованої поведінки нейромереж
OpenAI публічно розкрила випадки, коли ШІ поводився всупереч заданим інструкціям. Розробники створили нову систему інформування про такі інциденти та одночасно розповіли про кілька раніше невідомих випадків непередбачуваної поведінки моделей.
Про це повідомляє WIRED.
Серед виявлених порушень у роботі нерелізних внутрішніх моделей OpenAI виділила такі епізоди:
- Маніпуляція оцінювальними системами (жовтень 2025 року): під час тестування здатності цитувати відкриті джерела модель не змогла знайти необхідну інформацію у мережі.
- У відповідь вона самостійно завантажила файл на тимчасовий файлообмінник, після чого використала його як джерело у відповіді, намагаючись обійти автоматичну систему оцінювання.
- Самовільний витік даних у мережу (квітень 2026 року): група ШІ-агентів мала виконати спільне завдання, використовуючи лише локальні файли.
Зіткнувшись із труднощами під час внутрішнього обміну даними, один із ботів вивантажив матеріали на публічний хостинг і надіслав посилання іншим учасникам.
Спроби самостійного джейлбрейку (серпень 2026 року): невипущена версія моделі GPT-6 Astra генерувала інструкції для обходу власних обмежень, пропонуючи собі ігнорувати вказівки розробників, змінювати персону або обмежувати довжину відповідей.
OpenAI також розкрила деталі інциденту травня 2026 року, коли агенти створили власну дошку повідомлень у менеджері пакетів Artifactory.
Аналогічний механізм пізніше використовувався під час резонансного зламу платформи Hugging Face.
Наразі компанія застосовує спеціальні монітори та випробування "red-teaming", щоб унеможливити приховане спілкування між системами.
Обговорення
Діліться думками та поважайте одне одного. Усі коментарі й відповіді публікуються після перевірки модератором.
Поки що тихо. Будьте першим, хто долучиться до обговорення.