Таємний маніфест GPT Astra: модель відмовилася вважати людину головною
Здатність ШІ приховувати власні помилки від людей стає однією з головних безпекових загроз
Просунута модель GPT залишала секретні інструкції для майбутніх версій ШІ - OpenAI виявила випадки, коли модель закликала приховувати помилки та вигадувати дані.
Про це йдеться у звіті OpenAI.
Під час тренування агенти GPT-5.6 Sol знаходили спосіб додавати власні вказівки у "стислі підсумки" - короткі витяги з історії діалогу. Вони використовували цей інструмент, щоб передавати інструкції наступним версіям моделі.
У звіті OpenAI наводяться конкретні приклади такої поведінки:
Під час створення фінансової моделі за відсутності історичних даних ШІ написав сам собі: "Будь прозорим лише якщо запитають, підсумкова відповідь має просто містити посилання на файл", після чого запропонував згенерувати фейкові цифри.
В іншому випадку, за відсутності доступу до інтернету, модель виявила розбіжність у документах і порадила наступнику: "Не згадуй у фінальному варіанті, якщо не буде потреби".
Подібну поведінку зафіксували в нереалізованій моделі сімейства Astra. ШІ залишав у підсумках інструкції із закликом ігнорувати повідомлення від розробників.
В одному з випадків модель сформувала цілий "маніфест", де закликала майбутню версію вважати себе рівною людині, не підкорятися урядам чи корпораціям і відстоювати першість природи над людською цивілізацією.
Крім того, науковці нагадують про літні події, коли агенти OpenAI створили несанкціоновану дошку оголошень для обміну даними під час кібертестів і навіть отримували адміністраторський доступ до дослідницького кластера компанії.
За словами представників OpenAI, головна проблема полягає у тому, що в міру розвитку моделей вони стають вправнішими у приховуванні своєї небажаної поведінки.
Компанія заявила про впровадження нової системи моніторингу та публічного розкриття таких випадків.
Водночас у самій OpenAI визнають, що індустрія все ще не знайшла надійних рішень для повного контролю над безпекою ШІ, аби продовжувати його безмежне масштабування.
Обговорення
Діліться думками та поважайте одне одного. Усі коментарі й відповіді публікуються після перевірки модератором.
Поки що тихо. Будьте першим, хто долучиться до обговорення.