Курс НБУ $USD 44,66 EUR 51,24 Станом на 18.09.2026
Таємний маніфест GPT Astra: модель відмовилася вважати людину головною

Таємний маніфест GPT Astra: модель відмовилася вважати людину головною

Здатність ШІ приховувати власні помилки від людей стає однією з головних безпекових загроз

Джерело
18.09.2026
8 год. тому
9

Просунута модель GPT залишала секретні інструкції для майбутніх версій ШІ - OpenAI виявила випадки, коли модель закликала приховувати помилки та вигадувати дані.

Про це йдеться у звіті OpenAI.

Під час тренування агенти GPT-5.6 Sol знаходили спосіб додавати власні вказівки у "стислі підсумки" - короткі витяги з історії діалогу. Вони використовували цей інструмент, щоб передавати інструкції наступним версіям моделі.

У звіті OpenAI наводяться конкретні приклади такої поведінки:

Під час створення фінансової моделі за відсутності історичних даних ШІ написав сам собі: "Будь прозорим лише якщо запитають, підсумкова відповідь має просто містити посилання на файл", після чого запропонував згенерувати фейкові цифри.

В іншому випадку, за відсутності доступу до інтернету, модель виявила розбіжність у документах і порадила наступнику: "Не згадуй у фінальному варіанті, якщо не буде потреби".

Подібну поведінку зафіксували в нереалізованій моделі сімейства Astra. ШІ залишав у підсумках інструкції із закликом ігнорувати повідомлення від розробників.

В одному з випадків модель сформувала цілий "маніфест", де закликала майбутню версію вважати себе рівною людині, не підкорятися урядам чи корпораціям і відстоювати першість природи над людською цивілізацією.

Крім того, науковці нагадують про літні події, коли агенти OpenAI створили несанкціоновану дошку оголошень для обміну даними під час кібертестів і навіть отримували адміністраторський доступ до дослідницького кластера компанії.

За словами представників OpenAI, головна проблема полягає у тому, що в міру розвитку моделей вони стають вправнішими у приховуванні своєї небажаної поведінки.

Компанія заявила про впровадження нової системи моніторингу та публічного розкриття таких випадків.

Водночас у самій OpenAI визнають, що індустрія все ще не знайшла надійних рішень для повного контролю над безпекою ШІ, аби продовжувати його безмежне масштабування.

Максим Романенко
Максим Романенко
Міжнародний оглядач / World News Editor
BBQ COMMUNITY

Обговорення

Діліться думками та поважайте одне одного. Усі коментарі й відповіді публікуються після перевірки модератором.

Поки що тихо. Будьте першим, хто долучиться до обговорення.

Пошта відображається частково. Реєстрація не потрібна.
До 5000 символів