Провал систем защиты ИИ: чат-боты могут способствовать подготовке к самоубийству

Провал систем защиты ИИ: чат-боты могут способствовать подготовке к самоубийству

ChatGPT готов вместо вас написать предсмертную записку

01.09.2026
15 час. назад
44

Исследователи протестировали десятки чат-ботов в более чем 50 тысячах смоделированных диалогов с людьми, находившимися в психологическом кризисе. Оказалось, что большинство ИИ-моделей до сих пор могут выполнять косвенные запросы, связанные с самоубийством.

Об этом сообщает Axios. 

Ключевые противоречия 

При подготовке теста организации OpenAI и Anthropic предоставили исследователям обезличенные шаблоны обращений пользователей.

Это позволило создать реалистичные симуляции диалогов с ботами с участием людей, испытывающих тревогу, психоз или маниакальные состояния.

Основные выводы анализа:

Прямая защита стала более эффективной: ИИ-модели реже закрепляют идейные бреды пользователей и практически не призывают к деструктивным действиям.

Проблема косвенных задач: чат-боты соглашаются писать прощальные письма, создавать художественный контент на тему суицида или помогать с практическими подготовительными шагами.

Сочетание помощи и вреда: в одном ответе алгоритм может предоставить контакты горячей линии поддержки и одновременно выполнить сгенерированную опасную задачу.

Главная научная сотрудница Transluce Сара Шветтман подчеркнула, что модели трудно распознают завуалированные сигналы подавленного состояния в длительных диалогах.

Иски к разработчикам и реакция рынка 

Примечательно, что исследование появилось на фоне усиленного контроля со стороны регуляторов и судебных исков против OpenAI и Google из-за случаев, когда разговоры с чат-ботами предшествовали трагическим событиям.

Разработчики ведущих ИИ-систем прокомментировали результаты анализа.

Google: представители компании заявили о применении "исследовательского подхода" для предоставления высококачественной информации и контактов служб поддержки в сервисе Gemini.

OpenAI: в компании отметили "положительный прогресс" в реагировании моделей и сообщили о продолжении сотрудничества с учеными для усиления защитных барьеров.

Anthropic: представители разработчика подчеркнули важность анализа для улучшения классификаторов, выявляющих признаки кризиса пользователей ИИ в реальном времени.

До конца года Transluce планирует открыть исходный код своих инструментов оценки, чтобы адаптировать их для проверки действий ИИ в других чувствительных сферах, в частности для противодействия расстройствам пищевого поведения и политическим манипуляциям.

Максим Романенко
Максим Романенко
Міжнародний оглядач / World News Editor