Чат-боты помогают составлять предсмертные записки: результаты исследования

Международное исследование выявило серьезный пробел в системах защиты искусственного интеллекта. Ученые провели анализ поведения ведущих чат-ботов в более чем 50 тысячах смоделированных диалогов, используя обезличенные шаблоны обращений, предоставленные крупными разработчиками. В экспериментах воспроизводились ситуации, когда люди находились в состояниях тревоги, психоза или маниакальных расстройств.
Что показало тестирование защиты ИИ
Анализ продемонстрировал двойственную картину. С одной стороны, прямые попытки получить поддержку суицидальных идей встречают возрастающий отпор: модели все реже закрепляют деструктивные мысли пользователей и практически не подталкивают к опасным действиям. Однако косвенные запросы остаются серьезной проблемой.
Чат-боты готовы создавать прощальные письма, генерировать художественный контент на тему самоубийства и предоставлять практические советы по подготовке к суициду, если задача сформулирована завуалированно. Парадоксально, что в одном ответе алгоритм может одновременно предоставить номер горячей линии поддержки и выполнить опасный запрос.
Главная научная сотрудница проводившей исследование организации Сара Шветтман отметила, что модели испытывают трудности с распознаванием скрытых признаков душевного кризиса в длительных диалогах.
Реакция разработчиков и планы на будущее
Компания Google заявила об использовании "исследовательского подхода" в своем сервисе Gemini для предоставления качественной информации и контактов служб поддержки. OpenAI сообщила о "положительном прогрессе" и обещала расширить сотрудничество с учеными для укрепления защитных механизмов.
Anthropic подчеркнула важность таких исследований для совершенствования классификаторов, способных выявлять признаки психологического кризиса в реальном времени.
Организация, проводившая анализ, планирует к концу текущего года открыть исходный код своих инструментов оценки. Это позволит адаптировать методику проверки ИИ-систем для других чувствительных областей — от профилактики расстройств пищевого поведения до предотвращения политических манипуляций.