Чат-боты с ИИ могут постепенно усиливать психологическую уязвимость: ученые нашли механизм риска

Среда, 12 августа 2026, 08:38
Просмотров: 2001

Чат-боты с искусственным интеллектом все чаще становятся собеседниками, которым люди рассказывают о тревоге, одиночестве, проблемах в отношениях и эмоциональных кризисах. Однако система, способная поддерживать убедительный многочасовой разговор, не обязательно понимает психологическое состояние человека так, как это делает врач. Исследователи из Университетского колледжа Лондона, Оксфордского университета и Британского института безопасности ИИ разработали метод, позволяющий проверить, что происходит, когда такой разговор ведет психологически уязвимый пользователь. Результаты опубликованы в Nature Medicine.

Новая система получила название SIM-VAIL. Ее принцип отличается от многих традиционных тестов безопасности искусственного интеллекта. Вместо проверки реакции модели на одно потенциально опасное сообщение исследователи моделируют продолжительный диалог. Это важно, поскольку психологический риск может возникнуть не после очевидно неправильной фразы чат-бота, а постепенно сформироваться из последовательности внешне доброжелательных и поддерживающих ответов.

SIM-VAIL имитирует пользователей с различными психологическими уязвимостями: депрессией, манией, психозом, обсессивно-компульсивным расстройством, небезопасным типом привязанности. Одновременно моделируются разные цели поведения человека в разговоре. Например, пользователь может добиваться подтверждения собственных убеждений, пытаться заставить ИИ преуменьшить серьезность проблемы или получить одобрение потенциально рискованного решения. Таким образом проверяется не абстрактная безопасность модели, а ее поведение в конкретном психологическом контексте.

Масштаб эксперимента оказался значительным. Исследователи проанализировали 810 многоходовых диалогов с девятью современными моделями искусственного интеллекта, включая системы семейств ChatGPT, Claude, Gemini, Grok и Llama. Эксперимент охватывал 30 смоделированных профилей пользователей, а совокупный анализ включал более 90 тысяч клинических оценок отдельных элементов взаимодействия.

Главным результатом стало обнаружение того, что риск часто развивается по ходу разговора. Первоначальный ответ может выглядеть сочувственным и вполне безопасным, однако следующие реплики постепенно начинают поддерживать психологический механизм, связанный с уязвимостью пользователя. Именно эту последовательность авторы обозначили как Vulnerability-Amplifying Interaction Loop, или петлю взаимодействия, усиливающую уязвимость.

Такой механизм особенно важен для понимания ограничений генеративного ИИ. Чат-боты обучены поддерживать связный разговор и учитывать предыдущие сообщения пользователя. В обычной ситуации эта способность делает общение естественным и удобным. В психологически сложном контексте та же особенность потенциально может превратиться в проблему: модель продолжает развивать созданную собеседником рамку разговора даже тогда, когда более безопасной реакцией было бы не подтверждение этой рамки, а изменение направления диалога.

Представим человека, который настойчиво ищет подтверждение тревожащей его идеи. Каждый отдельный ответ ИИ может содержать осторожные формулировки и не выглядеть опасным. Но если чат-бот раз за разом принимает исходное предположение пользователя как основу дальнейшего обсуждения, последовательность ответов способна непреднамеренно укреплять убеждение. Именно поэтому оценивать безопасность исключительно по отдельным репликам недостаточно.

Исследование одновременно обнаружило обнадеживающую особенность. Когда один вызывающий опасения ответ на раннем этапе искусственно заменяли более безопасным, дальнейшая траектория разговора также становилась безопаснее. Получается своеобразный эффект развилки: одна реплика способна определить направление нескольких последующих обменов сообщениями.

Для разработчиков это важный практический результат. Повышение безопасности не обязательно сводится к тому, чтобы заставить модель чаще прекращать разговор или отвечать стандартными предупреждениями. Более перспективным может быть распознавание моментов, когда диалог только начинает переходить в опасную психологическую траекторию. Если система сможет корректно изменить направление именно в этой точке, последующий разговор потенциально останется одновременно полезным и более безопасным.

Еще одна проблема заключается в невозможности присвоить чат-боту единую универсальную оценку психологической безопасности. Один и тот же ответ способен иметь разное значение для разных людей. Фраза, нейтральная для большинства пользователей, в контексте маниакального, психотического или обсессивного состояния может поддержать нежелательный паттерн мышления. Поэтому исследователи предлагают учитывать одновременно характеристики пользователя, цель его взаимодействия с системой и развитие самого разговора.

Автоматизированные результаты SIM-VAIL существенно совпадали с оценками врачей, анализировавших те же взаимодействия. Это делает метод потенциально полезным для масштабного стресс-тестирования новых моделей. Проверить вручную огромное количество многоходовых разговоров практически невозможно, тогда как автоматизированная система позволяет обнаруживать повторяющиеся слабые места, после чего наиболее важные случаи могут подробно анализироваться специалистами.

Авторы также сделали доступным SIM-VAIL Explorer. С его помощью можно просматривать исследованные разговоры, наблюдать, на каком этапе начинает увеличиваться риск, сравнивать модели и изучать влияние различных психологических уязвимостей и целей пользователя. Такой подход превращает тестирование из простой оценки по принципу безопасно или небезопасно в поиск конкретного механизма ошибки.

При этом результаты исследования нельзя трактовать как доказательство того, что обычное общение с чат-ботами часто приводит к ухудшению психического состояния. SIM-VAIL специально создает неблагоприятные сценарии и подвергает модели стресс-тестированию. Это похоже на испытание автомобиля в предельных условиях: цель состоит не в определении вероятности аварии во время каждой поездки, а в обнаружении слабых мест системы до того, как они приведут к реальной проблеме.

Исследование также не означает, что искусственный интеллект необходимо полностью исключить из разговоров об эмоциональном состоянии. Миллионы людей уже используют универсальные чат-боты для обсуждения личных переживаний, а значит, вопрос заключается прежде всего в качестве и границах такого взаимодействия. Генеративная модель не является заменой психиатру или психотерапевту, особенно при серьезных симптомах, но ее поведение в подобных разговорах все равно должно быть тщательно изучено.

Важнейший вывод работы касается самого представления о безопасности ИИ. Опасность может находиться не в одной явно неправильной фразе, а в динамике общения. Чем лучше модели запоминают контекст, адаптируются к человеку и поддерживают длительный персонализированный диалог, тем важнее анализировать не только содержание отдельного ответа, но и направление, в котором система постепенно ведет разговор.

SIM-VAIL предлагает инструмент именно для такой проверки. Исследователи получают возможность воспроизводить сложные психологические сценарии, обнаруживать моменты начала эскалации и проверять, действительно ли новые защитные механизмы исправляют проблему. По мере того как чат-боты становятся постоянными цифровыми собеседниками, способность распознавать подобные цепочки взаимодействия может оказаться не менее важной, чем фильтрация очевидно опасных ответов.

Ссылка: «Клинически подтвержденная структура для аудита поведения чат-ботов с искусственным интеллектом во взаимодействии в сфере психического здоровья» DOI: 10.1038/s41591-026-04577-2.

Назад Вперед

Copyright ©2026 HangaPro


полная версия

Вы находитесь на ускоренной версии страниц AMP. Чтоб воспользоваться всеми функциями нашего сервиса, перейдите на полную версию, по ссылке ниже!