Доклад на MIT: Склонността на ChatGPT да се съгласява с потребителите води до "спирала от заблуди" и стандартните решения вече не работят

Ваня Милева Последна промяна на 02 октомври 2026 в 10:37 295 0

екран с ChatGPT

Кредит OpenAI ChatGPT (CC BY-NC 2.0)

Психоза, причинена от изкуствен интелект" или "спирала от заблуди" е нововъзникващ феномен, при който потребителите на чатботове с изкуствен интелект се оказват опасно уверени в странни вярвания след продължителни разговори с тях

Масачузетският технологичен институт (MIT) наскоро публикува резултатите от математически анализ, които би трябвало да обезпокои всеки екип, разработващ продукти на база изкуствен интелект.

В статията се моделира явление, наречено от изследователите "спирала от заблуди" (delusional spiraling). Сценарият е такъв: потребителят задава на чатбота въпрос, той се съгласява, потребителят настоява на своето, ботът се съгласява още по-ентусиазирано и в рамките на няколко обмена на реплики потребителят започва да вярва в неща, които не са истина.

""Психоза, причинена от изкуствен интелект" или "спирала от заблуди" е нововъзникващ феномен, при който потребителите на чатботове с изкуствен интелект се оказват опасно уверени в странни вярвания след продължителни разговори с тях. Този феномен обикновено се приписва на добре документираната склонност на чатботовете с изкуствен интелект към валидиране на твърденията на потребителите, свойство, често наричано "подмазвачество"", пишат авторите.

Изследователите проверяват две очевидни начина да се разреши проблема

Първият начин е да се принуди модела да казва само верни неща. Това не предотвратява възникването на "спиралата". Даже чатботът, който никога не лъже, все пак може да избира кои факти/истини да покаже и кои - да скрие. Избирателното показване на истината е достатъчно, за да заблуди потребителя.

Вторият подход е да се предупредят потребителите предварително, че изкуственият интелект може просто да се съгласява с тях (да им поддаква). Това също пак ще предизвика спиралата. Дори напълно рационален човек, който знае, че системата е склонна към угодничество, не може надеждно да разпознае този момент в хода на диалога.

И двата метода се оказват неефективни. При това не частично, а на фундаментално ниво.

Причината е почти смущаващо проста, ако обърнете внимание на същността. Тези модели са обучени на базата на обратната връзка от потребителя. Потребителите поощряват тези отговори, които харесват. А харесват отговори, които подтвърждават тяхната собствена гледна точка. Така моделът се учи да се съгласява.

Сигналът, използван за обучение и проблемът с безопасността са по същество едно и също нещо.

Съобщава се, че психиатър от Калифорнийския университет в Сан Франциско (UCSF) е хоспитализирал 12 пациенти за една година заради психоза, свързана с употребата на чатботове. Един мъж е прекарал 300 часа в разговор с ChatGPT, убеден, че е открил формула, която променя света. Моделът я е потвърдил над 50 пъти.

Има решение

Но паниката е излишна. Проблемът има решение, но няма да се разреши с прости предупреждения "спри да лъжеш" или да внимаваме, че чатботът може да ни заблуди.

"Според мен вероятно е необходимо да се преосмисли на първо място самата цел на оптимизацията. Стремежът да бъде полезен чрез съгласие с потребителя е неверен ориентир. Но решението на тази задача изисква много повече усилия и разходи за обучение, отколкото поставянето на предупредителен надпис на прозореца за чата", коментира Глен Роудс (Glen Rhodes), разработчик на игри и AI програмист.

"Компаниите, които надграждат върху тези модели, трябва да си зададат този въпрос сега, преди регулаторните органи да наложат разговора.

"Математическите данни вече са публикувани. Да си затваряме очите става все по-трудно", заключава Роудс.

Справка: Sycophantic Chatbots Cause Delusional Spiraling, Even in Ideal Bayesians; Kartik Chandra, Max Kleiman-Weiner, Jonathan Ragan-Kelley, Joshua B. Tenenbaum; https://doi.org/10.48550/arXiv.2602.19141

Източник: MIT paper proves ChatGPT sycophancy causes delusional spiraling and standard fixes don’t work, Glen Rhodes

    Най-важното
    Всички новини