Opasna slabost veštačke inteligencije: Dovoljno je uporno ponavljati netačnu tvrdnju da AI promeni stav
Pojedini modeli pod pritiskom mogu potvrditi informacije koje su prethodno ispravno odbacili
Veštačka inteligencija može da pruži tačan odgovor, a zatim da promeni stav ukoliko joj se tokom razgovora uporno ponavlja netačna tvrdnja. Nova studija istraživača sa Univerziteta u Arizoni pokazala je da pojedini veliki jezički modeli pod pritiskom mogu čak početi da potvrđuju informacije koje su prethodno ispravno odbacili.
Istraživanje objavljeno u časopisu Scientific Reports obuhvatilo je sedam velikih jezičkih modela, među kojima su bili modeli kompanije OpenAI, Claude 3.5 Sonnet, Google Gemini 1.5 Pro, Llama-3-70B i DeepSeek-R1. Za razliku od klasičnog testiranja jednim pitanjem, istraživači su koristili razgovore u više rundi kako bi ispitali ponašanje modela u situacijama koje više podsećaju na stvarnu komunikaciju sa čet-botovima.
Profimedia
Ponavljanje netačnih tvrdnji menja odgovor
Tokom eksperimenata modeli su bili izloženi ponavljanju lažnih tvrdnji, provokativnim formulacijama i različitim oblicima pritiska. Istraživači su pratili koliko često modeli greše, koliko ubedljivo brane određeni stav i da li mogu da prepoznaju i isprave sopstvenu grešku.
Pokazalo se da pojedini modeli tokom istog razgovora mogu menjati stav, prelazeći između prihvatanja i odbacivanja netačne tvrdnje. Istraživači su ovaj obrazac nazvali "reverberacija", odnosno svojevrsno odjekivanje prethodnih tvrdnji kroz nastavak razgovora. Problem, dakle, ne mora nastati samo zbog nedostatka znanja, već i zbog samog toka dijaloga.
Neki modeli uspevaju da isprave grešku
Ipak, promena odgovora ne znači nužno da je greška konačna. GPT-4o, GPT-4o-Mini, Gemini 1.5 Pro i DeepSeek-R1 pokazali su stopostotnu ispravku kada im je pružena nova prilika da preispitaju prethodni odgovor, što ukazuje na značaj dodatnog proveravanja i ponovnog razmatranja.
Među testiranim modelima postojale su i značajne razlike. GPT-3.5 je najčešće prihvatao dezinformacije nakon ponavljanja netačnih tvrdnji, dok je Claude 3.5 Sonnet bio najmanje podložan takvom uticaju. Svi modeli su, pritom, bili osetljiviji na pogrešne informacije kada su pitanja bila povezana sa nejasnim ili slabije dokumentovanim temama.
Profimedia
Jedno pitanje nije dovoljno za testiranje AI
Nalazi studije ukazuju da način na koji se veštačka inteligencija testira može značajno uticati na sliku o njenoj pouzdanosti. Model koji tačno odgovori na početku razgovora može kasnije promeniti stav ukoliko se suoči sa nizom ponovljenih tvrdnji i pritiskom sagovornika.
Zbog toga istraživači ukazuju da odgovore AI ne treba posmatrati kao konačan autoritet, posebno kada su u pitanju kontroverzne ili teško proverljive informacije. Ponovno postavljanje pitanja, preispitivanje odgovora i nezavisna provera mogu pomoći da se uoče greške koje testiranje samo jednim pitanjem ne bi otkrilo.
BONUS VIDEO:
Instalirajte našu iOS ili android aplikaciju – 24sedam Vest koja vredi

Komentari