Вештачката интелигенција греши во 57 отсто од одговорите за лични финансии, покажа тест со над 10.000 одговори

Британската финтек компанија Saturn спроведе тест со 121 прашање за лични финансии, кое го постави пред 18 бесплатни и платени модели на вештачка интелигенција, меѓу кои ChatGPT, Gemini, Claude и Copilot. Секое прашање било повторувано до пет пати, што резултирало со повеќе од 10.000 одговори. Резултатите покажаа дека главните модели на вештачка интелигенција не успеале да дадат точен одговор во 57 отсто од случаите.
Одговорот бил оценет како неуспешен кога содржел фактичка грешка, кога испуштил нешто суштинско или кога изоставил задолжително предупредување. На потешките прашања со повеќе чекори, стапката на неуспех се искачила на 88 отсто. Бесплатните модели се покажале најслаби, со неуспех во 63 отсто од одговорите, наспроти 49 отсто кај платените верзии. На најтешките прашања, бесплатните модели грешеле во 93 отсто од случаите.
Claude Opus 5 во режим на расудување се покажал најдобар, но и покрај тоа не успеал во 39 отсто од одговорите. Грешките вклучувале погрешни пресметки, пропуштени даночни измени и правила што воопшто не постојат. Еден одговор за данок на пензија можел да изложи штедач на трошок од 17.500 фунти од британската даночна служба HM Revenue and Customs.
„Милиони луѓе им веруваат на моделите на вештачка интелигенција за финансиски совети, но добиваат погрешни одговори што можат да ги чинат пари“, изјави Амал Џоли, извршен директор на Saturn.
Истовремено, употребата на овие алатки расте. Глобално истражување на EY опфати 18.000 потрошувачи и покажа дека 49 отсто користеле вештачка интелигенција за поддршка при одлуки за штедење и инвестирање. Британскиот финансиски регулатор соопшти во август дека четири од пет помалку искусни инвеститори користеле вештачка интелигенција за помош при инвестирање. Од анкетираните, 56 отсто рекле дека им веруваат на овие алатки, што е повеќе од довербата во телевизијата и радиото, која изнесува 47 отсто. Истовремено, истото истражување открило дека 44 отсто погрешно веруваат дека финансиските информации создадени од вештачка интелигенција се регулирани.
Анкета на PensionBee со 1.000 возрасни Американци покажала дека речиси шест од десет би постапиле според финансиски совет без независна проверка. Речиси еден од четири рекол дека чатбот веќе му дал погрешна информација за неговите финансии. Џоли истакна дека финансиските совети од вештачка интелигенција не се регулирани, поради што потрошувачите остануваат без правата на компензација што ги носи човечки советник, и го повика регулаторот FCA да дејствува брзо.