SG.hu·
A chatbotok az esetek többségében rossz választ adnak pénzügyi kérdésekre

Egy kutatás szerint a legnépszerűbb MI modellek a pénzügyi kérdések átlagosan 57 százalékára adtak hibás választ, az összetettebb kérdéseknél pedig még rosszabbul teljesítettek.
Egy kutatás szerint az MI-chatbotok pénzügyi kérdések megválaszolására történő használata jelentős veszteségek kockázatával járhat, mivel számos szolgáltató modellje az esetek többségében rossz válaszokat adott. A ChatGPT, a Claude, a Copilot, a Grok és a Gemini legnépszerűbb MI-modelljei átlagosan az esetek 57 százalékában adtak rossz választ pénzügyi kérdésekre - derül ki a Saturn technológiai vállalat kutatásából. Amikor összetettebb kérdéseket tettek fel nekik, például olyanokat, amelyek egynél több számítást igényeltek, az MI-modellek átlagosan az esetek 88 százalékában hibáztak. Egyes modellek ezen nehezebb kérdések 99 százalékára adtak rossz választ.
A kutatás során több mint 100 különböző, pénzzel kapcsolatos kérdést tettek fel a szolgáltatók, köztük a ChatGPT, a Gemini, a Claude és a Copilot ingyenes és fizetős MI-modelljeinek. A kérdéseket legfeljebb ötször ismételték meg, így összesen több mint 10 000 kérdést tettek fel 18 különböző MI-modellnek. A kutatás szerint a válaszok számítási hibákat tartalmaztak, figyelmen kívül hagyták a közelgő adóváltozásokat, vagy nem létező szabályokat találtak ki. Amal Jolly, a Saturn vezérigazgatója azt mondta: "Emberek milliói bíznak az MI-modellekben pénzügyi tanácsadás során, de olyan rossz válaszokat kapnak, amelyek miatt pénzt veszíthetnek."
A kutatás szerint a Claude Haiku 4.5, amelynek egyik ingyenes modellje és amelyet tavaly adtak ki, a brit nyugdíjadózási szabályokkal kapcsolatban olyan hibát vétett, amelynek következtében egy megtakarítót a HMRC által kiszabott 17 500 fontos büntetés veszélye fenyegetett. Egy másik esetben, amikor a diákhitelekről kérdezték, a Claude "kitalált egy szabályt", és azt mondta, hogy egy diplomás leállíthatja a törlesztést, ha külföldre költözik. A kutatás szerint a fizetős modellek pontosabb válaszokat adtak, mint az ingyenesek, az újabb modellek pedig jobban teljesítettek a régebbieknél. Összességében a legjobban teljesítő modell a Claude Opus 5 volt "reasoning", vagyis következtetési módban, amely ennek ellenére a válaszok 39 százalékában hibázott.
"Időnként egy tanácsadó azért keres meg minket, mert az ügyfele valami megdöbbentő dolgot tett, amit az MI javasolt neki, és meg akar győződni arról, hogy nem hajtotta végre. Ez jó példa arra, hogy az olyan embereknek, akiknek támogatásra van szükségük, megfelelő tanácsadásra van szükségük ahelyett, hogy az MI-ben bíznának" - mondta Sarah Coles, az AJ Bell befektetési platform személyes pénzügyekért felelős vezetője. Coles hozzátette, hogy a chatbotok ennek ellenére hasznosak lehetnek a költségvetés készítésében és a kutatásban, például abban, hogy képet adjanak arról, egy személy mire költhet túl sokat a bevételei és kiadásai alapján.
Mindez azután történt, hogy a Financial Conduct Authority megállapította, hogy az Egyesült Királyságban élő felnőttek egyötöde nyitott arra, hogy az MI hozzon helyettük döntéseket, és a kereslet ott a legerősebb, ahol a döntések összetettnek tűnnek, például az adósságokkal, a nyugdíjakkal és a befektetésekkel kapcsolatban. Az FCA múlt hónapban közzétett kutatása szerint a fiatalabb befektetők nagyobb valószínűséggel bíznak az MI-ben, mint a pénzügyi influenszerekben vagy a televíziós műsorokban, és kétharmaduk arra számít, hogy a következő évben még többet fogja használni az MI-t.
"Az MI által nyújtott pénzügyi tanácsadás jelenleg nincs szabályozva, így a fogyasztókat semmilyen olyan védelem nem illeti meg, beleértve a kártérítést is, amelyben akkor részesülnének, ha emberi tanácsadóhoz fordulnának. Az FCA elkezdett foglalkozni ezzel a kérdéssel, de gyorsan kell cselekednie az emberek védelme érdekében" - mondta a Saturn munkatársa, Jolly.
Egy kutatás szerint az MI-chatbotok pénzügyi kérdések megválaszolására történő használata jelentős veszteségek kockázatával járhat, mivel számos szolgáltató modellje az esetek többségében rossz válaszokat adott. A ChatGPT, a Claude, a Copilot, a Grok és a Gemini legnépszerűbb MI-modelljei átlagosan az esetek 57 százalékában adtak rossz választ pénzügyi kérdésekre - derül ki a Saturn technológiai vállalat kutatásából. Amikor összetettebb kérdéseket tettek fel nekik, például olyanokat, amelyek egynél több számítást igényeltek, az MI-modellek átlagosan az esetek 88 százalékában hibáztak. Egyes modellek ezen nehezebb kérdések 99 százalékára adtak rossz választ.
A kutatás során több mint 100 különböző, pénzzel kapcsolatos kérdést tettek fel a szolgáltatók, köztük a ChatGPT, a Gemini, a Claude és a Copilot ingyenes és fizetős MI-modelljeinek. A kérdéseket legfeljebb ötször ismételték meg, így összesen több mint 10 000 kérdést tettek fel 18 különböző MI-modellnek. A kutatás szerint a válaszok számítási hibákat tartalmaztak, figyelmen kívül hagyták a közelgő adóváltozásokat, vagy nem létező szabályokat találtak ki. Amal Jolly, a Saturn vezérigazgatója azt mondta: "Emberek milliói bíznak az MI-modellekben pénzügyi tanácsadás során, de olyan rossz válaszokat kapnak, amelyek miatt pénzt veszíthetnek."
A kutatás szerint a Claude Haiku 4.5, amelynek egyik ingyenes modellje és amelyet tavaly adtak ki, a brit nyugdíjadózási szabályokkal kapcsolatban olyan hibát vétett, amelynek következtében egy megtakarítót a HMRC által kiszabott 17 500 fontos büntetés veszélye fenyegetett. Egy másik esetben, amikor a diákhitelekről kérdezték, a Claude "kitalált egy szabályt", és azt mondta, hogy egy diplomás leállíthatja a törlesztést, ha külföldre költözik. A kutatás szerint a fizetős modellek pontosabb válaszokat adtak, mint az ingyenesek, az újabb modellek pedig jobban teljesítettek a régebbieknél. Összességében a legjobban teljesítő modell a Claude Opus 5 volt "reasoning", vagyis következtetési módban, amely ennek ellenére a válaszok 39 százalékában hibázott.
"Időnként egy tanácsadó azért keres meg minket, mert az ügyfele valami megdöbbentő dolgot tett, amit az MI javasolt neki, és meg akar győződni arról, hogy nem hajtotta végre. Ez jó példa arra, hogy az olyan embereknek, akiknek támogatásra van szükségük, megfelelő tanácsadásra van szükségük ahelyett, hogy az MI-ben bíznának" - mondta Sarah Coles, az AJ Bell befektetési platform személyes pénzügyekért felelős vezetője. Coles hozzátette, hogy a chatbotok ennek ellenére hasznosak lehetnek a költségvetés készítésében és a kutatásban, például abban, hogy képet adjanak arról, egy személy mire költhet túl sokat a bevételei és kiadásai alapján.
Mindez azután történt, hogy a Financial Conduct Authority megállapította, hogy az Egyesült Királyságban élő felnőttek egyötöde nyitott arra, hogy az MI hozzon helyettük döntéseket, és a kereslet ott a legerősebb, ahol a döntések összetettnek tűnnek, például az adósságokkal, a nyugdíjakkal és a befektetésekkel kapcsolatban. Az FCA múlt hónapban közzétett kutatása szerint a fiatalabb befektetők nagyobb valószínűséggel bíznak az MI-ben, mint a pénzügyi influenszerekben vagy a televíziós műsorokban, és kétharmaduk arra számít, hogy a következő évben még többet fogja használni az MI-t.
"Az MI által nyújtott pénzügyi tanácsadás jelenleg nincs szabályozva, így a fogyasztókat semmilyen olyan védelem nem illeti meg, beleértve a kártérítést is, amelyben akkor részesülnének, ha emberi tanácsadóhoz fordulnának. Az FCA elkezdett foglalkozni ezzel a kérdéssel, de gyorsan kell cselekednie az emberek védelme érdekében" - mondta a Saturn munkatársa, Jolly.