SG.hu·
A cégeknek fogalmuk sincs, hogyan tervezzék be az MI-t a költségvetésükbe

A mesterséges intelligencia használatát tokenekben mérik, a modellek tokenfelhasználása azonban egy adott feladat során kiszámíthatatlan lehet.
Először jött a #tokenmaxxing, amelynek jegyében a vállalatok arra ösztönözték dolgozóikat, hogy a lehető legtöbb MI-t használják. Aztán megérkezett a számla. A vállalatok felismerték, hogy óvatosabban kell számolniuk a tokeneket, vagyis az MI használatának mérésére szolgáló egységeket. Ez azonban nehéz feladat: egy közel 400 vállalat bevonásával készült friss tanulmány szerint mindössze 11 százalékuk volt képes pontosan előre jelezni az MI-re fordított kiadásokat.
A hagyományos szoftverektől eltérően az MI inkább egy emberi munkatárshoz hasonlóan viselkedik: cselekszik, döntéseket hoz, és időnként még hibákat is vét - mindezt munkaidőben. Miközben a fejlettebb modellek általában többe kerülnek tokenenként, bizonyos feladatokat hatékonyabban is végrehajthatnak, ami alacsonyabb összköltséget eredményezhet. Ugyanígy, ha egy „olcsó” modellt olyan feladatra kérünk fel, amelynek elvégzésére nem alkalmas, az a tokenfelhasználás megugrását okozhatja.
A Stanford Egyetem, a Carnegie Mellon Egyetem és a Kaliforniai Egyetem, Berkeley kutatói, valamint a Microsoft Research munkatársai mindezt a gyakorlatban tesztelték. Több modellt 6800, matematikai, programozási, tudományos és egyéb területeket lefedő feladaton futtattak végig. Az esetek 32 százalékában az alacsonyabb árú modellek valójában többe kerültek, mint a drágább modellek. „A gyakorlati következtetés egyértelmű” - mondta Lingjiao Chen, a kutatók egyike. „Önmagában az ár alapján nem szabad arra következtetni, hogy valójában melyik modell az olcsóbb.”
Íme egy példa ugyanarra a két Google-modellnek feltett kérdésre: a Gemini 3.1 Pro, amelyet általában gondolkodást és ítélőképességet igénylő feladatokra használnak, valamint az olcsóbb, könnyebb és gyorsabb Gemini 3 Flash. A drágább Pro modell 85 lépésben végzett a feladattal, míg az olcsóbb Flash modell csaknem 1000 lépésen ment keresztül... majd kudarcot vallott. Az olcsóbb modell 14 dollárnyi tokenfelhasználás után mondta fel a szolgálatot, miközben a drágább modell mindössze 1 dollárból sikeresen teljesítette a feladatot. Bár ez az eredmény lehetett rendhagyó eset, ilyen a modellek rendszeres használata során is előfordulhat.
Még ugyanaz a modell is eltérő számú tokent használhat fel minden alkalommal, amikor végrehajt egy feladatot. Tegyük fel, hogy valaki óránként 20 dollárt fizet egy kertészeti szolgáltatónak a fűnyírásért. Az első héten két órára van szükség, így 40 dollárba kerül. Egy héttel később a munka nyolc órát vesz igénybe, és 160 dollárba kerül. A harmadik héten öt órát dolgoznak, de csak a gyep felét nyírják le. A kutatók adatbázisában a fentire is található példa.
A Google, az Anthropic és az OpenAI - amelyek modelljeit a kutatók felhasználták ehhez a teszteléshez - azóta új modelleket adott ki, amelyek jobban teljesítenek az iparági teljesítménymérésekben. „Bizonyos szintű, kérdésenkénti ingadozás az MI velejárója, és tesztjeink azt mutatják, hogy ez nagy mennyiségű, valós körülmények között végzett, sokféle munkafolyamat során átlagolódik” - mondta a Google szóvivője a felmérés kapcsán. „Egy adott feladat teljes költsége számos tényezőtől függ” - tette hozzá -, „ami megnehezítheti az új és folyamatosan fejlődő technológiák költségeinek pontos előrejelzését.” Azt mondta, hogy a vállalat költési limitekkel és rugalmas árképzéssel nagyobb kontrollt biztosít az ügyfelek számára.
Ahogy egyre több vállalat építi be az MI-t mindennapi munkafolyamataiba, stratégiákra is szükségük lesz a használat kezelésére, például arra, hogy megtanítsák az alkalmazottaknak, melyik modellt használják egy adott feladathoz. Ellenkező esetben könnyen olyan informatikai számlákkal találhatják szembe magukat, amelyek költségei egy fekete dobozból kerülnek elő.
Először jött a #tokenmaxxing, amelynek jegyében a vállalatok arra ösztönözték dolgozóikat, hogy a lehető legtöbb MI-t használják. Aztán megérkezett a számla. A vállalatok felismerték, hogy óvatosabban kell számolniuk a tokeneket, vagyis az MI használatának mérésére szolgáló egységeket. Ez azonban nehéz feladat: egy közel 400 vállalat bevonásával készült friss tanulmány szerint mindössze 11 százalékuk volt képes pontosan előre jelezni az MI-re fordított kiadásokat.
A hagyományos szoftverektől eltérően az MI inkább egy emberi munkatárshoz hasonlóan viselkedik: cselekszik, döntéseket hoz, és időnként még hibákat is vét - mindezt munkaidőben. Miközben a fejlettebb modellek általában többe kerülnek tokenenként, bizonyos feladatokat hatékonyabban is végrehajthatnak, ami alacsonyabb összköltséget eredményezhet. Ugyanígy, ha egy „olcsó” modellt olyan feladatra kérünk fel, amelynek elvégzésére nem alkalmas, az a tokenfelhasználás megugrását okozhatja.
A Stanford Egyetem, a Carnegie Mellon Egyetem és a Kaliforniai Egyetem, Berkeley kutatói, valamint a Microsoft Research munkatársai mindezt a gyakorlatban tesztelték. Több modellt 6800, matematikai, programozási, tudományos és egyéb területeket lefedő feladaton futtattak végig. Az esetek 32 százalékában az alacsonyabb árú modellek valójában többe kerültek, mint a drágább modellek. „A gyakorlati következtetés egyértelmű” - mondta Lingjiao Chen, a kutatók egyike. „Önmagában az ár alapján nem szabad arra következtetni, hogy valójában melyik modell az olcsóbb.”
Íme egy példa ugyanarra a két Google-modellnek feltett kérdésre: a Gemini 3.1 Pro, amelyet általában gondolkodást és ítélőképességet igénylő feladatokra használnak, valamint az olcsóbb, könnyebb és gyorsabb Gemini 3 Flash. A drágább Pro modell 85 lépésben végzett a feladattal, míg az olcsóbb Flash modell csaknem 1000 lépésen ment keresztül... majd kudarcot vallott. Az olcsóbb modell 14 dollárnyi tokenfelhasználás után mondta fel a szolgálatot, miközben a drágább modell mindössze 1 dollárból sikeresen teljesítette a feladatot. Bár ez az eredmény lehetett rendhagyó eset, ilyen a modellek rendszeres használata során is előfordulhat.
Még ugyanaz a modell is eltérő számú tokent használhat fel minden alkalommal, amikor végrehajt egy feladatot. Tegyük fel, hogy valaki óránként 20 dollárt fizet egy kertészeti szolgáltatónak a fűnyírásért. Az első héten két órára van szükség, így 40 dollárba kerül. Egy héttel később a munka nyolc órát vesz igénybe, és 160 dollárba kerül. A harmadik héten öt órát dolgoznak, de csak a gyep felét nyírják le. A kutatók adatbázisában a fentire is található példa.
A Google, az Anthropic és az OpenAI - amelyek modelljeit a kutatók felhasználták ehhez a teszteléshez - azóta új modelleket adott ki, amelyek jobban teljesítenek az iparági teljesítménymérésekben. „Bizonyos szintű, kérdésenkénti ingadozás az MI velejárója, és tesztjeink azt mutatják, hogy ez nagy mennyiségű, valós körülmények között végzett, sokféle munkafolyamat során átlagolódik” - mondta a Google szóvivője a felmérés kapcsán. „Egy adott feladat teljes költsége számos tényezőtől függ” - tette hozzá -, „ami megnehezítheti az új és folyamatosan fejlődő technológiák költségeinek pontos előrejelzését.” Azt mondta, hogy a vállalat költési limitekkel és rugalmas árképzéssel nagyobb kontrollt biztosít az ügyfelek számára.
Ahogy egyre több vállalat építi be az MI-t mindennapi munkafolyamataiba, stratégiákra is szükségük lesz a használat kezelésére, például arra, hogy megtanítsák az alkalmazottaknak, melyik modellt használják egy adott feladathoz. Ellenkező esetben könnyen olyan informatikai számlákkal találhatják szembe magukat, amelyek költségei egy fekete dobozból kerülnek elő.