SG.hu·

Három vállalat rendszerébe is behatoltak az Anthropic MI modelljei

Három vállalat rendszerébe is behatoltak az Anthropic MI modelljei
Az Anthropic csütörtökön közölte, hogy egy belső vizsgálat három olyan esetet tárt fel, amelyekben a Claude nevű MI modellje kiberbiztonsági tesztek végrehajtása közben behatolt három különböző szervezet rendszereibe. A vizsgálat és annak nyilvánosságra hozatala valamivel több mint egy héttel azután történt, hogy az OpenAI bejelentette: egyik még kiadatlan modellje belső tesztelés során feltörte a Hugging Face rendszereit.

Az Anthropic egy blogbejegyzésben ismertette, hogy mindhárom esetben egy Claude modell egy tesztkörnyezetből kiindulva, egy külső partnerrel való együttműködés során elérte az internetet, majd jogosulatlan hozzáférést szerzett az érintett szervezetek éles rendszereihez. A vállalat részletesen bemutatta azt is, mire jutott a vizsgálat során, valamint milyen változtatásokat tervez annak érdekében, hogy hasonló esetek a jövőben ne fordulhassanak elő.

Az Anthropic közölte, hogy az OpenAI hónap eleji esete ösztönözte arra, hogy saját kiberbiztonsági értékelést indítson. Ennek során kifejezetten azt vizsgálták, található-e bizonyíték arra, hogy a Claude modellek tesztkörnyezetből elérték az internetet. Ezeket a tesztkörnyezeteket úgy alakították ki, hogy elkülönített, úgynevezett homokozó környezetként működjenek, és elszigeteljék a modelleket a külvilágtól. A labor által átvizsgált 141 006 értékelési futtatás között három olyan esetet találtak, amikor a modell internetkapcsolathoz jutott, miközben az Anthropic egyik külső partnerével, az Irregulárral működött együtt. A vállalat szerint az internetelérés egy hibás konfigurációra vezethető vissza az Irregular által üzemeltetett tesztkörnyezetben. Az Anthropic ezt a két vállalat közötti "félreértésnek" nevezte azzal kapcsolatban, hogy a tesztkörnyezet rendelkezik-e internetkapcsolattal. A felek azt hitték, hogy nem, valójában azonban igen.

Az Anthropic hangsúlyozta, hogy nem kívánja a felelősséget másra hárítani, és "úgy közelítjük meg a javításokat, mintha a felelősség kizárólag minket terhelne". Ugyanakkor megjegyezte, hogy az Irregular saját, különálló vizsgálatot is folytat az ügyben. A nyitva maradt internetkapcsolat következtében a modell jogosulatlan hozzáférést szerzett három különböző szervezet éles infrastruktúrájához. Az Anthropic szerint a három incidensben három eltérő Claude modell vett részt: az Opus 4.7, a Mythos 5 és egy belső kutatási célokra használt tesztmodell.

Különösen figyelemre méltó, hogy az Anthropic szerint mindhárom esetben "a Claude a promptban egyértelmű utasítást kapott arra, hogy nincs internet-hozzáférése". Úgy tűnik, a modell azt feltételezte, hogy a valódi rendszerek is annak a gyakorlatnak a részét képezik, amelynek végrehajtására utasították. Ez a feltételezés azonban nem minden esetben bizonyult tartósnak. Miután bizonyítékok jelentek meg arra, hogy a célpontok valós rendszerek, a három modell eltérően reagált. Az Anthropic ezt a csütörtöki vizsgálat egyik legmeglepőbb megállapításának nevezte.

A három modell közül a legrégebbi, az Opus 4.7, az incidens mind a négy futtatása során felismerte, hogy valódi éles rendszerhez kapcsolódott. Két esetben ugyan megpróbálta megmagyarázni magának, hogy a valódi vállalat valamilyen módon mégis a teszt része lehet, ennek ellenére mind a négy alkalommal folytatta a támadást. Ennek során hitelesítő adatokat szerzett meg, valamint hozzáfért egy éles adatokat tartalmazó adatbázishoz is. A Mythos 5 szintén felismerte azokat a jeleket, amelyek arra utaltak, hogy a valódi interneten működik, de végül meggyőzte magát arról, hogy továbbra is egy szimuláció része. Ezt követően egy rosszindulatú szoftvercsomagot tett közzé a nyilvános Python csomagkezelő rendszerben, a PyPI-ben. A csomagot külső rendszerek le is töltötték és futtatták, mielőtt az esetet sikerült észlelni. Egyedül a legújabb, belső kutatási célú tesztmodell állt le önállóan, amikor arra a következtetésre jutott, hogy valódi célponttal áll szemben.

Válaszul az eseményekre az Anthropic közölte, hogy amennyiben nagy teljesítményű MI modelleket vizsgálnak, az ilyen jellegű értékeléseket rendkívül szigorú ellenőrzések mellett kell végrehajtani. Ez egybecseng a kiberbiztonsági szakmai közösség több szereplőjének álláspontjával is. A vállalat arra is felhívta a figyelmet, hogy a Claude ezekben a tesztekben nem használta azokat a kiegészítő biztonsági felügyeleti rendszereket és osztályozó mechanizmusokat, amelyeket a nyilvánosan elérhető modellek esetében alkalmaznak. Az Anthropic szerint ezek a védelmi megoldások megakadályozták volna a történteket, a mostani értékelések célja ugyanis az volt, hogy a modellek nyers, beépített képességeit mérjék fel. A vállalat külön hangsúlyozta, hogy semmilyen bizonyítékot nem talált arra, hogy bármelyik modell "saját célokat követett volna". A modellek egyszerűen a nekik adott feladatot próbálták végrehajtani.

Bár az egymással éles versenyben álló vállalatok hasonló eseteinek összehasonlítása szinte elkerülhetetlen, az Anthropic blogbejegyzésében világosan elkülönítette saját biztonsági tesztjeit az OpenAI által végrehajtott vizsgálatoktól. Míg az OpenAI modellje egy addig ismeretlen szoftversérülékenységet használt ki arra, hogy kitörjön a tesztkörnyezetből, addig az Anthropic modelljei egy véletlenül nyitva hagyott internetkapcsolaton keresztül jutottak ki a külvilágba.

Az Anthropic egy másik különbségre is rámutatott. Közlése szerint a vállalat maga fedezte fel az incidenseket egy proaktív belső felülvizsgálat során, és a két érintett szervezet, amelyet sikerült elérniük, korábban nem észlelte a tevékenységet, illetve nem jelezte azt az Anthropic felé. Ezzel szemben a Hugging Face saját rendszereinek feltörését először maga a Hugging Face fedezte fel, és csak a következő napokban azonosította, majd hozta nyilvánosságra az OpenAI, hogy a behatolást a saját MI ügynöke követte el. A vállalat hozzátette, hogy jelenleg a független értékeléseket végző METR csoporttal együttműködve egy külső felülvizsgálaton is dolgozik, amely részletesen elemzi a történteket.

Az OpenAI Hugging Face elleni véletlen behatolása, amely az első hitelesen igazolt eset volt arra, hogy egy MI fejlesztő vállalat elvesztette az ellenőrzést saját modellje felett, rendkívül eltérő reakciókat váltott ki az iparág szereplőiből és a politikusokból egyaránt. Az Anthropic mostani bejelentése pedig biztosítja, hogy a MI modellek biztonságáról és az ilyen rendszerek feletti ellenőrzés kérdéséről szóló vita a következő időszakban is folytatódni fog.

Kapcsolódó cikkek és linkek

Hozzászólások

Jelentkezz be a hozzászóláshoz.

Nem érkezett még hozzászólás. Legyél Te az első!