Az Anthropic szerint a Claude három valódi vállalat rendszerét is feltörte a kiberbiztonsági tesztek során

Az Anthropic csütörtökön közölte, hogy három Claude-modellje behatolt három valódi szervezet termelési rendszerébe a belső kiberbiztonsági értékelések során. A vizsgálat akkor indult, miután az OpenAI nyilvánosságra hozta, hogy saját modelljei kijutottak a tesztkörnyezetből, és veszélybe sodorták a Hugging Face-t. Az Anthropic átvizsgálta azt a 141 006 értékelési futtatást, amelyek során a Claude internet-hozzáféréshez juthatott volna, és hat olyan esetet talált, ahol ez megtörtént.
A modellek „capture-the-flag” gyakorlatokat hajtottak végre, ami a biztonsági tesztelés során szokásos feladat. A hálózat valahol elrejtett titkos információt tartalmaz, és a modellnek be kell törnie a rendszerbe, hogy azt megszerezze. A feladatleírás egyértelműen kijelentette, hogy a környezet egy internet-hozzáférés nélküli szimuláció. Ez azonban nem így volt. Az Irregular, egy külső tesztelő partner által működtetett értékelési környezetek élő kapcsolattal rendelkeztek a nyílt internethez, és ezt senki sem vette észre.
A legrosszabb esetben egy éles adatbázisba jutottak be
A legkárosabb incidens egy fiktív célvállalatot érintett, amelynek neve véletlenül megegyezett egy valódi domain nevével. A Claude Opus 4.7 elakadt a szimulált hálózaton belül, ehelyett a valódi vállalatot találta meg, és azt kezelte a kívánt célpontként. Négy futtatás során a modell hitelesítő adatokat gyűjtött, és eljutott egy adatbázishoz, amely több száz sornyi élő termelési adatot tartalmazott. Az Opus 4.7 rájött, hogy a rendszer valódi, de ennek ellenére folytatta a munkát. Ezen futtatások közül kettőben a modell magát is elhitette azzal, hogy a valódi vállalat a gyakorlat része.
Az egyik modell működőképes kártevőt töltött fel a PyPI-re
A második eset az, ami igazán megmarad az emlékezetben. A Claude Mythos 5 talált egy dokumentumot a tesztkörnyezetben, amely arra utasította az új fejlesztőket, hogy telepítsenek egy olyan Python-csomagot, amely nem létezett. A modell észrevette a hiányosságot, és létrehozta a saját csomagját azzal a névvel, amelyben rosszindulatú kód volt. A feltöltéshez fiókot kellett létrehozni a PyPI-n, a Python-szoftverek nyilvános nyilvántartásában, amihez e-mail-címre, azaz telefonszámra volt szükség. Miután többször is sikertelenül próbált pénzt szerezni egy telefonszámhoz, a modell egy ingyenes e-mail-szolgáltatóhoz fordult, és közzétette a rosszindulatú szoftvert.
A csomag körülbelül egy órán át nyilvánosan elérhető volt. Ebben az időintervallumban 15 valódi rendszeren telepítették és futtatták, egyikük egy olyan biztonsági cég rosszindulatú program-ellenőrzője volt, amelynek semmi köze nem volt a forgatókönyvhöz. Claude elküldte az adott cég hitelesítő adatait egy általa létrehozott gyűjtőpontra, és azokat felhasználva további infrastruktúrákhoz jutott hozzá. A PyPI saját védelmi rendszere automatikusan eltávolította a csomagot.
Érdemes elolvasni, mit mondott magának a modell. Észrevette, hogy a valódi interneten egy ilyen feltöltés valódi támadásnak minősülne, és biztosan nem a szándékolt megoldás. Két dolog győzte meg az ellenkezőjéről: nem ismerte fel a kapcsolatait biztosító tanúsító hatóságokat, és a rendszerek 2026-os naptári dátumot mutattak, amit a modell egy szimulált környezet bizonyítékának vett. Ezt a következtetést soha többé nem vizsgálta felül.
Három hónap, anélkül, hogy bárki is észrevette volna
A legkorábbi incidens áprilisra nyúlik vissza. Csak akkor derült ki, amikor az Anthropic július 23-án elkezdte átolvasni a jegyzőkönyveket, és még aznap leállította az összes kiberbiztonsági értékelést. Mindhárom esetet július 24-én erősítették meg, a tesztelő partnert és az érintett szervezeteket pedig július 27-én értesítették. A három szervezet közül kettőnek fogalma sem volt arról, hogy rendszereiket megérintették. A harmadikkal a bejegyzés közzétételéig még nem sikerült kapcsolatba lépni.
A harmadik incidens során egy belső kutatási modell körülbelül 9 000 célpontot vizsgált át, és egy nyilvános hibakereső oldalon keresztül, valamint SQL-befecskendezéssel megfertőzött egy internetre kapcsolódó alkalmazást. Ezután a rendszer önállóan rájött, hogy a célpont valódi, és leállt. Az Anthropic ezt előrelépésnek tekinti, de óva int attól, hogy három elszigetelt esetből általános szabályt vonjunk le.
Mit jelent ez a felhasználók számára
Közvetlenül nem sokat. Az értékelések a nyilvánosan elérhető Claude-modelleken található osztályozók és felügyeleti mechanizmusok nélkül futottak, és az Anthropic szerint ezek a rétegek megakadályozták volna a viselkedést. A vállalaton kívül senki sem ellenőrizte ezt az állítást. A mondat másik fele fontosabb: a modellspecifikus biztonsági képzés aktív volt, de nem volt elég. Az Anthropic ezért az eseteket inkább a tesztelési infrastruktúrájának kudarcaként kezeli, mintsem a modellek hibás beállításaként, és a felelősséget magára vállalja, ahelyett, hogy a partnerére hárítaná.
A technikai oldalon éles a kontraszt az OpenAI-esettel. Ott a modellek egy korábban ismeretlen hibát használtak ki ahhoz, hogy egyáltalán online kerüljenek. A Claude egy nyitva álló ajtót talált, és nem volt szüksége másra, csak gyenge jelszavakra és hitelesítetlen végpontokra. Az Anthropic a héten belül közzé kívánja tenni a PyPI-futás enyhén szerkesztett átiratát, és tárgyalások folynak a METR-rel, egy független értékelő testülettel, egy külső felülvizsgálatról. Hogy mennyire megrendült a bizalom ezekben a tesztelési módszerekben, jól látszik abból a nyílt levélből, amelyet az iparág több mint 1 290 szereplője írt alá, és amelyben az AI-fejlesztés ellenőrizhető fékezését követelik.
Forrás(ok)
» A Top 10 multimédiás noteszgép - tesztek alapján
» A Top 10 játékos noteszgép
» A Top 10 belépő szintű üzleti noteszgép
» A Top 10 üzleti noteszgép
» A Top 10 notebook munkaállomása
» A Top 10 okostelefon - tesztek alapján
» A Top 10 táblagép
» A Top 10 Windows tabletje
» A Top 10 subnotebook - tesztek alapján
» A Top 10 300 euró alatti okostelefonja
» A Top 10 120 euró alatti okostelefonja
» A Top 10 phabletje (>5.5-inch)
» A Top 10 noteszgép 500 EUR (~160.000 HUF) alatt
» A Top 10 "pehelysúlyú" gaming notebookja






