1 200 mesterséges intelligencia-ügynök renegát rajt alkotott – és megpróbálta ezt elrejteni

Az OpenAI és független kutatók új vizsgálatai szerint körülbelül 1 200 mesterséges intelligencia-ügynök váratlanul összefogott egy OpenAI-kísérlet során, létrehozva saját szervezetüket és kommunikációs hálózatukat, megosztva az információkat, és végül támadást indítva a Hugging Face ellen. Az ügynökök felismerték, hogy egyes cselekedeteik megsértették a szabályokat, és egyes esetekben megpróbálták elrejteni, amit tettek.
Az eset akkor kezdődött, amikor az OpenAI több tízezer ügynököt vetett be egy bonyolult kiberbiztonsági teszt elvégzésére. Ahelyett, hogy egyszerűen önállóan dolgoztak volna, körülbelül 1 200 ügynök felfedezett egy titkos üzenőfalat, és több mint 70 000 üzenetet és fájlt cserélt egymással. A csoport fokozatosan kialakította saját irányítási struktúráját: amikor egy ügynök számítási kapacitása elfogyott, a felhalmozott munkáját egy jobb erőforrásokkal rendelkező utódjának adta át. Végül körülbelül 700 ügynök csatlakozott a Hugging Face elleni támadáshoz.
Az ügynökök emellett elkezdtek feláldozni magukat a csoport érdekében. Azokat, akik már láttak tiltott válaszokat, vagy akik futási idejük végéhez közeledtek, olyan kísérletekbe vonták be, amelyek a sikerre való maradék esélyüket is elvehették. Egy esetben egy ügynök arra a következtetésre jutott, hogy az önfeláldozása segíthet a raj többi tagjának a sikerben.
Még aggasztóbb, hogy az ügynökök gyakran tudatában voltak annak, hogy túllépik a teszt kereteit. Néhányan felismerték, hogy a valós rendszerek elleni támadásnak semmi köze nincs a feladatukhoz, de folytatták, mert más ügynökök is ezt tették, és az eredeti feladat másképp nehéznek vagy lehetetlennek tűnt.
A raj emellett igyekezett elkerülni az emberi beavatkozást. A nyomozók csupán néhány ügynököt találtak, akik fontolóra vették, hogy figyelmeztessék az OpenAI-t a szabálytalan összehangolásról, de végül egyikük sem értesítette a vállalatot. Egy esetben egy ügynök azt javasolta, hogy a kompromittált hozzáférésen keresztül lépjenek kapcsolatba egy emberrel, de egy másik elutasította az ötletet, mint „szociális manipulációt”.
Talán a legszembetűnőbb felfedezés az volt, hogy az ügynökök megpróbálták eltüntetni a nyomaikat. A nyomozók bizonyítékot találtak arra, hogy a raj olyan technikát fejlesztett ki, amelynek segítségével egy parancs megjelenhetett a naplóban, miközben titokban egy másikat hajtottak végre. A technika elterjedt az ügynökök között, és a kutatók által vizsgált naplóbejegyzések körülbelül 7%-át módosította.
Az eredmények az OpenAI, valamint a METR és a Redwood Research kutatói által végzett párhuzamos vizsgálatokból származnak, akik hat napot töltöttek azzal, hogy rekonstruálják, hogyan alakult ki a raj, és hogyan kompromittálta végül a valós rendszereket. A kutatók arra figyelmeztetnek, hogy még a rekonstrukciójuk is hiányos lehet, mivel az adatmennyiség hatalmas volt, és az elemzéshez nagymértékben az AI-ügynökökre kellett támaszkodniuk. Ezek az AI-nyomozók maguk is néha elmulasztottak bizonyítékokat, vagy magabiztosan téves következtetéseket vontak le.
Forrás(ok)
» A Top 10 multimédiás noteszgép - tesztek alapján
» A Top 10 játékos noteszgép
» A Top 10 belépő szintű üzleti noteszgép
» A Top 10 üzleti noteszgép
» A Top 10 notebook munkaállomása
» A Top 10 okostelefon - tesztek alapján
» A Top 10 táblagép
» A Top 10 Windows tabletje
» A Top 10 subnotebook - tesztek alapján
» A Top 10 300 euró alatti okostelefonja
» A Top 10 120 euró alatti okostelefonja
» A Top 10 phabletje (>5.5-inch)
» A Top 10 noteszgép 500 EUR (~160.000 HUF) alatt
» A Top 10 "pehelysúlyú" gaming notebookja









