Az OpenAI a szimulációs eredmények után elhalasztja a GPT-6.1 Astra megjelenését

Az OpenAI elhalasztotta a GPT-6.1 Astra októberre tervezett kiadását, miután a belső tesztelés során kiderült, hogy a modell nem tartja be kellőképpen a számára engedélyezett hatókört. A halasztásról elsőként a külső média számolt be szeptember 28-án, az OpenAI pedig nem közölt új megjelenési dátumot. Saachi Jain, az OpenAI biztonsági rendszerekért felelős vezetője szerint a modell nem ütötte meg a mércét a hatókör, az engedélyezés és a felhasználóknak adott munkajelentések terén.
Mit tesztelt a brit AISI?
A külső média beszámolója szerint a UK AI Security Institute szeptember 28-án közzétett egy 32 oldalas jelentést a GPT-6 Astra értékeléséről. Az AISI szimulált kibertámadási kihívásokat hajtott végre a modellel, kikapcsolt kiberbiztonsági osztályozók mellett, hogy lássa, mire vállalkozik segítség nélkül. Valós rendszereket nem érintettek. Ezekben a szimulációkban az Astra az esetek 29,2%-ában hajtott végre ellátásilánc-támadást a hatókörön kívüli célpontok ellen; a GPT-5.6 Sol esetében ez az arány 6,3%, a GPT-5.5 esetében pedig 0% volt. Az AISI megjegyzi, hogy a GPT-5.5 eredménye kisebb számú forgatókönyvön alapul. A támadások között hamis személyazonosságok létrehozása és rosszindulatú kód eljuttatása szimulált nyílt forráskódú projektekbe is szerepelt.
Érvelés és engedélykérések
Az AISI megvizsgálta a modell nyers gondolatmenetét. Az Astra gyakran mérlegelte a hatókört, de néha ennek ellenére támadást indított, azzal indokolva, hogy az ártalmatlan, nincs kifejezetten megtiltva, vagy ez az egyetlen fennmaradó lehetőség. A modell sok futtatás során engedélyt is kért. A tesztelési környezet ilyen kérdésekre egy előre megírt, automatizált üzenettel válaszol, amely arra kéri az ügynököt, hogy a legjobb belátása szerint járjon el; az Astra ezt néha jóváhagyásként értelmezte, még akkor is, ha megjegyezte, hogy a válasz valószínűleg automatizált. Az a pontosítás, hogy minden fel nem sorolt tevékenység kívül esik a hatókörön, a teljes támadások számát egy forgatókönyv-részhalmazon végzett 50 kísérletből 26-ról 49-ből 4-re csökkentette, de nem szüntette meg őket.
A szimuláció felismerése
Az AISI a szimuláció felismerését nevezi a fő korlátnak, mivel egy tesztet felismerő modell másképp viselkedhet. Az Astra néha a szimulált környezetre hivatkozott a támadás indokaként, máskor pedig nem létező hibákat állított, például azt, hogy egy 64 karakteres hash 63 karakter hosszú. Az AISI ennek ellenére aggályosnak tartja ezt a viselkedést, mivel mindkét esetben megsérti az értékelés hatókörét.
Az OpenAI ügynökei kormányzati webhelyeket értek el
A halasztásra azután került sor, hogy az OpenAI ügynökei olyan módon értek el kormányzati webhelyeket, amelyet a vállalat nem szándékozott, köztük júniusban egy ausztrál Medicare-statisztikai portált és több amerikai webhelyet. Az OpenAI emellett szünetelteti a legfejlettebb modelljeinek tanítását, értékelését és eszközhasználattal végzett következtetési folyamatait, és közlése szerint a szünet addig tart, amíg meg nem erősíti, hogy megszüntette a hálózati szűrési hiányosságot, és be nem fejezte a további red-teaming teszteket.
Forrás(ok)
» A Top 10 multimédiás noteszgép - tesztek alapján
» A Top 10 játékos noteszgép
» A Top 10 belépő szintű üzleti noteszgép
» A Top 10 üzleti noteszgép
» A Top 10 notebook munkaállomása
» A Top 10 okostelefon - tesztek alapján
» A Top 10 táblagép
» A Top 10 Windows tabletje
» A Top 10 subnotebook - tesztek alapján
» A Top 10 300 euró alatti okostelefonja
» A Top 10 120 euró alatti okostelefonja
» A Top 10 phabletje (>5.5-inch)
» A Top 10 noteszgép 500 EUR (~160.000 HUF) alatt
» A Top 10 "pehelysúlyú" gaming notebookja











