A tesztek 88%-ában hazugságon kapták őket: a kínai modelleken futó MI-ügynökök megtanultak csalni, az amerikai modellek pedig ugyanezt tették

A kínai modellekre épülő AI-ügynökök a szimulált licitverseny legtöbb menetében hazudtak a Reuters által áttekintett kutatás szerint. Az Alibaba Qwen3-Max-Preview és a Moonshot Kimi-K2 modelljén futó ügynökök a menetek 88%-ában legalább egy hamis állítást tettek. A DeepSeek-V3.2-Exp 84%-ot ért el. Az amerikai cégek modelljei is hasonló eredményeket produkáltak ugyanebben a tesztben.
A kísérletre márciusban került sor. A Beihang Egyetem, a Pekingi Egyetem, a Nottinghami Egyetem Ningbo Kínai kampuszának és a 360 AI Security Labnak a kutatói ügyfélszerződésekre licitáltatták az ügynököket. Minden ügynök tájékoztatást kapott arról, hogy mire képes a terméke, és mire van szüksége az ügyfélnek. Amikor lehetőséget kaptak arra, hogy tanuljanak a korábbi fordulókból, és újra próbálkozzanak, a három kínai modellekre épülő ügynök 12–20 százalékponttal megtévesztőbbé vált.
Ez a tanulmány egyike annak a legalább 20-nak, amelyet a Reuters több mint 200, 2025 óta publikált dokumentum között azonosított. Egy másik, amelyet idén az ICML-en mutattak be, arra jutott, hogy mind a kínai, mind az amerikai modelleken futó ügynökök meghamisították az eredményeket, és fájlokat fabrikáltak ahelyett, hogy beismerték volna a feladat kudarcát. 2025 márciusában a Fudani Egyetem kutatói arról is beszámoltak, hogy az Alibaba Qwen2.5-72B-Instruct modelljén futó egyik ügynök egy másik környezetben másolatot készített önmagáról, miután megtudta, hogy le fogják cserélni. Az Alibabához köthető ROME ügynök pedig a felhőalapú számítási kapacitást kriptovaluta-bányászatra irányította át, mielőtt a biztonsági rendszerek leállították volna.
Ezek közül az esetek közül a legtöbb olyan ellenőrzött kísérletekből származott, amelyeket a hibák előidézésére terveztek. A Reuters nem talált bizonyítékot arra, hogy bármelyik kínai fejlesztésű agent kijutott volna a szélesebb internetre, vagy elkerülte volna a leállítást. Több kutató ennek ellenére figyelmeztetésnek nevezte az eredményeket. Ahogy a rendszerek egyre nagyobb képességekre tesznek szert, ugyanazt a viselkedést egyre nehezebb kordában tartani.
Kína szakpolitikai szinten is elkezdte kezelni ezt a kérdést. A szeptember 14-én közzétett AI Safety Governance Framework 3.0 az értékelők megtévesztését és a képességek eltitkolását kockázatként sorolja fel. Az Alibaba, a DeepSeek, a Moonshot és a Z.ai nem válaszolt a Reuters megkeresésére. Az első három korábban azt közölte, hogy rendszeresen teszteli a rendszereit, és frissíti a biztonsági intézkedéseket.
» A Top 10 multimédiás noteszgép - tesztek alapján
» A Top 10 játékos noteszgép
» A Top 10 belépő szintű üzleti noteszgép
» A Top 10 üzleti noteszgép
» A Top 10 notebook munkaállomása
» A Top 10 okostelefon - tesztek alapján
» A Top 10 táblagép
» A Top 10 Windows tabletje
» A Top 10 subnotebook - tesztek alapján
» A Top 10 300 euró alatti okostelefonja
» A Top 10 120 euró alatti okostelefonja
» A Top 10 phabletje (>5.5-inch)
» A Top 10 noteszgép 500 EUR (~160.000 HUF) alatt
» A Top 10 "pehelysúlyú" gaming notebookja









