Notebookcheck Logo

Mi áll valójában a Kimi K3 rekordszámai mögött?

A Kimi webes felület kezdőképernyője beviteli mezővel és a K3 logóval
ⓘ Screenshot: Kimi.com / Moonshot AI
Az egyszerű felület mögött a legnagyobb nyílt AI-modell rejtőzik
Kína új zászlóshajója méretrekordokat dönt, és a címlapok egymást követik. Maga a Moonshot is a Kimi K3-at a Claude és a GPT mögé sorolja. Részletesen elemezzük, mit is jelentenek valójában a számok, hogy valaha is futtathatja-e majd saját maga a modellt, mennyibe kerül valójában, és mi történik a bevitt adatokkal.
AI Software Benchmark

A Kimi K3 július 16. óta elérhető az interneten, és a címek alapján úgy tűnik, mintha Kína éppen most előzte volna meg az Egyesült Államokat. 2,8 billió paraméterével ez a legnagyobb modell, amelynek súlyozási paramétereit nyilvánosságra hozzák. Egyes megfigyelők máris a következő „DeepSeek-pillanatnak” nevezik.

A modellről szóló legérdekesebb mondat azonban nem a címekben található. A Moonshot saját technikai blogjában olvasható. Ott a fejlesztő azt írja, hogy az általános teljesítmény még mindig elmarad a legerősebb zárt forráskódú modellektől, nevezetesen a Claude Fable 5-től és a GPT-5.6 Sol-tól. Ritka dolog, hogy egy vállalat bemutatja a saját termékét, és kijelenti, hogy az nem a legjobb. Pontosan ezért érdemes közelebbről is megvizsgálni a rekordszámokat.

Már beszámoltunk arról a egyszerű hírről, hogy a K3 elérhető, és ingyenesen kipróbálható. Ez a cikk arról szól, mi következik ezután.

Az első hely, és mit is mér valójában

A K3 egy fontos összehasonlításban valóban győzedelmeskedik. A Frontend Code Arena-ban, ahol a felhasználók két eredményt látnak egymás mellett, és kiválasztják a jobbat anélkül, hogy tudnák, melyik modell állította elő, a K3 kerül ki győztesként. Még a Claude-ot és a GPT-t is megelőzi.

A bökkenő: ez a teszt az ízlést méri. A felhasználók értékelik, melyik webes felület tetszik nekik jobban. Ez sokat mond a tervezésről, de keveset a helyességről. Aki ezt úgy értelmezi, hogy „Kimi legyőzi az amerikai modelleket”, az nem vette észre a különbséget a preferencia-rangsor és a pontossági teszt között.

Miért kell alaposan elolvasni a teljesítménytáblázatokat

A Moonshot közzéteszi a méréseit, és az érdekes rész a lábjegyzetekben található. A benchmarktól függően minden modell egy-egy különböző ügynök-keretrendszerben futott, néha a KimiCode-ban, néha a Claude Code-ban, néha pedig a Codexben. Ezek különböző kiindulási feltételek, nem pedig egy tiszta verseny ugyanazon a pályán.

Az egyik kódolási tesztben maga a Moonshot is elismeri, hogy a Claude Fable 5 a feladatok 35 százalékában fallback-ekbe ütközött, ami lefelé húzhatta a pontszámát. Egy másik tesztben a K3 csak egy olyan technikával éri el a legjobb pontszámát, amely 300 000 tokenre tömöríti a kontextust. E kontextuskezelés nélkül a szám csökken.

Hogy milyen könnyen megfordulhatnak ezek a számok, azt a független elemző cég, az Artificial Analysis értékelése is mutatja. Ott a Kimi K3 49 százalékot ért el a hallucinációs mutatóban. Ez gyenge eredménynek tűnik. A skála azonban fordított: azt méri, hogy a modell milyen gyakran nem téved. Minél magasabb az érték, annál jobb, és ugyanazon a listán a Claude Fable 5 45 százalékkal a K3 alatt helyezkedik el, míg több GPT-5.6-változat is jóval lemarad tőle.

Egy érdemes megjegyezni szabály: mielőtt elhinnél egy teljesítményteszt-címet, ellenőrizd, hogy pontosan mit mértek, és merre mutat a skála.

Lehet-e saját magunk futtatni a K3-at?

Olvasóink számára ez a valódi kérdés. Az őszinte válasz: a hétköznapi felhasználók számára ez gyakorlatilag semmilyen különbséget nem jelent, még akkor sem, ha a súlyok nyilvánosságra kerülnek. Az ok egyszerűen a méret.

Gondolkodjunk el egy pillanatra. A Moonshot a K3-at a kezdetektől fogva egy MXFP4 nevű kompakt számformátumban edzi, amely súlyonként körülbelül négy bitet használ. A súlyok, más néven paraméterek, azok a tanult numerikus értékek, amelyekből egy AI-modell felépül. 2,8 billió paraméter esetén ez azt jelenti, hogy csak a modellfájl mérete körülbelül 1,4 terabájt. Nem gigabájt. Terabájt. Hogy ez mit jelent: egy tipikus, nyolcmilliárd paraméterrel rendelkező modell – amely jól felszerelt laptopon is fut – körülbelül öt gigabájtot foglal el.

Egy 1,4 terabájtos modellfájl: a K3 túl nagy ahhoz, hogy bármely otthoni számítógépen futtatható legyen.

Maga a Moonshot is azt javasolja, hogy a K3-at 64 vagy annál több gyorsítóval rendelkező szupercsomópont-konfigurációkon futtassák. Ez nem túlzott óvatosság, hanem e méretek egyszerű következménye. Egyetlen, 96 gigabájt memóriával rendelkező professzionális grafikus kártya teljesítménye több mint tízszeres eltérést jelent.

Az „Open weights” tehát nem azt jelenti, hogy ezt a modellt otthon fogja futtatni. Azt jelenti, hogy a kutatók, a vállalatok és a felhőszolgáltatók letölthetik, megvizsgálhatják és saját infrastruktúrájukon futtathatják, ahelyett, hogy kizárólag a Moonshot szerverein keresztül bérelnék. Ez értékes, de eltér attól, amit sokan elképzelnek.

Ha valóban felhő nélküli mesterséges intelligenciát szeretne a saját gépén, akkor az erre a feladatra épített kis modellek jelentik a megfelelő választást. Egy külön cikkben bemutattuk, hogyan működik ez, és milyen hardverre van szükség ehhez.

Egy megjegyzés a technikailag kíváncsiaknak: mivel a K3-at az első naptól kezdve ilyen alacsony pontossággal tanították be, a kompakt formátum az eredeti állapot, nem pedig egy utólag összenyomott modell. A szokásos kérdés, hogy a méretcsökkentés mennyibe kerül a minőségből, ebben az esetben nem merül fel ugyanúgy.

Mennyibe kerül a gyakorlatban

A számlázás tokenekben történik, amelyek általában csak néhány karakterből álló kis szövegrészletek. Az API-n keresztül a Moonshot 3 dollárt számol fel minden egymillió bemeneti token után, és 15 dollárt minden egymillió kimeneti token után. Az ismételt bemenetekért 30 centet számolnak fel, ami sokkal olcsóbb.

Ezzel a K3 már nem számít olcsó megoldásnak. Körülbelül háromszor annyiba kerül, mint saját elődje, amely a bemeneti tokenekért alig egy dollárt számított fel. A 10 és 50 dolláros Claude Fable 5-höz képest a K3 egyértelműen olcsóbb. A Claude Sonnet 5 azonban a jelenlegi, 2 és 10 dolláros bevezető áron még mindig alulmúlja, és csak szeptemberben éri el a K3 árszintjét. A Moonshotnál véget ér az a korszak, amikor a kínai modellek főként az áron keresztül versenyeztek.

Van még egy szempont, amelyet könnyű figyelmen kívül hagyni. A K3 jelenleg mindig a legmagasabb erőfeszítési szinten gondolkodik. A Moonshot később tervezi a takarékosabb üzemmódok bevezetését. Ez alapos válaszokat eredményez, de azt is jelenti, hogy még egy egyszerű kérdés is elindítja a költséges érvelési folyamatot. Független mérések szerint a modell másodpercenként körülbelül 62 kimeneti tokent állít elő, ami sebesség tekintetében a mezőny közepén helyezkedik el.

Mi történik a bevitelekkel

Bárki számára, aki az alkalmazásban vagy a weboldalon kipróbálja a K3-at, ez a szakasz a legfontosabb. A Moonshot adatvédelmi irányelvei egyértelműen kimondják, hogy a beviteleket, hanganyagokat, képeket, videókat és fájlokat a szolgáltatások nyújtása és fejlesztése céljából dolgozzák fel, kifejezetten beleértve a saját modellek betanítását és optimalizálását is.

Az irányelvben sehol sem található külön kapcsoló, amellyel kikapcsolhatná a tartalmára vonatkozó betanítást. Az irányelv az érintettek általános jogaira hivatkozik, amelyeket a fiókbeállítások révén vagy az adatvédelmi kapcsolattartónak küldött e-mailben gyakorolhat. Ezzel szemben a ChatGPT és a Claude egy kapcsolót helyezett el közvetlenül a beállítások között.

Továbbá az irányelvben szerepel: az összegyűjtött adatok közé tartoznak az IP-cím, az eszközazonosítók, a munkamenet- és beszélgetés-azonosítók, valamint – amennyiben az eszközbeállítások ezt lehetővé teszik – a vágólapról származó adatok. A tárolási helyet illetően az irányelv csak annyit mond, hogy az adatok átvihetők a lakóhelye szerinti országon kívüli szerverekre. Országot nem neveznek meg. A szolgáltató a szingapúri székhelyű Moonshot AI PTE. LTD., székhelye Szingapúrban van, az irányelv kelte pedig 2025. július 7.

Ártalmatlan feladatokkal végzett próbaüzem esetén ez elfogadható. Vállalati belső adatok, ügyféladatok vagy magánjellegű dokumentumok esetében ugyanazok a szabályok vonatkoznak, mint bármely más felhőszolgáltatásnál, csakhogy itt olyan szolgáltatóról van szó, amelynek saját feltételei kifejezetten rendelkeznek a modellek betanításáról.

Kik profitálnak leginkább a Kimi K3-ból

A kipróbálása semmibe sem kerül. Két csoport profitálhat belőle a leginkább: azok, akik fejlesztéssel vagy tervezéssel foglalkoznak, és azok, akik rendszeresen nagyon hosszú dokumentumokkal dolgoznak. A K3 ott erős, ahol a kód és a vizuális elemek találkoznak: webes felületeken, 3D-ben és animációkban. Az egymillió tokenes kontextusablak igazi érv a hosszú szövegek mellett, és a képfeldolgozás is beépített.

Ha a legjobb válaszminőséget vagy a legzökkenőmentesebb felhasználói élményt szeretné, akkor továbbra is az amerikai csúcsmodellek jelentik a jobb választást. Ezt a Moonshot is elismeri. És aki reméli, hogy hamarosan egy csúcstechnológiás modellt telepíthet a saját számítógépére, annak szem előtt kell tartania azt az 1,4 terabájtot.

A K3-mal kapcsolatban nem annyira a rangsor, mint inkább a fejlődés üteme figyelemre méltó. Egy kínai vállalat olyan modellt szállít, amely felveszi a versenyt a világ legjobbjaival, és nyilvánosságra hozza a modell adatait. Két évvel ezelőtt ezt még nehéz lett volna elképzelni.

Google LogoAdd as a preferred source on Google
Mail Logo
> Magyarország - Kezdőlap > Hírek > News Archive > Newsarchive 2026 07 > Mi áll valójában a Kimi K3 rekordszámai mögött?
Steffen Zahn, 2026-07-20 (Update: 2026-07-20)