A Kimi K3 API szokatlan kombinációval érkezett: csúcsközeli benchmark-eredmények, agresszív árazás és letölthető súlyok. A Moonshot AI 2026. július 27-én tette közzé ezeket a súlyokat, amivel a K3 lett az eddigi legnagyobb nyíltan elérhető modell, és először fordult elő, hogy egy ilyen léptékű modellt elvben saját magad is futtathatsz.
Aki már fizet egy élvonalbeli szolgáltatónak, annak ez gyakorlati, nem filozófiai kérdést vet fel. Van helye a stackedben, és mit változtat valójában, ha forgalmat terelsz rá? Ez az útmutató az árazási számtant, az integrációs munkát és azokat a pontokat járja körül, ahol a főcímbe kerülő számok nem fordulnak át éles működéssé.
Röviden: a Kimi K3 nagyjából 3 dollárt kér millió gyorsítótár-tévesztéses bemeneti tokenért, 0,30 dollárt millió gyorsítótárazott bemeneti tokenért és 15 dollárt millió kimeneti tokenért, 1 048 576 tokenes kontextusablakkal. A felület az OpenAI és az Anthropic konvencióival is kompatibilis, így egy munkaterhelés átállítása jórészt alap-URL és modellnév cseréje. A csapda az, hogy a gondolkodás mindig aktív és alapból maximális szinten van, amitől a kimeneti tokenek uralják a számlát, hacsak nem állítod be tudatosan.
Mi valójában a Kimi K3
Az architektúra itt azért számít, mert egyszerre magyarázza az árazást és az üzemeltetési korlátokat.
A K3 ritka szakértőkeverék modell 2,8 billió összparaméterrel, amelyből tokenenként nagyjából 104 milliárd aktiválódik. 896 szakértőt tartalmaz, és minden tokent 16-hoz irányít. Ez az arány az oka annak, hogy egy ekkora modellt egyáltalán ki lehet szolgálni: a teljes paraméterszám memóriaköltségét fizeted, de egy sokkal kisebb modell számítási költségét.
A figyelmi terv a valóban újszerű rész. A Moonshot a K3-at az általa Kimi Delta Attentionnek nevezett megoldásra építette: ez egy lineáris figyelmi mechanizmus, amelyet nagyjából három az egyhez arányban szőnek át teljes figyelmi rétegek, az Attention Residuals nevű technikával megtámogatva. A lineáris rétegek olcsón kezelik a lokális szekvenciaszerkezetet, míg a teljes figyelmi rétegek megőrzik a globális információáramlást. Ez a kombináció teszi a milliós kontextust gazdaságilag hihetővé, nem pusztán hirdetetté.
A modellkártyából két üzemeltetési részlet következik. A súlyok MXFP4 formátumban, MXFP8 aktivációkkal érkeznek, a gondolkodás pedig mindig be van kapcsolva, vagyis a modell minden kérésnél a válasz mellett egy reasoning_content mezőt is visszaad. A gondolkodást nem tudod kikapcsolni. Csak azt választhatod meg, mennyit veszel belőle.
Mennyibe kerül a Kimi K3 API
A közzétett díjak egyszerűek, és a köztük lévő rés az, ahol az érdekes döntések laknak.
A gyorsítótár-tévesztéses bemenet nagyjából 3 dollár millió tokenenként. A gyorsítótárazott bemenet nagyjából 0,30 dollár, azaz tizedannyi. A kimenet nagyjából 15 dollár millióért. Néhány szolgáltatóval ellentétben ez az árazás lapos a teljes kontextusablakon, nem lépcsőzik feljebb egy küszöb után, ami a hosszú kontextusú munkát sokkal tervezhetőbbé teszi.
Számolj végig egy valós esetet. Tegyük fel, hogy egy ügynök egy ügyfélszolgálati folyamatot kezel 40 000 tokenes rendszerprompttal és tudásbevezetővel, hozzátesz 2000 token beszélgetést, és 1500 token választ plusz gondolkodást állít elő. Hidegen ez a kérés durván tizenkét és fél cent bemenetbe és valamivel több mint két cent kimenetbe kerül. Melegen, gyorsítótárazott 40 000 tokenes előtaggal, a bemeneti költség másfél cent alá esik, miközben a kimeneti költség változatlan. Napi tízezer kérésnél ez a különbség maga a funkció gazdaságossága.
Ebből két tanulság adódik. Először: úgy építsd fel a promptokat, hogy a stabil anyag elöl legyen és soha ne változzon, mert a gyorsítótárazás csak azonos maradó előtagon segít. Másodszor: figyeld szorosan a kimeneti oldalt, mivel a gondolkodási tokenek kimenetként számlázódnak, és a szintbeállítás alapból maximumon áll. A LLM-késleltetés csökkentéséről szóló útmutatónk részletesebben tárgyalja az előtagfegyelmet, és itt szinte változtatás nélkül érvényes.
Az integráció többnyire csak alap-URL csere
A Moonshot olyan felületen keresztül teszi elérhetővé a K3-at, amely az OpenAI és az Anthropic konvencióival egyaránt kompatibilis, így a legtöbb alkalmazás migrációja valóban kicsi. Irányítsd a meglévő klienst a Moonshot végpontra, állítsd a modellazonosítót kimi-k3 értékre, és add meg az új hitelesítő adatokat. A már valamelyik protokollt beszélő kód általában módosítás nélkül működik.
Három különbséget érdemes kifejezetten kezelni, mielőtt élesítesz.
Az első a reasoning_effort. A K3 elfogad egy felső szintű mezőt low, high vagy max értékkel, alapértelmezése pedig max. Ha ezt osztályozási vagy kinyerési feladatnál így hagyod, kiterjedt mérlegelésért fizetsz olyan munkánál, amelynek nem volt rá szüksége. Rutinhívásoknál állítsd lowra, és tartsd fenn a high vagy max értéket azoknak a kéréseknek, amelyek tényleg profitálnak belőle.
A második a reasoning_content. Mivel a gondolkodás mindig aktív, a válaszok a tényleges felelet mellett gondolkodási mezőt is hordoznak. A feldolgozó kódodnak tudnia kell, hogy ez a mező létezik, a naplózásodnak el kell döntenie, megőrzi-e, a felületed pedig semmiképp ne jelenítse meg véletlenül.
A harmadik a szokásos fegyelem, amely minden szolgáltatónál érvényes. Tartsd a hitelesítő adatokat szerveroldalon, tedd a hívást saját proxy mögé, hogy megmaradjon a felhasználónkénti mérés és a szolgáltatóváltás lehetősége, és rögzítsd a modellazonosítót ahelyett, hogy egy mozgó aliast követnél. Az ehhez a réteghez ajánlott architektúrát az OpenAI API-integrációról szóló útmutatónk írja le, és pontosan ezért szándékosan szolgáltatófüggetlen.
A milliós kontextus, és mikor hagyd figyelmen kívül
Az 1 048 576 tokenes ablak valódi képesség, és egyben az a funkció, amelyet a legvalószínűbben rosszul használnak.
Akkor érdemli ki a helyét, ha a feladat tényleg teljes korpuszra kiterjedő következtetést kíván: egy szerződés összevetése minden korábbi változatával, egy viselkedés végigkövetése egy teljes repón, vagy egy hosszú ügynöki pálya összefésülése, ahol a korábbi lépések számítanak. Ilyenkor a visszakeresés aktívan árt, mert a releváns töredéket olyan kapcsolatok jelölik ki, amelyeket a kereső nem lát.
Rossz eszköz viszont dokumentumgyűjtemény feletti kérdés-válaszra. Millió tokent tömni minden kérésbe lassabb és sokkal drágább, mint kikeresni azt a négy szakaszt, ami számít, és a pontos visszakeresések találati pontossága gyakran rosszabb, nem jobb. Az őszinte szabály: a nagy kontextus azokra a feladatokra való, ahol előre nem tudhatod, melyik rész releváns. Minden más továbbra is visszakereső folyamatba tartozik.
A benchmarkok őszinte olvasása
A K3 jól teljesít. Az összesített intelligenciaindexeken épp a vezető zárt csúcsmodellek mögött áll, miközben kényelmesen megelőzi az előző generációt, és erős az ügynöki és terminálalapú kódolási értékeléseken. A jelentett számok között szerepel nyolcvanas évek felső harmadába eső eredmény a Terminal-Bench 2.1-en és nyolcvan feletti a FrontierSWE-n.
Ezek a számok olyan megszorítást érdemelnek, amely minden modellre igaz, nem csak erre. A kódolási benchmarkok eredményei erősen függenek a futtatókerettől, és a kereteket keverő összehasonlítások azonos modelleknél is tíz-huszonöt pontot ingadozhatnak. Egy szolgáltató saját ügynöki állványzatával előállított pontszám nem hasonlítható közvetlenül általános futtatóval kapotthoz. Ha egy táblázat egyik modellt a másik elé sorolja, előbb nézd meg, ugyanúgy értékelték-e mindkettőt.
A gyakorlati következtetés: a nyilvános benchmarkok szűkítésre jók, döntésre használhatatlanok. Építs kis értékelő készletet a saját forgalmadból, futtasd át rajta a jelölt modelleket a saját promptjaiddal és állványzatoddal, és azon a munkán hasonlíts, amit ténylegesen végzel. Harminc-száz reprezentatív eset többet mond bármelyik ranglistánál.
Hol illeszkedik egy éles stackbe
2026-ban az ésszerű minta az útválasztás, nem a hűség, és a K3 jól illeszkedik ebbe.
A nagy volumenű rutinmunkát küldd kis, gyors, olcsó modellhez. A hosszú távú ügynöki munkát, a nagy repós feladatokat és a valódi teljes korpuszos következtetést küldd a K3-hoz, ahol a kontextusablak és az ügynöki teljesítmény kitermeli a költséget. Tarts kéznél egy zárt csúcsmodellt arra a kisebbségre, ahol a lehető legjobb válasz kell, és nem az ár dönt.
Előfeltétel egy absztrakciós réteg, amellyel alkalmazáskód érintése nélkül mozgathatod a forgalmat a szolgáltatók között. Azok a csapatok, amelyek egyetlen gyártó kliensét drótozzák be a kódbázisukba, azt tapasztalják, hogy a váltás hetekbe kerül, ezért soha nem váltanak, és soha nem realizálják a megtakarítást. Előbb építsd meg a varratot, és a modellválasztás projekt helyett konfigurációs döntés lesz.
Egy további szempont kifejezetten a K3 mellett szól. Mivel a súlyok közzétettek, az API-ra épített munkaterhelés később átköltözhet általad felügyelt infrastruktúrára az alkalmazás újraírása nélkül. Ez valódi stratégiai opció, és a Kimi K3 saját üzemeltetéséről szóló testvércikkünk foglalkozik vele.
Építtesd meg rendesen az integrációt
A Mecanik éles nyelvi modell integrációkat épít több szolgáltatónál az MI-integrációs szolgáltatásaink részeként. Nálunk van a proxy- és útválasztó réteg, a prompt-gyorsítótárazás szerkezete, a szinthangolás, az értékelő keret és azok a költségkorlátok, amelyek megakadályozzák, hogy egy ígéretes funkcióból kiszámíthatatlan számla legyen.
Ha meglévő szolgáltatótól fontolgatod a váltást a Kimi K3-ra, átfuttatjuk a saját forgalmadat mindkettőn, és megmutatjuk a minőségi és költségkülönbséget, mielőtt bármihez köteleznéd magad. A tágabb üzleti képhez az MI-integrációs költségútmutatónk mutatja be, hogyan néznek ki reálisan az építési és üzemeltetési büdzsék. A teljes modellspecifikáció a Kimi K3 modellkártyán érhető el.
Kapcsolódó bejegyzések: MI-ügynökség vagy házon belüli fejlesztés: UK AI 2026 , Claude API vs OpenAI API: fejlesztői összehasonlítás , DeepSeek R1 vs. OpenAI o3-mini: melyik API a legjobb? , Létezik igazi MI? A mítoszok és a valóság feltárása .
Gyakran ismételt kérdések
Mennyibe kerül a Kimi K3 API? A közzétett árazás nagyjából 3 dollár millió gyorsítótár-tévesztéses bemeneti tokenenként, 0,30 dollár millió gyorsítótárazott bemeneti tokenenként és 15 dollár millió kimeneti tokenenként, laposan a teljes kontextusablakon. Mivel a gondolkodási tokenek kimenetként számlázódnak és a szint alapból maximumon áll, általában a kimenet a domináns költség.
Kompatibilis a Kimi K3 API az OpenAI kliens könyvtárakkal? Igen. A Moonshot az OpenAI és az Anthropic konvencióival egyaránt kompatibilis felületet tesz elérhetővé, így a legtöbb alkalmazás az alap-URL, a modellazonosító és a hitelesítő adatok cseréjével migrál. Szánj némi időt a gondolkodási szint mezőre és a minden válasszal visszatérő többlet gondolkodási tartalomra.
Kikapcsolható a gondolkodás a Kimi K3-ban? Nem. A gondolkodás mindig aktív, és minden válasz tartalmaz gondolkodási tartalom mezőt. A mélységet a gondolkodási szint beállításával szabályozod, amely low, high vagy max értéket vesz fel, és alapból max. Rutinfeladatoknál állítsd be kifejezetten, hogy ne fizess fölösleges mérlegelésért.
A milliós kontextust használjam visszakeresés helyett? Csak akkor, ha a feladat tényleg teljes korpuszra kiterjedő következtetést kíván, például egy viselkedés végigkövetését egy teljes repón. Dokumentumhalmaz feletti kérdés-válaszra a visszakeresés továbbra is gyorsabb, olcsóbb és gyakran pontosabb, mint minden kérésnél megtölteni a kontextusablakot.
Mennyire megbízhatóak a Kimi K3 közzétett benchmark-eredményei? Az eredmények valósak, de futtatókeret-függők. A kódolási értékelések a használt ügynöki állványzattól függően tíz-huszonöt pontot ingadozhatnak, így egy szolgáltató saját keretével készült eredmény nem hasonlítható közvetlenül általános futtatókhoz. Döntés előtt validáld a saját feladataidon.
Hozzászólások