Skip to content
Kimi K3: ce înseamnă, concret, să-l rulezi local, să-l folosești remote sau să-l bagi în Claude Code
← ← Înapoi la Idei AI

Kimi K3: ce înseamnă, concret, să-l rulezi local, să-l folosești remote sau să-l bagi în Claude Code

Săptămâna trecută Moonshot AI a anunțat Kimi K3. Ieri au publicat greutățile. De atunci internetul e plin de articole care spun aceleași trei lucruri: „2.8 trilioane de parametri", „cel mai mare model open-weight din istorie", „rulează-l local". Ultima parte e, pentru 99.9% dintre noi, falsă.

Articolul ăsta încearcă să răspundă la trei întrebări practice pentru cineva care face software pe bani, nu pentru cineva care colecționează benchmark-uri: cât costă să-l rulezi local, ce se schimbă dacă îl folosești remote în locul Claude Code, și cum îl conectezi la Claude Code în cinci minute.


1. Datele de lansare, verificate

Ordinea evenimentelor contează, pentru că a existat o fereastră de zece zile în care modelul era live dar greutățile nu:

Data Ce s-a întâmplat
16 iulie 2026 Anunțul K3. API live pe platform.kimi.ai, model live în aplicația Kimi și în Kimi Code. Fără greutăți.
26 iulie 2026, seara (EDT) Greutățile apar pe Hugging Face, cu aproximativ o zi înaintea termenului anunțat.
27 iulie 2026 „Kimi K3 Open Day": raport tehnic + infrastructura de antrenare open-source (MoonEP, FlashKDA, AgentEnv). Fireworks, Baseten, Together și Modal anunță hosting day-0.

Repo-ul oficial este huggingface.co/moonshotai/Kimi-K3 — public, negated, cu safetensors reale, LICENSE și model card complet. Există și un repo GitHub MoonshotAI/Kimi-K3 cu raportul tehnic în PDF.

Un avertisment care merită spus explicit: în săptămâna asta au apărut zeci de mirror-uri și repo-uri „Kimi-K3" care nu sunt ale Moonshot. Dacă descarci ceva, descarcă din organizația moonshotai și pinuiește commit hash-ul. Modelul cere trust_remote_code=True, ceea ce înseamnă că execuți cod Python venit din repo. Citește-l înainte.


2. Ce este K3, tehnic

Din model card-ul oficial:

  • 2.8T parametri totali, 104B activi per token — MoE cu 896 experți, din care se activează 16 (plus 2 shared). Adică ~1.8% densitate de routare.
  • 93 de layere, dintre care 69 KDA (Kimi Delta Attention — atenție liniară cu delta-rule) și 24 Gated MLA.
  • Context 1.048.576 tokeni, flat, fără tiering de preț.
  • Multimodal nativ (text + imagine, encoder MoonViT-V2 de 401M).
  • Cuantizare nativă MXFP4 cu activări MXFP8 — quantization-aware training aplicat din faza de SFT.
  • Thinking mereu pornit. Nu există mod non-thinking. reasoning_effort acceptă low / high / max, default max.

Pe benchmark-uri: e primul model open-weight care intră serios în discuția cu vârful. Bate Claude Opus 4.8 și GPT-5.5 pe majoritatea probelor de coding și agentic, e la câteva puncte sub Claude Fable 5 și GPT-5.6 Sol pe cele mai multe, și e peste amândouă pe câteva (SWE-Marathon 42.0, BrowseComp 91.2, MCPMark 94.5). Artificial Analysis îl pune la 57 pe Intelligence Index — primul loc între modelele open-weight.

Detaliul de arhitectură care contează operațional: KDA sparge prefix caching-ul convențional. Moonshot a contribuit propria implementare de caching în vLLM odată cu lansarea. Dacă serveşti K3 pe un build vechi de vLLM, o să te doară.


3. Local: matematica dură

Aici e partea unde trebuie să fim onești.

Greutățile publicate ocupă 96 de shard-uri, ~1.56 TB (1.42 TiB). Nu 594 GB — cifra aia a circulat masiv în presa de dinainte de lansare și e pur și simplu greșită; nu poți stoca 2.8T parametri la 4 biți în mai puțin de ~1.4 TB, oricât de creativ ai fi. Și asta e înainte de KV cache, care la 1M context devine el însuși un consumator serios.

Ce înseamnă asta în hardware:

  • Un nod de 8× H100 80GB = 640 GB. Nu încape. Nici pe departe.
  • Un nod de 8× accelerator de 192 GB = 1.536 TB. Încape teoretic modelul, nu mai încape nimic altceva.
  • Recomandarea Moonshot: minim 64 de acceleratoare (8 noduri × 8), cu expert parallelism și interconectare serioasă între noduri.
  • Cineva a raportat că a pornit K3 pe 80× RTX 5090, obținând 20 tok/s pe un singur stream, ziua unu, netunat. E o realizare tehnică, nu o soluție.

Motoarele recomandate oficial: vLLM, SGLang, TokenSpeed. Comanda de bază arată banal:

vllm serve moonshotai/Kimi-K3 \
  --tensor-parallel-size 8 \
  --max-model-len 131072 \
  --trust-remote-code

Sfat practic dacă chiar ajungi acolo: pornește de la 128k–256k context, nu de la 1M. Fereastra completă cere fie un kernel de atenție liniară suportat în build-ul tău, fie destule GPU-uri pe care să sharduiești KV cache-ul.

Statusul GGUF: la momentul scrierii, nu există port-uri GGUF de fidelitate completă confirmate pentru llama.cpp / Ollama / LM Studio. Vor apărea. Dar chiar și un Q2 dinamic de tip Unsloth ar rămâne în zona de sute de GB — nu coboară sub pragul de „server", coboară doar sub pragul de „datacenter".

Traducere pentru o firmă de consultanță de 1–5 oameni

Nu. Nu există scenariu în care rularea locală a lui K3 are sens economic pentru noi. Un Mac Studio M3 Ultra, oricât de bine echipat, nu vede modelul ăsta nici cu binoclul. Un RTX 4090 e o glumă în context.

Ce are sens local, dacă vrei suveranitate pe date: Kimi K2.7 Code (1T parametri, 256k context, ~325 GB la Q2 dinamic, ~605 GB la precizie completă) rulează pe un Mac Studio bine dotat sau pe o stație cu 256+ GB memorie unificată. E un model bun. Nu e K3, dar e un model bun, și diferența dintre „bun" și „frontier" contează mai puțin decât crezi pentru 80% din task-uri.

Concluzia onestă: „open weights" pentru K3 înseamnă suveranitate pentru companii cu rack-uri, nu pentru developeri cu laptop-uri. E o distincție care se pierde în titluri.


4. Remote, în loc de Claude Code: economia reală

Aici discuția devine interesantă, pentru că e singura variantă practică.

Prețuri

Input (cache miss) Input (cache hit) Output
Kimi K3 $3.00 / 1M $0.30 / 1M $15.00 / 1M
Claude Opus 5 $5.00 / 1M $25.00 / 1M
Claude Opus 4.8 ~$5.00 / 1M ~$25.00 / 1M

K3 e la nivel de Sonnet ca preț de listă. Nu e modelul chinezesc ieftin la care se aștepta toată lumea după K2 — e de 3–4x mai scump decât propriul lui predecesor K2.6 ($0.95/$4).

Partea care schimbă calculul e cache hit-ul la $0.30 — o reducere de 90%. În bucle agentice, unde retrimiti același system prompt, aceleași fișiere și același context de repo la fiecare pas, majoritatea input-ului lovește cache-ul. OpenRouter raportează ~92% cache hit rate pe traficul K3, ceea ce aduce input-ul efectiv pe la ~$0.52/1M.

Contrapunctul, și e unul serios: K3 gândește mereu la effort maxim. Fiecare token de raționament e facturat la $15/1M. Nu există buton de „gândește mai puțin ca să plătesc mai puțin". Blended (80/20 input/output) ajunge pe la $5.40/1M — față de ~$9 pentru Opus 4.8. Real, dar nu spectaculos, și complet dependent de cât de vorbăreț e modelul pe task-ul tău.

Măsurători independente Artificial Analysis pe endpoint-ul Moonshot: ~62 tokeni/secundă output, ~2 secunde până la primul token. E mai lent decât ești obișnuit. Într-o buclă agentică lungă, latența per task poate anula avantajul de preț per token.

Unde rulează, de fapt, request-ul tău

Asta e întrebarea care contează pentru oricine lucrează cu clienți din US sau EU sub NDA.

  • API-ul Moonshot direct (api.moonshot.ai) — infrastructură în China. Pentru multe contracte, un non-starter automat, indiferent de calitatea modelului.
  • Fireworks / Baseten — hosting în US, cu opțiuni de Zero Data Retention, certificate de Moonshot. Preț identic: $3/$15. Nimeni nu subcotează, ceea ce e în sine un indiciu despre cum arată acordurile de licențiere din spate.
  • Vercel AI Gateway — rutează între providerii US cu failover, același model ID moonshotai/kimi-k3, plus un tier „Kimi K3 Fast" mai scump și mai rapid.
  • OpenRouter — mai mulți provideri, routing pe preț/viteză/acuratețe de tool calling.

Dacă ai clauze de data residency în contract, varianta US-hosted nu e opțională. Și merită citită înainte, nu după.


5. Cum îl bagi în Claude Code

Partea bună: Claude Code nu verifică cu cine vorbește. Citește trei variabile de mediu — un URL, un token, un nume de model — și trimite request-ul unde arată ele. Moonshot expune un endpoint compatibil Anthropic, deci harness-ul rămâne identic: aceleași hooks, aceleași MCP servers, aceleași skill-uri, aceleași obiceiuri.

Configurația (din documentația oficială Moonshot)

Persistent, în ~/.claude/settings.json:

{
  "env": {
    "ANTHROPIC_BASE_URL": "https://api.moonshot.ai/anthropic",
    "ANTHROPIC_AUTH_TOKEN": "YOUR_MOONSHOT_API_KEY",
    "ANTHROPIC_MODEL": "kimi-k3[1m]",
    "ANTHROPIC_DEFAULT_OPUS_MODEL": "kimi-k3[1m]",
    "ANTHROPIC_DEFAULT_SONNET_MODEL": "kimi-k3[1m]",
    "ANTHROPIC_DEFAULT_HAIKU_MODEL": "kimi-k3[1m]",
    "ANTHROPIC_DEFAULT_FABLE_MODEL": "kimi-k3[1m]",
    "CLAUDE_CODE_SUBAGENT_MODEL": "kimi-k3[1m]",
    "ENABLE_TOOL_SEARCH": "false",
    "CLAUDE_CODE_AUTO_COMPACT_WINDOW": "1048576",
    "CLAUDE_CODE_EFFORT_LEVEL": "max"
  }
}

Sau temporar, doar pentru sesiunea curentă, cu export pe aceleași variabile înainte de claude. Nu le amesteca — valorile din settings.json au prioritate peste cele exportate în terminal, și ăsta e motivul numărul unu pentru care „nu merge configurația".

Verificarea se face cu /status, nu cu /model. Meniul /model e o listă fixă de alias-uri interne și nu va afișa niciodată modele Kimi — nu e un bug, nu ai ce comuta acolo. /status trebuie să arate base URL-ul Moonshot și kimi-k3[1m].

Capcanele, în ordinea în care le vei întâlni

  1. ANTHROPIC_API_KEY rămas prin shell. Intră în conflict cu ANTHROPIC_AUTH_TOKEN și produce erori 401 derutante. Șterge-l.
  2. Variabilele de tier neconfigurate. Dacă setezi doar ANTHROPIC_MODEL, task-urile de background (titluri de conversație, sumarizare) și sub-agenții cer nume de modele Claude pe care endpoint-ul Kimi nu le recunoaște — și eșuează silențios. Setează-le pe toate.
  3. ENABLE_TOOL_SEARCH trebuie false. Endpoint-ul nu suportă încă funcționalitatea. Claude Code o dezactivează oricum by default când base URL-ul nu e Anthropic, dar explicit e mai bine.
  4. WebFetch nu funcționează pe endpoint-ul Kimi în acest moment — întoarce „temporarily unavailable" sau conținut gol. Workaround: lipești conținutul în chat sau folosești un MCP de scraping.
  5. CLAUDE_CODE_AUTO_COMPACT_WINDOW trebuie să corespundă modelului: 1048576 pentru K3, 262144 pentru K2.7 Code. Prea mic → compactează prematur și pierzi context; prea mare → erori de context length.
  6. Preserved thinking history. K3 a fost antrenat într-un mod care cere ca mesajul complet al asistentului — inclusiv reasoning_content și tool_calls — să fie trimis înapoi în messages, nu doar content. Claude Code se descurcă, dar dacă îți construiești propriul harness sau comuți modelul la mijlocul unei sesiuni, așteaptă-te la output instabil.
  7. Web search se facturează separat, ~$0.004 per apel, peste prețul pe tokeni.

Alternativ, Moonshot are propriul CLI — Kimi Code — cu care spun că modelul lucrează cel mai bine, și pe care îl poți instala în paralel. Diferența e vizibilă în benchmark-urile lor: K3 face 72.9 pe Kimi Code Bench cu harness-ul propriu și 73.7 cu Claude Code, deci harness-ul nu e factorul decisiv.


6. Licența — citește-o

Asta e partea pe care majoritatea articolelor o sar.

K3 nu e MIT și nu e Apache 2.0. E un document propriu, „Kimi K3 License", etichetat pe Hugging Face ca license:other. Artificial Analysis l-a clasificat drept „Commercial Use Restricted".

Textul e MIT pe majoritatea lungimii lui — poți descărca, rula, modifica, fine-tuna, redistribui și folosi comercial fără cost de licență. Două clauze schimbă lucrurile la scară:

  • Model-as-a-Service: dacă tu sau afiliații tăi operați un business care oferă terților acces la inferență sau fine-tuning, și veniturile agregate ale grupului (nu cele atribuibile K3) depășesc $20M pe orice 12 luni consecutive, trebuie să semnezi un acord separat cu Moonshot înainte de orice uz comercial.
  • Atribuire: orice produs comercial cu peste 100 milioane utilizatori activi lunar sau peste $20M venit lunar trebuie să afișeze „Kimi K3" vizibil în interfață.

Uzul strict intern și accesul prin produsele Moonshot sau prin partenerii lor certificați sunt exceptate.

Pentru o firmă de dimensiunea noastră, ambele praguri sunt teoretice. Dar dacă construiești un produs pe care speri să-l vinzi, sau dacă revinzi inferență, clauza 2 e o obligație contractuală, nu o notă de subsol. Și pragul de $20M pe grup e suficient de mic încât practic toți providerii serioși de inferență intră sub el — ceea ce explică de ce nimeni nu subcotează prețul Moonshot.


7. Verdict

Local: nu, decât dacă ai un cluster. Pentru suveranitate pe date la scară de firmă mică, K2.7 Code pe hardware propriu e răspunsul real.

Remote, ca înlocuitor pentru Claude Code: merită testat, cu ochii deschiși. Economia e reală dar mai mică decât sugerează titlurile — ~40% sub Opus pe blended, condiționat de cache hit rate bun, și plătită parțial în latență, pentru că modelul gândește mereu la maxim. Pentru munca de client sub NDA, folosește un provider US-hosted cu ZDR, nu endpoint-ul direct.

Ca al doilea creier: aici mi se pare cel mai interesant. Ai deja abonamentul de Claude Code. Costul marginal de a configura un al doilea profil care rutează spre K3 e de cinci minute și un API key. Un al doilea model, cu o părere independentă pe același cod, care excelează exact pe zonele unde e clasat primul — frontend, design, task-uri agentice foarte lungi — nu e o înlocuire. E o a doua opinie. Iar cc-switch sau un simplu alias în .zshrc fac comutarea instantanee.

Ăsta e, cred, adevăratul câștig al săptămânii ăsteia: nu că avem un model mai ieftin, ci că harness-ul a devenit portabil. Uneltele pe care ni le-am format ca obiceiuri — Claude Code, MCP, skills — nu mai sunt legate de un singur furnizor. Asta e o veste bună indiferent pe cine alegi la final.


Notă, ca de obicei: cred că AI-ul e viitorul și că fricțiunile de mai sus — WebFetch care nu merge, variabilele de mediu care trebuie setate manual în opt locuri, 1.5 TB de greutăți pe care nu-i poate rula nimeni acasă — sunt probleme de tinerețe care se vor rezolva. Ecosistemul are 18 luni de maturitate reală. Dar cât timp le avem în față, merită discutate onest, pentru că deciziile de infrastructură pe care le luăm acum ne costă bani reali în lunile următoare.

Toate datele din articol sunt verificate la 28 iulie 2026 din model card-ul oficial, documentația platformei Moonshot și raportările independente. Într-o săptămână de lansare, lucrurile se mișcă zilnic — verifică repo-ul înainte de orice decizie de producție.