Kimi K2.7 Code Test: Das erste Open-Weight-Modell in GitHub Copilot

·
review kimi moonshot coding

Ein Open-Weight-Modell ist in GitHub Copilot eingezogen

Am 1. Juli veröffentlichte GitHub eine leise Ankündigung: Kimi K2.7 Code ist ab sofort allgemein in GitHub Copilot verfügbar. Es ist das erste Open-Weight-Modell, das in der Copilot-Modellauswahl erscheint.

Bis jetzt bot Copilot nur Closed-Source-Modelle an — GPT, Claude, Gemini. Nun steht ein Modell von Moonshot AI, einem chinesischen KI-Labor, direkt daneben. Sie können es in VS Code 1.127+, Visual Studio 17.14.6+, JetBrains 1.9.1+, Copilot CLI und sogar GitHub Mobile auswählen.

Für Unternehmenskunden ist es bei Copilot Business und Enterprise standardmäßig deaktiviert — Administratoren müssen die Kimi K2.7 Code-Richtlinie explizit aktivieren. GitHub empfiehlt, das Modell zunächst anhand der eigenen Sicherheits- und Compliance-Anforderungen zu prüfen. Standardformulierung, aber allein die Tatsache, dass es dort verfügbar ist, sagt einiges über die Qualität des Modells aus.

Von K2.6 zu K2.7 Code: Was sich geändert hat

Kimi K2.7 Code basiert auf K2.6, dient aber einem anderen Zweck — K2.6 ist ein Allzweckmodell, K2.7 Code ist auf Programmierung spezialisiert.

Benchmark-Daten von der offiziellen Seite und der HuggingFace-Modellkarte:

BenchmarkK2.6K2.7 CodeVerbesserung
Kimi Code Bench v250.962.0+21.8%
Program Bench48.353.6+11.0%
MLS Bench Lite26.735.1+31.5%
Kimi Claw 24/7 Bench42.946.9+9.3%
MCP Atlas69.476.0+9.5%
MCP Mark Verified72.881.1+11.4%

Zwei Punkte sind bemerkenswert:

  1. Die Programmier-Verbesserungen sind deutlich größer als die agentischen Gewinne. MLS Bench Lite stieg um 31,5 % — dieser Benchmark verlangt von Modellen die Entwicklung generalisierbarer ML-Methoden, K2.7 Code hat sich also am stärksten bei komplexen forschungsorientierten Programmieraufgaben verbessert.
  2. Der Verbrauch von Thinking-Tokens sank um ~30 %. Das Modell gelangt mit weniger interner Überlegung zur Antwort, was sich direkt auf die Antwortgeschwindigkeit und API-Kosten auswirkt.

Wie es sich gegen die führenden Closed-Source-Modelle schlägt

Der ehrliche Vergleich (aus denselben offiziellen Benchmarks):

BenchmarkK2.7 CodeGPT-5.5Claude Opus 4.8
Kimi Code Bench v262.069.067.4
Program Bench53.669.163.8
MLS Bench Lite35.135.542.8
MCP Atlas76.079.481.3
MCP Mark Verified81.192.976.4

Es gibt eine echte Lücke. Beim Program Bench — der Modelle auffordert, Programmverhalten aus kompilierten Binärdateien nachzubauen — erzielt GPT-5.5 einen Score von 69,1 gegenüber 53,6 bei K2.7 Code. Das ist erheblich.

Aber betrachten Sie die andere Seite:

  • Bei MLS Bench Lite liegt K2.7 Code (35.1) praktisch gleichauf mit GPT-5.5 (35.5)
  • Bei MCP Mark Verified schlägt K2.7 Code (81.1) Claude Opus 4.8 (76.4)
  • K2.7 Code ist Open-Source. GPT-5.5 und Opus 4.8 sind es nicht.

Ein Open-Weight-Modell, das die teuersten Closed-Source-Modelle bei einigen Benchmarks erreicht oder übertrifft — das ist ein bedeutsames Signal, unabhängig davon, wo man in der Debatte Open vs. Closed steht.

1T Parameter, 32B aktiv — Architekturdetails

ParameterWert
ArchitekturMixture-of-Experts (MoE)
Gesamtparameter1T
Aktivierte Parameter pro Token32B
Schichten61
Experten384
Experten pro Token8
Kontextlänge256K
AttentionMLA (Multi-head Latent Attention)
Vision EncoderMoonViT (400M Parameter)

384 Experten, 8 aktiv pro Token — der klassische MoE-Kompromiss zwischen Kapazität und Rechenaufwand. Der MLA-Attention-Mechanismus (ursprünglich aus DeepSeek V2) hält den KV-Cache-Speicherverbrauch in Grenzen.

Der MoonViT Vision Encoder ist erwähnenswert — K2.7 Code akzeptiert Text-, Bild- und Video-Eingaben. Sie können einen Screenshot eines UI-Designs machen und das Modell den Frontend-Code schreiben lassen, oder ein Whiteboard-Architekturdiagramm für eine Analyse abfotografieren.

Preise: Open-Source, aber nicht kostenlos

Über die Kimi API:

ModellEingabe (Cache Miss)Eingabe (Cache Hit)AusgabeKontext
kimi-k2.7-code$0.95/M$0.19/M$4.00/M262,144 Tokens

Verglichen mit Claude Sonnet 4.6 bei $3.00/$15.00 — die Eingabe ist 3x günstiger, die Ausgabe fast 4x günstiger. Die API unterstützt automatisches Kontext-Caching, sodass wiederholter Kontext auf $0.19/M sinkt. Lange Multi-Turn-Sitzungen werden erheblich günstiger.

Da die Gewichte offen sind (Modified MIT License), können Sie das Modell auch selbst hosten — mit vLLM, SGLang oder KTransformers. Ein 1T-Parameter-Modell ist nicht trivial zu deployen, aber native INT4-Quantisierung ist verfügbar, und die Community hat bereits Ollama-Builds und diverse quantisierte Versionen bereitgestellt.

Kimi Code Abo-Pläne (Jahresabrechnung, monatlicher Preis):

PlanPreisGeeignet für
Moderato$15/Mo.Regelmäßiges Programmieren, wöchentlich aktualisiertes Kontingent
Allegretto$31/Mo.Größeres Kontingent + höhere Parallelität
Allegro$79/Mo.Intensive Entwicklung, komplexe Projekte
Vivace$159/Mo.Maximales Kontingent, große Codebases

Praktische Fallstricke

Ein paar Dinge, auf die Sie achten sollten:

  1. Thinking-Modus ist obligatorisch. K2.7 Code unterstützt keinen Non-Thinking-Modus. Wenn Sie das Denken in Kimi Code deaktivieren, fallen Anfragen automatisch auf K2.6 zurück.
  2. Es ist ein Programmiermodell, Punkt. Für Texterstellung, Analyse oder allgemeine Konversation empfiehlt Moonshot AI stattdessen K2.6.
  3. Temperature und Sampling. Die empfohlenen Einstellungen sind temperature=1.0 und top-p=0.95 — höher als die Standardwerte der meisten Modelle. Passen Sie Ihre Einstellungen entsprechend an.

Für wen ist K2.7 Code geeignet

SzenarioEmpfehlungWarum
GitHub Copilot-NutzerAusprobierenDirekt in der Modellauswahl wählbar, keine Migrationskosten
Kostenbewusste TeamsEmpfohlenAPI-Preise liegen bei ~1/3 bis 1/4 von Claude
Bilinguale (CN/EN) ProjekteSehr empfohlenChinesisches Code-Verständnis ist eine echte Stärke
Self-Hosting-AnforderungenPrüfenswertOffene Gewichte, Modified MIT License
Maximale ProgrammierleistungNoch nichtProgram Bench und andere schwere Benchmarks liegen noch hinter GPT-5.5
Nicht-ProgrammieraufgabenNicht empfohlenMoonshot AI sagt explizit: K2.6 für Allzweckaufgaben verwenden

Das Fazit

Kimi K2.7 Code ist nicht einfach nur ein weiteres Open-Source-Modell-Release. Es ist das erste Open-Weight-Modell in der GitHub Copilot-Modellauswahl. Es schlägt Claude Opus 4.8 bei MCP Mark Verified. Es kostet etwa ein Drittel der gängigen Closed-Source-Modelle. Und es verbraucht 30 % weniger Thinking-Tokens als sein Vorgänger.

Die Schwächen sind ebenfalls klar — es liegt bei den schwierigsten Programmier-Benchmarks hinter GPT-5.5, der erzwungene Thinking-Modus schränkt die Flexibilität ein, und das Self-Hosting eines 1T-Modells erfordert weiterhin erhebliche Infrastruktur.

Aber für die meisten realen Entwicklungsabläufe bietet K2.7 Code etwas, das es bisher nicht gab: Ein ausreichend gutes, ausreichend günstiges Open-Source-Programmiermodell, das direkt in Ihren bestehenden Tools sitzt. Das verändert die Wettbewerbslandschaft.