Kimi K2.7 Code Test: Das erste Open-Weight-Modell in GitHub Copilot
Ein Open-Weight-Modell ist in GitHub Copilot eingezogen
Am 1. Juli veröffentlichte GitHub eine leise Ankündigung: Kimi K2.7 Code ist ab sofort allgemein in GitHub Copilot verfügbar. Es ist das erste Open-Weight-Modell, das in der Copilot-Modellauswahl erscheint.
Bis jetzt bot Copilot nur Closed-Source-Modelle an — GPT, Claude, Gemini. Nun steht ein Modell von Moonshot AI, einem chinesischen KI-Labor, direkt daneben. Sie können es in VS Code 1.127+, Visual Studio 17.14.6+, JetBrains 1.9.1+, Copilot CLI und sogar GitHub Mobile auswählen.
Für Unternehmenskunden ist es bei Copilot Business und Enterprise standardmäßig deaktiviert — Administratoren müssen die Kimi K2.7 Code-Richtlinie explizit aktivieren. GitHub empfiehlt, das Modell zunächst anhand der eigenen Sicherheits- und Compliance-Anforderungen zu prüfen. Standardformulierung, aber allein die Tatsache, dass es dort verfügbar ist, sagt einiges über die Qualität des Modells aus.
Von K2.6 zu K2.7 Code: Was sich geändert hat
Kimi K2.7 Code basiert auf K2.6, dient aber einem anderen Zweck — K2.6 ist ein Allzweckmodell, K2.7 Code ist auf Programmierung spezialisiert.
Benchmark-Daten von der offiziellen Seite und der HuggingFace-Modellkarte:
| Benchmark | K2.6 | K2.7 Code | Verbesserung |
|---|---|---|---|
| Kimi Code Bench v2 | 50.9 | 62.0 | +21.8% |
| Program Bench | 48.3 | 53.6 | +11.0% |
| MLS Bench Lite | 26.7 | 35.1 | +31.5% |
| Kimi Claw 24/7 Bench | 42.9 | 46.9 | +9.3% |
| MCP Atlas | 69.4 | 76.0 | +9.5% |
| MCP Mark Verified | 72.8 | 81.1 | +11.4% |
Zwei Punkte sind bemerkenswert:
- Die Programmier-Verbesserungen sind deutlich größer als die agentischen Gewinne. MLS Bench Lite stieg um 31,5 % — dieser Benchmark verlangt von Modellen die Entwicklung generalisierbarer ML-Methoden, K2.7 Code hat sich also am stärksten bei komplexen forschungsorientierten Programmieraufgaben verbessert.
- Der Verbrauch von Thinking-Tokens sank um ~30 %. Das Modell gelangt mit weniger interner Überlegung zur Antwort, was sich direkt auf die Antwortgeschwindigkeit und API-Kosten auswirkt.
Wie es sich gegen die führenden Closed-Source-Modelle schlägt
Der ehrliche Vergleich (aus denselben offiziellen Benchmarks):
| Benchmark | K2.7 Code | GPT-5.5 | Claude Opus 4.8 |
|---|---|---|---|
| Kimi Code Bench v2 | 62.0 | 69.0 | 67.4 |
| Program Bench | 53.6 | 69.1 | 63.8 |
| MLS Bench Lite | 35.1 | 35.5 | 42.8 |
| MCP Atlas | 76.0 | 79.4 | 81.3 |
| MCP Mark Verified | 81.1 | 92.9 | 76.4 |
Es gibt eine echte Lücke. Beim Program Bench — der Modelle auffordert, Programmverhalten aus kompilierten Binärdateien nachzubauen — erzielt GPT-5.5 einen Score von 69,1 gegenüber 53,6 bei K2.7 Code. Das ist erheblich.
Aber betrachten Sie die andere Seite:
- Bei MLS Bench Lite liegt K2.7 Code (35.1) praktisch gleichauf mit GPT-5.5 (35.5)
- Bei MCP Mark Verified schlägt K2.7 Code (81.1) Claude Opus 4.8 (76.4)
- K2.7 Code ist Open-Source. GPT-5.5 und Opus 4.8 sind es nicht.
Ein Open-Weight-Modell, das die teuersten Closed-Source-Modelle bei einigen Benchmarks erreicht oder übertrifft — das ist ein bedeutsames Signal, unabhängig davon, wo man in der Debatte Open vs. Closed steht.
1T Parameter, 32B aktiv — Architekturdetails
| Parameter | Wert |
|---|---|
| Architektur | Mixture-of-Experts (MoE) |
| Gesamtparameter | 1T |
| Aktivierte Parameter pro Token | 32B |
| Schichten | 61 |
| Experten | 384 |
| Experten pro Token | 8 |
| Kontextlänge | 256K |
| Attention | MLA (Multi-head Latent Attention) |
| Vision Encoder | MoonViT (400M Parameter) |
384 Experten, 8 aktiv pro Token — der klassische MoE-Kompromiss zwischen Kapazität und Rechenaufwand. Der MLA-Attention-Mechanismus (ursprünglich aus DeepSeek V2) hält den KV-Cache-Speicherverbrauch in Grenzen.
Der MoonViT Vision Encoder ist erwähnenswert — K2.7 Code akzeptiert Text-, Bild- und Video-Eingaben. Sie können einen Screenshot eines UI-Designs machen und das Modell den Frontend-Code schreiben lassen, oder ein Whiteboard-Architekturdiagramm für eine Analyse abfotografieren.
Preise: Open-Source, aber nicht kostenlos
Über die Kimi API:
| Modell | Eingabe (Cache Miss) | Eingabe (Cache Hit) | Ausgabe | Kontext |
|---|---|---|---|---|
| kimi-k2.7-code | $0.95/M | $0.19/M | $4.00/M | 262,144 Tokens |
Verglichen mit Claude Sonnet 4.6 bei $3.00/$15.00 — die Eingabe ist 3x günstiger, die Ausgabe fast 4x günstiger. Die API unterstützt automatisches Kontext-Caching, sodass wiederholter Kontext auf $0.19/M sinkt. Lange Multi-Turn-Sitzungen werden erheblich günstiger.
Da die Gewichte offen sind (Modified MIT License), können Sie das Modell auch selbst hosten — mit vLLM, SGLang oder KTransformers. Ein 1T-Parameter-Modell ist nicht trivial zu deployen, aber native INT4-Quantisierung ist verfügbar, und die Community hat bereits Ollama-Builds und diverse quantisierte Versionen bereitgestellt.
Kimi Code Abo-Pläne (Jahresabrechnung, monatlicher Preis):
| Plan | Preis | Geeignet für |
|---|---|---|
| Moderato | $15/Mo. | Regelmäßiges Programmieren, wöchentlich aktualisiertes Kontingent |
| Allegretto | $31/Mo. | Größeres Kontingent + höhere Parallelität |
| Allegro | $79/Mo. | Intensive Entwicklung, komplexe Projekte |
| Vivace | $159/Mo. | Maximales Kontingent, große Codebases |
Praktische Fallstricke
Ein paar Dinge, auf die Sie achten sollten:
- Thinking-Modus ist obligatorisch. K2.7 Code unterstützt keinen Non-Thinking-Modus. Wenn Sie das Denken in Kimi Code deaktivieren, fallen Anfragen automatisch auf K2.6 zurück.
- Es ist ein Programmiermodell, Punkt. Für Texterstellung, Analyse oder allgemeine Konversation empfiehlt Moonshot AI stattdessen K2.6.
- Temperature und Sampling. Die empfohlenen Einstellungen sind temperature=1.0 und top-p=0.95 — höher als die Standardwerte der meisten Modelle. Passen Sie Ihre Einstellungen entsprechend an.
Für wen ist K2.7 Code geeignet
| Szenario | Empfehlung | Warum |
|---|---|---|
| GitHub Copilot-Nutzer | Ausprobieren | Direkt in der Modellauswahl wählbar, keine Migrationskosten |
| Kostenbewusste Teams | Empfohlen | API-Preise liegen bei ~1/3 bis 1/4 von Claude |
| Bilinguale (CN/EN) Projekte | Sehr empfohlen | Chinesisches Code-Verständnis ist eine echte Stärke |
| Self-Hosting-Anforderungen | Prüfenswert | Offene Gewichte, Modified MIT License |
| Maximale Programmierleistung | Noch nicht | Program Bench und andere schwere Benchmarks liegen noch hinter GPT-5.5 |
| Nicht-Programmieraufgaben | Nicht empfohlen | Moonshot AI sagt explizit: K2.6 für Allzweckaufgaben verwenden |
Das Fazit
Kimi K2.7 Code ist nicht einfach nur ein weiteres Open-Source-Modell-Release. Es ist das erste Open-Weight-Modell in der GitHub Copilot-Modellauswahl. Es schlägt Claude Opus 4.8 bei MCP Mark Verified. Es kostet etwa ein Drittel der gängigen Closed-Source-Modelle. Und es verbraucht 30 % weniger Thinking-Tokens als sein Vorgänger.
Die Schwächen sind ebenfalls klar — es liegt bei den schwierigsten Programmier-Benchmarks hinter GPT-5.5, der erzwungene Thinking-Modus schränkt die Flexibilität ein, und das Self-Hosting eines 1T-Modells erfordert weiterhin erhebliche Infrastruktur.
Aber für die meisten realen Entwicklungsabläufe bietet K2.7 Code etwas, das es bisher nicht gab: Ein ausreichend gutes, ausreichend günstiges Open-Source-Programmiermodell, das direkt in Ihren bestehenden Tools sitzt. Das verändert die Wettbewerbslandschaft.