Test de Kimi K2.7 Code : Le premier modèle open-weight dans GitHub Copilot
Un modèle open-weight vient d’entrer dans GitHub Copilot
Le 1er juillet, GitHub a publié une annonce discrète : Kimi K2.7 Code est désormais disponible en accès général dans GitHub Copilot. C’est le premier modèle open-weight à apparaître dans le sélecteur de modèles de Copilot.
Jusqu’à présent, Copilot ne proposait que des modèles propriétaires — GPT, Claude, Gemini. Désormais, un modèle de Moonshot AI, un laboratoire d’IA chinois, figure à leurs côtés. Vous pouvez le sélectionner dans VS Code 1.127+, Visual Studio 17.14.6+, JetBrains 1.9.1+, Copilot CLI et même GitHub Mobile.
Pour les utilisateurs entreprise, les plans Copilot Business et Enterprise le désactivent par défaut — les administrateurs doivent activer explicitement la politique Kimi K2.7 Code. GitHub recommande de l’évaluer au regard de vos exigences de sécurité et de conformité. Un langage standard, mais le simple fait qu’il soit présent en dit long sur la qualité du modèle.
De K2.6 à K2.7 Code : ce qui a changé
Kimi K2.7 Code est construit sur K2.6 mais remplit un objectif différent — K2.6 est un modèle généraliste, K2.7 Code est spécialisé dans le codage.
Données de benchmark issues de la page officielle et de la fiche modèle HuggingFace :
| Benchmark | K2.6 | K2.7 Code | Amélioration |
|---|---|---|---|
| Kimi Code Bench v2 | 50.9 | 62.0 | +21.8% |
| Program Bench | 48.3 | 53.6 | +11.0% |
| MLS Bench Lite | 26.7 | 35.1 | +31.5% |
| Kimi Claw 24/7 Bench | 42.9 | 46.9 | +9.3% |
| MCP Atlas | 69.4 | 76.0 | +9.5% |
| MCP Mark Verified | 72.8 | 81.1 | +11.4% |
Deux points à retenir :
- Les gains en codage sont bien supérieurs aux gains agentiques. MLS Bench Lite a bondi de 31,5 % — ce benchmark demande aux modèles d’inventer des méthodes de ML généralisables, K2.7 Code s’est donc le plus amélioré sur les tâches de codage complexes orientées recherche.
- L’utilisation des tokens de réflexion a chuté d’environ 30 %. Le modèle arrive aux réponses avec moins de délibération interne, ce qui impacte directement la vitesse de réponse et les coûts API.
Face aux meilleurs modèles propriétaires
La comparaison honnête (à partir des mêmes benchmarks officiels) :
| Benchmark | K2.7 Code | GPT-5.5 | Claude Opus 4.8 |
|---|---|---|---|
| Kimi Code Bench v2 | 62.0 | 69.0 | 67.4 |
| Program Bench | 53.6 | 69.1 | 63.8 |
| MLS Bench Lite | 35.1 | 35.5 | 42.8 |
| MCP Atlas | 76.0 | 79.4 | 81.3 |
| MCP Mark Verified | 81.1 | 92.9 | 76.4 |
L’écart est réel. Sur Program Bench — qui demande aux modèles de reconstituer le comportement d’un programme à partir de binaires compilés — GPT-5.5 obtient 69,1 contre 53,6 pour K2.7 Code. C’est significatif.
Mais regardez l’autre côté :
- Sur MLS Bench Lite, K2.7 Code (35,1) est pratiquement à égalité avec GPT-5.5 (35,5)
- Sur MCP Mark Verified, K2.7 Code (81,1) bat Claude Opus 4.8 (76,4)
- K2.7 Code est open-source. GPT-5.5 et Opus 4.8 ne le sont pas.
Un modèle open-weight qui égale ou dépasse les modèles propriétaires les plus chers sur certains benchmarks — c’est un signal fort, quelle que soit votre position dans le débat ouvert vs fermé.
1T paramètres, 32B actifs — Détails d’architecture
| Paramètre | Valeur |
|---|---|
| Architecture | Mixture-of-Experts (MoE) |
| Paramètres totaux | 1T |
| Paramètres activés par token | 32B |
| Couches | 61 |
| Experts | 384 |
| Experts par token | 8 |
| Longueur de contexte | 256K |
| Attention | MLA (Multi-head Latent Attention) |
| Encodeur vision | MoonViT (400M paramètres) |
384 experts, 8 actifs par token — le compromis classique MoE entre capacité et calcul. Le mécanisme d’attention MLA (originaire de DeepSeek V2) maintient la mémoire du cache KV sous contrôle.
L’encodeur vision MoonViT mérite d’être mentionné — K2.7 Code accepte du texte, des images et de la vidéo en entrée. Vous pouvez capturer une maquette d’interface et lui faire écrire le code frontend, ou photographier un diagramme d’architecture sur tableau blanc pour analyse.
Tarification : open-source mais pas gratuit
Via l’API Kimi :
| Modèle | Input (cache miss) | Input (cache hit) | Output | Contexte |
|---|---|---|---|---|
| kimi-k2.7-code | $0.95/M | $0.19/M | $4.00/M | 262,144 tokens |
Comparez avec Claude Sonnet 4.6 à $3.00/$15.00 — l’input est 3 fois moins cher, l’output près de 4 fois moins cher. L’API prend en charge la mise en cache automatique du contexte, donc le contexte répété descend à $0,19/M. Les longues sessions multi-tours deviennent nettement plus économiques.
Puisque les poids sont ouverts (licence Modified MIT), vous pouvez également l’auto-héberger avec vLLM, SGLang ou KTransformers. Un modèle de 1T paramètres n’est pas trivial à déployer, mais la quantification INT4 native est disponible, et la communauté propose des builds Ollama et diverses versions quantifiées.
Plans d’abonnement Kimi Code (facturation annuelle, prix mensuel) :
| Plan | Prix | Idéal pour |
|---|---|---|
| Moderato | $15/mo | Codage régulier, quota renouvelé chaque semaine |
| Allegretto | $31/mo | Quota plus large + concurrence accrue |
| Allegro | $79/mo | Développement intensif, projets complexes |
| Vivace | $159/mo | Quota maximum, grandes bases de code |
Points d’attention pratiques
Quelques éléments à surveiller :
- Le mode réflexion est obligatoire. K2.7 Code ne prend pas en charge le mode sans réflexion. Si vous désactivez la réflexion dans Kimi Code, les requêtes basculent automatiquement vers K2.6.
- C’est un modèle de codage, point final. Pour la rédaction, l’analyse ou la conversation générale, Moonshot AI recommande K2.6 à la place.
- Température et échantillonnage. Les paramètres recommandés sont temperature=1.0 et top-p=0.95 — plus élevés que les valeurs par défaut de la plupart des modèles. Ajustez en conséquence.
À qui s’adresse K2.7 Code
| Scénario | Recommandation | Pourquoi |
|---|---|---|
| Utilisateurs GitHub Copilot | À essayer | Sélectionnez-le directement dans le sélecteur de modèles, zéro coût de migration |
| Équipes soucieuses des coûts | Recommandé | Les tarifs API sont environ 1/3 à 1/4 de ceux de Claude |
| Projets bilingues (CN/EN) | Fortement recommandé | La compréhension du code en chinois est un véritable atout |
| Besoin d’auto-hébergement | À évaluer | Poids ouverts, licence Modified MIT |
| Performance maximale en codage | Pas encore | Program Bench et d’autres benchmarks difficiles restent en retrait par rapport à GPT-5.5 |
| Tâches non liées au codage | Non recommandé | Moonshot AI indique explicitement d’utiliser K2.6 pour les tâches généralistes |
Le verdict
Kimi K2.7 Code n’est pas simplement une nouvelle sortie de modèle open-source. C’est le premier modèle open-weight dans le sélecteur de modèles de GitHub Copilot. Il bat Claude Opus 4.8 sur MCP Mark Verified. Il coûte environ un tiers des modèles propriétaires courants. Et il utilise 30 % de tokens de réflexion en moins que son prédécesseur.
Les faiblesses sont claires aussi — il est en retrait par rapport à GPT-5.5 sur les benchmarks de codage les plus difficiles, le mode réflexion imposé limite la flexibilité, et l’auto-hébergement d’un modèle de 1T paramètres nécessite toujours une infrastructure conséquente.
Mais pour la plupart des workflows de développement réels, K2.7 Code offre quelque chose qui n’existait pas auparavant : un modèle de codage open-source suffisamment performant, suffisamment économique, et intégré directement dans vos outils existants. Cela change la donne concurrentielle.