Test de Kimi K2.7 Code : Le premier modèle open-weight dans GitHub Copilot

·
review kimi moonshot coding

Un modèle open-weight vient d’entrer dans GitHub Copilot

Le 1er juillet, GitHub a publié une annonce discrète : Kimi K2.7 Code est désormais disponible en accès général dans GitHub Copilot. C’est le premier modèle open-weight à apparaître dans le sélecteur de modèles de Copilot.

Jusqu’à présent, Copilot ne proposait que des modèles propriétaires — GPT, Claude, Gemini. Désormais, un modèle de Moonshot AI, un laboratoire d’IA chinois, figure à leurs côtés. Vous pouvez le sélectionner dans VS Code 1.127+, Visual Studio 17.14.6+, JetBrains 1.9.1+, Copilot CLI et même GitHub Mobile.

Pour les utilisateurs entreprise, les plans Copilot Business et Enterprise le désactivent par défaut — les administrateurs doivent activer explicitement la politique Kimi K2.7 Code. GitHub recommande de l’évaluer au regard de vos exigences de sécurité et de conformité. Un langage standard, mais le simple fait qu’il soit présent en dit long sur la qualité du modèle.

De K2.6 à K2.7 Code : ce qui a changé

Kimi K2.7 Code est construit sur K2.6 mais remplit un objectif différent — K2.6 est un modèle généraliste, K2.7 Code est spécialisé dans le codage.

Données de benchmark issues de la page officielle et de la fiche modèle HuggingFace :

BenchmarkK2.6K2.7 CodeAmélioration
Kimi Code Bench v250.962.0+21.8%
Program Bench48.353.6+11.0%
MLS Bench Lite26.735.1+31.5%
Kimi Claw 24/7 Bench42.946.9+9.3%
MCP Atlas69.476.0+9.5%
MCP Mark Verified72.881.1+11.4%

Deux points à retenir :

  1. Les gains en codage sont bien supérieurs aux gains agentiques. MLS Bench Lite a bondi de 31,5 % — ce benchmark demande aux modèles d’inventer des méthodes de ML généralisables, K2.7 Code s’est donc le plus amélioré sur les tâches de codage complexes orientées recherche.
  2. L’utilisation des tokens de réflexion a chuté d’environ 30 %. Le modèle arrive aux réponses avec moins de délibération interne, ce qui impacte directement la vitesse de réponse et les coûts API.

Face aux meilleurs modèles propriétaires

La comparaison honnête (à partir des mêmes benchmarks officiels) :

BenchmarkK2.7 CodeGPT-5.5Claude Opus 4.8
Kimi Code Bench v262.069.067.4
Program Bench53.669.163.8
MLS Bench Lite35.135.542.8
MCP Atlas76.079.481.3
MCP Mark Verified81.192.976.4

L’écart est réel. Sur Program Bench — qui demande aux modèles de reconstituer le comportement d’un programme à partir de binaires compilés — GPT-5.5 obtient 69,1 contre 53,6 pour K2.7 Code. C’est significatif.

Mais regardez l’autre côté :

  • Sur MLS Bench Lite, K2.7 Code (35,1) est pratiquement à égalité avec GPT-5.5 (35,5)
  • Sur MCP Mark Verified, K2.7 Code (81,1) bat Claude Opus 4.8 (76,4)
  • K2.7 Code est open-source. GPT-5.5 et Opus 4.8 ne le sont pas.

Un modèle open-weight qui égale ou dépasse les modèles propriétaires les plus chers sur certains benchmarks — c’est un signal fort, quelle que soit votre position dans le débat ouvert vs fermé.

1T paramètres, 32B actifs — Détails d’architecture

ParamètreValeur
ArchitectureMixture-of-Experts (MoE)
Paramètres totaux1T
Paramètres activés par token32B
Couches61
Experts384
Experts par token8
Longueur de contexte256K
AttentionMLA (Multi-head Latent Attention)
Encodeur visionMoonViT (400M paramètres)

384 experts, 8 actifs par token — le compromis classique MoE entre capacité et calcul. Le mécanisme d’attention MLA (originaire de DeepSeek V2) maintient la mémoire du cache KV sous contrôle.

L’encodeur vision MoonViT mérite d’être mentionné — K2.7 Code accepte du texte, des images et de la vidéo en entrée. Vous pouvez capturer une maquette d’interface et lui faire écrire le code frontend, ou photographier un diagramme d’architecture sur tableau blanc pour analyse.

Tarification : open-source mais pas gratuit

Via l’API Kimi :

ModèleInput (cache miss)Input (cache hit)OutputContexte
kimi-k2.7-code$0.95/M$0.19/M$4.00/M262,144 tokens

Comparez avec Claude Sonnet 4.6 à $3.00/$15.00 — l’input est 3 fois moins cher, l’output près de 4 fois moins cher. L’API prend en charge la mise en cache automatique du contexte, donc le contexte répété descend à $0,19/M. Les longues sessions multi-tours deviennent nettement plus économiques.

Puisque les poids sont ouverts (licence Modified MIT), vous pouvez également l’auto-héberger avec vLLM, SGLang ou KTransformers. Un modèle de 1T paramètres n’est pas trivial à déployer, mais la quantification INT4 native est disponible, et la communauté propose des builds Ollama et diverses versions quantifiées.

Plans d’abonnement Kimi Code (facturation annuelle, prix mensuel) :

PlanPrixIdéal pour
Moderato$15/moCodage régulier, quota renouvelé chaque semaine
Allegretto$31/moQuota plus large + concurrence accrue
Allegro$79/moDéveloppement intensif, projets complexes
Vivace$159/moQuota maximum, grandes bases de code

Points d’attention pratiques

Quelques éléments à surveiller :

  1. Le mode réflexion est obligatoire. K2.7 Code ne prend pas en charge le mode sans réflexion. Si vous désactivez la réflexion dans Kimi Code, les requêtes basculent automatiquement vers K2.6.
  2. C’est un modèle de codage, point final. Pour la rédaction, l’analyse ou la conversation générale, Moonshot AI recommande K2.6 à la place.
  3. Température et échantillonnage. Les paramètres recommandés sont temperature=1.0 et top-p=0.95 — plus élevés que les valeurs par défaut de la plupart des modèles. Ajustez en conséquence.

À qui s’adresse K2.7 Code

ScénarioRecommandationPourquoi
Utilisateurs GitHub CopilotÀ essayerSélectionnez-le directement dans le sélecteur de modèles, zéro coût de migration
Équipes soucieuses des coûtsRecommandéLes tarifs API sont environ 1/3 à 1/4 de ceux de Claude
Projets bilingues (CN/EN)Fortement recommandéLa compréhension du code en chinois est un véritable atout
Besoin d’auto-hébergementÀ évaluerPoids ouverts, licence Modified MIT
Performance maximale en codagePas encoreProgram Bench et d’autres benchmarks difficiles restent en retrait par rapport à GPT-5.5
Tâches non liées au codageNon recommandéMoonshot AI indique explicitement d’utiliser K2.6 pour les tâches généralistes

Le verdict

Kimi K2.7 Code n’est pas simplement une nouvelle sortie de modèle open-source. C’est le premier modèle open-weight dans le sélecteur de modèles de GitHub Copilot. Il bat Claude Opus 4.8 sur MCP Mark Verified. Il coûte environ un tiers des modèles propriétaires courants. Et il utilise 30 % de tokens de réflexion en moins que son prédécesseur.

Les faiblesses sont claires aussi — il est en retrait par rapport à GPT-5.5 sur les benchmarks de codage les plus difficiles, le mode réflexion imposé limite la flexibilité, et l’auto-hébergement d’un modèle de 1T paramètres nécessite toujours une infrastructure conséquente.

Mais pour la plupart des workflows de développement réels, K2.7 Code offre quelque chose qui n’existait pas auparavant : un modèle de codage open-source suffisamment performant, suffisamment économique, et intégré directement dans vos outils existants. Cela change la donne concurrentielle.