Kimi K2.7 Code深度体验:开源编程模型跑进了GitHub Copilot
开源模型第一次出现在GitHub Copilot的模型选择器里
7月1日,GitHub官方博客发了一条消息:Kimi K2.7 Code正式上线GitHub Copilot,成为Copilot模型选择器中第一个开源权重模型。
这件事本身就值得单独说说。GitHub Copilot此前只提供闭源模型——GPT系列、Claude系列、Gemini系列。现在一个来自中国团队Moonshot AI的开源模型挤了进去,而且是以”正式可用”而非”实验性”的身份。VS Code 1.127+、Visual Studio 17.14.6+、JetBrains 1.9.1+、Copilot CLI、甚至GitHub Mobile上都能选用。
对于企业用户,Copilot Business和Enterprise默认关闭,管理员需要手动开启Kimi K2.7 Code策略。GitHub的建议是”在启用前根据自身安全合规要求进行评估”——措辞很标准,但也说明GitHub对这个模型的质量是认可的。
从K2.6到K2.7 Code:变了什么
Kimi K2.7 Code基于K2.6训练,但定位完全不同——K2.6是通用模型,K2.7 Code专注编程。
核心数据对比(来自官方页面和HuggingFace模型卡):
| Benchmark | K2.6 | K2.7 Code | 提升 |
|---|---|---|---|
| Kimi Code Bench v2 | 50.9 | 62.0 | +21.8% |
| Program Bench | 48.3 | 53.6 | +11.0% |
| MLS Bench Lite | 26.7 | 35.1 | +31.5% |
| Kimi Claw 24/7 Bench | 42.9 | 46.9 | +9.3% |
| MCP Atlas | 69.4 | 76.0 | +9.5% |
| MCP Mark Verified | 72.8 | 81.1 | +11.4% |
两个值得注意的点:
- 编程提升幅度远大于Agent提升。MLS Bench Lite涨了31.5%,说明K2.7 Code在复杂ML研究类编程任务上进步最大。
- 思考token用量减少约30%。同样的任务,K2.7 Code花更少的”内心独白”就能给出答案,直接影响响应速度和API成本。
和顶级闭源模型比,差距在哪
直接看数据(同样来自官方benchmark):
| Benchmark | K2.7 Code | GPT-5.5 | Claude Opus 4.8 |
|---|---|---|---|
| Kimi Code Bench v2 | 62.0 | 69.0 | 67.4 |
| Program Bench | 53.6 | 69.1 | 63.8 |
| MLS Bench Lite | 35.1 | 35.5 | 42.8 |
| MCP Atlas | 76.0 | 79.4 | 81.3 |
| MCP Mark Verified | 81.1 | 92.9 | 76.4 |
说实话,和GPT-5.5、Claude Opus 4.8比还有差距,尤其是Program Bench(从二进制文件逆向重建程序行为)这种极限任务上,GPT-5.5的69.1对比K2.7 Code的53.6,差距明显。
但换个角度看:
- MLS Bench Lite上,K2.7 Code的35.1和GPT-5.5的35.5基本持平
- MCP Mark Verified上,K2.7 Code的81.1超过了Claude Opus 4.8的76.4
- K2.7 Code是开源的,GPT-5.5和Opus 4.8不是
一个开源模型能在部分benchmark上追平甚至超越最贵的闭源模型,这个信号本身就很有意义。
1T参数,32B激活——架构细节
| 参数 | 值 |
|---|---|
| 架构 | Mixture-of-Experts (MoE) |
| 总参数 | 1T |
| 每token激活参数 | 32B |
| 层数 | 61 |
| 专家数 | 384 |
| 每token选择专家数 | 8 |
| 上下文长度 | 256K |
| 注意力机制 | MLA (Multi-head Latent Attention) |
| 视觉编码器 | MoonViT (400M参数) |
384个专家里每次只激活8个,这就是MoE架构的精髓——1T的知识容量,32B的推理成本。加上MLA注意力机制(DeepSeek V2首创的那个),KV cache的内存占用也控制得不错。
值得一提的是MoonViT视觉编码器——K2.7 Code支持文本、图像和视频输入。你可以直接截个UI设计图让它写前端代码,或者拍张白板上的架构图让它分析。
定价:开源但不免费
通过Kimi API使用:
| 模型 | 输入 (cache miss) | 输入 (cache hit) | 输出 | 上下文 |
|---|---|---|---|---|
| kimi-k2.7-code | $0.95/M | $0.19/M | $4.00/M | 262,144 tokens |
对比Claude Sonnet 4.6的$3.00/$15.00,输入便宜3倍多,输出便宜近4倍。而且Kimi API支持自动上下文缓存,重复上下文的命中价格只要$0.19/M,长对话场景下成本进一步摊薄。
当然,因为权重开源(Modified MIT License),你也可以用vLLM、SGLang或KTransformers自己部署。1T参数的模型自部署门槛不低,但INT4量化方案已经提供,社区也有Ollama和各种量化版本可用。
如果通过Kimi Code订阅使用(年付月价):
| 方案 | 月价 | 适用场景 |
|---|---|---|
| Moderato | $15 | 日常编程,每周刷新配额 |
| Allegretto | $31 | 更大配额 + 更高并发 |
| Allegro | $79 | 密集开发,复杂项目 |
| Vivace | $159 | 最高配额,大型代码库 |
实际使用注意事项
几个容易踩的坑:
- 强制thinking模式。K2.7 Code不支持关闭思考模式,永远带着思维链运行。如果你在Kimi Code里关闭thinking,请求会自动回退到K2.6。
- 专为编程设计。写文章、做分析、日常对话,官方建议用K2.6而不是K2.7 Code。术业有专攻。
- 温度和采样参数。官方推荐temperature=1.0, top-p=0.95——这和大多数模型默认的低温度不同,注意调整。
谁应该试试K2.7 Code
| 场景 | 是否推荐 | 理由 |
|---|---|---|
| 使用GitHub Copilot的开发者 | 推荐尝试 | 直接在Copilot里选用,零迁移成本 |
| 成本敏感的团队 | 推荐 | API价格约为Claude的1/3-1/4 |
| 中英双语项目 | 强烈推荐 | 中文编程理解是强项 |
| 需要自部署的企业 | 值得评估 | 开源权重,Modified MIT许可 |
| 追求极限编程能力 | 暂时不推荐 | Program Bench等硬指标仍落后GPT-5.5 |
| 非编程用途 | 不推荐 | 官方明确说通用任务用K2.6 |
写在最后
Kimi K2.7 Code不是”又一个开源模型”。它是第一个进入GitHub Copilot模型选择器的开源权重模型,在MCP Mark Verified上超过了Claude Opus 4.8,API价格不到主流闭源模型的三分之一,还把思考token砍了30%。
缺点也明摆着——在最难的编程benchmark上和GPT-5.5差距不小,强制thinking模式限制了灵活性,1T参数的自部署门槛依然很高。
但对大多数实际开发场景来说,K2.7 Code提供了一个此前不存在的选项:一个足够好、足够便宜、还开源的编程模型。这本身就改变了竞争格局。