Kimi K2.7 Code深度体验:开源编程模型跑进了GitHub Copilot

·
review kimi moonshot coding

开源模型第一次出现在GitHub Copilot的模型选择器里

7月1日,GitHub官方博客发了一条消息:Kimi K2.7 Code正式上线GitHub Copilot,成为Copilot模型选择器中第一个开源权重模型

这件事本身就值得单独说说。GitHub Copilot此前只提供闭源模型——GPT系列、Claude系列、Gemini系列。现在一个来自中国团队Moonshot AI的开源模型挤了进去,而且是以”正式可用”而非”实验性”的身份。VS Code 1.127+、Visual Studio 17.14.6+、JetBrains 1.9.1+、Copilot CLI、甚至GitHub Mobile上都能选用。

对于企业用户,Copilot Business和Enterprise默认关闭,管理员需要手动开启Kimi K2.7 Code策略。GitHub的建议是”在启用前根据自身安全合规要求进行评估”——措辞很标准,但也说明GitHub对这个模型的质量是认可的。

从K2.6到K2.7 Code:变了什么

Kimi K2.7 Code基于K2.6训练,但定位完全不同——K2.6是通用模型,K2.7 Code专注编程。

核心数据对比(来自官方页面HuggingFace模型卡):

BenchmarkK2.6K2.7 Code提升
Kimi Code Bench v250.962.0+21.8%
Program Bench48.353.6+11.0%
MLS Bench Lite26.735.1+31.5%
Kimi Claw 24/7 Bench42.946.9+9.3%
MCP Atlas69.476.0+9.5%
MCP Mark Verified72.881.1+11.4%

两个值得注意的点:

  1. 编程提升幅度远大于Agent提升。MLS Bench Lite涨了31.5%,说明K2.7 Code在复杂ML研究类编程任务上进步最大。
  2. 思考token用量减少约30%。同样的任务,K2.7 Code花更少的”内心独白”就能给出答案,直接影响响应速度和API成本。

和顶级闭源模型比,差距在哪

直接看数据(同样来自官方benchmark):

BenchmarkK2.7 CodeGPT-5.5Claude Opus 4.8
Kimi Code Bench v262.069.067.4
Program Bench53.669.163.8
MLS Bench Lite35.135.542.8
MCP Atlas76.079.481.3
MCP Mark Verified81.192.976.4

说实话,和GPT-5.5、Claude Opus 4.8比还有差距,尤其是Program Bench(从二进制文件逆向重建程序行为)这种极限任务上,GPT-5.5的69.1对比K2.7 Code的53.6,差距明显。

但换个角度看:

  • MLS Bench Lite上,K2.7 Code的35.1和GPT-5.5的35.5基本持平
  • MCP Mark Verified上,K2.7 Code的81.1超过了Claude Opus 4.8的76.4
  • K2.7 Code是开源的,GPT-5.5和Opus 4.8不是

一个开源模型能在部分benchmark上追平甚至超越最贵的闭源模型,这个信号本身就很有意义。

1T参数,32B激活——架构细节

参数
架构Mixture-of-Experts (MoE)
总参数1T
每token激活参数32B
层数61
专家数384
每token选择专家数8
上下文长度256K
注意力机制MLA (Multi-head Latent Attention)
视觉编码器MoonViT (400M参数)

384个专家里每次只激活8个,这就是MoE架构的精髓——1T的知识容量,32B的推理成本。加上MLA注意力机制(DeepSeek V2首创的那个),KV cache的内存占用也控制得不错。

值得一提的是MoonViT视觉编码器——K2.7 Code支持文本、图像和视频输入。你可以直接截个UI设计图让它写前端代码,或者拍张白板上的架构图让它分析。

定价:开源但不免费

通过Kimi API使用:

模型输入 (cache miss)输入 (cache hit)输出上下文
kimi-k2.7-code$0.95/M$0.19/M$4.00/M262,144 tokens

对比Claude Sonnet 4.6的$3.00/$15.00,输入便宜3倍多,输出便宜近4倍。而且Kimi API支持自动上下文缓存,重复上下文的命中价格只要$0.19/M,长对话场景下成本进一步摊薄。

当然,因为权重开源(Modified MIT License),你也可以用vLLM、SGLang或KTransformers自己部署。1T参数的模型自部署门槛不低,但INT4量化方案已经提供,社区也有Ollama和各种量化版本可用。

如果通过Kimi Code订阅使用(年付月价):

方案月价适用场景
Moderato$15日常编程,每周刷新配额
Allegretto$31更大配额 + 更高并发
Allegro$79密集开发,复杂项目
Vivace$159最高配额,大型代码库

实际使用注意事项

几个容易踩的坑:

  1. 强制thinking模式。K2.7 Code不支持关闭思考模式,永远带着思维链运行。如果你在Kimi Code里关闭thinking,请求会自动回退到K2.6。
  2. 专为编程设计。写文章、做分析、日常对话,官方建议用K2.6而不是K2.7 Code。术业有专攻。
  3. 温度和采样参数。官方推荐temperature=1.0, top-p=0.95——这和大多数模型默认的低温度不同,注意调整。

谁应该试试K2.7 Code

场景是否推荐理由
使用GitHub Copilot的开发者推荐尝试直接在Copilot里选用,零迁移成本
成本敏感的团队推荐API价格约为Claude的1/3-1/4
中英双语项目强烈推荐中文编程理解是强项
需要自部署的企业值得评估开源权重,Modified MIT许可
追求极限编程能力暂时不推荐Program Bench等硬指标仍落后GPT-5.5
非编程用途不推荐官方明确说通用任务用K2.6

写在最后

Kimi K2.7 Code不是”又一个开源模型”。它是第一个进入GitHub Copilot模型选择器的开源权重模型,在MCP Mark Verified上超过了Claude Opus 4.8,API价格不到主流闭源模型的三分之一,还把思考token砍了30%。

缺点也明摆着——在最难的编程benchmark上和GPT-5.5差距不小,强制thinking模式限制了灵活性,1T参数的自部署门槛依然很高。

但对大多数实际开发场景来说,K2.7 Code提供了一个此前不存在的选项:一个足够好、足够便宜、还开源的编程模型。这本身就改变了竞争格局。