Kimi K2.7 Code深度體驗:開源程式設計模型跑進了GitHub Copilot

·
review kimi moonshot coding

開源模型第一次出現在GitHub Copilot的模型選擇器裡

7月1日,GitHub官方部落格發了一則消息:Kimi K2.7 Code正式上線GitHub Copilot,成為Copilot模型選擇器中第一個開源權重模型

這件事本身就值得單獨聊聊。GitHub Copilot此前只提供閉源模型——GPT系列、Claude系列、Gemini系列。現在一個來自中國團隊Moonshot AI的開源模型擠了進去,而且是以「正式可用」而非「實驗性」的身份。VS Code 1.127+、Visual Studio 17.14.6+、JetBrains 1.9.1+、Copilot CLI、甚至GitHub Mobile上都能選用。

對於企業用戶,Copilot Business和Enterprise預設關閉,管理員需要手動開啟Kimi K2.7 Code政策。GitHub的建議是「在啟用前根據自身安全合規要求進行評估」——措辭很標準,但也說明GitHub對這個模型的品質是認可的。

從K2.6到K2.7 Code:改了什麼

Kimi K2.7 Code基於K2.6訓練,但定位完全不同——K2.6是通用模型,K2.7 Code專注程式設計。

核心數據對比(來自官方頁面HuggingFace模型卡):

BenchmarkK2.6K2.7 Code提升
Kimi Code Bench v250.962.0+21.8%
Program Bench48.353.6+11.0%
MLS Bench Lite26.735.1+31.5%
Kimi Claw 24/7 Bench42.946.9+9.3%
MCP Atlas69.476.0+9.5%
MCP Mark Verified72.881.1+11.4%

兩個值得注意的點:

  1. 程式設計提升幅度遠大於Agent提升。MLS Bench Lite漲了31.5%,說明K2.7 Code在複雜ML研究類程式設計任務上進步最大。
  2. 思考token用量減少約30%。同樣的任務,K2.7 Code花更少的「內心獨白」就能給出答案,直接影響回應速度和API成本。

和頂級閉源模型比,差距在哪

直接看數據(同樣來自官方benchmark):

BenchmarkK2.7 CodeGPT-5.5Claude Opus 4.8
Kimi Code Bench v262.069.067.4
Program Bench53.669.163.8
MLS Bench Lite35.135.542.8
MCP Atlas76.079.481.3
MCP Mark Verified81.192.976.4

老實說,和GPT-5.5、Claude Opus 4.8比還有差距,尤其是Program Bench(從二進位檔案逆向重建程式行為)這種極限任務上,GPT-5.5的69.1對比K2.7 Code的53.6,差距明顯。

但換個角度看:

  • MLS Bench Lite上,K2.7 Code的35.1和GPT-5.5的35.5基本持平
  • MCP Mark Verified上,K2.7 Code的81.1超過了Claude Opus 4.8的76.4
  • K2.7 Code是開源的,GPT-5.5和Opus 4.8不是

一個開源模型能在部分benchmark上追平甚至超越最貴的閉源模型,這個訊號本身就很有意義。

1T參數,32B啟動——架構細節

參數
架構Mixture-of-Experts (MoE)
總參數1T
每token啟動參數32B
層數61
專家數384
每token選擇專家數8
上下文長度256K
注意力機制MLA (Multi-head Latent Attention)
視覺編碼器MoonViT (400M參數)

384個專家裡每次只啟動8個,這就是MoE架構的精髓——1T的知識容量,32B的推理成本。加上MLA注意力機制(DeepSeek V2首創的那個),KV cache的記憶體佔用也控制得不錯。

值得一提的是MoonViT視覺編碼器——K2.7 Code支援文字、圖片和影片輸入。你可以直接截一張UI設計圖讓它寫前端程式碼,或者拍張白板上的架構圖讓它分析。

定價:開源但不免費

透過Kimi API使用:

模型輸入 (cache miss)輸入 (cache hit)輸出上下文
kimi-k2.7-code$0.95/M$0.19/M$4.00/M262,144 tokens

對比Claude Sonnet 4.6的$3.00/$15.00,輸入便宜3倍多,輸出便宜近4倍。而且Kimi API支援自動上下文快取,重複上下文的命中價格只要$0.19/M,長對話場景下成本進一步攤薄。

當然,因為權重開源(Modified MIT License),你也可以用vLLM、SGLang或KTransformers自己部署。1T參數的模型自部署門檻不低,但INT4量化方案已經提供,社群也有Ollama和各種量化版本可用。

如果透過Kimi Code訂閱使用(年付月價):

方案月價適用場景
Moderato$15日常寫程式,每週刷新配額
Allegretto$31更大配額 + 更高並行
Allegro$79密集開發,複雜專案
Vivace$159最高配額,大型程式碼庫

實際使用注意事項

幾個容易踩的坑:

  1. 強制thinking模式。K2.7 Code不支援關閉思考模式,永遠帶著思維鏈運行。如果你在Kimi Code裡關閉thinking,請求會自動回退到K2.6。
  2. 專為程式設計打造。寫文章、做分析、日常對話,官方建議用K2.6而不是K2.7 Code。術業有專攻。
  3. 溫度和取樣參數。官方推薦temperature=1.0, top-p=0.95——這和大多數模型預設的低溫度不同,注意調整。

誰應該試試K2.7 Code

場景是否推薦理由
使用GitHub Copilot的開發者推薦嘗試直接在Copilot裡選用,零遷移成本
成本敏感的團隊推薦API價格約為Claude的1/3-1/4
中英雙語專案強烈推薦中文程式設計理解是強項
需要自部署的企業值得評估開源權重,Modified MIT許可
追求極限程式設計能力暫時不推薦Program Bench等硬指標仍落後GPT-5.5
非程式設計用途不推薦官方明確說通用任務用K2.6

寫在最後

Kimi K2.7 Code不是「又一個開源模型」。它是第一個進入GitHub Copilot模型選擇器的開源權重模型,在MCP Mark Verified上超過了Claude Opus 4.8,API價格不到主流閉源模型的三分之一,還把思考token砍了30%。

缺點也擺在那裡——在最難的程式設計benchmark上和GPT-5.5差距不小,強制thinking模式限制了靈活性,1T參數的自部署門檻依然很高。

但對大多數實際開發場景來說,K2.7 Code提供了一個此前不存在的選項:一個夠好、夠便宜、還開源的程式設計模型。這本身就改變了競爭格局。