Kimi K2.7 Code深度體驗:開源程式設計模型跑進了GitHub Copilot
開源模型第一次出現在GitHub Copilot的模型選擇器裡
7月1日,GitHub官方部落格發了一則消息:Kimi K2.7 Code正式上線GitHub Copilot,成為Copilot模型選擇器中第一個開源權重模型。
這件事本身就值得單獨聊聊。GitHub Copilot此前只提供閉源模型——GPT系列、Claude系列、Gemini系列。現在一個來自中國團隊Moonshot AI的開源模型擠了進去,而且是以「正式可用」而非「實驗性」的身份。VS Code 1.127+、Visual Studio 17.14.6+、JetBrains 1.9.1+、Copilot CLI、甚至GitHub Mobile上都能選用。
對於企業用戶,Copilot Business和Enterprise預設關閉,管理員需要手動開啟Kimi K2.7 Code政策。GitHub的建議是「在啟用前根據自身安全合規要求進行評估」——措辭很標準,但也說明GitHub對這個模型的品質是認可的。
從K2.6到K2.7 Code:改了什麼
Kimi K2.7 Code基於K2.6訓練,但定位完全不同——K2.6是通用模型,K2.7 Code專注程式設計。
核心數據對比(來自官方頁面和HuggingFace模型卡):
| Benchmark | K2.6 | K2.7 Code | 提升 |
|---|---|---|---|
| Kimi Code Bench v2 | 50.9 | 62.0 | +21.8% |
| Program Bench | 48.3 | 53.6 | +11.0% |
| MLS Bench Lite | 26.7 | 35.1 | +31.5% |
| Kimi Claw 24/7 Bench | 42.9 | 46.9 | +9.3% |
| MCP Atlas | 69.4 | 76.0 | +9.5% |
| MCP Mark Verified | 72.8 | 81.1 | +11.4% |
兩個值得注意的點:
- 程式設計提升幅度遠大於Agent提升。MLS Bench Lite漲了31.5%,說明K2.7 Code在複雜ML研究類程式設計任務上進步最大。
- 思考token用量減少約30%。同樣的任務,K2.7 Code花更少的「內心獨白」就能給出答案,直接影響回應速度和API成本。
和頂級閉源模型比,差距在哪
直接看數據(同樣來自官方benchmark):
| Benchmark | K2.7 Code | GPT-5.5 | Claude Opus 4.8 |
|---|---|---|---|
| Kimi Code Bench v2 | 62.0 | 69.0 | 67.4 |
| Program Bench | 53.6 | 69.1 | 63.8 |
| MLS Bench Lite | 35.1 | 35.5 | 42.8 |
| MCP Atlas | 76.0 | 79.4 | 81.3 |
| MCP Mark Verified | 81.1 | 92.9 | 76.4 |
老實說,和GPT-5.5、Claude Opus 4.8比還有差距,尤其是Program Bench(從二進位檔案逆向重建程式行為)這種極限任務上,GPT-5.5的69.1對比K2.7 Code的53.6,差距明顯。
但換個角度看:
- MLS Bench Lite上,K2.7 Code的35.1和GPT-5.5的35.5基本持平
- MCP Mark Verified上,K2.7 Code的81.1超過了Claude Opus 4.8的76.4
- K2.7 Code是開源的,GPT-5.5和Opus 4.8不是
一個開源模型能在部分benchmark上追平甚至超越最貴的閉源模型,這個訊號本身就很有意義。
1T參數,32B啟動——架構細節
| 參數 | 值 |
|---|---|
| 架構 | Mixture-of-Experts (MoE) |
| 總參數 | 1T |
| 每token啟動參數 | 32B |
| 層數 | 61 |
| 專家數 | 384 |
| 每token選擇專家數 | 8 |
| 上下文長度 | 256K |
| 注意力機制 | MLA (Multi-head Latent Attention) |
| 視覺編碼器 | MoonViT (400M參數) |
384個專家裡每次只啟動8個,這就是MoE架構的精髓——1T的知識容量,32B的推理成本。加上MLA注意力機制(DeepSeek V2首創的那個),KV cache的記憶體佔用也控制得不錯。
值得一提的是MoonViT視覺編碼器——K2.7 Code支援文字、圖片和影片輸入。你可以直接截一張UI設計圖讓它寫前端程式碼,或者拍張白板上的架構圖讓它分析。
定價:開源但不免費
透過Kimi API使用:
| 模型 | 輸入 (cache miss) | 輸入 (cache hit) | 輸出 | 上下文 |
|---|---|---|---|---|
| kimi-k2.7-code | $0.95/M | $0.19/M | $4.00/M | 262,144 tokens |
對比Claude Sonnet 4.6的$3.00/$15.00,輸入便宜3倍多,輸出便宜近4倍。而且Kimi API支援自動上下文快取,重複上下文的命中價格只要$0.19/M,長對話場景下成本進一步攤薄。
當然,因為權重開源(Modified MIT License),你也可以用vLLM、SGLang或KTransformers自己部署。1T參數的模型自部署門檻不低,但INT4量化方案已經提供,社群也有Ollama和各種量化版本可用。
如果透過Kimi Code訂閱使用(年付月價):
| 方案 | 月價 | 適用場景 |
|---|---|---|
| Moderato | $15 | 日常寫程式,每週刷新配額 |
| Allegretto | $31 | 更大配額 + 更高並行 |
| Allegro | $79 | 密集開發,複雜專案 |
| Vivace | $159 | 最高配額,大型程式碼庫 |
實際使用注意事項
幾個容易踩的坑:
- 強制thinking模式。K2.7 Code不支援關閉思考模式,永遠帶著思維鏈運行。如果你在Kimi Code裡關閉thinking,請求會自動回退到K2.6。
- 專為程式設計打造。寫文章、做分析、日常對話,官方建議用K2.6而不是K2.7 Code。術業有專攻。
- 溫度和取樣參數。官方推薦temperature=1.0, top-p=0.95——這和大多數模型預設的低溫度不同,注意調整。
誰應該試試K2.7 Code
| 場景 | 是否推薦 | 理由 |
|---|---|---|
| 使用GitHub Copilot的開發者 | 推薦嘗試 | 直接在Copilot裡選用,零遷移成本 |
| 成本敏感的團隊 | 推薦 | API價格約為Claude的1/3-1/4 |
| 中英雙語專案 | 強烈推薦 | 中文程式設計理解是強項 |
| 需要自部署的企業 | 值得評估 | 開源權重,Modified MIT許可 |
| 追求極限程式設計能力 | 暫時不推薦 | Program Bench等硬指標仍落後GPT-5.5 |
| 非程式設計用途 | 不推薦 | 官方明確說通用任務用K2.6 |
寫在最後
Kimi K2.7 Code不是「又一個開源模型」。它是第一個進入GitHub Copilot模型選擇器的開源權重模型,在MCP Mark Verified上超過了Claude Opus 4.8,API價格不到主流閉源模型的三分之一,還把思考token砍了30%。
缺點也擺在那裡——在最難的程式設計benchmark上和GPT-5.5差距不小,強制thinking模式限制了靈活性,1T參數的自部署門檻依然很高。
但對大多數實際開發場景來說,K2.7 Code提供了一個此前不存在的選項:一個夠好、夠便宜、還開源的程式設計模型。這本身就改變了競爭格局。