Análisis de Kimi K2.7 Code: El Primer Modelo de Pesos Abiertos en GitHub Copilot
Un Modelo de Pesos Abiertos Acaba de Entrar en GitHub Copilot
El 1 de julio, GitHub hizo un anuncio discreto: Kimi K2.7 Code ya está disponible de forma general en GitHub Copilot. Es el primer modelo de pesos abiertos en aparecer en el selector de modelos de Copilot.
Hasta ahora, Copilot solo ofrecía modelos de código cerrado: GPT, Claude, Gemini. Ahora, un modelo de Moonshot AI, un laboratorio de IA chino, se ubica justo al lado de ellos. Puedes seleccionarlo en VS Code 1.127+, Visual Studio 17.14.6+, JetBrains 1.9.1+, Copilot CLI e incluso GitHub Mobile.
Para usuarios empresariales, los planes Copilot Business y Enterprise lo tienen deshabilitado por defecto: los administradores deben habilitar explícitamente la política de Kimi K2.7 Code. GitHub recomienda revisarlo primero según tus requisitos de seguridad y cumplimiento normativo. Es el lenguaje estándar, pero el simple hecho de que esté ahí dice algo sobre la calidad del modelo.
De K2.6 a K2.7 Code: Qué Cambió
Kimi K2.7 Code está construido sobre K2.6 pero cumple un propósito diferente: K2.6 es un modelo de propósito general, K2.7 Code está especializado en programación.
Datos de benchmarks de la página oficial y la ficha del modelo en HuggingFace:
| Benchmark | K2.6 | K2.7 Code | Mejora |
|---|---|---|---|
| Kimi Code Bench v2 | 50.9 | 62.0 | +21.8% |
| Program Bench | 48.3 | 53.6 | +11.0% |
| MLS Bench Lite | 26.7 | 35.1 | +31.5% |
| Kimi Claw 24/7 Bench | 42.9 | 46.9 | +9.3% |
| MCP Atlas | 69.4 | 76.0 | +9.5% |
| MCP Mark Verified | 72.8 | 81.1 | +11.4% |
Dos aspectos a destacar:
- Las ganancias en programación son mucho mayores que las ganancias agénticas. MLS Bench Lite subió un 31.5% — este benchmark pide a los modelos inventar métodos generalizables de ML, por lo que K2.7 Code mejoró más en tareas de programación complejas orientadas a la investigación.
- El uso de tokens de razonamiento se redujo ~30%. El modelo llega a las respuestas con menos deliberación interna, lo que impacta directamente en la velocidad de respuesta y los costos de la API.
Cómo Se Compara con los Principales Modelos de Código Cerrado
La comparación honesta (de los mismos benchmarks oficiales):
| Benchmark | K2.7 Code | GPT-5.5 | Claude Opus 4.8 |
|---|---|---|---|
| Kimi Code Bench v2 | 62.0 | 69.0 | 67.4 |
| Program Bench | 53.6 | 69.1 | 63.8 |
| MLS Bench Lite | 35.1 | 35.5 | 42.8 |
| MCP Atlas | 76.0 | 79.4 | 81.3 |
| MCP Mark Verified | 81.1 | 92.9 | 76.4 |
Hay una brecha real. En Program Bench — que pide a los modelos reconstruir el comportamiento de programas a partir de binarios compilados — GPT-5.5 obtiene 69.1 frente al 53.6 de K2.7 Code. Es una diferencia significativa.
Pero veamos el otro lado:
- En MLS Bench Lite, K2.7 Code (35.1) está prácticamente empatado con GPT-5.5 (35.5)
- En MCP Mark Verified, K2.7 Code (81.1) supera a Claude Opus 4.8 (76.4)
- K2.7 Code es de código abierto. GPT-5.5 y Opus 4.8 no lo son.
Un modelo de pesos abiertos igualando o superando a los modelos de código cerrado más caros en algunos benchmarks — eso es una señal significativa, independientemente de tu postura en el debate abierto vs cerrado.
1T de Parámetros, 32B Activos — Detalles de Arquitectura
| Parámetro | Valor |
|---|---|
| Architecture | Mixture-of-Experts (MoE) |
| Total Parameters | 1T |
| Activated Parameters per Token | 32B |
| Layers | 61 |
| Experts | 384 |
| Experts per Token | 8 |
| Context Length | 256K |
| Attention | MLA (Multi-head Latent Attention) |
| Vision Encoder | MoonViT (400M params) |
384 expertos, 8 activos por token — el clásico compromiso de MoE entre capacidad y cómputo. El mecanismo de atención MLA (originario de DeepSeek V2) mantiene bajo control la memoria del KV cache.
Vale la pena mencionar el codificador de visión MoonViT: K2.7 Code acepta entrada de texto, imagen y video. Puedes capturar una pantalla de un diseño de UI y pedirle que escriba el código del frontend, o fotografiar un diagrama de arquitectura en una pizarra para su análisis.
Precios: Código Abierto Pero No Gratuito
A través de la API de Kimi:
| Model | Input (cache miss) | Input (cache hit) | Output | Context |
|---|---|---|---|---|
| kimi-k2.7-code | $0.95/M | $0.19/M | $4.00/M | 262,144 tokens |
Compáralo con Claude Sonnet 4.6 a $3.00/$15.00 — la entrada es 3 veces más barata, la salida casi 4 veces más barata. La API soporta almacenamiento automático de contexto en caché, por lo que el contexto repetido baja a $0.19/M. Las sesiones largas de múltiples turnos se vuelven significativamente más económicas.
Como los pesos son abiertos (Modified MIT License), también puedes alojarlo tú mismo con vLLM, SGLang o KTransformers. Un modelo de 1T de parámetros no es trivial de desplegar, pero la cuantización nativa INT4 está disponible, y la comunidad ya tiene builds de Ollama y varias versiones cuantizadas listas.
Planes de suscripción de Kimi Code (facturación anual, precio mensual):
| Plan | Price | Best for |
|---|---|---|
| Moderato | $15/mo | Regular coding, weekly refreshed quota |
| Allegretto | $31/mo | Larger quota + higher concurrency |
| Allegro | $79/mo | Intensive development, complex projects |
| Vivace | $159/mo | Maximum quota, large codebases |
Consideraciones Prácticas
Algunas cosas a tener en cuenta:
- El modo de razonamiento es obligatorio. K2.7 Code no soporta el modo sin razonamiento. Si desactivas el razonamiento en Kimi Code, las solicitudes recurren automáticamente a K2.6.
- Es un modelo de programación, punto. Para redacción, análisis o conversación general, Moonshot AI recomienda K2.6 en su lugar.
- Temperatura y muestreo. La configuración recomendada es temperature=1.0 y top-p=0.95 — más alta que los valores predeterminados de la mayoría de los modelos. Ajústalo según corresponda.
Quién Debería Probar K2.7 Code
| Escenario | Recomendación | Por qué |
|---|---|---|
| Usuarios de GitHub Copilot | Pruébalo | Selecciónalo directamente en el selector de modelos, cero costo de migración |
| Equipos conscientes del costo | Recomendado | Los precios de la API son ~1/3 a 1/4 de Claude |
| Proyectos bilingües (CN/EN) | Muy recomendado | La comprensión de código en chino es una fortaleza genuina |
| Requisitos de auto-alojamiento | Vale la pena evaluar | Pesos abiertos, licencia Modified MIT |
| Máximo rendimiento en programación | Todavía no | Program Bench y otros benchmarks difíciles aún están por detrás de GPT-5.5 |
| Tareas no relacionadas con programación | No recomendado | Moonshot AI dice explícitamente que se use K2.6 para trabajo de propósito general |
Conclusión
Kimi K2.7 Code no es solo otro lanzamiento de un modelo de código abierto. Es el primer modelo de pesos abiertos en el selector de modelos de GitHub Copilot. Supera a Claude Opus 4.8 en MCP Mark Verified. Cuesta aproximadamente un tercio de los principales modelos de código cerrado. Y usa un 30% menos de tokens de razonamiento que su predecesor.
Las debilidades también son claras: queda por detrás de GPT-5.5 en los benchmarks de programación más difíciles, el modo de razonamiento obligatorio limita la flexibilidad, y alojar un modelo de 1T aún requiere una infraestructura seria.
Pero para la mayoría de los flujos de trabajo de desarrollo del mundo real, K2.7 Code ofrece algo que antes no existía: un modelo de código abierto para programación lo suficientemente bueno, lo suficientemente económico, que se integra directamente en tus herramientas existentes. Eso cambia el panorama competitivo.