¿Mejor que Fable 5 y GPT-5.6? Los chinos presentaron el nuevo modelo Kimi V3, pero aún faltan mediciones independientes

  • Moonshot AI de China presentó Kimi K3 – un modelo con 2,8 billones de parámetros y un contexto de hasta 1 millón de tokens
  • Según el fabricante, supera a la competencia china GLM 5.2, pero con la élite occidental (Fable 5, GPT-5.6, Opus 4.8) el resultado es más bien un empate
  • Todos los números provienen de Moonshot, algunos incluso de un benchmark interno – aún faltan pruebas independientes

Sdílejte:
Jakub Kárník
Jakub Kárník
23. 7. 2026 20:00

La etiqueta «supera a los mejores modelos occidentales» se adhiere a casi cada segundo anuncio de China en 2026. Ahora le tocó el turno a Moonshot AI con su nuevo modelo insignia Kimi K3. Sobre el papel, es un verdadero cañón: 2,8 billones de parámetros, arquitectura Mixture-of-Experts y una ventana de contexto de hasta 1 millón de tokens. Las ambiciones son claras: competir con lo mejor que ofrecen hoy OpenAI, Anthropic y los rivales nacionales.

Billones de parámetros y memoria para todo un repositorio

El mayor atractivo es precisamente la ventana de contexto de un millón. Un programador puede cargar un repositorio completo, varios trabajos científicos o un montón de documentos legales en una sola conversación, sin tener que acortar el texto agresivamente. Moonshot, sin embargo, enfoca Kimi K3 principalmente en desarrolladores – no está diseñado para funcionar como un autocompletador de código, sino como un compañero que entiende grandes proyectos, refactoriza entre archivos y es capaz de depurar errores. A esto se añade el trabajo con imágenes, los llamados enjambres de agentes y la integración en su propia herramienta Kimi Code. Sin embargo, el millón de tokens completo solo lo disfrutarán los suscriptores de tarifas más altas; el nivel más económico se detiene en 256 mil.

Benchmarks que conviene tomar con cautela

Y ahora lo principal, en lo que se basa todo el revuelo. Frente al rival chino GLM 5.2, Kimi K3 está realmente en otra liga – en la prueba DeepSWE obtuvo 67,5 puntos frente a 46,2, en SWE Marathon incluso 42 frente a solo 13. Ahí no hay discusión. Pero el titular «supera a Claude Fable» ya es una exageración de marketing. Frente a la élite occidental, Kimi K3 solo gana a veces: en Program Bench (77,8) y SWE Marathon (42,0) es el primero, pero en DeepSWE lo superan Fable 5 y GPT-5.6 Sol y en el Kimi Code Bench 2.0 creado por Moonshot, terminó con 72,9 puntos detrás de Fable 5 (76,9). Que el fabricante se asegure un buen número en su propia prueba no sorprende a nadie – es precisamente por eso que los benchmarks internos deben verse con cautela hasta que lleguen las mediciones independientes.

El verdadero campo de batalla se llama código

Independientemente de cómo resulten los números después de la remensuración, la dirección es clara. Kimi Code se une a la misma liga que Claude Code de Anthropic o Codex de OpenAI, y la lucha por los programadores se convierte en la arena principal de toda la industria. Para los desarrolladores, esta es una buena noticia: la competencia empuja los precios a la baja y las capacidades al alza. Pero guardemos el resto de los superlativos entusiastas hasta que Kimi K3 pase por las manos de alguien más que sus creadores.

¿Confía en los benchmarks de los propios fabricantes o espera las pruebas independientes?

Fuente: Data Science in Your Pocket, Moonshot AI

Sobre el autor

Jakub Kárník

Jakub je znám svou nekonečnou zvědavostí a vášní pro nejnovější technologie. Jeho láska k mobilním telefonům začala s iPhonem 3G, ale dnes se spoléhá na… Más sobre el autor

Jakub Kárník
Sdílejte: