Kimi
Kimi

Kimi

Moonshot AI

Modelos lingüísticos de gran tamaño

Modelos lingüísticos de gran tamaño

Kimi

Kimi

Kimi K3 es el lanzamiento de un modelo poco común que conmovió tanto los puntos de referencia como los mercados. Sus resultados agentes son realmente sólidos, pero el sistema de parámetros de 2,8T aún no es una implementación empresarial fácil ni totalmente probada.

CURRENT MODEL SNAPSHOT

Proveedor: Moonshot AI
Referencia actual: Kimi K3
Ciclo de vida: Actual
Pesos: Pesos abiertos anunciados para el 27 de julio de 2026
Revisado: 20 de julio de 2026

Degradado abstracto azul y morado

Kimi K3 es el modelo que conmovió los mercados antes de que se lanzaran sus pesos

Moonshot AI lanzó Kimi K3 el 16 de julio de 2026 como un modelo de combinación de expertos de 2,8 billones de parámetros con visión nativa y una ventana de contexto de un millón de tokens. Sólo 16 de sus 896 expertos están activos por token; Kimi Delta Attention y Attention Residuals son las ideas arquitectónicas destinadas a hacer que esa escala sea práctica para tareas largas.

Lo destacable no fue sólo la especificación técnica. El 17 de julio, Z.ai cayó aproximadamente un 28 % y MiniMax alrededor de un 16 % a medida que los inversores revalorizaron el valor competitivo de los desarrolladores chinos de IA. Las acciones tecnológicas estadounidenses también cayeron: el Nasdaq perdió un 1,4% y el Nvidia un 2,2%. Kimi fue un catalizador, no la única causa: las ganancias corporativas, los precios del petróleo y el riesgo geopolítico también afectaron el día de negociación, y las acciones de tecnología se recuperaron parcialmente el lunes siguiente.

La interpretación del mercado seguía siendo racional. Si un laboratorio chino puede acercarse al rendimiento de un modelo cerrado, fijar un precio agresivo para su API y luego liberar sus pesos, la escasez y el poder de fijación de precios en todo el sector parecen menos seguros. Ésa es una señal económica, no un punto de referencia.

A partir de esta revisión del 20 de julio de 2026, el lanzamiento de los pesos completos está programado para el 27 de julio y aún no están disponibles. Por lo tanto, K3 debe describirse como un lanzamiento de peso abierto anunciado, no un modelo de peso abierto que ya pueda implementarse.

Lo que realmente dicen las pruebas

Los resultados independientes justifican la atención, pero no la mitología. Artificial Analysis obtuvo la puntuación K3 en 57 en su Intelligence Index. En su ámbito de tareas comerciales, K3 alcanzó un GDPval-AA v2 Elo de 1668—por encima de GPT-5.5 y Claude Opus 4.8 en esa prueba, detrás de Claude Fable 5. K3 también lideró AutomationBench-AA al 53% y quedó segundo con AA-Briefcase.

Esos son resultados significativos para los agentes de IA porque prueban la finalización de las tareas, no solo la respuesta a preguntas breves. También exponen las compensaciones:

  • Artificial Analysis estimado alrededor $0,94 por tarea de referencia completada. Esto está cerca de los principales modelos propietarios, pero materialmente por encima de los rivales de menor costo como GLM y DeepSeek.

  • K3 generado aproximadamente 132 millones de tokens de salida al otro lado de la suite. Una mejor economía de tareas no significa necesariamente una operación concisa.

  • La precisión aumentó de 33% en K2.6 a 46% en K3, mientras que la tasa de alucinaciones medida empeoró de 39% a 51%. La capacidad y la confiabilidad avanzaron en direcciones diferentes.

  • La propia nota de lanzamiento de Moonshot dice que K3 todavía se ubica por debajo Claude Fable 5 y GPT-5.6 Sol en general.

Las demostraciones realizadas por el proveedor añaden evidencia útil: optimización del kernel las 24 horas, una tarea de diseño de chips de 48 horas, un compilador MiniTriton y flujos de trabajo de investigación que abarcan muchas herramientas. Trátelos como evidencia de diseño, no como puntos de referencia neutrales. Un comprador debe reproducir la estructura del trabajo (no el mensaje de demostración del proveedor) en su propio repositorio, documentos, herramientas y casos de falla.

El caso empresarial: impresionante, operativamente joven

K3 es un candidato serio para la automatización a largo plazo, la programación a escala de repositorio y la investigación multimodal. Su argumento más fuerte es el uso sostenido de herramientas con una calidad adyacente a la frontera, no el número de un millón de tokens por sí solo.

El panorama operativo es menos maduro. Moonshot suspendió temporalmente las nuevas suscripciones después de que la demanda excediera la capacidad. La empresa recomienda 64 o más aceleradores para autohospedaje, por lo que la futura versión abierta mejorará el control sin que la implementación sea simple o barata. El precio del API alojado es de $3 por millón de tokens de entrada sin caché y de $15 por millón de tokens de salida, con entrada en caché de $0,30.

¿Cómo lo evaluaríamos?

Ejecute un proceso de negocio completo con evidencia contradictoria, tiempos de espera de herramientas, un resultado intermedio deliberadamente malo, abstención esperada y un esquema de salida estricto. Realice un seguimiento de los resultados completados, las reclamaciones no respaldadas, las correcciones de los revisores, la tasa de recuperación, la latencia final y los tokens totales. Compárelo tanto con un modelo cerrado superior como con un candidato de peso abierto más económico.

evidencia utilizada

Estado de soporte Beam AI

En evaluación. Esta es una referencia de selección de modelo, no una confirmación de una integración Beam, un resultado comparativo, una disponibilidad regional o una recomendación de producción. Valide la superficie y la versión exactas de K3 en el flujo de trabajo previsto antes de comprometerse con el cliente.

Use case 1

Agente de ingeniería a escala de repositorio

Ofrezca a K3 un cambio real y limitado que requiera búsqueda en el repositorio, implementación, pruebas, documentación y recuperación de una llamada fallida a la herramienta. Mida los parches aceptados, las regresiones, los problemas de seguridad, las correcciones de los revisores, los tokens de salida y si su horizonte a largo plazo supera a un flujo de trabajo descompuesto.

Use case 2

Punto de referencia de operaciones a largo plazo

Pruebe un flujo de trabajo administrativo de varias horas con herramientas de navegador o API, puntos de control, reanudabilidad y aprobación humana. AutomationBench hace de esta una hipótesis prometedora; solo su tasa de finalización, recuperación de fallas y costo por caso aceptado pueden validarlo.

Use case 3

Análisis multimodal de la sala de pruebas

Utilice documentos, tablas, capturas de pantalla e imágenes para crear un mapa de problemas vinculado a las fuentes. Inserte contradicciones y material irrelevante, luego califique el respaldo de las citas, la evidencia omitida, las conclusiones no respaldadas, la minimización de datos y el tiempo del revisor.

Use case 4

Estudio de implementación de peso abierto

Después de enviar las ponderaciones, compare el punto final alojado con una compilación autoadministrada aprobada. Incluya la procedencia de los artefactos, la cuantificación, la capacidad de más de 64 aceleradores, el rendimiento, la capa de seguridad, el monitoreo, la aplicación de parches, el costo total y la dotación de personal operativo, no solo la calidad del modelo.

Otros LLM

Aquí tienes una lista de LLMs que se pueden utilizar con Beam

Empieza hoy

Build AI agents with the right model

See how Beam can orchestrate governed AI workflows across the model family that fits your requirements.

Empieza hoy

Build AI agents with the right model

See how Beam can orchestrate governed AI workflows across the model family that fits your requirements.

Empieza hoy

Build AI agents with the right model

See how Beam can orchestrate governed AI workflows across the model family that fits your requirements.

PREGUNTAS FRECUENTES

Preguntas frecuentes

Model selection, deployment, governance, and Beam support questions answered.

¿Kimi K3 provocó la venta masiva de acciones de IA en julio de 2026?

Fue un catalizador importante, especialmente para los desarrolladores chinos de IA directamente expuestos: Z.ai cayó aproximadamente un 28% y MiniMax alrededor de un 16% el 17 de julio. La liquidación generalizada en Estados Unidos también reflejó las ganancias, el petróleo y el riesgo geopolítico, y las acciones de tecnología se recuperaron parcialmente el lunes siguiente. La conclusión útil es que K3 desafió las suposiciones de los inversores sobre la escasez y los precios del modelo de frontera; no es que un día de negociación demostrara que era el mejor modelo del mundo.

¿Qué tan fuerte es Kimi K3 en puntos de referencia independientes?

Artificial Analysis obtuvo una puntuación de K3 de 57 en su Intelligence Index, 1668 Elo en GDPval-AA v2 y 53 % en AutomationBench-AA, donde lideraba en el momento de la revisión. La misma evaluación encontró un alto volumen de producción y una tasa de alucinaciones del 51%, por lo que la página trata la historia de referencia como sólida pero no incondicional.

¿El Kimi K3 es de peso abierto hoy?

Aún no a partir de esta revisión del 20 de julio de 2026. Moonshot anunció que los pesos completos se lanzarían el 27 de julio. Hasta que los artefactos se envíen y puedan inspeccionarse, K3 debe describirse como un modelo alojado con un lanzamiento de peso abierto anunciado.

¿Puede una empresa autohospedar Kimi K3 de forma económica?

Posiblemente, pero no por casualidad. Moonshot recomienda al menos 64 aceleradores, lo que hace que la planificación de capacidad, la ingeniería de inferencia, los controles de seguridad, la observabilidad, la aplicación de parches y la propiedad de guardia sean fundamentales para la decisión. Los pesos abiertos reducen la dependencia del proveedor; no eliminan el costo de infraestructura.

¿Beam admite Kimi K3 en producción?

La compatibilidad con Beam se encuentra actualmente en evaluación. No se adjunta ninguna integración de producción aprobada ni punto de referencia Beam a este registro CMS. Valide el punto final o la futura versión de peso, la región, los controles de datos, las herramientas, el comportamiento de falla y el modelo operativo antes de comprometerse con el cliente.