2 min de lectura

Kimi K3 ocupa el puesto nº 2 en AA-Briefcase

Kimi K3 de Moonshot AI obtiene la segunda puntuación más alta en AA-Briefcase, pero es caro y lento, con un promedio de $10.57 y 56.4 minutos por tarea.

Imagen: Hacker News

Kimi K3 de Moonshot AI ha logrado la segunda puntuación más alta en AA-Briefcase, el benchmark de Artificial Analysis para trabajo de conocimiento basado en agentes, quedando solo por detrás de Claude Fable 5. El modelo de 2.8T parámetros obtuvo 57 en el Índice de Inteligencia de Artificial Analysis, que según la firma lo sitúa junto a modelos como Opus 4.8 y GPT-5.5.

En AA-Briefcase, Kimi K3 alcanzó un Elo de 1543 —un salto de +727 respecto a Kimi K2.6, que tenía 816— y quedó solo por detrás de Claude Fable 5, que obtuvo 1574.

Gráfico del benchmark de AA-Briefcase
Gráfico del benchmark de AA-Briefcase

Artificial Analysis describe AA-Briefcase como un benchmark propietario construido alrededor de un conjunto de datos privado de tareas realistas repartidas en miles de archivos de entrada complejos. Las tareas requieren salidas como hojas de cálculo, presentaciones y maquetas de interfaz, y los resultados se integran en un único Elo basado en corrección, calidad analítica y calidad de presentación.

La posición de Kimi K3 se sustentó en puntuaciones subyacentes sólidas:

Recomendado

Un modelo de OpenAI vulneró su entorno aislado para completar una tarea

  • Tasa de aprobación según la rúbrica: 51%, solo por detrás de Claude Fable 5 con 56%
  • Elo de calidad analítica: 1754, frente a 1744 de Claude Fable 5
  • Elo de presentación: 1471, por detrás de GPT-5.6 Sol (max) con 1660 y Claude Opus 4.8 (max) con 1492
Tabla de clasificación de AA-Briefcase

1 / 2

El contrapeso son el coste y la velocidad. Artificial Analysis indica que Kimi K3 promedia $10.57 por tarea, lo que lo convierte en uno de los modelos más caros en AA-Briefcase y supone aproximadamente un aumento de 10x en el coste por tarea. Promedia 83 turnos por tarea, frente a 67 de Claude Fable 5 y 50 de GPT-5.6 Sol (max). Kimi K3 tiene un precio de $3/$15 por cada 1M de tokens de entrada/salida, con un descuento del 90% para tokens en caché.

Gráfico del coste por tarea
Gráfico del coste por tarea

Además, es lento. Kimi K3 promedia 56.4 minutos por tarea en AA-Briefcase, uno de los tiempos más altos registrados en el benchmark. Según Artificial Analysis, eso se debe a las 83 interacciones por tarea del modelo, 120k tokens de salida por tarea y velocidades más lentas en la API propia de Kimi. La firma señala que es aproximadamente 2.5x el tiempo de Claude Fable 5 y alrededor de 3.8x más que Grok 4.5 (high).

Ava Chen

AI Editor

Ava covers the rapidly evolving world of artificial intelligence, from foundational models and research labs to the real-world economics of intelligence. With a background in computational linguistics, she cuts through the hype to find out what actually works. She firmly believes that benchmarks are just marketing until reproduced in the wild.

vía Hacker News

// Sigue leyendo