3 min de lectura

Kimi K3 casi iguala a Fable a una fracción del coste

Fireworks dice que Kimi K3 y Fable 5 están cerca en calidad en alrededor de 1.030 tareas tipo agente, con un enrutamiento que alcanzó un 93 % de precisión a un coste mucho menor.

Imagen: Hacker News

Fireworks dice que Kimi K3, un modelo abierto, se acerca a Fable 5 en calidad mientras cuesta drásticamente menos en cargas de trabajo estilo agente. En una prueba realizada en aproximadamente 1.030 tareas, la compañía afirma que el enrutamiento entre los dos modelos alcanzó un 93 % de precisión y ofreció resultados hasta 50 veces más rentables que usar solo Fable en bucles largos tipo agente.

La prueba comparativa combinó cinco familias de tareas, cada una ejecutada mediante el mismo arnés en bucles reales de agente:

  • SWE: 460 tareas reales de corrección de errores en repositorios
  • Terminal: 89 tareas a largo plazo de seguridad, criptografía, ingeniería inversa y administración de sistemas
  • Algorítmicas: 100 problemas al estilo LeetCode o AtCoder
  • Multi-Idioma: 225 tareas de implementación en seis lenguajes
  • Legal: 120 tareas de agente legal calificadas por abogados

Fireworks también usó enrutamiento oracular, un método teórico de mejor caso que ejecuta cada tarea en ambos modelos y elige la respuesta correcta más barata. En ese escenario, K3 fue seleccionado para entre el 72 % y el 96 % de las tareas, lo que sugiere que un enrutador práctico y sólido podría enviar la mayor parte del tráfico al modelo más barato sin perder calidad.

Recomendado

Google elimina los controles de muestreo de Gemini en los nuevos modelos Flash

En rendimiento bruto, los dos modelos estuvieron a menudo muy cerca. Fireworks afirma que K3 obtuvo un 92,4 % en SWE, frente al 92,6 % de Fable 5. En los cinco grupos de la prueba comparativa, la brecha generalmente se mantuvo dentro de unos pocos puntos, aunque Fable lideró en una cobertura más amplia de lenguajes de programación en el conjunto Multi-Idioma.

El hallazgo más relevante es que los modelos parecen especializarse en áreas distintas. Según Fireworks, K3 rindió especialmente bien en matemáticas simbólicas y herramientas para desarrolladores, mientras que Fable se desempeñó mejor en trabajo web y de visualización de datos. En tareas basadas en terminal, K3 consiguió 11 victorias en solitario frente a 7 de Fable, incluyendo aciertos en problemas de seguridad y criptografía como un hash de 7z, criptoanálisis FEAL, secretos filtrados, una vulnerabilidad activa y procesos asíncronos fuera de control.

El coste es donde la división quedó mucho más clara. Fireworks dice que K3 fue más barato en las cinco familias de tareas. En SWE, la compañía indica que K3 utilizó aproximadamente 55 interacciones y 1,3 millones de tokens por tarea, frente a 21 interacciones y 130.000 tokens para Fable. Pero en tareas terminal largas, Fable fue el modelo que se expandió de forma dramática, alcanzando 64 interacciones y 1,5 millones de tokens, a veces terminando en un tiempo de espera. Fireworks atribuye la ventaja de coste de K3 a la tarificación por token, el caché de prompts y las diferencias en la cantidad de trabajo que cada modelo realiza en distintas tareas.

La conclusión principal de la compañía es simple: no elijas un solo modelo para todo. Fireworks sostiene que el enrutamiento por tarea supera a cualquiera de los modelos por separado, elevando la calidad por encima de cualquier configuración de modelo único y manteniendo el coste cerca de la opción más barata. En su planteamiento, el modelo premium cerrado se convierte en la excepción, mientras que el modelo abierto y más económico gestiona la mayor parte del tráfico.

Eso deja a Kimi K3 + Fable como el argumento de Fireworks para un nuevo estado del arte: no un modelo, sino una mezcla enrutada de especialistas.

Ava Chen

AI Editor

Ava covers the rapidly evolving world of artificial intelligence, from foundational models and research labs to the real-world economics of intelligence. With a background in computational linguistics, she cuts through the hype to find out what actually works. She firmly believes that benchmarks are just marketing until reproduced in the wild.

vía Hacker News

// Sigue leyendo