• 4 min de lectura
GPT-5.6 lideró esta prueba de dibujo en coste y calidad
Un benchmark con lápices de colores enfrentó a GPT-5.6 Sol, Claude Fable 5, Grok 4.5 y Gemini 3.6 Flash en 28 dibujos. GPT-5.6 ganó en calidad del resultado y eficiencia.

Imagen: Hacker News
Un nuevo benchmark de arena de dibujo dio a cuatro modelos de visión el mismo lienzo en blanco y un conjunto de herramientas de lápices de colores, y les pidió que recrearan pinturas famosas o dibujaran a partir de indicaciones textuales. En los 28 dibujos en total, los resultados fueron dispares: GPT-5.6 Sol se impuso como el más sólido en general, Gemini 3.6 Flash obtuvo las mejores puntuaciones brutas de similitud en las dos pruebas con imágenes objetivo, Claude Fable 5 fue con mucho el más caro, y Grok 4.5 tuvo dificultades.
La configuración proviene de tryai.dev, que afirma que las pruebas están intencionadamente abiertas en lugar de ser benchmarks estrictos de capacidades. Cada modelo podía ajustar el color, el ancho de la punta y la presión, dibujar lotes de trazos, emborronar, borrar e inspeccionar su trabajo con view_canvas. El arnés es de código abierto en github.com/hershalb/canvas-arena.
Los cuatro modelos probados fueron GPT-5.6 Sol, Claude Fable 5, Grok 4.5 y Gemini 3.6 Flash. Se los evaluó contra dos reproducciones con puntuación —la Mona Lisa y La noche estrellada de Van Gogh— además de cinco dibujos solo por indicación: un pescador anciano, una puesta de sol sobre el océano, una rosa roja en un jarrón de vidrio, un gato atigrado dormido y el interior de una cabaña con una chimenea encendida.
Coste, velocidad y uso de herramientas
Los promedios y totales en los siete dibujos por modelo mostraron diferencias marcadas:
- GPT-5.6 Sol: 72 puntuación media, 96.2 min, 3.4M tokens, $7.74, 6.0, 116
- Claude Fable 5: 75 puntuación media, 412.5 min, 14.6M tokens, $160.58, 15.6, 207
- Grok 4.5: 79 puntuación media, 94.8 min, 34.0M tokens, $9.21, 4.3, 354
- Gemini 3.6 Flash: 77 puntuación media, 136.9 min, 27.7M tokens, $12.87, 22.6, 190
Los modelos también usaron las mismas herramientas de maneras muy diferentes. GPT-5.6 Sol nunca invocó set_color, set_brush ni set_pressure; en su lugar, configuraba esos parámetros en línea durante las llamadas a draw. Grok 4.5 hizo lo contrario: el 65% de sus 1.349 llamadas a herramientas fueron esas funciones de configuración, lo que lo llevó a un promedio de 99 pasos por dibujo. Claude Fable 5 se apoyó mucho en smudge y en revisiones frecuentes, mientras que Gemini 3.6 Flash fue el revisor más agresivo, con aproximadamente 23 autochequeos por dibujo.

Recomendado
Poolside apuesta por Laguna S 2.1 para IA de programación autoalojada
Los modelos a menudo editaron más allá de su mejor resultado
En las dos tareas con imagen objetivo, el sitio puntuó las ejecuciones usando SSIM y RMSE. Gemini 3.6 Flash obtuvo el SSIM bruto más alto en ambos objetivos, incluyendo un pico de 0.449 en la Mona Lisa, pero los autores del benchmark advierten que SSIM mide la similitud estructural, no si un humano consideraría que el dibujo se ve mejor.
Un patrón mayor: más revisiones no condujeron a mejores resultados finales. Según la prueba, las ocho ejecuciones con objetivo terminaron por debajo de la mejor puntuación alcanzada a mitad de ejecución. Los ejemplos incluyeron:
- GPT-5.6 Sol, Mona Lisa: alcanzó un pico de 0.352 SSIM, terminó en 0.325
- GPT-5.6 Sol, La noche estrellada: alcanzó un pico de 0.179, terminó en 0.130
- Gemini 3.6 Flash, Mona Lisa: alcanzó un pico de 0.449, terminó en 0.337
El veredicto cualitativo de los autores fue más decisivo que la clasificación por métricas brutas. Llamaron a GPT-5.6 Sol el «líder indiscutible», diciendo que su Noche estrellada y su rosa fueron sus favoritos del lote y que, en general, superó a los demás en detalle. Claude Fable 5 fue juzgado segundo en calidad, pero a aproximadamente 20 veces el coste de GPT-5.6 Sol. Grok 4.5, en sus palabras, fue «prácticamente basura aquí», mientras que Gemini 3.6 Flash se consideró claramente mejor que Grok, pero no una comparación justa uno a uno con modelos de nivel de vanguardia.
El resultado es menos un benchmark limpio que una prueba de estrés útil para tareas visuales largas que usan herramientas, y que hace difícil ignorar el coste de la autocorrección repetida.
AI Editor
Ava covers the rapidly evolving world of artificial intelligence, from foundational models and research labs to the real-world economics of intelligence. With a background in computational linguistics, she cuts through the hype to find out what actually works. She firmly believes that benchmarks are just marketing until reproduced in the wild.
vía Hacker News


