• 4 min de lectura
GPT-5.6 Sol lidera enfrentamiento de modelos con lápices de colores
GPT-5.6 Sol lideró una prueba de 28 dibujos con lápices de colores, mientras que Gemini obtuvo el SSIM pico más alto y Claude costó aproximadamente 20 veces más.

Imagen: Hacker News
Los cuatro modelos de visión realizaron 28 dibujos en una prueba con lápices de colores, partiendo de un lienzo en blanco y una indicación de texto o de una de dos imágenes de referencia: la Mona Lisa y La noche estrellada de Van Gogh. Cada modelo usó las mismas herramientas para ajustar el color, el ancho del pincel y la presión; trazar capas de trazos; difuminar, borrar e inspeccionar su lienzo.
El arnĂ©s de cĂłdigo abierto está disponible en github.com/hershalb/canvas-arena. Los autores enfatizan que esto no es una medida objetiva de la habilidad artĂstica, pero sostienen que las tareas abiertas revelan diferencias que los benchmarks estándar pueden pasar por alto.
Uso de herramientas, coste y velocidad
Los modelos desarrollaron estilos de trabajo marcadamente distintos:
- GPT-5.6 Sol nunca llamĂł a set_color, set_brush ni set_pressure; en su lugar especificĂł esos ajustes dentro de las llamadas a draw.
- Grok 4.5 usĂł esas herramientas de ajuste en el 65% de sus 1,349 llamadas a herramientas, promediando 99 pasos por dibujo.
- Claude Fable 5 se apoyĂł mucho en smudge, con 123 llamadas, y revisĂł su trabajo de forma repetida.
- Gemini 3.6 Flash dedicĂł casi un tercio de sus llamadas a 'view_canvas', promediando alrededor de 23 autoevaluaciones por dibujo**.
Claude fue con diferencia el modelo más caro en la prueba, con un coste estimado de $160.58 por siete dibujos—aproximadamente 20 veces el coste de GPT-5.6 Sol ($7.74), Grok 4.5 ($9.21) o Gemini 3.6 Flash ($12.87). Grok procesó más tokens, con 34 millones, pero alrededor del 98% fueron lecturas en caché. Gemini usó 27.7 millones de tokens, también beneficiándose en gran medida de lecturas en caché.
Puntuaciones objetivo y desempeño de los modelos
La similitud se midiĂł con SSIM, donde 0 significa menos similar y 1 significa más similar. Las imágenes se redimensionaron a 256Ă—256 antes de calcular SSIM y RMSE; las puntuaciones miden la cercanĂa estructural y a nivel de pĂxel, no la calidad artĂstica.

Recomendado
Gemini 3.6 Flash de Google reduce el uso de tokens, pero queda por detrás de sus rivales
| Modelo y objetivo | Llamadas a herramientas | Tiempo | Revisiones | SSIM final | SSIM pico | RMSE | |---|---:|---:|---:|---:|---:|---:| | GPT-5.6 Sol — Mona Lisa | 448 | 4m 41s | 7 | 0.325 | 0.352 | 54.2 | | Claude Fable 5 — Mona Lisa | 86 | 18m 58s | 27 | 0.286 | 0.289 | 56.9 | | Grok 4.5 — Mona Lisa | 106 | 4m 30s | 5 | 0.151 | 0.152 | 95.6 | | Gemini 3.6 Flash — Mona Lisa | 60 | 5m 31s | 22 | 0.337 | 0.449 | 51.1 | | GPT-5.6 Sol — La noche estrellada | 235 | 5m 47s | 4 | 0.130 | 0.179 | 37.8 | | Claude Fable 5 — La noche estrellada | 43 | 11m 30s | 12 | 0.153 | 0.176 | 40.9 | | Grok 4.5 — La noche estrellada | 58 | 5m 51s | 3 | 0.039 | 0.039 | 104.9 | | Gemini 3.6 Flash — La noche estrellada | 74 | 6m 36s | 24 | 0.172 | 0.190 | 42.8 |
Los modelos generalmente se estancaron pronto. En las ocho ejecuciones objetivo, la imagen final obtuvo una puntuación inferior a la mejor versión intermedia. Gemini alcanzó el pico más alto—0.449 en la Mona Lisa—pero terminó en 0.337 tras seguir editando. GPT-5.6 Sol alcanzó un pico de 0.352 en la Mona Lisa y finalizó en 0.325; en La noche estrellada cayó de 0.179 a 0.130.
Los autores consideraron a GPT-5.6 Sol el más fuerte en general, nombrando sus dibujos de La noche estrellada y de rosas como sus favoritos. Describieron a Grok 4.5 como en gran medida inutilizable, mientras que Claude Fable 5 quedó en segundo lugar en calidad pero fue mucho más lento y aproximadamente 20 veces más caro que las otras opciones principales.
AI Editor
Ava covers the rapidly evolving world of artificial intelligence, from foundational models and research labs to the real-world economics of intelligence. With a background in computational linguistics, she cuts through the hype to find out what actually works. She firmly believes that benchmarks are just marketing until reproduced in the wild.
vĂa Hacker News


