GPT 5.5 es mejor que Opus 4.8

Llevo mucho tiempo diciendo que GPT 5.5 es mejor que Opus 4.7 en sus versiones más altas de inteligencia.

De hecho, ¡GPT 5.5 es mejor incluso que el nuevo modelo de Opus 4.8!

Los benchmarks "tradicionales" que miden esto (SWE-Bench Pro) son muy malos y no se corresponden con la experiencia que tienes como programador. Situaban a todos los modelos cerca unos de otros (aun los más malos), daban resultados incoherentes, estaban contaminados y tenían fallos graves.

Por ejemplo, permitían que Opus hiciera trampas mirando el log de git (wow)

Por eso mismo han creado un nuevo benchmark que parece representar mejor estas diferencias y da lugar a resultados mucho más creíbles.

Creo que los resultados de este benchmark no van a sorprender a nadie que haya usado mucho estos modelos para tareas de programación en el mundo real.

Os dejo el link abajo ⬇️

deepswe.datacurve.ai

Visualizaciones: 1,7 milLikes: 7Respuestas: 3Reposts: 1Ver en X

¿Te ha gustado el post?

Déjame tu email y te aviso cuando publique algo nuevo.

Posts relacionados

Es muuuuuy fácil ver qué apps están vibecodeadas. Muy fácil. Hay detalles que te lo gritan en la cara desde el minuto uno. Cosas pequeñas… pero que inmediatamente te delatan: 🎨 El diseño. No es que sea feo. Es que es el diseño default. Puedes casi adivinar qué modelo lo ha

Visualizaciones: 93,6 milLikes: 802Respuestas: 64Reposts: 32Ver en X

Si Fable ya es casi inusable aún pagando 100/200 € al mes, miedo me da cuando se acabe el periodo de límites extendidos. Anthropic necesita computación ya. Bueno, la lleva necesitando meses, pero ahora la gente se está dando cuenta de lo mucho que cunde Codex e incluso Grok.

Visualizaciones: 10,5 milLikes: 155Respuestas: 7Reposts: 3Ver en X