GPT 5.5 es mejor que Opus 4.8
Llevo mucho tiempo diciendo que GPT 5.5 es mejor que Opus 4.7 en sus versiones más altas de inteligencia.
De hecho, ¡GPT 5.5 es mejor incluso que el nuevo modelo de Opus 4.8!
Los benchmarks "tradicionales" que miden esto (SWE-Bench Pro) son muy malos y no se corresponden con la experiencia que tienes como programador. Situaban a todos los modelos cerca unos de otros (aun los más malos), daban resultados incoherentes, estaban contaminados y tenían fallos graves.
Por ejemplo, permitían que Opus hiciera trampas mirando el log de git (wow)
Por eso mismo han creado un nuevo benchmark que parece representar mejor estas diferencias y da lugar a resultados mucho más creíbles.
Creo que los resultados de este benchmark no van a sorprender a nadie que haya usado mucho estos modelos para tareas de programación en el mundo real.
Os dejo el link abajo ⬇️