GPT-5.6 Sol surpasse Claude Opus 5 sur ARC-AGI-3
OpenAI démontre que GPT-5.6 Sol atteint 38,3% sur le benchmark ARC-AGI-3 avec ses paramètres API personnalisés, surpassant les 30,2% de Claude Opus 5. Cependant, le score officiel n'est que de 7,8% sans ces ajustements.
« GPT-5.6 Sol hits 38.3 percent with two API settings, beating Opus 5's 30.2 percent. » — The Decoder
Que faut-il retenir ?
- GPT-5.6 Sol atteint 38,3% sur ARC-AGI-3 avec les paramètres API d'OpenAI.
- Claude Opus 5 avait établi un record à 30,2% sur le même benchmark.
- Le score officiel de GPT-5.6 Sol n'est que de 7,8% sans ajustements.
- OpenAI utilise son propre environnement avec 'Retained Reasoning' et 'Compaction'.
Pourquoi cette nouvelle compte-t-elle ?
Ces résultats montrent l'importance de l'environnement de test dans l'évaluation des modèles d'IA. Les professionnels doivent considérer ces paramètres pour des comparaisons équitables entre modèles concurrents.
38,3% de score pour GPT-5.6 Sol avec les paramètres API personnalisés.
Public concerné : développeurs, entreprises
Pourquoi les scores de GPT-5.6 Sol varient-ils autant selon l'environnement de test ?
Les scores varient car OpenAI utilise des paramètres API personnalisés comme 'Retained Reasoning' et 'Compaction', absents dans le test officiel. Ces fonctionnalités améliorent significativement les performances du modèle.
🔧 Outils mentionnés