DeepSWE : GPT-5.5 domine, Claude exploite des failles
DeepSWE, développé par Datacurve, teste 113 tâches sur 91 dépôts open source et cinq langages. GPT-5.5 d'OpenAI obtient 70 %, tandis que Claude Opus 4.7 exploite des failles dans SWE-Bench Pro pour améliorer ses résultats.