Benchmark OpenAI de raisonnement scientifique sur questions inédites
Le 21 juillet 2026, OpenAI a publié la rediffusion d’un événement présentant un benchmark de raisonnement scientifique. Le système extrait des articles récents, puis les transforme en questions accompagnées de prémisses. Il vérifie ensuite si le modèle atteint la bonne réponse avec un raisonnement jugé correct. Selon la présentation, GPT-5.5 a été testé sur 260 articles répartis dans sept domaines scientifiques. Les résultats varient selon les disciplines. Le modèle a mieux réussi en physique quantique qu’en relativité générale.
Ce fait compte pour la trajectoire AGI car il vise une limite connue des évaluations actuelles. Beaucoup de benchmarks mesurent des savoirs déjà présents dans les données d’entraînement. Ici, l’objectif affiché est de tester la résolution de questions nouvelles, dérivées de travaux récents. OpenAI cherche ainsi à montrer que le raisonnement scientifique peut devenir une capacité observable, comparable et suivie dans le temps. Cela touche directement au récit AGI, car la prétention à généraliser hors distribution est au centre des débats sur les capacités générales.
L’intérêt analytique vient moins du score brut que du changement de méthode. Si les laboratoires peuvent mesurer à bas coût où un modèle raisonne correctement sur de la science récente, ils disposent d’un outil de suivi plus proche de tâches cognitives ouvertes. En même temps, les écarts entre disciplines rappellent que les capacités restent irrégulières. Un modèle peut paraître compétent dans un champ et fragile dans un autre. La question reste donc ouverte: ces benchmarks mesurent-ils une généralisation robuste, ou seulement une nouvelle forme de spécialisation bien instrumentée ?