Évaluation scientifique des agents autonomes sur recherche et synthèse

Le fait — SciExplore a été publié le 23 juillet 2026 sur arXiv. Le benchmark évalue des grands modèles de langage et des agents autonomes sur 103 tâches couvrant plus de dix disciplines scientifiques. Les tâches vont de la navigation dans des bases scientifiques à la synthèse de connaissances issues de sources multiples. Les auteurs rapportent de forts écarts entre systèmes et une très faible précision sur les tâches de synthèse les plus difficiles. Le contexte — Une partie du discours sur l’AGI met en avant l’automatisation de la recherche scientifique. Des entreprises comme Anthropic et OpenAI poussent aussi des outils destinés aux chercheurs. SciExplore apporte donc un test plus proche d’un travail intellectuel ouvert que beaucoup de benchmarks académiques standard. Il mesure non seulement le rappel d’information, mais aussi l’ancrage des preuves et la composition de résultats dispersés. L’analyse — Les résultats vont contre une lecture linéaire des progrès agentiques. Ils suggèrent que l’accès aux outils et aux corpus ne suffit pas quand la tâche exige désambiguïsation, sélection de preuves et synthèse fiable. Pour la trajectoire AGI, cela renforce l’idée d’un écart persistant entre compétence locale et autonomie épistémique, c’est-à-dire la capacité à construire un savoir juste en contexte. La question reste ouverte sur ce qui manque le plus, le raisonnement, la mémoire, la vérification, ou la conception même des interfaces d’agent.