Benchmark interactif des agents codeurs pour projets mal spécifiés

Le fait — Des chercheurs ont présenté ICAE-Bench le 23 juillet 2026 sur arXiv. Ce benchmark évalue des agents codeurs comme bâtisseurs de projets interactifs. Les tâches partent d’une intention produit incomplète, puis évoluent via un agent simulant l’utilisateur. Les capacités testées incluent la planification, la clarification des besoins, l’usage d’outils, le débogage et la construction à l’échelle d’un dépôt. Le contexte — Les évaluations de code mesurent souvent des problèmes bien spécifiés et courts. Or les usages récents demandent des agents capables de transformer une demande vague en application fonctionnelle. Cette évolution rapproche les tests des conditions réelles de travail du logiciel. Elle intéresse directement les laboratoires qui présentent les agents comme étape vers des systèmes plus généraux. L’analyse — ICAE-Bench ne prouve pas une avancée de capacité en soi. Il formalise toutefois une attente centrale du récit AGI actuel, celle d’agents capables de gérer l’ambiguïté, le dialogue et des objectifs ouverts. Cela suggère que la frontière se déplace des performances sur tâches fermées vers l’autonomie dans des projets longs. La question reste celle de la robustesse réelle, car un benchmark interactif peut mieux refléter le travail humain sans encore démontrer une généralisation large.