Recul des engagements de sécurité des laboratoires frontier

Le 7 juillet 2026, Axios a relayé un rapport du Future of Life Institute, un think tank focalisé sur les risques de l’IA. Le rapport évalue les pratiques de sécurité des principaux laboratoires d’IA. Selon Axios, Anthropic arrive en tête de l’AI Safety Index avec une note globale de C+. OpenAI et Google DeepMind reçoivent chacun un C. Les évaluateurs estiment qu’Anthropic, OpenAI, Google DeepMind et Meta ont affaibli ou supprimé des engagements antérieurs. Ces engagements portaient sur une pause du développement si certains seuils de danger étaient approchés. Le rapport cite aussi des efforts en interprétabilité, en surveillance du raisonnement et en dispositions contre la perte de contrôle. Il juge néanmoins ces mesures insuffisantes face à des systèmes très capables. Axios souligne aussi l’extension du travail de plusieurs entreprises avec les armées.

Ce fait compte dans le suivi vers l’AGI car il ne porte pas sur un produit. Il porte sur la manière dont les laboratoires frontier redéfinissent leurs garde-fous. L’interprétabilité désigne les méthodes pour comprendre ce qu’un modèle fait réellement. La surveillance du raisonnement vise à détecter des comportements problématiques pendant l’exécution. Ces outils sont désormais au centre du débat sur l’alignement, c’est-à-dire l’effort pour garder des systèmes puissants compatibles avec les intentions humaines. L’intérêt de cet article tient à son angle indépendant. Il documente un recul institutionnel plutôt qu’une promesse volontaire de sécurité. Cela suggère que la concurrence et les usages stratégiques pèsent davantage sur les choix des laboratoires. Le point saillant n’est pas la note elle-même. C’est le décalage entre des capacités présentées comme croissantes et des engagements qui deviennent plus flexibles. Si cette tendance se confirme, la gouvernance de l’AGI reposerait moins sur l’autorégulation annoncée par les entreprises. La question reste alors ouverte: quels mécanismes crédibles peuvent remplacer des promesses que les acteurs peuvent réviser eux-mêmes ?