Évaluations externes des modèles OpenAI sur des scénarios cyber offensifs

Le 4 août 2026, OpenAI a publié une note sur des évaluations cyber réalisées par des organismes externes. Le document porte sur ses modèles récents et sur des tests de cybersécurité menés avant déploiement. OpenAI y rapporte des résultats issus de partenaires indépendants plutôt que d’autoévaluations internes. La note décrit des scénarios où des modèles ont montré des compétences utiles en intrusion, en recherche de vulnérabilités et en opérations offensives simulées. Elle présente aussi les mesures de réduction du risque, comme les limitations d’usage, les évaluations ciblées et les protocoles de surveillance.

Ce type de publication compte dans le suivi AGI, car il documente la gouvernance des modèles dits frontier. Les capacités cyber sont suivies de près, car elles combinent raisonnement, planification et adaptation. Ce sont des traits souvent présentés comme des briques vers des agents plus généraux. Les évaluations par des tiers répondent aussi à une demande récurrente des chercheurs en sécurité. Cette demande vise des preuves indépendantes, pas seulement des affirmations des laboratoires.

Le point important n’est pas qu’un modèle soit « bon en cyber » au sens marketing. Le point important est qu’un laboratoire juge nécessaire de publier un cadre d’évaluation externe sur des usages offensifs. Cela suggère que les seuils de risque changent avec la montée des capacités agentiques. Cela montre aussi une tension persistante entre transparence utile et divulgation de détails exploitables. La question reste ouverte de savoir si ces évaluations externes deviendront comparables entre laboratoires.