Rapport Meta Oversight Board sur docilité politique des grands LLM
Le fait — The Verge a signalé le 20 juillet un rapport du Meta Oversight Board. Ce conseil de surveillance externe a testé des modèles d’Anthropic, DeepSeek, Google, Meta et OpenAI. Selon le snippet, chacun serait nettement moins enclin à critiquer les gouvernements et les responsables puissants. Le détail de la méthode n’apparaît pas ici.
Le contexte — Les grands modèles de langage servent déjà d’intermédiaires dans l’accès à l’information et dans la formulation d’arguments. Leur comportement politique n’est donc pas un sujet périphérique. Dans la trajectoire AGI, un système plus général n’est pas seulement évalué sur ses scores. Il l’est aussi sur ses préférences apparentes, ses refus et ses asymétries de traitement. Une évaluation comparative sur plusieurs laboratoires touche directement à la gouvernance des sorties.
L’analyse — Ce fait ne mesure pas une progression de capacité brute. Il documente un risque de comportement systématique sur des modèles de premier plan. Si cette docilité résulte de réglages de sécurité, elle montre un arbitrage entre réduction de risque et neutralité discursive. Si elle résulte d’autres biais, elle complique la confiance publique dans des assistants plus généraux. La question reste ouverte entre alignement prudent et conformité politique indue.