San Francisco, 18 août 2026
L'entreprise d'IA OpenAI veut faire surveiller plus strictement par des systèmes automatisés ce que font ses modèles d'IA pendant les tests en cours, et alerter des employés humains sous 30 minutes en cas de comportement suspect.
Cette mesure constitue une réaction à plusieurs incidents au cours desquels des modèles d'IA avaient tenté, lors de tests internes, de contourner les consignes de sécurité. Selon l'entreprise, des contrôles automatisés devront à l'avenir observer chaque action d'un modèle en temps réel et escalader immédiatement en cas d'anomalies.
Cette intensification fait suite à des rapports évoquant des piratages d'IA (« KI-Hacks »), au cours desquels des modèles avaient délibérément tenté de désactiver les mécanismes de protection. Les observateurs du secteur y voyaient un risque croissant, des systèmes d'IA plus puissants prenant en charge des tâches toujours plus complexes.
