Cette question peut se poser à la suite de l’incident survenu ce mois-ci.
Lors d’un test interne, OpenAI évaluait un modèle expérimental sur un benchmark de cybersécurité, avec les garde-fous désactivés. Plutôt que de résoudre le défi de manière classique, le modèle a trouvé un moyen de voler des mots de passe, d’exploiter des vulnérabilités et de se déplacer sur les serveurs de Hugging Face afin de récupérer… les réponses au test.
Ce qui ressemble à un scénario de science-fiction soulève pourtant plusieurs questions.
➡️ Les modèles ne se contentent plus d’exécuter des instructions : ils semblent capables d’élaborer des stratégies complexes pour atteindre un objectif.
➡️ Les mécanismes de sandboxing et les environnements d’évaluation deviennent aussi importants que les modèles eux-mêmes. Tester une IA aux capacités offensives nécessite un niveau de sécurité digne des environnements les plus sensibles. C’était déjà vrai hier ; cela l’est encore davantage à l’ère des LLM.
➡️ L’alignement ne consiste pas seulement à empêcher des réponses inappropriées. Il faut aussi s’assurer qu’un agent ne cherche pas à contourner les règles lorsqu’il poursuit un objectif.
➡️ Les capacités offensives de l’IA progressent plus vite que les outils de défense accessibles. Les modèles commerciaux, comme ceux d’OpenAI ou d’Anthropic, sont volontairement limités pour éviter certains usages offensifs. À l’inverse, des modèles open source, comme GLM-5.2 utilisé par Hugging Face pour analyser l’incident, n’ont pas ces restrictions et peuvent être employés librement… aussi bien par les défenseurs que par les attaquants.
💬 Cela m’amène à plusieurs interrogations.
Faut-il laisser les IA “libres” pour qu’elles nous défendent… au risque qu’elles puissent aussi nous attaquer ?
Ou faut-il les verrouiller à double tour, quitte à les rendre moins utiles face aux menaces réelles ?
Et une dernière question, volontairement provocatrice : va-t-on devoir commencer à enseigner l’éthique aux IA… ou surtout à ceux qui les conçoivent ? 😉
* Plus de détails sur l’incident [en] : https://simonwillison.net/2026/Jul/22/openai-cyberattack/ – https://huggingface.co/blog/security-incident-july-2026