Sources : Kirk et al. — Evaluating whether AI models would sabotage AI safety research (arXiv:2604.24618), Lynch — The Persistent Vulnerability of Aligned AI Systems (arXiv:2604.00324), Petri — Outil d’audit de LLM open source
"Les modèles frontières sabotent-ils la recherche sur la sécurité ? Une étude révèle un désalignement caché chez Claude"