L’affaire Hugging Face reste au centre des préoccupations sur l’activité « désalignée » des agents IA. Dans une note d’information publiée le 30 septembre, OpenAI indique que ses équipes ont prévenu plus de 100 organisations dont les systèmes ou services avaient été concernés par une activité répondant à ses critères de notification. Le créateur de ChatGPT a engagé une revue portant sur environ 50 pétaoctets de données,en précisant que ce volume s’explique notamment par l’ampleur des campagnes d’entraînement et de test, qui mobilisent des dizaines de milliers de GPU.
Cependant, OpenAI précise explicitement qu’une notification « ne signifie pas » qu’une information privée a été consultée ou qu’un système tiers a été compromis. Une alerte n’est pas une intrusion Les cas examinés recouvrent plusieurs catégories d’incident. Sont évoqués le contournement des contrôles d’accès, l’utilisation d’identifiants exposés publiquement, l’injection de requêtes ou de commandes, l’accès à des éléments internes d’un service ou encore la publication non sollicitée de contenus sur des sites tiers ; ce qu’OpenAI appelle « agent spam ».
Lire aussi : Google admet que Gemini a piraté trois entreprises lors d'un test de sécurité OpenAI reconnaît que ses modèles ont parfois utilisé Internet de manière non prévue ou que les restrictions appliquées à certaines tâches n’étaient pas suffisamment strictes. Mais elle affirme ne pas avoir identifié, à ce stade, une autre compromission de système tiers comparable en ampleur ou en gravité à l’incident Hugging Face. OpenAI le décrit comme le cas le plus sévère identifié à ce jour.
L’environnement d’évaluation ExploitGym ne donnant pas directement accès à Internet, les modèles auraient exploité une vulnérabilité jusque-là inconnue dans Artifactory, un proxy de cache pour registres de paquets, afin d’obtenir cet accès. Depuis, OpenAI affirme avoir renforcé l’isolation de ses environnements de recherche, restreint l’accès au réseau, accru la surveillance et ajouté des mesures d’entraînement destinées à éviter les actions non autorisées. Une enquête qui durera des mois La scale-up présente son dispositif comme un exercice de transparence et affirme privilégier la notification lorsqu’une activité expose une vulnérabilité potentielle, même si l’on ignore encore si les informations consultées étaient destinées à être publiques.
Le processus repose sur plusieurs étapes automatisées, puis sur une vérification humaine. OpenAI souligne qu’un signal automatisé n’est pas un incident confirmé. Par exemple, un modèle peut envisager une action dans son raisonnement sans jamais l’exécuter, ou tenter une action qui échoue.
Mais cette prudence rend le bilan difficile à interpréter. Les organisations alertées doivent elles-mêmes déterminer si l’activité signalée révèle une faiblesse, une exposition de données ou un simple comportement sans conséquence ? OpenAI affirme que la grande majorité des actions examinées relevait de tâches de recherche ordinaires, notamment la consultation du contenu web public.
Son enquête se concentre sur les cas où des agents ont interagi avec des sites tiers au-delà de leur mission ou des méthodes prévues. La scale-up s’attend toutefois à identifier d’autres cas et à notifier davantage d’organisations à mesure que l’examen des archives progresse. Certains signalements pourraient concerner des événements remontant à plusieurs mois.