OpenAI, l’entreprise qui développe des modèles d’intelligence artificielle, annonce un réseau d’extraction entièrement interrompu au 28 juillet 2026. Pourtant, des chercheurs obtenaient encore du raisonnement masqué sur Azure, la plateforme de Microsoft, le 13 septembre.

L’annonce du 30 septembre concerne donc un réseau identifié. Elle laisse ouverte une autre question : quand les différents services hébergeant ces modèles ont-ils reçu les mêmes protections ?

Le blocage de juillet ne couvrait pas encore Azure en septembre

OpenAI rapporte 16 000 requêtes provenant de plus de 4 000 utilisateurs les 24 et 25 juillet. L’entreprise a ensuite identifié plus de 15 000 utilisateurs présentant des comportements apparentés.

Ces chiffres mesurent des tentatives d’extraction, précise une note du communiqué. Ils ne comptabilisent pas autant de réussites. Le dossier ne permet donc pas de chiffrer le volume effectivement récupéré par ce réseau.

Les tests du 13 septembre éclairent une autre limite. L’attaque par rejeu était bloquée sur l’API directe d’OpenAI, l’interface permettant aux logiciels d’interroger ses modèles. Elle fonctionnait encore sur Azure pour tous les modèles OpenAI testés, dont GPT-6 Astra.

Les chercheurs situent l’introduction de protections sur le point d’accès Azure d’OpenAI au 27 septembre. L’écart documenté concerne donc les semaines précédant l’annonce, sans prouver une vulnérabilité persistante après cette correction.

OpenAI reconnaît d’ailleurs que le travail reste inachevé. L’entreprise indique que les services hébergés par ses partenaires doivent bénéficier des mêmes protections. Pour un développeur, le choix de l’hébergeur devient ainsi une question de sécurité, même à modèle identique.

L’extraction portait sur du texte de raisonnement intermédiaire

L’étude initiale, déposée le 10 août, décrit la récupération d’une chaîne de pensée : le texte de raisonnement intermédiaire normalement masqué au client. L’objet extrait était donc du texte produit pendant le traitement d’une demande.

La méthode exploitait la compatibilité de blocs chiffrés entre sessions, utilisateurs et modèles d’un même fournisseur. Les chercheurs transmettaient ces blocs à un modèle plus faible, capable d’en restituer le contenu en clair.

Le chiffrement rendait le contenu illisible pour le client. Le modèle recevant le bloc rejoué pouvait toutefois y accéder. La protection dépendait donc aussi de ce que ce second modèle acceptait de restituer.

OpenAI affirme que les opérateurs n’ont ni cassé le chiffrement ni compromis une base de données. Ils n’ont pas non plus accédé directement aux conversations stockées des utilisateurs. L’entreprise dit avoir fermé une voie permettant de rejouer le raisonnement chiffré d’un autre utilisateur.

Elle annonce également des contrôles capables de retenir les sorties diffusées susceptibles de révéler du raisonnement.

Les mesures indiquent des traces longues, sans démontrer une copie du modèle

Sur Azure, les chercheurs rapportent une restitution textuelle en une seule tentative. Sa longueur correspondait, à quelques tokens près, au compte déclaré par le fournisseur. Ces unités représentent les fragments de texte traités par le modèle.

L’étude fournit aussi des mesures sur 120 problèmes de programmation par modèle, auprès de trois fournisseurs. Entre 82 % et 89 % des traces extraites avaient une longueur proche de celle d’origine, à moins de 5 % près. Le décodage restituait environ cinq fois plus de raisonnement que le résumé visible.

Ces résultats étayent la récupération de traces étendues. La proximité des longueurs ne prouve toutefois pas, à elle seule, l’identité de chaque mot.

La distillation consiste à entraîner un modèle à partir des sorties d’un autre. Les traces intermédiaires peuvent alimenter cet apprentissage, mais leur récupération ne démontre pas qu’un concurrent a reproduit les capacités du modèle.

Les chercheurs examinent aussi une méthode dite du bloc-notes. Elle demande au modèle d’écrire son raisonnement dans les paramètres d’un outil, visibles dans la réponse de l’interface. Elle ne nécessite ni déchiffrement ni second modèle.

Sur 152 questions d’un jeu d’évaluation, les deux méthodes produisaient une longueur médiane de 128 unités de texte. Leurs distributions présentaient néanmoins une différence mesurable. Leur utilité comparable pour la distillation reste une hypothèse, sans résultat d’entraînement démontré.

Le périmètre et la date du correctif restent déterminants

Le dossier établit deux faits compatibles : OpenAI annonce avoir interrompu un réseau en juillet ; Azure permettait encore l’extraction testée en septembre. Des protections y ont été introduites avant le communiqué du 30 septembre.

Le volume réellement extrait par le réseau reste inconnu. L’efficacité des traces pour entraîner un autre modèle reste également à démontrer. Pour les entreprises utilisatrices, la vérification porte sur leur service d’accès précis et ses protections, au-delà du nom du modèle.