OpenAI a publié le 5 octobre 2026 un rapport technique de 20 pages consacré à textGrain, le filigrane statistique qu'il va appliquer au texte éligible produit par ChatGPT et Codex dans l'Union européenne. Dans un billet intitulé « Our approach to EU text provenance rules », l'entreprise annonce ce marquage « au cours des prochaines semaines » pour se conformer à l'AI Act. Les clients de son API peuvent l'activer depuis le 5 octobre, partout dans le monde, pour certains modèles, mais il y restera désactivé par défaut.

Le rapport est cosigné par cinq chercheurs d'OpenAI et quatre universitaires de l'université de Pennsylvanie et de Yale. Le billet, mis en ligne à 15 h UTC selon le flux RSS de l'entreprise, annonce une mise à jour de ce rapport « dans les prochaines semaines ». OpenAI a relayé l'annonce le même jour sur son compte X.

Un signal logé dans le choix des mots Un modèle de langage choisit chaque mot par tirage dans une distribution de probabilités. textGrain remplace une partie de ce hasard par des valeurs pseudo-aléatoires calculées à partir d'une clé secrète et des mots qui précèdent. Le rapport décrit un découpage du vocabulaire en blocs, puis un problème de transport optimal à coûts de Gumbel qui oriente le choix du bloc. À l'intérieur du bloc retenu, les mots gardent leurs probabilités relatives d'origine.

Le rapport s'organise autour d'un « budget d'entropie », la part de hasard que l'on accepte de sacrifier pour créer le signal. Les auteurs le présentent comme une réponse à une limite du filigrane Gumbel-max. Avec une même clé et une même consigne, elle peut produire des réponses identiques, ce qui gêne les applications qui demandent plusieurs variantes d'un texte.

Le détecteur n'a besoin que du texte et de la clé. Le rapport précise que le taux de faux positifs théorique repose sur des hypothèses d'indépendance et qu'une clé déployée doit être calibrée de façon empirique. Le signal n'ajoute ni caractère caché ni espace invisible : il est porté par les mots eux-mêmes.

Le centre d'aide d'OpenAI indique que textGrain est conçu pour résister aux modifications légères et au copier-coller. Une paraphrase substantielle ou une traduction peut en revanche le rendre indétectable. 95 % à 400 jetons, 17 % après une réécriture Le billet d'OpenAI publie des taux mesurés sur des réponses à des questions du jeu de données anglophone ELI5.

Ils dépendent de la longueur du texte et du sujet, avec un détecteur réglé pour viser 1 % de faux positifs. Situation testéeDétection annoncée Passage de 400 jetons sur un sujet de psychologieenviron 95 % Passage de 200 jetonsenviron 80 % Autre jeu de passages de 400 jetons, 10 % des mots remplacés par des synonymesd'environ 92 % à 66 % Même jeu, un quart des mots remplacés17 % Contenus mathématiques« nettement plus bas » dans le texte ; environ 60 % à 400 jetons selon la lecture du graphique d'OpenAI par The Decoder Les deux lignes consacrées aux synonymes proviennent d'une évaluation distincte, menée sur un autre jeu de passages de 400 jetons, dont le taux de départ est d'environ 92 %. Pour les autres langues, le centre d'aide présente une évaluation sur 500 consignes rédigées en anglais puis traduites dans les 23 autres langues officielles de l'Union.

Au même seuil de 1 % de faux positifs, la détection va de 42,2 % en roumain à 69,0 % en espagnol. OpenAI indique avoir renforcé le signal pour les langues sous 60 %, grâce à un paramètre de force réglable. Le seuil de 200 jetons correspond à celui du code de bonnes pratiques européen sur la transparence des contenus générés.

Ce code exempte de filigrane les « textes très courts », définis comme ceux de moins de 200 jetons. Au-delà, le marquage reste requis même si sa fiabilité est plus faible. Article 50 : une obligation applicable depuis le 2 août L'article 50, paragraphe 2, du règlement (UE) 2024/1689 vise les fournisseurs de systèmes d'IA qui génèrent du texte, de l'image, du son ou de la vidéo.

Leurs sorties doivent être « marquées dans un format lisible par machine et identifiables comme ayant été générées ou manipulées par une IA ». L'obligation s'applique depuis le 2 août 2026, une échéance détaillée dans un précédent article d'ActuIA sur le compte à rebours de l'AI Act. Le règlement (UE) 2026/1744 du 8 juillet 2026, publié au Journal officiel le 24 juillet, dit omnibus numérique sur l'IA, a ajouté un paragraphe 4 à l'article 111.

Selon le texte publié par le service d'assistance AI Act de la Commission, les systèmes mis sur le marché avant le 2 août 2026 ont jusqu'au 2 décembre 2026 pour se conformer à l'article 50, paragraphe 2. Pour ChatGPT et Codex, déjà commercialisés à cette date, les « prochaines semaines » annoncées par OpenAI tombent dans cette fenêtre. La Commission a publié le 10 juin le code de bonnes pratiques, jugé adéquat par elle et par le Comité IA, puis, le 20 juillet, des lignes directrices sur l'article 50.

OpenAI figure parmi les signataires de la section 1, consacrée aux fournisseurs, dans la liste publiée par la Commission qui recensait environ 190 organisations fin juillet. Cette obligation de marquage s'ajoute à celle, distincte, des résumés de données d'entraînement exigés des modèles à usage général. API désactivée par défaut : qui porte l'obligation ?

Dans l'API, le filigrane restera désactivé par défaut, écrit OpenAI. Son centre d'aide décrit l'activation : un réglage « Text provenance » dans les paramètres de l'organisation, rubrique Data controls, ou dans ceux d'un projet, avec le choix des modèles concernés. La couverture doit s'étendre aux modèles plus anciens au cours des prochaines semaines.

Il ne s'agit pas d'un paramètre d'appel, et la référence de l'API n'en mentionnait aucun le 6 octobre. OpenAI dit travailler avec des partenaires cloud, qu'il ne nomme pas dans son billet, pour proposer le filigrane sur leurs services ; The Decoder cite Microsoft Azure. Pour une entreprise française qui intègre un modèle d'OpenAI dans un assistant ou un outil de rédaction proposé sous son propre nom, les lignes directrices de la Commission fournissent la grille de lecture.

Elles qualifient de fournisseur l'organisation qui met un système d'IA sur le marché ou en service sous son nom ou sa marque, y compris un chatbot développé en interne pour son propre usage. Elles rappellent que l'article 50 ne vise pas explicitement les modèles à usage général. Un fournisseur peut s'appuyer sur le marquage mis en place en amont par le fournisseur du modèle, dans la mesure où ce marquage est conforme et sans que cela le décharge de sa propre responsabilité.

Selon cette lecture des lignes directrices, qui ne traitent pas explicitement le cas d'une option désactivée, un intégrateur qui laisse le réglage par défaut ne peut pas se prévaloir du filigrane d'OpenAI. Il lui revient alors de l'activer, pour un projet ou pour toute l'organisation, ou de marquer les sorties par un autre moyen. L'article 50 prévoit une exception pour les fonctions d'assistance à la mise en forme standard et pour les outils qui ne modifient pas de manière substantielle les données fournies.

Son paragraphe 4 ajoute une obligation distincte pour les déployeurs qui publient un texte généré afin d'informer le public sur des questions d'intérêt public, sauf relecture humaine et responsabilité éditoriale. Le même paragraphe vise les hypertrucages, dont l'Espagne a prévu de sanctionner le défaut d'étiquetage dans un projet de loi de mars 2025. Un détecteur réservé, dans les limites du code OpenAI a ouvert le 5 octobre les candidatures pour accéder à son détecteur.

Le billet relie ce choix aux taux mesurés : « Ces limites contribuent à notre décision de réserver l'accès initial au détecteur à des chercheurs et organisations expertes approuvés ». Le centre d'aide cite des partenaires à Cornell, à l'ETH Zurich et à l'institut slovaque KInIT. L'accès au détecteur reste ainsi soumis à candidature, y compris pour les clients de l'API qui activent le filigrane.

Le code autorise ce verrou pour le texte libre, jugé moins fiable, mais il l'encadre. Les signataires doivent ouvrir un accès contrôlé et gratuit aux autorités de surveillance du marché et autres régulateurs, aux forces de l'ordre, aux médias et aux vérificateurs de faits. La liste comprend aussi les signaleurs de confiance, les chercheurs indépendants, les établissements d'enseignement et de recherche et la société civile.

La restriction doit rester limitée dans le temps. Les lignes directrices demandent aussi au fournisseur de rendre les moyens de détection accessibles aux personnes exposées aux contenus. Une rédaction ou une université figurent parmi les catégories que le code oblige les signataires à servir ; un service RH qui voudrait contrôler une lettre de motivation n'entre dans aucune de ces catégories.

Anthropic, Google, vLLM : d'autres choix de périmètre Anthropic a annoncé le 14 août un filigrane dérivé de SynthID-Text, appliqué au niveau mondial « parce que nous n'avons pas encore de moyen durable de le limiter par région ». Le billet annonçait alors une API de détection « prochainement », selon sa version archivée le jour même. Dans sa version actuelle, comme sur la page de lancement de Claude Fable 5.1 publiée en septembre, Anthropic présente cette API en aperçu privé.

Elle est ouverte aux régulateurs, forces de l'ordre, médias, vérificateurs de faits, chercheurs indépendants, organismes éducatifs et groupes de la société civile de l'UE, ainsi qu'aux entreprises tenues de vérifier le filigrane pour leur propre conformité. Google avait rendu SynthID Text open source en 2024. Le 24 septembre, le projet vLLM a décrit l'intégration d'un filigrane Gumbel-max dans son moteur d'inférence, dans un billet signé par des ingénieurs de Mistral et de Red Hat.

OpenAI prévoit de publier textGrain en open source, sans date, et affirme qu'il a égalé ou dépassé SynthID pour le texte dans ses évaluations. OpenAI se distingue par un marquage limité au territoire où la loi l'impose, là où Anthropic l'applique partout. Les deux entreprises convergent sur un point : l'absence de filigrane détecté « ne prouve pas que le texte est d'origine humaine », écrit OpenAI.

Le texte peut être trop court, édité ou traduit, provenir d'un modèle non pris en charge ou d'un autre éditeur, ou dater d'avant le marquage. ST Stephane Nachez Rédaction ActuIA — actualités, données et analyses sur l'intelligence artificielle pour les décideurs.