Les textes générés par ChatGPT vont intégrer un filigrane invisible

La technologie d’OpenAI oriente le choix des mots de ses modèles pour laisser une empreinte invisible, pouvant être repérée par son détecteur. Mais la méthode a ses failles.

openai-outil-detection-chatgpt-codex
Le système de watermark est d'abord limité à l'Union européenne. © temitiman - stock.adobe.com

Pour se conformer à l’AI Act, OpenAI s’apprête à implémenter un filigrane invisible sur les contenus textuels générés par ChatGPT et Codex dans l’Union européenne, a annoncé l’entreprise dans un billet de blog. Baptisée textGrain, cette technologie de watermarking « ajoute un signal statistique invisible dans le choix des mots du modèle », pouvant être repéré par son propre détecteur, « dont l’accès est dans un premier temps réservé à des chercheurs et des organisations expertes approuvées », indique le communiqué.

Une empreinte invisible, qui n’altère pas la qualité des outputs

Dévoilée ce lundi 5 octobre 2026, la technologie textGrain n’insère aucun marqueur visible dans le texte. Au lieu de ça, elle oriente la manière dont le modèle compose ses phrases et sélectionne ses mots, de façon à créer un pattern imperceptible à la lecture, mais pouvant être repéré par un outil dédié. Le marquage reste attaché au texte lorsqu’il est copié-collé, mais ne permet pas de le relier à « une personne, une organisation, un prompt ou une conversation », assure OpenAI.

La société créatrice de ChatGPT recycle ainsi une méthode qu’elle avait mise de côté : en août 2024, le Wall Street Journal révélait que la firme disposait d’un outil comparable, affichant un taux de réussite de 99,9 %, qu’elle avait finalement renoncé à déployer à grande échelle, de peur de faire fuir une partie de ses utilisateurs et de dégrader la qualité des réponses de ChatGPT. Cette dernière crainte semble aujourd’hui écartée. « Sur l’ensemble des benchmarks utilisés pour évaluer Astra, notre dernier modèle frontière, nous n’observons pas de différence de performance significative avec ou sans watermarking », assure OpenAI.

comparatif-performances-avec-sans-watermark
Un comparatif des performances d’Astra, avec ou sans watermark. © OpenAI

Une détection fragilisée par les textes courts et les réécritures

Théoriquement plus efficace que d’autres méthodes proposées par des acteurs tiers, ce système de détection est-il pour autant infaillible ? Non, reconnaît OpenAI, qui en a déjà identifié plusieurs limites :

  • Une efficacité moindre sur des textes courts : l’outil a repéré le watermark dans « environ 80 % des passages de 200 tokens, contre environ 95 % des passages de 400 tokens », peut-on lire.
  • La réécriture du texte fragilise la détection : sur des passages plus longs, remplacer 10 % des mots par des synonymes a fait chuter le taux de détection d’environ 92 % à 66 %. Lorsque 25 % des mots sont modifiés, ce taux tombe à 17 %. Une traduction peut également compliquer l’identification.
  • Le système ne reconnaît que les textes produits par les modèles d’OpenAI : un contenu qui passe sous les radars peut provenir « d’un modèle non pris en charge, être antérieur au watermarking ou avoir été généré par les outils d’une autre entreprise », rappelle l’entreprise, sans préciser les modèles qui embarqueront effectivement ce système.
impact-reecriture-detection-outil-openai.
Retoucher le texte rend la détection plus incertaine. © OpenAI

L’outil d’OpenAI peut donc se tromper, et produire de faux positifs comme de faux négatifs. Une fragilité qui a amené OpenAI à en réserver, dans un premier temps, l’accès à des chercheurs et des organisations approuvés. « Nous prévoyons de réexaminer chaque volet de cette approche à mesure que la technologie, les standards et les données évolueront », peut-on lire.

Le déploiement du watermarking d'OpenAI

  • Dans l’Union européenne : le watermarking sera activé dans les prochaines semaines pour les « utilisateurs éligibles de ChatGPT et Codex », quel que soit leur abonnement. Au lancement, il ne sera pas imposé par défaut dans les pays de l’Union européenne.
  • Pour les clients de l’API : les développeurs peuvent déjà activer le watermarking sur les textes générés par certains modèles, en fonction de « leurs obligations de transparence et des services proposés à leurs utilisateurs ». Le système sera également déployé, dans les prochaines semaines, sur les modèles d’OpenAI accessibles via ses partenaires cloud.

Après Anthropic, OpenAI se conforme à l’AI Act

Avec ce dispositif, OpenAI répond aux obligations de l’article 50 de l’AI Act, applicable depuis le 2 août 2026, qui exige des fournisseurs que les contenus textuels produits par leurs systèmes d’IA « soient marqués dans un format lisible par machine et détectables comme étant générés ou manipulés artificiellement ». En mai dernier, la firme américaine avait déjà rendu public un outil capable d’identifier les images générées par ses modèles.

OpenAI suit également la voie tracée par Anthropic, qui a introduit, cet été, un système de marquage des fichiers et des contenus textuels générés par ses modèles lancés après le 2 août 2026.

Sujets liés :
Publier un commentaire
Ajouter un commentaire

Votre adresse email ne sera pas publiée.

Les meilleurs détecteurs de texte par IA