Watermark sur les textes générés par Claude : Anthropic répond à vos questions

Claude Code est-il concerné, peut-on effacer le filigrane ou se rabattre sur un autre modèle ? Anthropic apporte enfin des réponses détaillées.

claude-watermark
10 choses à savoir sur le filigrane de Claude © Anthropic

Anthropic va intégrer un filigrane invisible sur les textes générés par Claude, et des métadonnées C2PA sur ses fichiers pour se conformer à l’AI Act. Le dispositif sera activé sur tous les modèles lancés après le 2 août 2026, et la firme en détaille désormais le fonctionnement. Ce qu’il faut savoir, en 10 questions.

Comment Claude peut-il marquer un texte sans rien ajouter ?

Le filigrane n’insère ni caractère caché ni mot supplémentaire. Quand Claude rédige, plusieurs candidats se valent souvent. Après Le temps était froid et, le choix entre couvert et gris ne change pas le sens de la phrase, et revient à un tirage aléatoire.

Le filigrane ne modifie pas ces choix, mais leur source. Une clé secrète combinée aux mots qui précèdent remplace le tirage arbitraire. Le modèle n’est donc pas poussé vers certains mots et ne retient jamais un terme qu’il n’aurait pas envisagé, mais la séquence obtenue devient vérifiable pour qui détient la clé.

Anthropic reprend SynthID-Text, une méthode publiée par Google DeepMind dans Nature en 2024, héritée d’une proposition du chercheur Scott Aaronson en 2022.

Le filigrane dégrade-t-il les réponses ou coûte-t-il plus cher ?

Anthropic dit n’avoir mesuré aucun effet sur le contenu, la créativité ou la lisibilité. L’étude à l’origine de la méthode allait dans le même sens. Google DeepMind avait servi un modèle marqué à une partie du trafic Gemini, sans écart significatif sur les votes des utilisateurs, et des évaluateurs humains comparant les réponses côte à côte n’avaient relevé aucune différence de qualité. Le marquage ne produit aucun token supplémentaire, donc ni surcoût ni ralentissement.

Le code généré par Claude est-il marqué ?

Très peu. Le filigrane a besoin de choix arbitraires entre formulations équivalentes, alors que le code impose une sortie exacte qu’une variante casserait.

Le même raisonnement vaut pour les passages factuels : où 2 + 2 = n’appelle qu’une seule suite possible. Le marquage peut se loger dans les commentaires, avec un effet négligeable sur le code en lui-même.

Et quand Claude corrige ou traduit un texte déjà écrit ?

Les deux cas s’opposent :

  • Sur une relecture, les mots sont principalement ceux de l’auteur, le filigrane peut donc difficilement s’insérer. Selon l’ampleur des corrections, l’intervention du modèle peut rester indétectable.
  • En revanche, une traduction est marquée intégralement, puisque Claude en choisit chaque mot. Elle sera donc facile à détecter, c’est un texte généré.

Les images et les fichiers sont-ils concernés de la même manière ?

Ils sont concernés, mais pas de la même manière.

Les fichiers PNG, JPG ou SVG produits par Claude reçoivent une note signée cryptographiquement dans leurs métadonnées, au standard ouvert C2PA, déjà utilisé par les fabricants d’appareils photo. Il ne s’agit pas d’un filigrane, puisque rien n’est modifié ni dissimulé dans le fichier. Mais tout outil compatible peut lire cette mention, et Anthropic prévoit de proposer le sien.

Le filigrane peut-il remonter jusqu’à un utilisateur ?

Non. Ni le filigrane ni la clé ne contiennent d’information permettant d’identifier un utilisateur ou une organisation. Le marquage porte sur les sorties du modèle, et la clé répond à une seule question :est-il probable que Claude soit intervenu ?

Peut-on effacer le filigrane ?

En partie. Une retouche légère ne suffit pas. Une réécriture complète l’efface, mais Anthropic note qu’un texte dont chaque mot a été remplacé relève difficilement encore de la génération par IA. La longueur compte tout autant, la détection perdant en fiabilité sur un échantillon court, faute de choix de mots en nombre suffisant.

Comment vérifier qu’un texte a été généré par Claude ?

Anthropic annonce une API de détection, dont les modalités restent à définir. Elle ne fonctionnera pas comme les détecteurs de texte IA du marché qui resteront privés de la clé. Ils resteront limités aux les tics d’écriture des modèles, à l’image de la construction « ce n’est pas X, c’est Y ». Le résultat restera une probabilité, sans distinguer un texte rédigé par Claude d’un texte retravaillé par Claude.

Peut-on passer sur une autre IA ou un ancien modèle ?

Pas durablement. Le code de bonnes pratiques européen sur la transparence des contenus générés par IA, signé en juillet 2026 en amont des obligations entrées en vigueur le 2 août, réunit environ 190 signataires, dont la plupart des grands fournisseurs de modèles. Chacun déploiera son propre marquage, avec sa clé et peut-être des méthodes différentes.

Les modèles de Claude antérieurs au 2 août échappent encore au filigrane, mais Anthropic dispose d’une période de transition et travaille à les couvrir dans les mois à venir. Vous pouvez donc y échapper pour le moment, mais ça ne durera pas.

Et peut-on échapper au filigrane avec un VPN ?

Non. Le marquage opère au niveau du modèle et s’applique partout dès le lancement, sans distinction de pays. Anthropic explique ne pas disposer de moyen durable pour le restreindre à une région, et dit continuer d’évaluer d’autres approches. Se connecter depuis l’extérieur de l’Union européenne ne change rien au texte produit.

Sujets liés :
Publier un commentaire
Ajouter un commentaire

Votre adresse email ne sera pas publiée.

Visuel enquête Visuel enquête

Community managers : participez à notre enquête 2026

L'objectif est de comprendre comment évolue votre métier : missions, réseaux utilisés, outils...

Je participe

Les meilleurs détecteurs de texte par IA