OpenAI introduira dans les prochaines semaines un filigrane invisible dans certains textes générés par ChatGPT et Codex dans l’Union européenne. Baptisée textGrain, cette technologie doit faciliter l’identification automatisée des contenus produits par intelligence artificielle afin de répondre aux exigences de transparence de l’AI Act européen. Mais OpenAI reconnaît elle-même les limites de ce dispositif.
OpenAI franchit une nouvelle étape dans l’identification des contenus produits par intelligence artificielle. L’entreprise a annoncé lundi qu’elle allait progressivement intégrer un signal invisible aux textes éligibles générés par ChatGPT et Codex pour les utilisateurs de tous les forfaits dans l’Union européenne.
La mesure répond aux dispositions européennes imposant que certains contenus générés par IA puissent être identifiables sous une forme lisible par machine.
Une empreinte statistique dans le choix des mots
La technologie est baptisée textGrain. Contrairement à ce que l’expression « filigrane invisible » pourrait laisser penser, elle n’ajoute ni caractères cachés, ni espaces invisibles, ni ponctuation particulière au texte.
Le système agit directement sur la manière dont le modèle choisit entre différents mots ou fragments de mots possibles. Au fil du texte, ces choix créent un motif statistique invisible qu’un détecteur disposant des paramètres nécessaires peut ensuite rechercher.
Pour le lecteur, le texte conserve une apparence parfaitement normale.
OpenAI affirme que ses évaluations n’ont pas mis en évidence de dégradation significative de la qualité des réponses ni de ralentissement notable de ses modèles.
Impossible d’identifier l’utilisateur de ChatGPT
L’entreprise insiste cependant sur les limites de cette technologie.
La détection du filigrane peut constituer un indice qu’un système d’OpenAI a généré ou traité tout ou partie d’un texte. Elle ne permet en revanche ni d’identifier l’utilisateur, ni de retrouver son prompt ou sa conversation, ni de mesurer la part exacte de contribution humaine.
Elle ne permet pas davantage de déterminer l’auteur ou le propriétaire juridique du contenu, ni de savoir si les informations contenues dans le texte sont exactes.
Des faux positifs et des faux négatifs possibles
OpenAI reconnaît également que la détection n’est pas infaillible. Le système peut produire des faux positifs, en signalant une marque inexistante, mais également des faux négatifs en ne détectant pas un filigrane pourtant présent.
Les textes courts sont notamment plus difficiles à identifier. Une réécriture importante, une paraphrase ou une traduction peuvent également affaiblir la signature statistique.
Pour cette raison, le détecteur ne sera pas immédiatement accessible au grand public. Dans un premier temps, son utilisation sera réservée à des chercheurs et à des organisations spécialisées préalablement approuvées.
Un système facultatif pour l’API
Le dispositif fonctionnera différemment pour les utilisateurs professionnels de l’API d’OpenAI.
Depuis ce 5 octobre, les clients de l’API dans le monde entier peuvent choisir d’activer le filigrane sur les sorties textuelles de certains modèles. Cette fonctionnalité restera toutefois désactivée par défaut.
Chaque organisation pourra ainsi décider de son utilisation en fonction de ses propres obligations de transparence.
OpenAI travaille parallèlement avec ses partenaires du cloud afin que le système puisse également être appliqué aux contenus générés par ses modèles lorsqu’ils sont utilisés à travers leurs services.
textGrain devrait devenir open source
OpenAI prévoit enfin de rendre textGrain disponible en open source, afin de permettre à d’autres acteurs d’étudier la technologie, de l’améliorer et de développer de nouvelles méthodes de provenance des contenus.
Cette évolution pose cependant une question plus large : sera-t-il réellement possible de distinguer de manière fiable un texte humain d’un texte généré ou profondément retravaillé par une intelligence artificielle ?
Pour l’heure, OpenAI appelle elle-même à la prudence : l’absence de filigrane détectable ne constitue pas une preuve qu’un texte a été écrit par un humain.