Source: The Conversation – in French – By François Rastier, Directeur de recherche, Centre national de la recherche scientifique (CNRS)

L’ESSENTIEL
-
Il est très difficile, aujourd’hui, de savoir si un texte est produit par un humain ou par une intelligence artificielle, malgré des avancées législatives qui vont dans le sens d’un affichage de son usage.
-
Certains logiciels monétisent cette difficulté et proposent de détecter les textes produits par une IA, mais leur fiabilité reste difficile à prouver.
-
Si le règlement européen sur l’IA, l’IA Act, promet plus de transparence sur les contenus générés par IA, la majorité des utilisateurs, par défaut, tient pour authentiques les textes ainsi produits.
Les textes générés par intelligence artificielle (IA) ouvrent une situation nouvelle : relevant à leur manière du régime de la post-vérité par leur indifférence à toute catégorisation, ces textes ne sont ni vrais ni faux, ni authentiques ni falsifiés. Nulle autorité ne s’aviserait de s’en porter garant. Les firmes productrices des chatbots se contentent des mentions comme « Peut comporter des erreurs » et autres formules d’un vague précautionneux imitées des industries du tabac ou de l’agroalimentaire.
Prenons l’exemple de l’édition. Un nouveau problème d’authentification se pose aux journalistes comme aux éditeurs de journaux ou de livres. Comment savoir si un manuscrit reçu est l’œuvre d’un humain ou le produit d’une IA ? Cette question met évidemment en jeu la crédibilité des auteurs comme celle des éditeurs.
En amont, les IA ont été entraînées non seulement à partir de données personnelles et de documents en accès libre, mais aussi de textes sous droits. Couvert par un commode « secret industriel » ce pillage initial, euphémisé en fair use, ou « usage équitable », n’a pas été compensé par les quelques droits d’usage négociés discrètement par les éditeurs les plus importants.
Désormais, cependant, l’édition se doit en outre d’évaluer la part prise par l’IA dans les textes qui lui sont soumis pour publication. À la suite de divers scandales, les éditeurs tentent de rassurer leur public en publiant des recommandations destinées aux auteurs.
Or, pour les grands éditeurs scientifiques anglo-saxons, l’usage de l’IA générative ne remet pas en cause l’authenticité des manuscrits soumis : elle doit simplement apparaître dans les remerciements – ce qui est déjà lui reconnaître une personnalité, comme si elle était devenue une collègue. En somme, cet usage semble accepté, bon gré mal gré.
IA et littérature
Dans le domaine de la création littéraire, la notion d’auteur (humain) reste privilégiée. Ainsi, en 2024, la romancière japonaise Rie Kudan reçut le prestigieux prix Akutagawa pour un roman d’anticipation, mais suscita des critiques quand elle révéla malicieusement avoir eu recours à l’IA – pour 5 % du texte seulement assura-t-elle. Comme une prophétie autoréalisatrice, son roman décrit les effets de l’IA sur la société à venir.
Depuis, les jurys semblent plus suspicieux, mais parfois à leur détriment. Gagnant du prix Commonwealth de la meilleure nouvelle, Jamir Nazir dut rendre sa récompense. Mais après un long procès, et sur la foi « de brouillons, d’ébauches, de plans, de documents horodatés et de notes », il eut gain de cause en juillet 2026 et le montant de son prix fut même doublé à titre de dédommagement.
Les indices stylistiques restent d’autant plus conjecturaux que les humains et les IA imitent réciproquement leur langage, par un effet mimétique de code-switching (alternance codique, ndlr) pour les premiers et, pour les IA, par « un alignement » programmé qui les conduit à se régler sur les propos que leur adressent leurs utilisateurs.
La détection de l’IA par l’IA ?
Pour lever les doutes, on a alors recours à des logiciels d’IA spécialisés dans la détection – en application peut-être d’un adage de Mark Zuckerberg, qui affirme que l’IA peut réparer les dommages qu’elle cause, comme jadis la lance d’Achille pouvait magiquement guérir les blessures. Et de fait, les doutes semés par les textes artificiels se sont assez épaissis pour donner matière à un nouveau secteur économique voué à la détection des IA, et que nous nommerons l’« industrie du soupçon ». Elle parvient à monétiser la confusion semée par les textes artificiels.
Dans ce domaine, la firme la plus importante reste Pangram, fondée en 2018. Son directeur, Max Spero, presse les éditeurs de « modérer strictement le contenu généré par IA » (« strictly moderate AI-generated content ») et n’a pas hésité à dénoncer nommément des journalistes, notamment ceux du New York Times. Les accusations, reprises par The Atlantic, suscitèrent une polémique qui s’assourdit toutefois quand James Taranto, dans le Wall Street Journal, montra que les mêmes articles, soumis à Pangram, obtenaient des scores différents à divers moments de la journée.
À l’heure actuelle du moins, les logiciels d’IA destinés à détecter les textes artificiels sont tout aussi opaques et trompeurs que ceux qui ont produit ces textes. Ils se contentent d’aligner des pourcentages : par exemple, le témoignage encore inédit, l’Expérience humaine, de Thierry Crouzet, soumis par son auteur au logiciel Justdone, serait écrit à 61 % par une IA. Il s’interroge : « Je ne serais qu’à 39 % humain ? » Il lui suffit d’ailleurs de soumettre son texte à d’autres outils de détection pour voir varier son pourcentage d’humanité…
Comme ces pourcentages sont calculés à partir d’indices opaques, ces logiciels ne font pas mieux que les lecteurs suspicieux, mais somme toute pire, car ils présentent des conjectures comme des résultats et multiplient ainsi les faux positifs comme les faux négatifs. Aussi, craignant sans doute des injustices et surtout des procès, de grandes universités, comme Austin, Yale, Berkeley ou le MIT, ont décidé d’interdire l’usage des détecteurs d’IA.
Une humanisation artificielle ?
Cependant leur succès ne se dément pas, car l’on prend volontiers les sorties machines pour des résultats. Et outre, ces détecteurs d’IA reposent sur des technologies duales et proposent benoîtement de maquiller les textes générés par IA pour les « humaniser » et se garantir ainsi des accusations, qu’elles soient justifiées ou non.
Ainsi Justdone propose : « Préservez l’authenticité de vos écrits en identifiant les contenus générés par l’IA. Précision de 99,8 %. » Grammarly, pour sa part, « détecte et corrige le contenu généré par IA » et se présente comme un logiciel « d’humanisation ». Inutile de souligner le paradoxe d’une originalité machinale promue par des slogans comme : « Rendez votre texte 100 % original. »
Le recours à une humanisation artificielle ne trahirait-il pas une démission éthique ? Il fait en tout cas les affaires des entreprises de détection, et l’on comprend mieux pourquoi le directeur de Pangram dénonçait des « coupables » : l’intimidation devenait telle que des auteurs en viennent à utiliser son IA pour se prémunir de l’accusation d’avoir utilisé l’IA…
La confusion s’accroît ainsi. Par exemple, accusé par Pangram de publier 41 % de posts longs et 30 % de posts courts générés par IA, le grand réseau professionnel LinkedIn a mis en place un bouton qui permet à ses utilisateurs de marquer les textes qu’ils suspectent de la mention désobligeante AI slop. C’est un moyen d’entraîner son propre détecteur d’IA, mais par des conjectures qui restent incontrôlables. La perplexité s’accroît encore quand on s’avise que LinkedIn met obligeamment à disposition de ses abonnés premium un générateur de textes, et que sa maison mère est actionnaire d’OpenAI.
En somme, on ne saurait s’en remettre aux détecteurs d’IA, puisqu’ils conservent toute l’opacité des chatbots qu’ils sont censés caractériser.
Retenons enfin que cette étrange « humanisation » participe sans doute de la convergence entre textes artificiels et textes « humains » ou plus exactement culturels. Non seulement les auteurs sont peu à peu influencés par les textes artificiels qu’ils lisent, notamment s’ils usent fréquemment des chatbots, mais ils s’en remettent de plus en plus à l’IA pour corriger ceux qu’ils écrivent, avec l’espoir d’écarter les soupçons qui affectent à présent tout le monde, d’autant plus que n’importe quel robot peut jurer sur l’honneur qu’il n’en est pas un – pour peu qu’on le lui demande.
À lire aussi :
Comment les IA génératives grand public influencent le langage des publications académiques
Perspectives scientifiques et réglementaires
La comparaison entre textes artificiels et textes « humains » appelle un programme de recherche coordonné qui tiendrait compte des procédures de comparaison exploitées de longue date par la lexicométrie et la textométrie. Sur d’autres langues que le français, divers travaux comparatifs ont été menés, sur l’anglais notamment, et principalement à partir de diverses déclinaisons de ChatGPT. Quelle que soit la langue, les résultats sont concordants, malgré la diversité des méthodes, ce qui confirme l’objectivité des traits relevés.
Ainsi, par des méthodes de stylométrie, Przystalski et coll. mettent en évidence, par contraste avec les textes « humains » la monotonie des constructions syntaxiques, la prévisibilité de la structure des phrases, une fréquence encore affaiblie des mots rares, des schémas de ponctuation caractéristiques, et une expressivité limitée. Terčon et Dobrovoljc soulignent aussi un style impersonnel, marqué par la fréquence de nominalisations et des déterminants et une rareté relative des adjectifs et des adverbes. Étudiant des travaux universitaires, Herbold et coll. notent aussi l’abondance des nominalisations (caractéristiques des discours stéréotypés, pour ne pas dire des langues de bois).
Indépendamment d’un programme de linguistique comparative, et sachant que les performances imitatives des chatbots s’accroissent avec l’aide souvent involontaire des utilisateurs, la seule solution pour détecter les textes artificiels reste l’obligation pour les firmes qui les produisent de les caractériser en amont, par des métadonnées et/ou des mentions affichées. Entré en vigueur le 2 août 2026, l’IA Act élaboré par l’Union européenne impose, pour la première fois, un tel marquage sur son territoire – du moins à compter du 2 décembre, les grandes entreprises ayant obtenu un premier délai.
C’est là reconnaître enfin une responsabilité aux producteurs de « contenus », comme aussi aux utilisateurs professionnels. Comme les plateformes prétendent limiter leur rôle à celui d’hébergeurs, elles en restent cependant exemptées, ce qui semble exorbitant, alors que les autres médias sont tenus pour responsables de ce qu’ils diffusent.
S’il faut malgré tout saluer ce courageux retour à la raison juridique, la question des usages individuels reste évidemment ouverte, et rien encore n’empêchera des fraudeurs d’effacer ou de modifier les métadonnées des textes artificiels. En outre, ces métadonnées ne sont lisibles que par certains logiciels et restent hors de portée du grand public. Enfin, les résumés générés par IA, ceux que priment désormais les moteurs de recherche, comme Google, restent exemptés de marquage explicite.
La suspicion qui affecte désormais tous les textes, « humains » ou non, risque donc de perdurer malgré tout. Le problème qui se pose à nous n’est pas celui de la vérité : un texte artificiel peut être lu comme factuellement vrai, un texte naturel peut fourmiller de mensonges, mais la question de l’authenticité doit être posée avant tout.
Même si un texte inauthentique peut être déchiffré, il convient d’en suspendre l’interprétation, en suivant la mise en garde de Friedrich Schlegel, dans sa Philosophie de la philologie (1797) : « Il est inutile d’interpréter les textes inauthentiques. »
En d’autres termes, le critère de l’authenticité reste préjudiciel. Seule l’authenticité permet de légitimer une interprétation et de porter un jugement relevant de la raison pratique, c’est-à-dire de l’éthique. Or, personne ne peut répondre d’un texte artificiel, et il échappe de fait à toute responsabilité : la notion douteusement psychologisante d’hallucination reste trompeuse. En outre, de même qu’un texte qui mélange le vrai et le faux doit être récusé, car le faux l’emporte toujours, un texte composite qui mêle le naturel et l’artificiel, l’authentique et l’inauthentique devient l’objet d’une suspicion légitime.
Toutefois, comme le doute ne peut guère être levé, une crédulité plus ou moins résignée se généralise, si bien que la majorité des utilisateurs tient pour assurés les propos de l’IA. Ainsi, l’affichage des résumés IA en tête des réponses sur les moteurs de recherche semblait déjà, début 2025, suffire à 83 % du public.
![]()
François Rastier ne travaille pas, ne conseille pas, ne possède pas de parts, ne reçoit pas de fonds d’une organisation qui pourrait tirer profit de cet article, et n’a déclaré aucune autre affiliation que son organisme de recherche.
– ref. Peut-on vraiment détecter les textes générés par IA ? – https://theconversation.com/peut-on-vraiment-detecter-les-textes-generes-par-ia-289673
