Introduction — 99 % de fiabilité, et un 0/5

Emma est enseignante. Elle est aussi étudiante en reconversion. Lors d’un examen d’expression écrite, elle a reçu un 0 sur 5. Motif : le détecteur d’intelligence artificielle de Compilatio avait relevé 99 % d’IA dans sa copie.

Son témoignage est public, déposé sur Trustpilot le 14 juin 2023, noté une étoile.

Le même mois où Emma écrivait cela, OpenAI — l’entreprise qui fabrique ChatGPT — préparait la fermeture de son propre détecteur de textes générés par IA. L’outil avait été lancé en janvier 2023. Il a été retiré le 20 juillet suivant, avec cette phrase ajoutée en haut de l’annonce d’origine : plus disponible, « en raison de son faible taux de précision ».

Entre les deux, il y a une industrie. Des logiciels vendus aux universités, aux lycées, aux maisons d’édition et aux services de recrutement, qui promettent de dire si un texte a été écrit par une machine. Avec des chiffres : 94 à 99 % de fiabilité chez Compilatio, un faux positif sur dix mille chez Pangram.

Ces chiffres méritent d’être regardés de près, parce qu’ils ne servent pas à départager des outils dans un comparatif. Ils servent à mettre un 0 sur une copie, à convoquer un étudiant devant un conseil de discipline, et depuis quelques jours en France, à accuser publiquement un romancier primé.

Résumé du test

La promesse : un détecteur de texte IA sait dire de façon fiable si un texte vient d’une machine ou d’un humain.

Notre verdict : exagérée.

Les chiffres annoncés ne sont pas des mensonges. Ils sont vrais dans le cas le plus facile — un texte entièrement écrit par une IA, sans retouche, produit par une question simple — et ce cas n’est presque jamais celui où l’outil est utilisé pour sanctionner quelqu’un.

Trois constats tiennent tout l’article :

  1. Sur le cas réel, Compilatio refuse lui-même de donner un chiffre. Sa page officielle explique que pour un document mixte, mêlant passages humains et passages générés, « un chiffre unique » serait « peu représentatif de la réalité », et recommande de considérer l’analyse comme « un outil d’aide à la décision plutôt qu’un score de performance isolé ».
  2. La promesse s’inverse. Selon l’étude la plus récente, un texte humain simplement relu par une IA est signalé dans 38 à 80 % des cas, alors qu’un texte entièrement écrit par IA puis passé dans un humaniseur passe inaperçu plus de 96 % du temps. L’usage honnête est plus dangereux que la triche.
  3. Le français n’est mesuré nulle part publiquement. Compilatio dit avoir testé 24 langues dont le français, mais ne publie qu’une fourchette globale. Pangram publie des taux par langue — espagnol, japonais, arabe — et le français n’y figure pas.

Ce que nous avons vérifié

Le Recul n’a pas fait tourner ces logiciels sur un corpus maison. Nous disons donc exactement ce sur quoi cet article repose, et ce qu’il ne prétend pas être.

Nous avons lu les pages officielles des éditeurs, là où la promesse est écrite : la fiche de Compilatio consacrée à la fiabilité de son détecteur, mise à jour le 22 septembre 2026, et l’article de Pangram sur les faux positifs, publié le 15 septembre 2026. Ce sont leurs chiffres, dans leurs mots.

Nous avons lu les deux seules études indépendantes sérieuses publiées à ce jour, et nous les présentons toutes les deux, y compris quand elles se contredisent.

Nous avons lu les avis d’utilisateurs sur Trustpilot, en relevant les notes globales et en citant des témoignages datés et signés. Ce sont des témoignages, pas des mesures : nous les donnons pour ce qu’ils sont.

Nous avons lu la documentation officielle d’une université française qui a refusé d’installer le module de détection, et la couverture de deux affaires françaises récentes.

Ce que cet article ne contient pas : aucun taux de faux positifs mesuré par nos soins, aucune comparaison chiffrée entre outils réalisée par nous. Quand un chiffre apparaît ici, il vient d’un éditeur, d’une étude ou d’un utilisateur, et sa source est nommée.

Ce que promettent exactement les trois éditeurs

ÉditeurChiffre annoncéSur quoi il a été mesuré
Compilatio94 à 99 % de fiabilité sur les contenus académiques ; moins de 1 % de faux positifs7 400 textes en 24 langues (3 700 humains, 3 700 IA), textes IA obtenus par « des questions simples sans consignes spécifiques sur le style d'écriture »
Pangramenviron 1 faux positif sur 10 000corpus par genre : dissertations 0,004 %, écriture créative 0,009 %, articles médicaux 0,000 %, poèmes 0,05 %, recettes 0,23 %
GPTZero« le détecteur n° 1 pour les étudiants », 10 millions d'utilisateursaucun taux de faux positifs comparable mis en avant ; Pangram l'estime, lui, à environ 1 sur 100

Deux détails méritent qu’on s’y arrête.

Le premier est une phrase de Compilatio que presque personne ne lit, parce qu’elle se trouve au milieu d’une fiche d’aide : les textes qui ont servi à mesurer le moteur ont été générés en posant à l’IA « des questions simples sans consignes spécifiques sur le style d’écriture ». C’est le cas le plus facile qui soit. Aucun étudiant décidé à tricher ne procède ainsi : il donne un ton, un plan, des consignes, il recopie en modifiant. Le chiffre de 94 à 99 % décrit donc la performance de l’outil contre un tricheur qui ne fait aucun effort.

Le second, c’est que Compilatio distingue explicitement deux choses que le public confond : le « moteur de détection », qui étiquette des extraits homogènes, et « l’analyse », qui doit repérer les passages IA dans un document mixte. Les 94 à 99 % concernent le premier. Pour le second — c’est-à-dire pour un vrai devoir — l’éditeur écrit qu’un chiffre unique serait « peu représentatif de la réalité ».

Or c’est bien le second qui sert à sanctionner.

OpenAI a construit un détecteur de ses propres textes, puis l’a fermé

Le 31 janvier 2023, OpenAI met en ligne un classifieur censé distinguer les textes humains des textes générés par IA. L’entreprise est dans la meilleure position imaginable : elle connaît ses propres modèles de l’intérieur.

Les résultats publiés par OpenAI sur un jeu de textes anglais difficiles : le classifieur identifiait correctement 26 % des textes écrits par IA, et étiquetait à tort comme IA 9 % des textes écrits par des humains.

Le 20 juillet 2023, l’outil est retiré. La note ajoutée à l’annonce d’origine est restée en ligne depuis : le classifieur n’est plus disponible « en raison de son faible taux de précision ».

Ce point n’est pas anecdotique. Il fixe l’ordre de grandeur du problème. Si l’éditeur du modèle qu’il faut détecter n’y parvient pas de façon satisfaisante, il faut au minimum s’interroger devant un concurrent qui annonce 99 %.

Cet épisode explique aussi une légende tenace : le classifieur d’OpenAI, comme d’autres après lui, signalait des textes célèbres et évidemment humains. ActuaLitté rappelait fin décembre 2025 qu’il avait classé des passages de Shakespeare et la Déclaration d’indépendance des États-Unis comme probablement générés par une machine.

Les deux seules études sérieuses ne disent pas la même chose

C’est le point que les articles d’affiliation escamotent : les travaux indépendants existent, mais ils ne concordent pas.

ÉtudeCorpusCe qu'elle conclut
NBER / Chicago Booth
Jabarian & Imas, août 2025
1 992 passages, 6 genres courants (presse, blogs, avis, romans, CV)Pangram s'en sort remarquablement : faux positifs nuls sur les longs passages, sous 1 % sur les courts. GPTZero perd l'essentiel de sa capacité face aux humaniseurs
Université Notre-Dame
ACM AILS '26, 20 août 2026
642 résumés scientifiques, 4 disciplines, deux périodes (2013-2015 et 2023-2025)Sur les textes d'avant l'IA, aucun faux positif. Mais sur du texte simplement relu par IA, 38 à 80 % de signalements, et plus de 96 % d'évasion après humaniseur

Les deux études ont raison, sur des questions différentes. La première demande : ce détecteur sait-il reconnaître un texte de machine dans un corpus varié ? La seconde demande : que se passe-t-il quand un humain et une IA ont travaillé sur le même texte ?

La première question intéresse un éditeur de logiciel. La seconde est celle de tous les gens qui subissent l’outil.

Un résultat les réconcilie et mérite d’être dit, parce qu’il va à l’encontre de ce qu’on attendrait : sur les textes publiés entre 2013 et 2015, donc rigoureusement antérieurs aux IA génératives grand public, l’équipe de Notre-Dame relève 0 % de faux positifs, pour Pangram comme pour GPTZero. Sur ce point précis — un texte ancien, long, jamais touché par une machine — les détecteurs ne se trompent pas.

Le problème commence dès que le texte est récent, court, formel, ou retouché.

Le chiffre qui renverse la promesse

Voici le tableau qui devrait figurer dans toutes les notices, et qui ne figure dans aucune. Il vient de l’étude de Notre-Dame, au seuil standard de 0,50.

SituationSignalement
Texte humain publié avant l'IA (2013-2015)0 %
Texte humain récent, non retouché (2023-2025)8,9 % (GPTZero) à 14,9 % (Pangram)
Texte humain relu et corrigé par une IA38 % à 80 %
Texte 100 % IA passé dans un humaniseurmoins de 4 % détectés

Prenez deux étudiants.

Le premier écrit son devoir lui-même, puis demande à une IA de corriger ses tournures — ce que la plupart des règlements autorisent explicitement, et ce qu’on recommande à tout étudiant non francophone. Il a entre 38 et 80 % de risques d’être signalé.

Le second ne rédige rien, fait tout générer, puis passe le texte dans un humaniseur vendu quelques euros. Il a moins de 4 % de risques d’être repéré.

La conclusion des chercheurs est écrite noir sur blanc dans leur résumé : un score de détecteur ne doit pas servir de preuve autonome d’une fraude.

Un détail qui a son importance pour les étudiants de lettres, de droit ou d’histoire : l’étude relève que les textes de sciences humaines sont signalés beaucoup plus souvent que ceux de sciences dures, avec une différence statistiquement très solide. Plus votre discipline écrit en prose construite, plus la machine vous soupçonne.

Ce que racontent les utilisateurs

Les avis en ligne ne sont pas des mesures. Ils disent autre chose : ce que les gens vivent, et à quelle fréquence ils viennent s’en plaindre. Deux notes globales, relevées le 23 septembre 2026, et déjà éloquentes.

OutilNote TrustpilotAvis
Compilatio4,0 / 574
GPTZero2,2 / 5140

L’écart s’explique en partie par le public : Compilatio est noté par des enseignants, qui apprécient le gain de temps, autant que par des étudiants. Les avis y sont nettement polarisés. GPTZero, lui, est noté surtout par ceux qui viennent vérifier leur propre texte.

Les témoignages se ressemblent d’un outil à l’autre.

Sur Compilatio, Matteo Belloli écrit le 18 février 2026, une étoile : « Un texte entièrement rédigé par l’humain peut monter jusqu’à 88 % » d’IA détectée, tandis qu’« un texte généré entièrement par l’IA peut tomber à 0 % ». Il ajoute : « On m’a déjà accusé de rédiger à 47 % un devoir que j’avais entièrement fait moi-même. » Et Emma, citée en ouverture, rapporte un 0 sur 5 après un relevé à 99 %.

Sur GPTZero, Patchyca écrit le 24 mai 2026, une étoile : « Après plusieurs tests effectués sur des textes entièrement rédigés par des humains, plusieurs résultats indiquaient un score de 100 % IA. » Veritas Roi, le 1er avril 2026 : « Des textes complètement humains sont notés 100 % ia alors même que tous les autres détecteurs mettent 90 %+ humain. » Lyonel Shearer, le 21 mai 2025 : « GPTZéro a été le seul détecteur à indiquer que les textes avaient été entièrement écrits par de l’IA. (ce qui n’était pas le cas). »

Ces témoignages ne prouvent pas un taux. Ils montrent deux choses utiles. D’abord que les utilisateurs mènent spontanément la seule expérience qui vaille : soumettre un texte dont ils savent avec certitude qu’il est humain. Ensuite que les écarts rapportés ne sont pas de quelques points, mais de l’ordre du tout au rien — 88 %, 99 %, 100 % sur des textes personnels.

Une université française a refusé le module

C’est le fait le moins connu de tout ce dossier, et le plus parlant.

L’université de Lorraine met Compilatio à disposition de ses enseignants pour la détection de plagiat. Mais sur la page officielle de son service numérique, on lit ceci, à propos de la détection d’IA :

« Les outils de détection de triche reposant sur l’identification de contenus générés par l’IA ne sont pas fiables. Ils produisent de nombreux faux positifs et sont facilement contournés. »

Et la conséquence, écrite juste après : « L’Université de Lorraine a choisi de ne pas retenir la solution Magister+. »

Magister+, c’est précisément l’offre de Compilatio qui donne accès au détecteur d’IA. Une université publique française, en s’appuyant sur des recommandations publiées en juin 2025, a donc examiné le produit et décidé de ne pas l’acheter, en expliquant publiquement pourquoi.

Elle n’est pas seule à reculer. ActuaLitté rapportait fin 2025 que l’Australian Catholic University avait suspendu l’usage de Turnitin après que des étudiants eurent été accusés à tort sur la seule foi de scores automatiques. Le même article relate le cas d’un lycéen parisien accusé d’avoir utilisé l’IA lors d’une épreuve de philosophie sur ordinateur : l’administration a fini par reconnaître une erreur.

Nous avions déjà vu cette prudence s’installer ailleurs dans l’école, quand la Norvège a interdit l’IA à l’école primaire, et quand Anthropic a lancé une offre destinée aux enseignants. La détection, elle, avance sans ce débat.

Aucun chiffre pour le français

Voici ce qui manque, et personne ne le dit.

Compilatio indique avoir mesuré son moteur sur des textes en 24 langues, et le français figure bien dans la liste, aux côtés de l’allemand, de l’arabe, du croate, du grec moderne ou de l’ukrainien. Mais l’éditeur ne publie qu’une fourchette globale — 94 à 99 % — en précisant lui-même qu’elle varie « selon la longueur du document, la langue et la nature du contenu ». Aucun chiffre par langue.

Pangram, lui, publie des taux par langue. Les voici, tels qu’ils figurent sur son propre site le 15 septembre 2026.

CorpusFaux positifs annoncés
Avis produits, espagnol0,008 %
Avis produits, japonais0,015 %
Wikipédia, espagnol0,07 %
Wikipédia, japonais0,02 %
Wikipédia, arabe0,08 %
Françaisabsent du tableau

L’éditeur prend la peine de mesurer l’espagnol, le japonais et l’arabe, et de publier les résultats. Le français n’y est pas.

Ce n’est pas un procès d’intention : rien n’indique que Pangram se trompe davantage en français. Mais cela veut dire que lorsqu’un score Pangram est opposé à un texte français — ce qui est arrivé cette semaine à un romancier — personne ne peut dire à quel taux d’erreur ce score correspond. Ni l’accusateur, ni l’accusé, ni l’éditeur du logiciel.

Les deux études indépendantes ne comblent pas le trou : celle de Chicago Booth comme celle de Notre-Dame portent sur des corpus anglais.

Comment ces outils décident, et pourquoi ils se trompent

Un détecteur ne lit pas un texte. Il ne sait rien de son auteur, de sa date, de son contexte. Il mesure des régularités statistiques : la prévisibilité du vocabulaire, la régularité de la syntaxe, la longueur des phrases, la densité de certains mots.

Compilatio le formule sans détour sur sa page d’aide : la détection « s’appuie sur la reconnaissance de caractéristiques stylistiques typiques des textes rédigés par une IA », et « il peut arriver qu’un humain ait un style similaire à celui d’une intelligence artificielle ».

De là découle tout le reste. Les profils qui écrivent de façon régulière, structurée, sans aspérités, sont signalés plus souvent. Ce sont, concrètement :

  • les personnes qui écrivent dans une langue qui n’est pas la leur, et qui appliquent scrupuleusement les règles apprises ;
  • les élèves et étudiants à qui l’on a justement enseigné une structure — introduction, développement, conclusion, connecteurs logiques ;
  • les textes techniques, juridiques, administratifs ou académiques, dont la forme est contrainte ;
  • et les textes courts, où il y a trop peu de matière pour décider.

L’étude de Notre-Dame le confirme par la mesure : les scores élevés suivent la densité de mots longs et de vocabulaire académique, pas l’intention de l’auteur.

Autrement dit, ces outils ne détectent pas la fraude. Ils détectent un style. Et le style qu’ils sanctionnent est celui qu’on demande aux élèves d’acquérir.

L’affaire du roman primé

Le 21 septembre 2026, Thélyson Orélien reçoit le prix du roman Fnac pour C’était ça ou mourir, paru chez Boréal à Montréal en mars 2026 puis chez Grasset en France le 19 août. Le roman est en lice pour le Goncourt, le Médicis, le Femina, le Renaudot et le Décembre.

Le soir même, un compte X anonyme l’accuse d’avoir fait écrire son livre « presque entièrement » par une intelligence artificielle. L’élément produit à l’appui : des scores Pangram proches de 100 % sur plusieurs extraits.

L’auteur dément auprès de Libération et rappelle avoir commencé le manuscrit à l’automne 2017 et achevé une première version en 2019 — plusieurs années avant la diffusion grand public des IA génératives. Les éditions Grasset lui accordent leur « confiance absolue » et dénoncent une campagne de dénigrement.

Nous n’avons évidemment aucun moyen de dire ce que ce roman doit ou ne doit pas à une machine, et ce n’est pas l’objet de cet article. Ce que l’affaire montre, en revanche, tient en trois lignes :

  • un score de détecteur suffit aujourd’hui à lancer une accusation publique contre un auteur ;
  • la défense de l’auteur repose exactement sur le seul protocole que les chercheurs jugent probant — la date du texte ;
  • et le logiciel invoqué n’a publié aucun taux d’erreur pour la langue dans laquelle le livre est écrit.

Le problème n’est pas propre à l’édition. Nous l’avions déjà croisé sous une autre forme dans l’affaire des livres détruits par Anthropic : dès que l’IA entre dans la chaîne du livre, la charge de la preuve se déplace, et c’est l’humain qui doit démontrer qu’il a écrit.

Ce que dit déjà la justice française

Les tribunaux n’ont pas attendu.

Une ordonnance du tribunal administratif de Paris rendue le 12 février 2026 concerne une étudiante en droit de l’université Paris 1 Panthéon-Sorbonne, soupçonnée d’avoir rédigé son mémoire de stage avec une IA. La section disciplinaire avait refusé de la sanctionner en janvier. Saisi ensuite, le tribunal retient qu’on ne peut sanctionner l’usage de l’IA si les règles encadrant cet usage n’ont pas été définies au préalable et portées à la connaissance des étudiants.

À Toulouse, une étudiante exclue cinq ans de sa faculté pour triche à l’IA lors d’un partiel a obtenu la suspension de sa sanction.

Le principe rappelé est ancien et ne doit rien à l’informatique : on ne sanctionne que sur la base d’une règle connue à l’avance. Un score de logiciel ne crée pas cette règle, et ne remplace pas la démonstration.

Compilatio dit d’ailleurs la même chose que le juge, dans sa propre documentation : ses outils « fournissent des indications sur des passages suspects », et « il revient toujours au correcteur d’interpréter ces informations pour valider ou imputer les fraudes potentielles ». L’éditeur recommande même, en cas de doute, de « procéder à un examen plus approfondi des connaissances de l’étudiant ».

La promesse commerciale dit 99 %. La notice dit : parlez à l’étudiant.

Les humaniseurs, eux, tiennent leur promesse

Il faut regarder l’autre moitié du marché, parce qu’elle est massive : les outils qui promettent de rendre un texte IA « indétectable ».

C’est la partie la plus embarrassante du dossier. Leur promesse, elle, est tenue. L’étude de Notre-Dame mesure qu’après passage dans un humaniseur du commerce, moins de 4 % des textes générés par IA restent signalés. L’étude de Chicago Booth aboutit au même constat pour GPTZero, dont le taux d’échec grimpe autour de 50 % et au-delà face à ces outils — tout en relevant que Pangram y résiste nettement mieux.

L’université de Lorraine le dit dans les mêmes termes lorsqu’elle justifie son refus : ces détecteurs « sont facilement contournés ».

Le résultat est un système qui pénalise exactement les mauvaises personnes. Celui qui ne sait pas que les humaniseurs existent — souvent le plus honnête, parfois simplement le moins débrouillard — prend le risque. Celui qui organise sa triche passe.

Nous ne donnerons évidemment pas de mode d’emploi. Le seul intérêt de ce constat, c’est qu’il ruine l’argument de vente : un dispositif de contrôle qui se contourne en trois clics pour quelques euros ne protège rien. Il produit surtout des convocations.

Combien ça coûte

OutilGratuitPayant
GPTZero10 000 mots par mois, sans limite de duréede l'ordre de 8 à 25 $ par mois ; 23,99 $ pour 300 000 mots, 45,99 $ pour 500 000
Compilatio Magister+nonabonnement vendu aux établissements ; revendique plus de 1 100 établissements dans plus de 50 pays
Pangramnonpayant, principalement vendu aux institutions et aux plateformes

Un point sur le modèle économique, qui éclaire le reste : dans le cas de Compilatio, ce n’est pas la personne contrôlée qui paie. L’établissement achète, l’enseignant utilise, l’étudiant subit. Aucun des trois n’a le même intérêt à ce que le taux d’erreur soit connu précisément.

Notre verdict Le Recul

Promesse exagérée.

Nous ne disons pas que ces outils ne servent à rien. Face à un texte long, ancien ou entièrement généré sans retouche, ils fonctionnent, et les deux études indépendantes le confirment. Pangram, en particulier, est le seul à avoir accepté une évaluation extérieure et à en sortir bien.

Nous disons que le chiffre affiché ne décrit pas la situation dans laquelle il est utilisé.

Il est mesuré sur des textes homogènes, quand la réalité est mixte. Il est mesuré sur des textes IA produits par des questions simples, quand un tricheur donne des consignes. Il est publié en moyenne sur 24 langues, quand la décision porte sur une copie en français. Et il est opposé à une personne, quand l’éditeur lui-même écrit qu’il s’agit d’une « indication » et qu’« aucun détecteur d’IA ne peut être fiable à 100 % ».

Le plus solide argument contre la promesse est d’ailleurs fourni par Compilatio, dans cette phrase de sa propre page : « Les taux de fiabilité communiqués par les détecteurs d’IA ne sont pas comparables ! » Si les chiffres des uns et des autres ne sont pas comparables entre eux, ils ne sont pas non plus opposables à quelqu’un.

Et il reste ce fait que rien n’efface : l’entreprise qui fabrique ChatGPT a essayé de détecter les textes de ChatGPT, et a préféré fermer son outil.

Si un détecteur vous accuse à tort

Ce que vous pouvez opposer, avec des sources vérifiables :

  1. La date. C’est le seul argument que les chercheurs considèrent comme probant : sur des textes antérieurs aux IA génératives, l’étude de Notre-Dame relève zéro faux positif. Brouillons horodatés, historique de version, courriels, notes manuscrites, dépôt daté : tout ce qui prouve une chronologie vaut mieux qu’un contre-score.
  2. La notice de l’éditeur. Compilatio écrit lui-même que ses outils « fournissent des indications sur des passages suspects », qu’« il revient toujours au correcteur d’interpréter ces informations », et qu’« aucun détecteur d’IA ne peut être fiable à 100 % ».
  3. La règle préalable. Le tribunal administratif de Paris a retenu, le 12 février 2026, qu’on ne peut sanctionner l’usage de l’IA sans règle définie et portée à la connaissance des étudiants avant les faits.
  4. La position d’une université publique. L’université de Lorraine a refusé Magister+ en écrivant que ces outils « ne sont pas fiables », produisent « de nombreux faux positifs » et « sont facilement contournés ».
  5. L’entretien. C’est la recommandation de l’éditeur autant que le bon sens : un examen des connaissances sur les passages suspects tranche ce qu’aucun pourcentage ne tranchera.

Questions fréquentes

Quel est le détecteur de texte IA le plus fiable ? Sur les données publiées, Pangram est le seul à avoir été évalué par une équipe extérieure — les chercheurs de Chicago Booth — et à en ressortir avec des faux positifs proches de zéro sur des passages longs. Mais cette évaluation porte sur des textes anglais, et Pangram ne publie aucun taux pour le français. Il n’existe donc pas de réponse vérifiable pour un texte en français.

Les détecteurs de texte IA sont-ils fiables à 100 % ? Non, et l’éditeur le dit lui-même : la page d’aide de Compilatio affirme qu’« aucun détecteur d’IA ne peut être fiable à 100 % ».

Un détecteur peut-il signaler un texte que j’ai écrit moi-même ? Oui. L’étude de l’université Notre-Dame mesure entre 8,9 % et 14,9 % de signalements sur des textes humains récents non retouchés, et de 38 % à 80 % dès qu’une IA a servi à relire ou corriger. Plusieurs utilisateurs rapportent sur Trustpilot des scores de 88 %, 99 % et 100 % sur des textes personnels.

Comment fonctionne le détecteur d’IA de Compilatio ? Il repose sur un modèle de langue entraîné à reconnaître, selon Compilatio, « des caractéristiques stylistiques typiques des textes rédigés par une IA ». L’éditeur précise sur la même page qu’« il peut arriver qu’un humain ait un style similaire à celui d’une intelligence artificielle ».

Les universités utilisent-elles un détecteur d’IA ? Beaucoup, oui, mais pas toutes. L’université de Lorraine a officiellement refusé la solution Magister+, qui donne accès au détecteur, en la jugeant non fiable sur sa page de service numérique.

Peut-on être sanctionné sur la seule base d’un score ? La documentation de Compilatio dit que non : c’est au correcteur d’interpréter. Le tribunal administratif de Paris a jugé le 12 février 2026 qu’une sanction suppose une règle définie au préalable, et une étudiante toulousaine exclue cinq ans a obtenu la suspension de sa sanction.

Un détecteur repère-t-il un texte passé dans un humaniseur ? Rarement. L’étude de Notre-Dame mesure moins de 4 % de textes encore signalés après passage dans un humaniseur du commerce, et l’université de Lorraine relève que ces outils « sont facilement contournés ».

Les détecteurs marchent-ils aussi bien en français qu’en anglais ? Personne ne le sait publiquement. Compilatio dit avoir testé 24 langues dont le français, mais ne publie qu’une fourchette globale. Pangram publie des taux pour l’espagnol, le japonais et l’arabe, mais pas pour le français. Les deux études indépendantes portent sur l’anglais.

Pourquoi mon texte académique est-il plus signalé qu’un autre ? Parce que les détecteurs mesurent la régularité du style. L’étude de Notre-Dame observe que les scores élevés suivent la densité de mots longs et de vocabulaire académique, et que les textes de sciences humaines sont signalés nettement plus souvent que ceux de sciences dures.

Existe-t-il un détecteur de texte IA gratuit ? Oui, GPTZero propose 10 000 mots par mois gratuitement, et plusieurs concurrents offrent un collage limité. La gratuité ne change rien au problème de fond : le score obtenu reste une indication, quelle que soit la formule.

Conclusion — un chiffre n’est pas une preuve

Il y a un moment, dans ce dossier, où tout se retourne.

Ce n’est pas quand on lit les témoignages d’utilisateurs, ni même quand on découvre qu’une université publique française a refusé d’acheter le module. C’est quand on lit la page d’aide de l’éditeur lui-même et qu’on y trouve, écrites par lui, toutes les réserves que l’on cherchait : aucun détecteur n’est fiable à 100 %, les taux ne sont pas comparables entre eux, un humain peut écrire comme une machine, et pour un vrai document il n’existe pas de chiffre représentatif.

Tout cela est public. Tout cela est à quelques clics. Et tout cela disparaît au moment où un score s’affiche à l’écran devant un correcteur pressé.

La promesse n’est donc pas un mensonge : c’est une promesse vraie déplacée hors de son contexte. Elle décrit un laboratoire et sert dans un conseil de discipline.

Si vous enseignez, le plus utile n’est pas de choisir le meilleur détecteur, c’est de définir vos règles à l’avance et de vérifier ce que l’élève sait. Si vous étudiez ou si vous écrivez, gardez vos brouillons datés : à ce jour, la date reste la seule chose qu’aucun modèle statistique ne peut contredire.

Pour savoir quel outil fait quoi, et sur quelles mesures, notre comparateur de modèles d’IA donne les chiffres source par source. Et pour une autre promesse chiffrée passée au même crible, lire ce que vaut vraiment la promesse des 10 000 € par mois grâce à l’IA.