Détection IA

Le détecteur d’IA de Grammarly est-il fiable ?

Le détecteur d’IA de Grammarly peut afficher de très bons résultats sur des benchmarks standardisés, mais son score ne prouve pas comment un document a été écrit. Grammarly qualifie ce pourcentage d’estimation moyenne de la part de texte qui semble générée par une IA et rappelle que les passages courts sont plus difficiles à mesurer. Les études indépendantes vont dans le même sens : Grammarly obtient de bons résultats dans un grand benchmark partagé, tandis qu’une étude universitaire de 2025 a relevé des pourcentages bien plus bas que ceux d’un autre détecteur sur les mêmes introductions écrites par IA. Un score Grammarly est donc un signal de détection. Quand le résultat compte, passez le même passage dans un autre détecteur et lisez vous-même les passages signalés. Le détecteur AI-2-Human vous donne cette seconde lecture.

AI-2-HumanPublié le 15 min de lecture
Un exemple de texte à côté d’AI-2-Human sur un ordinateur portable et de rapports illustratifs Grammarly et AI-2-Human aux scores de détection IA différents.
Illustration d’un second avis : le même passage lu par deux détecteurs. Les scores affichés sont illustratifs et ne proviennent pas d’un document réel.

Qu’est-ce que le détecteur d’IA de Grammarly ?

Le détecteur d’IA de Grammarly estime quelle part d’un texte semble générée par une IA. Grammarly décrit le mécanisme dans sa propre documentation : le texte est découpé en sections, chaque section est comparée à un modèle d’apprentissage automatique qui recherche les motifs typiques des textes générés, comme les schémas de langue, la syntaxe et la complexité, puis Grammarly renvoie un pourcentage indiquant la part du texte qui semble générée par une IA.

La fonctionnalité ne se limite pas à un site à part. Grammarly l’intègre à son produit : l’agent AI Detector dans ses surfaces d’écriture, le contrôle IA dans Google Docs via l’extension de navigateur et les applications de bureau pour Word, avec une offre payante sur la plupart des formules. Une version gratuite existe aussi sur la page publique AI Detector, où vous collez un texte ou déposez un document pour voir le pourcentage qui semble généré par une IA.

Grammarly : guide utilisateur du détecteur d’IA (anglais)

Alors, quelle est la précision du détecteur d’IA de Grammarly ?

Aucun pourcentage de précision unique ne décrit toutes les analyses Grammarly. Ce que l’on peut affirmer est plus étroit : le détecteur de Grammarly sépare très fiablement les textes écrits par une IA de ceux écrits par un humain dans des conditions de benchmark, et la recherche indépendante montre que les pourcentages renvoyés peuvent rester bien en dessous du niveau réel d’implication de l’IA.

La formulation de Grammarly est plus instructive que n’importe quel résumé tiers. Son guide utilisateur parle d’une estimation moyenne de la part de texte généré par une IA, indique que des tests rigoureux ont été menés pour que le modèle soit directionnellement exact, note que les passages courts sont plus difficiles à mesurer que les longs, et affirme que la fonctionnalité n’est pas exacte à 100 % et ne doit pas servir d’évaluation définitive. Un autre article d’aide ajoute qu’aucun détecteur ne peut aujourd’hui déterminer de façon fiable et concluante si une IA a été utilisée, et que ces outils sont un point de données parmi d’autres, pas l’unique source de preuve.

Grammarly : l’usage de Grammarly déclenche-t-il les détecteurs d’IA ? (anglais)

  • Style d’écriture : une prose très formelle se rapproche des motifs que les détecteurs associent à l’écriture machine.
  • Longueur : les passages courts sont plus difficiles à mesurer précisément, de l’aveu de Grammarly.
  • Modèle générateur : chaque modèle laisse des traces différentes, et les détecteurs sont ajustés sur certaines familles.
  • Édition humaine : un texte généré puis largement réécrit ne ressemble plus à une sortie brute.
  • Auctorialité mixte : un document mêlant rédaction humaine et assistance IA est le cas le plus difficile.
  • Version du détecteur et corpus : Grammarly met son modèle à jour, et tout chiffre publié dépend du genre et de la longueur du corpus testé.

Que signifie réellement le pourcentage IA de Grammarly ?

Un score de 40 % ne signifie pas que Grammarly a établi que 40 % du document a été écrit par une IA. Cela signifie que le modèle a trouvé, dans les sections analysées, des motifs qui rendent à peu près cette part du texte proche d’une écriture générée. Grammarly emploie volontairement les mots estimé et moyen : le score doit être vu comme une estimation moyenne plutôt qu’un pourcentage définitif, et non comme une source de vérité objective, car la détection par IA est exposée à des erreurs.

Le découpage en sections explique une partie de cette ambiguïté. Analyser par sections montre quelles parties ont fait monter le résultat, mais un pourcentage unique compresse ensuite plusieurs jugements locaux en un seul chiffre : un document avec trois paragraphes formatés et quatre paragraphes personnels peut se retrouver avec un score moyen qui ne décrit bien ni les uns ni les autres.

Ce que dit le benchmark RAID à propos de Grammarly

RAID est un benchmark partagé conçu pour évaluer les détecteurs dans des conditions communes : plus de 10 millions de documents, 11 modèles de langue, 11 genres, quatre stratégies de décodage et une série d’attaques adverses, dont la paraphrase, la substitution de synonymes et les homoglyphes. Chaque détecteur est évalué sur le même corpus avec le même script : c’est la comparaison publique la plus équitable qui existe, et la plus difficile à transformer en promesse pour une copie donnée.

RAID : un benchmark partagé pour l’évaluation robuste des détecteurs de textes générés par machine (anglais)

Grammarly met en avant ses performances sur ce benchmark. Sa page produit indique que l’outil atteint 99 % de précision de détection et se classe premier sur le benchmark indépendant RAID. Il s’agit d’une affirmation commerciale, publiée par l’entreprise dont le détecteur est décrit, et elle doit être lue comme telle.

Grammarly : page produit du détecteur d’IA (anglais)

Le classement lui-même est plus précis. L’instantané cité ici a été relevé le 20 septembre 2026, et l’entrée de Grammarly est datée du 9 février 2026. Les entrées sont déposées par les développeurs des détecteurs et évaluées avec le script du benchmark : les conditions sont partagées, mais la soumission vient de l’éditeur. Dans cet instantané, Grammarly déclare un AUROC de 0,9987 sur l’ensemble des conditions RAID, attaques adverses comprises, avec 99,47 % d’exactitude au point de fonctionnement de 5 % de faux positifs et 98,21 % à 1 %. Sans attaques adverses, la même entrée rapporte un AUROC de 0,99972 et 99,91 % d’exactitude à 5 %.

Les noms des métriques comptent. L’AUROC mesure la capacité d’un détecteur à séparer les deux classes sur tous les seuils possibles, 1,0 étant la perfection : ce n’est pas un pourcentage de décisions correctes. L’exactitude rapportée par RAID est mesurée à un point de fonctionnement fixe, celui où seuls 5 % ou 1 % des textes humains sont signalés à tort.

Ce que dit la recherche indépendante sur Grammarly

Les chercheurs ont pris 30 articles en accès libre publiés avant 2022 dans deux revues de simulation en santé, en ont extrait les introductions et en ont produit cinq versions : l’original humain, une version légèrement éditée par IA, une version fortement éditée par IA, une version générée à partir des points clés et une version écrite à partir du titre. Trois détecteurs gratuits (ZeroGPT, Phrasly AI et Grammarly) et cinq lecteurs humains en aveugle ont noté les mêmes textes.

Grammarly a globalement distingué les cinq conditions, avec un effet significatif et une taille d’effet de 0,75, mais ses pourcentages absolus restaient très en dessous du niveau réel d’implication de l’IA. Sur ces mêmes introductions, l’outil a obtenu en moyenne 1,6 % sur le texte humain intact (intervalle de confiance à 95 % de 0,0 à 3,1), 3,0 % sur l’édition légère, 11,5 % sur l’édition lourde, 62,5 % sur le texte généré à partir des points clés et 50,0 % sur le texte entièrement écrit par IA. ZeroGPT a obtenu 6,5 %, 20,2 %, 43,1 %, 89,9 % et 92,5 % sur les mêmes conditions.

Advances in Simulation : capacité des outils de détection IA et des humains à identifier différents contenus générés par IA (2025, anglais)

Deux conclusions en découlent, et elles tirent en sens opposés. La rassurante : l’ordre de Grammarly était juste, ses scores montaient avec l’implication de l’IA, et c’est l’outil des trois qui signalait le moins souvent un texte humain intact. La prudente : un document entièrement écrit par un modèle de langue est tout de même ressorti à 50 % en moyenne. L’accord entre les outils a aussi été mesuré : 0,96 entre ZeroGPT et Phrasly, mais seulement 0,60 entre Grammarly et ZeroGPT, avec un biais de 24,7 points en faveur de ZeroGPT, et 0,57 entre Phrasly et Grammarly. Les lecteurs humains ont atteint 19 % d’exactitude globale.

Grammarly peut-il signaler un texte humain comme IA ?

Oui. Un faux positif est un texte réellement écrit par un humain qu’un détecteur lit comme généré par une IA, et Grammarly reconnaît ce cas au lieu de l’écarter. Sa documentation indique que le modèle est optimisé pour minimiser les faux positifs, que des schémas de langue, une syntaxe et une complexité humaines peuvent parfois ressembler de très près à ceux d’une IA, et que ces cas devraient être très rares. L’entreprise donne ensuite le conseil que ce guide reprend : replacer le résultat dans un contexte plus large plutôt que dans une source de vérité objective.

Les situations qui augmentent le risque sont décrites de façon constante dans la littérature sur la détection, et ce sont des propriétés du texte plutôt qu’une liste publiée par Grammarly : registre très formel, phrases répétitives, transitions prévisibles, faible variation lexicale, échantillons très courts, genres éloignés des données d’entraînement, anglais écrit comme langue seconde. Aucun de ces éléments ne prouve un usage de l’IA, et plusieurs résultent d’une écriture soignée.

Grammarly peut-il manquer un texte généré par une IA ?

Oui, et l’étude de 2025 en donne l’exemple public le plus concret : un texte entièrement écrit par une IA à partir d’un titre d’article a obtenu 50,0 % en moyenne sur Grammarly, alors que le même corpus dépassait 92 % sur les deux autres outils. Ce résultat ne doit pas être transformé en taux d’échec : il décrit 30 introductions d’une même discipline, à un moment donné. Il montre la forme du problème, à savoir qu’un détecteur réglé pour éviter les faux positifs laisse passer une partie des textes machines.

La documentation de Grammarly explique pourquoi une réécriture peut échapper au détecteur. Le modèle est entraîné sur des textes humains et générés fournis par les éditeurs de modèles de langue : les suggestions de grammaire ou de clarté ne modifient généralement pas le pourcentage, alors qu’une réécriture réelle par un modèle génératif le fait monter. Un texte généré puis retravaillé à la main se situe entre ces deux cas, tout comme un passage écrit par une personne puis fortement réécrit par un assistant : c’est le cas d’auctorialité mixte qu’aucun détecteur ne traite proprement.

Pourquoi les résultats de détection de Grammarly varient

Quand deux personnes passent le même texte dans le même outil et obtiennent des chiffres différents, ou quand deux outils ne sont pas d’accord sur un document, l’explication tient généralement aux conditions.

  • Version du détecteur : Grammarly met son modèle à jour en continu, donc les résultats évoluent avec le produit.
  • Longueur et granularité : le texte est analysé par sections, un document court repose donc sur moins de décisions locales.
  • Historique d’édition : les corrections de grammaire et de clarté ne modifient habituellement pas le score, alors qu’une réécriture générative le fait monter.
  • Seuil et comparaison : l’endroit où un détecteur place la frontière compte, et Grammarly indique que ses scores diffèrent de ceux de Turnitin, GPTZero, Copyleaks et d’autres.

Un pourcentage n’est interprétable qu’à côté d’une description du texte qu’il décrit. Deux phrases extraites d’un paragraphe, une dissertation écrite d’un seul trait et un rapport assemblé en trois semaines avec un assistant constituent trois mesures différentes, même quand l’outil affiche le même type de score.

La longueur du texte influence-t-elle le score IA de Grammarly ?

Grammarly le dit directement : les passages courts sont légèrement plus difficiles à mesurer précisément que les passages longs. C’est logique, car un détecteur qui analyse le texte par sections en a moins à examiner quand vous lui donnez deux phrases.

La règle pratique est celle de la proportion. Un pourcentage élevé sur un document entier, où les mêmes motifs se répètent sur plusieurs paragraphes, mérite plus d’attention qu’un pourcentage élevé sur une seule phrase. Si vous vérifiez un texte court, considérez le résultat comme provisoire.

Est-ce que l’édition ou la paraphrase modifient le score Grammarly ?

Grammarly trace une frontière utile à l’intérieur de l’édition. Les corrections non génératives, comme la grammaire, la clarté, le choix des mots ou la concision, n’affectent généralement pas le pourcentage IA, car elles ne changent pas les schémas de langue que le modèle lit. Réécrire des phrases ou des paragraphes entiers avec un assistant génératif est une autre opération : Grammarly indique qu’une telle réécriture avec son agent, son assistant génératif ou un paraphraseur fera monter le score, et qu’un texte venu d’un fournisseur externe a encore plus de chances d’obtenir un pourcentage élevé.

L’entreprise applique cette logique à ses propres outils, avec une franchise inhabituelle. Sa documentation prévient que réécrire du contenu avec les agents de reformulation ou d’humanisation de Grammarly fera probablement signaler le résultat comme généré par une IA, puisque ces réécritures viennent du modèle de langue de Grammarly, et suggère d’utiliser les agents pour obtenir des retours que vous intégrez vous-même. Si vous lisez le score de quelqu’un d’autre, le même fait joue en sens inverse : un texte passé par un outil de paraphrase est plus difficile à interpréter, et un pourcentage bas ne prouve pas qu’aucun assistant n’est intervenu.

Détecteur d’IA de Grammarly ou Authorship ?

Grammarly propose deux notions différentes sous des noms proches, et les confondre est le plus sûr moyen de mal lire un résultat. La détection IA examine le texte final et estime sa ressemblance avec une écriture générée. Authorship enregistre la façon dont le document a été créé, en classant le texte au fur et à mesure : saisi directement, collé depuis une source web, collé depuis une source inconnue comme une fenêtre de navigation privée, généré par une IA, ou saisi puis modifié par reformulation IA à la demande.

Grammarly : présentation d’Authorship (anglais)

Comment interpréter un score IA de Grammarly

Avant d’agir sur un pourcentage, passez en revue les questions ci-dessous. Elles font la différence entre lire un signal et traiter un chiffre comme un verdict.

  • Quelle quantité de texte a été analysée : un document entier ou un extrait court ?
  • Le passage est-il fortement édité, assisté par IA, ou un mélange des deux ?
  • Quelles sections ont été signalées, et partagent-elles un motif commun ?
  • Le texte semble-t-il réellement répétitif ou formaté ?
  • Un second détecteur renvoie-t-il une lecture proche ?
  • Existe-t-il des preuves de processus : brouillons, historique de versions ou rapport Authorship ?

Ce qu’un score Grammarly ne peut pas établir seul mérite d’être dit clairement : il ne dit pas qui a écrit un document, si un usage de l’IA a enfreint un règlement, si un travail a été plagié, ni si un étudiant est honnête. Grammarly présente elle-même sa détection comme un point de données et non comme l’unique source de preuve.

Que faire si Grammarly signale votre texte ?

Traitez la situation dans un ordre fixe plutôt que de réécrire par réflexe. La séquence ci-dessous est celle que ce guide recommande pour tout détecteur, et elle prend quelques minutes.

Une séquence de vérification réutilisable
  1. 1

    Lire le passage signalé

    Jugez d’abord le texte comme une écriture, et demandez-vous s’il semble réellement répétitif ou formaté.

  2. 2

    Vérifier la taille de l’échantillon

    Le score vient-il d’un document entier ou de quelques phrases ?

  3. 3

    Comparer avec un second détecteur

    Passez le même texte dans un autre outil et voyez si les lectures concordent.

  4. 4

    Réunir les preuves de processus

    Retrouvez brouillons, historique de versions ou rapport Authorship si l’auctorialité est contestée.

  5. 5

    Réviser ce qui doit l’être

    Ne réécrivez que les passages qui en ont vraiment besoin, et vérifiez les citations à part.

Parfois l’inquiétude est justifiée. Des phrases répétitives, des transitions qui ne relient rien et des paragraphes sans preuve méritent d’être corrigés, qu’un détecteur les ait remarqués ou non. Quand un passage est réellement mécanique, l’humaniseur AI-2-Human le réécrit en un brouillon plus naturel tout en gardant votre sens au centre.

Faut-il comparer Grammarly à un autre détecteur d’IA ?

Oui, et la recommandation vient aussi de l’éditeur. La documentation de Grammarly indique que sa détection utilise un modèle interne propriétaire, que les scores peuvent différer de ceux d’autres solutions comme Turnitin, GPTZero ou Copyleaks, et qu’un score Grammarly ne doit pas être lu comme l’indication claire qu’un autre détecteur affichera la même chose. L’étude indépendante a mesuré le même effet : un accord de 0,60 entre Grammarly et ZeroGPT sur des textes identiques, avec un écart d’environ 25 points.

Une comparaison aide dans les deux sens. Quand deux détecteurs signalent le même passage, ce passage mérite une lecture attentive. Quand ils divergent nettement, la divergence indique que le texte se situe près d’une frontière de décision et que le pourcentage est fragile : une information utile avant de réécrire quoi que ce soit.

Le détecteur AI-2-Human lit le même passage avec son propre modèle et montre les sections qui semblent encore générées, ce qui permet de mettre deux interprétations côte à côte : c’est un second avis, pas un appel à une autorité supérieure.

Avant de rendre votre texte : les points à vérifier

  • Je comprends que le pourcentage de Grammarly est une estimation, pas une mesure.
  • J’ai vérifié si la quantité de texte analysée était suffisante avant de lire le score.
  • J’ai lu les passages à l’origine du signalement plutôt que le seul chiffre affiché.
  • Je me suis demandé s’il s’agit d’écriture humaine, assistée par IA ou d’un mélange.
  • J’ai comparé un autre détecteur quand le résultat compte vraiment.
  • J’ai cherché brouillons, historique de versions ou rapport Authorship quand l’auctorialité est en question.
  • J’ai vérifié les citations et les faits indépendamment de la détection IA.
  • Je n’ai révisé que les passages qui en avaient réellement besoin.

Questions fréquentes

Sources et notes éditoriales

AI-2-Human n’est ni affilié à Grammarly ni approuvé par Grammarly. La documentation produit de Grammarly, les informations de benchmark et les recherches citées ont été consultées le 20 septembre 2026. Les modèles de détection et les classements de benchmark évoluent : vérifiez la documentation actuelle de Grammarly et le classement RAID en ligne avant de vous fier à un chiffre cité ici.

Mis à jour le

Besoin d’un second avis ?

Comparez votre score IA Grammarly avec un autre détecteur.

Passez le même passage dans AI-2-Human, consultez un autre signal de détection et décidez si le texte a réellement besoin d’être révisé.

Voir tous les guides