Guide sul rilevamento IA

Il rilevatore IA di Grammarly è affidabile?

Il rilevatore IA di Grammarly può ottenere risultati molto forti su benchmark standardizzati, ma il punteggio non prova come è stato scritto un documento. Grammarly definisce quella percentuale una stima media di quanto testo sembra generato dall’IA, dichiara che la funzione non è precisa al 100% e segnala che i brani brevi sono più difficili da misurare. Le prove indipendenti indicano lo stesso: buone prestazioni in un grande benchmark condiviso, mentre uno studio accademico del 2025 ha registrato percentuali molto più basse di un altro rilevatore sulle stesse introduzioni scritte dall’IA. Un punteggio Grammarly è quindi un segnale. Quando il risultato conta, confronta lo stesso brano con un altro rilevatore e leggi tu il testo segnalato. Il rilevatore IA di AI-2-Human ti dà quella seconda lettura.

AI-2-HumanPubblicato 15 min di lettura
Un campione di testo accanto ad AI-2-Human su un portatile e report illustrativi di Grammarly e AI-2-Human con punteggi IA diversi.
Illustrazione di un secondo parere: lo stesso brano letto da due rilevatori. I punteggi mostrati sono illustrativi, non risultati misurati su un documento specifico.

Che cos’è il rilevatore IA di Grammarly?

Il rilevatore IA di Grammarly stima quale parte di un testo sembra generata dall’IA. Grammarly spiega il meccanismo nella sua documentazione: il testo viene diviso in sezioni, ogni sezione è confrontata con un modello di apprendimento automatico che cerca schemi tipici dell’IA, come schemi linguistici, sintassi e complessità, e poi restituisce una percentuale. Il modello è descritto come addestrato su centinaia di migliaia di testi umani e IA.

La funzione non è un sito separato da visitare una volta. Grammarly la integra nel prodotto: l’agente AI Detector nelle sue superfici di scrittura, il controllo IA in Google Docs tramite l’estensione e le app desktop per Word, ed è a pagamento nella maggior parte dei piani. Esiste una versione gratuita sulla pagina pubblica AI Detector, dove incolli un testo o carichi un documento.

Grammarly: guida utente del rilevatore IA (in inglese)

Quanto è preciso, quindi, il rilevatore IA di Grammarly?

Non esiste una percentuale unica di precisione che descriva ogni scansione. Si può dire qualcosa di più stretto: il rilevatore separa testo IA e testo umano in modo molto affidabile in condizioni di benchmark, e la ricerca indipendente mostra che le percentuali restituite possono restare molto sotto il livello reale di coinvolgimento dell’IA.

Le parole di Grammarly fissano le aspettative meglio di qualsiasi riassunto. La guida utente definisce il punteggio una stima media di quanto testo generato dall’IA un documento contiene probabilmente, dice che i test hanno garantito che il modello è accurato nella direzione, segnala che i brani brevi sono più difficili da misurare e afferma che la funzione non è precisa al 100% e non va usata come valutazione definitiva. Un altro articolo aggiunge che nessun rilevatore oggi può stabilire in modo conclusivo se è stata usata l’IA e che questi strumenti sono un singolo dato, non l’unica fonte di prova.

Grammarly: l’uso di Grammarly attiva i rilevatori IA? (in inglese)

  • Stile di scrittura: la prosa formale e molto regolare si avvicina agli schemi che i rilevatori associano alla macchina.
  • Lunghezza del testo: i brani brevi sono più difficili da misurare di quelli lunghi, secondo Grammarly.
  • Modello generatore: ogni modello lascia tracce diverse e i rilevatori sono tarati su famiglie specifiche.
  • Editing umano: il testo generato e poi molto riscritto non sembra più output grezzo di un modello.
  • Paternità mista: unire stesura umana, aiuto IA e revisione manuale è il caso più difficile.
  • Versione e dati: ogni cifra pubblicata dipende dal genere e dalla lunghezza del materiale di test.

Che cosa significa davvero la percentuale IA di Grammarly?

Un punteggio del 40% non significa che Grammarly abbia stabilito che esattamente il 40% del documento è stato scritto dall’IA. Significa che il modello ha trovato schemi che fanno sembrare quella parte del testo scritta dall’IA. Grammarly usa di proposito le parole stima e media e ripete la precisazione: il punteggio è una stima media e non una valutazione percentuale definitiva, né una fonte oggettiva di verità, perché qualsiasi rilevamento IA può sbagliare.

Il design per sezioni spiega parte dell’ambiguità. Analizzare per sezioni mostra quali parti hanno prodotto il risultato, ma un’unica percentuale comprime diversi giudizi locali in un solo numero: un documento con tre paragrafi formulari e quattro personali può finire su un punteggio intermedio che non descrive bene nessuna delle due metà.

Che cosa dice il benchmark RAID su Grammarly

RAID è un benchmark condiviso creato per valutare i rilevatori in condizioni comuni: oltre 10 milioni di documenti con 11 modelli linguistici, 11 generi, quattro strategie di decodifica e attacchi adversariali come parafrasi, sostituzione di sinonimi e omoglifi. Ogni rilevatore partecipante è valutato sullo stesso materiale con lo stesso script, il che lo rende il confronto pubblico più equo disponibile e il più difficile da trasformare in una promessa su un singolo tema.

RAID: un benchmark condiviso per la valutazione robusta dei rilevatori di testo generato da macchina (in inglese)

Grammarly pubblicizza direttamente le sue prestazioni su quel benchmark. La pagina prodotto del rilevatore afferma che il prodotto raggiunge il 99% di precisione di rilevamento e si colloca al primo posto nel benchmark indipendente di RAID, davanti ad altri rilevatori leader. È un’affermazione del fornitore, pubblicata dall’azienda il cui rilevatore descrive, e va letta come tale.

Grammarly: pagina prodotto del rilevatore IA (in inglese)

La classifica in sé è più precisa. L’istantanea citata qui è stata rilevata il 20 settembre 2026 e la voce di Grammarly è datata 9 febbraio 2026. Le voci sono inviate dagli sviluppatori dei rilevatori e valutate con lo script del benchmark, quindi le condizioni sono condivise ma l’invio arriva dal fornitore. In quell’istantanea Grammarly dichiara un AUROC di 0,9987 su tutte le condizioni RAID, inclusi gli attacchi adversariali, con il 99,47% di precisione a un tasso obiettivo di falsi positivi del 5% e il 98,21% all’1%. Nella parte non adversarial, la stessa voce dichiara un AUROC di 0,99972 e il 99,91% di precisione al 5%.

I nomi delle metriche contano. L’AUROC misura quanto bene un rilevatore separa le due classi su tutte le soglie, dove 1,0 è perfetto, e non è una percentuale di decisioni corrette. La precisione di RAID è misurata a un punto operativo fisso, la soglia in cui solo il 5% o l’1% dei testi umani viene segnalato per errore.

Che cosa dice la ricerca indipendente su Grammarly

Il risultato indipendente più utile viene da uno studio peer-reviewed pubblicato su Advances in Simulation nel 2025. I ricercatori hanno preso 30 articoli open access pubblicati prima del 2022 in due riviste di simulazione sanitaria, ne hanno estratto le introduzioni e prodotto cinque versioni di ciascuna: l’originale umano, una versione umana con editing IA leggero, una con editing intenso, una generata da punti chiave umani e una scritta interamente dal titolo. Tre rilevatori gratuiti (ZeroGPT, Phrasly AI e Grammarly) e cinque valutatori umani in cieco hanno valutato lo stesso materiale.

Grammarly ha distinto le cinque condizioni nel complesso, con un effetto statisticamente significativo e una dimensione dell’effetto di 0,75, ma le sue percentuali assolute sono rimaste molto sotto il livello di coinvolgimento dell’IA. Su quelle introduzioni ha registrato una media dell’1,6% sul testo umano intatto (intervallo di confidenza al 95%: 0,0-3,1), 3,0% con editing leggero, 11,5% con editing intenso, 62,5% su testo generato da punti chiave e 50,0% su testo scritto interamente dall’IA dal titolo. ZeroGPT ha registrato 6,5%, 20,2%, 43,1%, 89,9% e 92,5%.

Advances in Simulation: capacità degli strumenti di rilevamento IA e degli umani di identificare contenuti generati dall’IA (2025, in inglese)

Ne seguono due conclusioni opposte. Quella incoraggiante: l’ordine di Grammarly era corretto, i punteggi salivano con il coinvolgimento dell’IA ed è stato il meno propenso dei tre a segnalare testo umano intatto. Quella prudente: un documento scritto interamente da un modello è tornato con il 50% di media, lontano da ciò che un lettore chiamerebbe scritto da una macchina.

Lo studio ha misurato anche la concordanza tra strumenti. ZeroGPT e Phrasly concordavano molto bene, con 0,96. Quella tra Grammarly e ZeroGPT era solo moderata, 0,60, con un bias di 24,7 punti: ZeroGPT restituiva sistematicamente percentuali più alte sullo stesso materiale, e Phrasly contro Grammarly si è fermata a 0,57. I valutatori umani non hanno fatto meglio: la precisione complessiva è stata del 19%.

Grammarly può segnalare scrittura umana come IA?

Sì. Un falso positivo è testo davvero umano che un rilevatore legge come generato o assistito dall’IA, e Grammarly riconosce il caso invece di escluderlo. La documentazione afferma che il modello è ottimizzato per ridurre i falsi positivi, che possono esserci casi in cui schemi linguistici, sintassi e complessità umani somigliano di più alla scrittura IA e che si aspetta che siano molto rari. Poi dà lo stesso consiglio di questa guida: leggi il risultato nel contesto, non come fonte oggettiva di verità.

Le condizioni che alzano il rischio sono descritte in modo coerente nella letteratura sui rilevatori e sono proprietà della scrittura più che una lista pubblicata da Grammarly. Registro molto formale, struttura delle frasi ripetitiva, transizioni prevedibili, poca varietà lessicale, campioni molto brevi, generi lontani dai dati di addestramento e inglese come lingua aggiuntiva si avvicinano di più al confine. Nessuna è prova di uso dell’IA, e diverse nascono da una scrittura accurata.

Grammarly può lasciar passare testo generato dall’IA?

Sì, e lo studio del 2025 è l’esempio pubblico più concreto: il testo scritto interamente dall’IA dal titolo ha registrato una media del 50,0% su Grammarly, mentre lo stesso materiale superava il 92% sugli altri due strumenti. Quel risultato non è un tasso di fallimento, perché descrive 30 introduzioni di una disciplina, con una famiglia di modelli e in un momento preciso. Mostra però la forma del problema: un rilevatore tarato per evitare falsi positivi lascia passare una parte del testo di macchina.

La documentazione spiega perché una riscrittura può sfuggire. Il modello è addestrato con testo umano e testo generato da IA di fornitori di modelli, e i suggerimenti di grammatica o chiarezza di solito non cambiano la percentuale, mentre una riscrittura significativa con un modello generativo la alza. Il testo generato e poi editato a mano sta tra i due casi, così come un passaggio scritto da una persona e poi molto riscritto da un assistente, la paternità mista che nessun rilevatore risolve bene. I modelli nuovi rendono il problema più difficile, perché i rilevatori si addestrano contro gli output esistenti quando il modello è stato creato.

Perché i risultati di Grammarly possono variare

Quando due persone passano lo stesso testo nello stesso strumento e ottengono numeri diversi, o quando due strumenti non concordano su un documento, la spiegazione sta di solito nelle condizioni.

  • Versione del rilevatore: Grammarly aggiorna il modello di continuo, quindi i risultati cambiano con il prodotto.
  • Lunghezza e granularità: il testo è analizzato per sezioni, un documento breve si basa su meno decisioni locali.
  • Storico di editing: le correzioni di grammatica o chiarezza lasciano il punteggio invariato; la riscrittura generativa lo alza.
  • Soglia e confronto: conta dove un rilevatore traccia la linea, e Grammarly dice che i suoi punteggi differiscono da Turnitin, GPTZero o Copyleaks.

Una percentuale è interpretabile solo accanto a una descrizione del testo. Due frasi incollate da un paragrafo, un tema scritto di getto e un report montato in tre settimane con un assistente sono tre misurazioni diverse, anche se lo strumento mostra lo stesso tipo di punteggio.

La lunghezza del testo influenza il punteggio di Grammarly?

Grammarly lo dice direttamente: i brani brevi sono più difficili da misurare di quelli lunghi. È ragionevole, perché un rilevatore che analizza per sezioni ha meno sezioni con cui lavorare quando gli dai due frasi, quindi il suo giudizio si basa su meno materiale.

La regola pratica è la proporzione. Una percentuale alta su un documento completo, dove gli schemi si ripetono in più paragrafi, merita più attenzione di una alta su una sola frase. Se analizzi qualcosa di breve, considera il risultato provvisorio.

L’editing o la parafrasi cambiano il punteggio di Grammarly?

Grammarly traccia una linea dentro l’editing, ed è utile. Le correzioni tradizionali non generative, come i suggerimenti su grammatica, chiarezza, scelta delle parole e concisione, di solito non influenzano la percentuale IA, perché non cambiano gli schemi linguistici di fondo. Riscrivere frasi o interi paragrafi con un assistente generativo è un’altra operazione: Grammarly afferma che una riscrittura significativa con il suo agente, assistente generativo o parafrasatore alza il punteggio, e che il testo di un fornitore esterno ha ancora più probabilità di ricevere una percentuale più alta.

L’azienda applica quella logica ai propri strumenti, cosa non comune. La documentazione avverte che riscrivere contenuti con i suoi agenti di riformulazione o umanizzazione farà probabilmente segnalare il risultato come generato dall’IA, perché quelle riscritture escono dal suo modello, e suggerisce di usare gli agenti per feedback da applicare a mano se la segnalazione è un problema. Se leggi il punteggio di un’altra persona, lo stesso fatto vale al contrario: il testo passato da un parafrasatore è più difficile da interpretare, e una percentuale bassa non prova che non ci fosse un assistente.

Rilevatore IA di Grammarly o Authorship?

Grammarly offre due idee diverse con nomi simili, e confonderle è il modo più rapido per leggere male un risultato. Il rilevamento IA esamina il testo finale e stima quanto assomigli a scrittura generata dall’IA. Authorship registra come il documento è stato creato e classifica il testo mentre viene inserito: scritto direttamente, incollato da una fonte del browser, incollato da una fonte sconosciuta come una finestra privata, generato dall’IA, o scritto e poi riformulato con l’IA su richiesta.

Grammarly: presentazione di Authorship (in inglese)

Authorship funziona in Google Docs tramite l’estensione e in Word tramite l’app desktop, e produce report condivisibili che nei piani superiori possono includere controlli IA e di plagio. La distinzione che conta è semplice: un rilevatore legge il testo e stima, un registro di paternità descrive il processo che lo ha prodotto.

Come interpretare un punteggio Grammarly

Prima di agire su una percentuale, passa in rassegna queste domande: sono la differenza tra leggere un segnale e trattare un numero come verdetto.

  • Quanto testo è stato analizzato: un documento completo o un estratto breve?
  • Il passaggio è molto editato, assistito dall’IA o una miscela?
  • Quali sezioni sono state segnalate e condividono uno schema?
  • La scrittura si legge come ripetitiva o formulare?
  • Un secondo rilevatore restituisce una lettura simile?
  • Esistono bozze, storico versioni o un report Authorship?

Ciò che un punteggio Grammarly non può stabilire da solo va detto chiaramente. Non dice chi ha scritto un documento, se l’uso dell’IA ha violato una policy, se c’è stato plagio o se qualcuno è onesto. Grammarly lo ammette, descrivendo il rilevamento come un singolo dato e non come l’unica fonte di prova.

Che cosa fare se Grammarly segnala il tuo testo

Affronta la situazione in un ordine fisso invece di riscrivere d’istinto. È la stessa sequenza che questa guida consiglia per qualsiasi rilevatore.

Una sequenza di revisione ripetibile
  1. 1

    Leggi il passaggio segnalato

    Valutalo prima come scrittura: si legge davvero come ripetitivo o formulare?

  2. 2

    Controlla la dimensione del campione

    Il punteggio viene da un documento completo o da due frasi?

  3. 3

    Confronta un secondo rilevatore

    Passa lo stesso testo in un altro strumento e verifica se le letture concordano.

  4. 4

    Raccogli prove di processo

    Cerca bozze, storico versioni o un report Authorship.

  5. 5

    Rivedi ciò che serve

    Riscrivi solo i passaggi che ne hanno bisogno e verifica le citazioni a parte.

A volte la preoccupazione è giustificata. Frasi con la stessa forma, transizioni che non collegano nulla e paragrafi che elencano affermazioni senza prove vanno corretti, con o senza segnalazione. Quando un passaggio è davvero meccanico, l’humanizer di AI-2-Human lo riscrive in una versione più naturale senza perdere il tuo significato.

Dovresti confrontare Grammarly con un altro rilevatore IA?

Sì, e qui la raccomandazione arriva anche dal fornitore. La documentazione afferma che il rilevamento usa un modello proprietario interno, che i punteggi possono differire da altre soluzioni come Turnitin, GPTZero o Copyleaks e che il punteggio non va letto come indicazione chiara che un altro rilevatore dirà lo stesso. Lo studio indipendente ha misurato lo stesso effetto: 0,60 di concordanza tra Grammarly e ZeroGPT su testi identici, con circa 25 punti di differenza.

Il confronto aiuta in entrambe le direzioni. Quando due rilevatori segnalano lo stesso passaggio, merita una lettura attenta. Quando divergono nettamente, la divergenza dice che il testo è vicino a un confine decisionale e che la percentuale è fragile, cosa utile da sapere prima di riscrivere o prima che altri agiscano.

Il rilevatore di AI-2-Human legge lo stesso passaggio con il proprio modello e segnala le sezioni che sembrano ancora generate, così metti due interpretazioni una accanto all’altra. È un secondo parere, non un ricorso a un’autorità superiore: ti dà più elementi prima di decidere che cosa cambiare.

Prima di consegnare: una checklist pratica

  • So che la percentuale di Grammarly è una stima, non una misurazione.
  • Ho controllato quanto testo è stato analizzato prima di leggere il punteggio.
  • Ho letto le sezioni segnalate e non solo il numero principale.
  • Ho considerato se il testo è umano, assistito dall’IA o misto.
  • Ho confrontato un secondo rilevatore quando il risultato conta davvero.
  • Ho cercato bozze, storico versioni o un report Authorship.
  • Ho verificato citazioni e fatti separatamente dal rilevamento IA.
  • Ho rivisto solo i passaggi che avevano davvero bisogno di miglioramenti.

Domande frequenti

Fonti e note editoriali

AI-2-Human non è affiliato a Grammarly né approvato da Grammarly. La documentazione di prodotto di Grammarly, le informazioni sui benchmark e la ricerca citata sono state consultate il 20 settembre 2026. I modelli di rilevamento e le classifiche dei benchmark cambiano nel tempo, quindi verifica la documentazione attuale di Grammarly e la classifica RAID prima di affidarti a una cifra citata qui.

Aggiornato

Serve un secondo parere?

Confronta il tuo punteggio IA di Grammarly con un altro rilevatore.

Passa lo stesso brano in AI-2-Human, controlla un altro segnale di rilevamento e decidi se il testo ha davvero bisogno di revisione.

Vedi tutte le guide