Guías de detección de IA

¿Es fiable el detector de IA de Grammarly?

El detector de IA de Grammarly puede rendir muy bien en benchmarks estandarizados, pero su puntuación no prueba cómo se escribió un documento. Grammarly llama a ese porcentaje una estimación media de cuánto texto parece generado por IA, afirma que la función no es 100% precisa y señala que los textos cortos son más difíciles de medir. La evidencia independiente apunta igual: rinde bien en un gran benchmark compartido, mientras un estudio académico de 2025 registró porcentajes muy inferiores a los de otro detector en las mismas introducciones de IA. Una puntuación es una señal: cuando el resultado importa, compara el mismo fragmento con otro detector y lee tú el texto marcado. El Detector de IA de AI-2-Human te da esa segunda lectura.

AI-2-HumanPublicado 15 min de lectura
Una muestra de texto junto a AI-2-Human en un portátil e informes ilustrativos de Grammarly y AI-2-Human con puntuaciones de IA distintas.
Ilustración de una segunda opinión: el mismo fragmento leído por dos detectores. Las puntuaciones mostradas son ilustrativas, no resultados medidos sobre un documento concreto.

¿Qué es el detector de IA de Grammarly?

El detector de IA de Grammarly estima qué parte de un texto parece generada por IA. Grammarly explica el mecanismo en su documentación: el texto se divide en secciones, cada una se compara con un modelo de aprendizaje automático que busca patrones típicos de la IA, como esquemas de lenguaje, sintaxis y complejidad, y después devuelve un porcentaje. El modelo se describe como entrenado con cientos de miles de textos humanos y de IA.

La función no es una web aparte que visitas una vez. Grammarly la integra en su producto, con el agente AI Detector en sus superficies de escritura, la comprobación de IA en Google Docs mediante la extensión y las aplicaciones de escritorio para Word, y es de pago en casi todos los planes. Hay una versión gratuita en la página pública AI Detector, donde pegas texto o subes un documento para ver el porcentaje.

Grammarly: guía de usuario del detector de IA (inglés)

Entonces, ¿qué precisión tiene el detector de IA de Grammarly?

No hay un porcentaje único de precisión que describa cada análisis. Lo que se puede decir es más concreto: el detector separa texto de IA de texto humano con mucha fiabilidad en condiciones de benchmark, y la investigación independiente muestra que los porcentajes que devuelve pueden quedar muy por debajo del nivel real de implicación de la IA.

Las propias palabras de Grammarly fijan mejor las expectativas. Su guía de usuario llama a la puntuación una estimación media de cuánto texto generado por IA contiene probablemente un documento, dice que las pruebas garantizaron que el modelo acierta en dirección, señala que los fragmentos cortos son más difíciles de medir y afirma que la función no es 100% precisa y no debe usarse como valoración definitiva. Otro artículo añade que ningún detector actual puede determinar de forma concluyente si se usó IA y que estas herramientas son un dato más, no la única fuente de prueba.

Grammarly: ¿el uso de Grammarly activa los detectores de IA? (inglés)

  • Estilo: la prosa formal y muy regular se acerca a los patrones que los detectores asocian con la máquina.
  • Longitud: los fragmentos cortos son más difíciles de medir que los largos, según Grammarly.
  • Modelo: cada modelo deja huellas distintas y los detectores se ajustan a familias concretas.
  • Edición humana: el texto generado y luego muy reescrito ya no parece salida de un modelo.
  • Autoría mixta: redacción humana más ayuda de IA y revisión manual es el caso más difícil.
  • Versión y datos: cada cifra publicada depende del género y la longitud del material de prueba.

¿Qué significa de verdad el porcentaje de IA de Grammarly?

Una puntuación del 40% no significa que Grammarly haya establecido que exactamente el 40% del documento lo escribió una IA. Significa que el modelo encontró patrones que hacen que esa parte del texto se parezca a escritura generada por IA. Grammarly usa a propósito las palabras estimación y media, y repite la matización: la puntuación debe leerse como una estimación media y no como una valoración porcentual definitiva, ni como fuente objetiva de verdad, porque cualquier detección de IA puede cometer errores.

El diseño por secciones explica parte de esa ambigüedad. Analizar por secciones muestra qué partes provocaron el resultado, pero un único porcentaje comprime varios juicios locales en un solo número: un documento con tres párrafos formulaicos y cuatro personales puede acabar en una puntuación intermedia que no describe bien ninguna de las dos mitades.

Qué informa el benchmark RAID sobre Grammarly

RAID es un benchmark compartido creado para evaluar detectores en condiciones comunes: más de 10 millones de documentos con 11 modelos de lenguaje, 11 géneros, cuatro estrategias de decodificación y ataques adversariales como parafraseo, cambios de sinónimos y homoglifos. Todos los detectores participantes se puntúan con el mismo material y el mismo script, lo que lo convierte en la comparación pública más justa disponible y en la más difícil de transformar en una promesa sobre un ensayo concreto.

RAID: un benchmark compartido para la evaluación robusta de detectores de texto generado por máquina (inglés)

Grammarly anuncia su rendimiento en ese benchmark directamente. Su página de producto del detector afirma que el producto alcanza un 99% de precisión de detección y que ocupa el primer puesto en el benchmark independiente de RAID, por delante de otros detectores líderes. Es una afirmación del proveedor, publicada por la empresa cuyo detector describe, y debe leerse como tal.

Grammarly: página de producto del detector de IA (inglés)

La clasificación en sí es más precisa. La instantánea citada aquí se tomó el 20 de septiembre de 2026 y la entrada de Grammarly está fechada el 9 de febrero de 2026. Las entradas las envían los desarrolladores de los detectores y se puntúan con el script del propio benchmark, así que las condiciones son compartidas pero el envío viene del proveedor. En esa instantánea Grammarly declara un AUROC de 0,9987 en todas las condiciones de RAID, incluidos los ataques adversariales, con un 99,47% de precisión con una tasa objetivo de falsos positivos del 5% y un 98,21% con el 1%. En la parte no adversarial, la misma entrada declara un AUROC de 0,99972 y un 99,91% de precisión con objetivo del 5%.

Los nombres de las métricas importan. El AUROC mide qué bien separa un detector las dos clases en todos los umbrales posibles, donde 1,0 es perfecto, y no es un porcentaje de decisiones correctas. La cifra de precisión de RAID se mide en un punto de funcionamiento fijo, el umbral donde solo el 5% o el 1% de los textos humanos se marcan por error.

Qué dice la investigación independiente sobre Grammarly

El resultado independiente más útil sobre Grammarly viene de un estudio revisado por pares publicado en Advances in Simulation en 2025. Los investigadores tomaron 30 artículos de acceso abierto publicados antes de 2022 en dos revistas de simulación sanitaria, extrajeron las introducciones y produjeron cinco versiones de cada una: el original humano, una versión humana con edición ligera de IA, una con edición intensa, una generada a partir de puntos clave humanos y una escrita enteramente desde el título. Tres detectores gratuitos (ZeroGPT, Phrasly AI y Grammarly) y cinco evaluadores humanos ciegos puntuaron el mismo material.

Grammarly distinguió las cinco condiciones en conjunto, con un efecto estadísticamente significativo y un tamaño del efecto de 0,75, pero sus porcentajes absolutos quedaron muy por debajo del nivel de implicación de la IA. En esas introducciones promedió un 1,6% en el texto humano intacto (intervalo de confianza del 95%: 0,0 a 3,1), un 3,0% con edición ligera, un 11,5% con edición intensa, un 62,5% en texto generado desde puntos clave y un 50,0% en texto escrito enteramente por IA desde el título. ZeroGPT promedió 6,5%, 20,2%, 43,1%, 89,9% y 92,5% en las mismas cinco condiciones.

Advances in Simulation: capacidad de las herramientas de detección de IA y de los humanos para identificar contenido generado por IA (2025, inglés)

De ahí salen dos conclusiones opuestas. La alentadora es que el orden de Grammarly era correcto: sus puntuaciones subían a medida que subía la implicación de la IA y fue la menos propensa de las tres herramientas a marcar texto humano intacto. La cautelosa es que un documento escrito enteramente por un modelo de lenguaje volvió con un 50% de media, lejos de lo que un lector llamaría escrito por máquina.

El estudio también midió la concordancia entre herramientas. ZeroGPT y Phrasly coincidían muy bien, con 0,96. La de Grammarly con ZeroGPT era solo moderada, 0,60, con un sesgo de 24,7 puntos: ZeroGPT devolvía sistemáticamente porcentajes más altos en el mismo material, y Phrasly frente a Grammarly quedó en 0,57. Los evaluadores humanos no lo hicieron mejor: su precisión global fue del 19%.

¿Puede Grammarly marcar escritura humana como IA?

Sí. Un falso positivo es texto realmente humano que un detector lee como generado o asistido por IA, y Grammarly reconoce el caso en lugar de descartarlo. Su documentación afirma que el modelo está optimizado para minimizar los falsos positivos, que puede haber casos en los que los patrones, la sintaxis y la complejidad humanos se parezcan más a la escritura de IA y que espera que sean muy raros. Después da el mismo consejo que esta guía: lee el resultado en contexto, no como fuente objetiva de verdad.

Las condiciones que elevan el riesgo se describen de forma consistente en la literatura sobre detectores, y son propiedades de la escritura más que una lista que Grammarly publique. El registro muy formal, la estructura de frases repetitiva, las transiciones predecibles, la poca variación léxica, las muestras muy cortas, los géneros alejados de los datos de entrenamiento y el inglés como lengua adicional se acercan más a la frontera. Ninguna es prueba de uso de IA, y varias son producto de una escritura cuidada.

¿Puede Grammarly pasar por alto texto generado por IA?

Sí, y el estudio de 2025 es el ejemplo público más concreto: el texto escrito enteramente por IA desde el título promedió un 50,0% en Grammarly, mientras el mismo material promediaba más del 92% en las otras dos herramientas. Ese resultado no es una tasa de fallo, porque describe 30 introducciones de una disciplina, generadas con una familia de modelos y en un momento concreto. Sí muestra la forma del problema: un detector ajustado para evitar falsos positivos deja pasar parte del texto de máquina.

La documentación de Grammarly explica por qué una reescritura puede escapar. Su modelo se entrena con texto humano y texto generado por IA de proveedores de modelos, y las sugerencias de gramática o claridad normalmente no cambian el porcentaje, mientras que una reescritura significativa con un modelo generativo lo sube. El texto generado y luego editado a mano queda entre esos dos casos, y también un pasaje escrito por una persona y muy reescrito por un asistente, la autoría mixta que ningún detector resuelve bien. Los modelos nuevos dificultan el problema, porque los detectores se entrenan contra las salidas que existían cuando se creó el modelo.

Por qué pueden variar los resultados del detector de Grammarly

Cuando dos personas pasan el mismo texto por la misma herramienta y obtienen números distintos, o cuando dos herramientas no coinciden sobre el mismo documento, la explicación suele estar en las condiciones.

  • Versión: Grammarly actualiza su modelo de forma continua, así que los resultados cambian con el producto.
  • Longitud: el texto se analiza por secciones, así que un documento corto se juzga con menos decisiones.
  • Edición: las correcciones de gramática o claridad suelen dejar la puntuación igual; la reescritura generativa la sube.
  • Umbral: dónde traza la línea un detector importa, y Grammarly dice que sus puntuaciones difieren de las de Turnitin, GPTZero o Copyleaks.

Un porcentaje solo es interpretable junto a una descripción del texto. Dos frases pegadas de un párrafo, un ensayo entero escrito de una vez y un informe montado en tres semanas con un asistente son tres mediciones distintas, aunque la herramienta muestre el mismo estilo de puntuación.

¿Influye la longitud del texto en la puntuación de Grammarly?

Grammarly lo dice directamente: los fragmentos cortos son más difíciles de medir que los largos. Es sensato, porque un detector que analiza por secciones tiene menos secciones con las que trabajar cuando le das dos frases, así que su juicio se apoya en menos material.

La regla práctica es la proporción. Un porcentaje alto en un documento completo, donde los patrones se repiten en varios párrafos, merece más atención que uno alto en una sola frase. Si analizas algo corto, trata el resultado como provisional.

¿La edición o el parafraseo cambian la puntuación de Grammarly?

Grammarly traza una línea dentro de la edición y es útil. Las correcciones tradicionales no generativas, como las sugerencias de gramática, claridad, elección de palabras y concisión, normalmente no afectan al porcentaje de IA, porque no cambian los patrones de lenguaje subyacentes que lee el modelo. Reescribir frases o párrafos enteros con un asistente generativo es otra operación: Grammarly afirma que una reescritura significativa con su agente, su asistente generativo o un parafraseador subirá la puntuación, y que el texto de un proveedor externo tiene aún más probabilidad de recibir un porcentaje más alto.

La empresa aplica esa lógica a sus propias herramientas, y es poco habitual tanta franqueza. Su documentación advierte de que reescribir contenido con sus agentes de reformulación o humanización probablemente hará que el resultado se marque como generado por IA, porque esas reescrituras salen de su propio modelo, y sugiere usar los agentes para recibir comentarios que apliques a mano si te preocupa que te marquen. Si estás leyendo la puntuación de otra persona, el mismo hecho importa al revés: el texto que ha pasado por un parafraseador es más difícil de interpretar, y un porcentaje bajo no prueba que no hubiera un asistente.

Detector de IA de Grammarly frente a Authorship

Grammarly incluye dos ideas distintas con nombres parecidos, y confundirlas es la forma más rápida de malinterpretar un resultado. La detección de IA examina el texto final y estima qué parte se parece a escritura generada por IA. Authorship registra cómo se creó el documento y clasifica el texto según entra: escrito directamente, pegado desde el navegador, pegado desde una fuente desconocida como una ventana privada, generado por IA, o escrito y luego reformulado con IA a demanda.

Grammarly: presentación de Authorship (inglés)

El seguimiento de Authorship funciona en Google Docs con la extensión y en Word con la aplicación de escritorio, y produce informes compartibles que pueden incluir comprobaciones de IA y de plagio en los planes superiores. La distinción que importa es sencilla: un detector lee el texto y estima, mientras que un registro de autoría describe el proceso que lo produjo.

Cómo interpretar una puntuación de Grammarly

Antes de actuar a partir de un porcentaje, repasa estas preguntas: son la diferencia entre leer una señal y tratar un número como un veredicto.

  • ¿Cuánto texto se analizó: un documento completo o un extracto corto?
  • ¿El pasaje está muy editado, asistido por IA o es una mezcla?
  • ¿Qué secciones se marcaron y comparten algún patrón?
  • ¿La escritura se lee como repetitiva o formulaica?
  • ¿Un segundo detector devuelve una lectura parecida?
  • ¿Hay borradores, historial de versiones o un informe de Authorship?

Lo que una puntuación de Grammarly no puede establecer por sí sola conviene decirlo claro. No dice quién escribió un documento, si el uso de IA rompió una política, si hubo plagio ni si alguien es honesto. Grammarly lo admite, al describir su detección como un dato más y no como la única fuente de prueba.

Qué hacer si Grammarly marca tu texto

Aborda la situación en un orden fijo en lugar de reescribir por reflejo. Es la misma secuencia que esta guía recomienda para cualquier detector.

Una secuencia de revisión que puedes repetir
  1. 1

    Lee el pasaje marcado

    Júzgalo primero como escritura: ¿se lee de verdad como repetitivo o formulaico?

  2. 2

    Comprueba el tamaño de la muestra

    ¿La puntuación salió de un documento completo o de un par de frases?

  3. 3

    Compara con un segundo detector

    Pasa el mismo texto por otra herramienta y mira si las lecturas coinciden.

  4. 4

    Reúne pruebas del proceso

    Busca borradores, historial de versiones o un informe de Authorship.

  5. 5

    Revisa lo que lo necesite

    Reescribe solo los pasajes que necesitan mejora y verifica las citas aparte.

A veces la preocupación es justa. Las frases con la misma forma, las transiciones que no conectan nada y los párrafos que enumeran afirmaciones sin pruebas merecen arreglarse, tanto si un detector lo notó como si no. Cuando un pasaje es realmente mecánico, el humanizador de AI-2-Human lo reescribe en una versión más natural sin perder tu significado.

¿Deberías comparar Grammarly con otro detector de IA?

Sí, y aquí la recomendación viene también del proveedor. La documentación de Grammarly afirma que su detección usa un modelo propio, que las puntuaciones pueden diferir de otras soluciones como Turnitin, GPTZero o Copyleaks y que su puntuación no debe leerse como indicación clara de que otro detector dirá lo mismo. El estudio independiente midió el mismo efecto: 0,60 de concordancia entre Grammarly y ZeroGPT en textos idénticos, con unos 25 puntos de diferencia.

La comparación ayuda en las dos direcciones. Cuando dos detectores marcan el mismo pasaje, merece una lectura atenta. Cuando discrepan con claridad, la discrepancia dice que el texto está cerca de una frontera de decisión y que el porcentaje es blando, algo que conviene saber antes de reescribir nada o de que otra persona actúe a partir del resultado.

El Detector de AI-2-Human lee el mismo pasaje con su propio modelo y señala las secciones que siguen pareciendo generadas, para poner dos interpretaciones una junto a otra. Es una segunda opinión, no una autoridad superior: te da más elementos antes de decidir qué cambiar.

Antes de entregar: lista de comprobación práctica

  • Entiendo que el porcentaje de Grammarly es una estimación, no una medición.
  • Comprobé si se analizó suficiente texto antes de leer la puntuación.
  • Leí los pasajes que provocaron la marca en lugar de solo el número principal.
  • Valoré si el texto es escritura humana, asistida por IA o una mezcla.
  • Comparé con otro detector cuando el resultado importa de verdad.
  • Busqué borradores, historial de versiones o un informe de Authorship cuando se cuestiona la autoría.
  • Verifiqué citas y datos aparte de la detección de IA.
  • Revisé solo los pasajes que de verdad necesitaban mejora.

Preguntas frecuentes

Fuentes y notas editoriales

AI-2-Human no está afiliado a Grammarly ni cuenta con su respaldo. La documentación de producto de Grammarly, la información de benchmarks y la investigación citada se consultaron el 20 de septiembre de 2026. Los modelos de detección y las clasificaciones de benchmark cambian con el tiempo, así que consulta la documentación actual de Grammarly y la clasificación de RAID en línea antes de fiarte de cualquier cifra citada aquí.

Actualizado

¿Quieres una segunda opinión?

Compara tu puntuación de IA de Grammarly con otro detector.

Pasa el mismo fragmento por AI-2-Human, revisa otra señal de detección y decide si el texto necesita de verdad una revisión.

Ver todas las guías