Guias de deteção de IA

O GPTZero é fiável?

O GPTZero identifica corretamente texto gerado por IA em muitas situações, mas não existe uma percentagem única de precisão que valha para qualquer texto. O benchmark do próprio GPTZero declara resultados muito fortes em quatro domínios em inglês, enquanto os estudos independentes mostram um desempenho que varia com a versão do detetor, o tipo de escrita, o comprimento do texto e o corpus testado. Há falsos positivos e falsos negativos documentados. Isso faz do GPTZero um sinal de deteção útil, mas não uma prova indiscutível de como um texto foi escrito. Quando o resultado importa, passar a mesma passagem pelo Detetor do AI-2-Human dá-te outro sinal antes de concluíres seja o que for.

AI-2-HumanPublicado 15 min de leitura
Uma amostra de texto ao lado do AI-2-Human num portátil e relatórios ilustrativos do GPTZero e do AI-2-Human com pontuações de deteção de IA diferentes.
Ilustração de uma segunda opinião: a mesma passagem lida por dois detetores. As pontuações mostradas são ilustrativas e não são resultados medidos num documento concreto.

O que é o GPTZero?

O GPTZero é um detetor de texto de IA. Colas um texto ou carregas um documento e o seu sistema de aprendizagem profunda estima que parte desse texto foi escrita por uma máquina. Devolve uma de três classificações do documento (escrito inteiramente por uma pessoa, inteiramente por uma IA ou por uma mistura de ambas) juntamente com uma categoria de confiança, e destaca as frases que mais contribuíram para o resultado. O GPTZero descreve também capacidades adicionais de deteção dirigidas a texto alterado com ferramentas de paráfrase.

GPTZero: tecnologia de deteção de IA

Qual é a precisão do GPTZero?

Não existe uma percentagem única de precisão do GPTZero que valha para qualquer texto. Os resultados declarados dependem da versão do modelo do detetor, de como o benchmark foi construído, que escrita humana foi usada como controlo, que modelo de IA gerou o texto automático, do género, do comprimento do texto, de o texto ter sido editado ou parafraseado depois, do limiar de classificação escolhido por quem testou e do idioma avaliado.

É por isso que este guia mantém separadas duas classes de provas. A primeira é o que o GPTZero declara sobre o seu próprio modelo, no seu próprio benchmark e com uma versão de modelo indicada. A segunda é o que investigadores independentes mediram quando passaram o GPTZero pelos seus próprios textos, que é outra pergunta: testaram a versão disponível na altura, no seu corpus e com um limiar que escolheram. Ambas são úteis e nenhuma substitui a outra.

A resposta curta para quem tem um documento concreto é, por isso, condicional: o GPTZero pode ser muito eficaz com escrita semelhante àquela com que foi treinado e avaliado, e a sua documentação publicada reconhece que as amostras curtas, o texto de IA muito modificado, os géneros pouco habituais e a escrita procedimental são casos mais difíceis.

O que declara o benchmark atual do GPTZero

O GPTZero publica uma página de avaliação estandardizada que, segundo indica, é atualizada trimestralmente, com previsões em bruto disponíveis para quem quiser reproduzir os resultados. Na sua avaliação de fevereiro de 2026, o GPTZero declara, como média de quatro domínios em inglês para a versão de modelo 4.3b, uma taxa de falsos positivos de 0,08%, uma sensibilidade de 99,60%, uma precisão de 99,93% e uma exatidão de 99,76%. Cada benchmark usa 1.000 textos humanos e 1.000 textos gerados por LLM, distribuídos de forma uniforme pelos modelos testados (250 textos por modelo), e o conjunto de modelos é renovado trimestralmente.

As linhas por domínio são publicadas em separado, o que importa porque as médias escondem variação. O GPTZero declara 99,85% de exatidão em recensões de artigos académicos (0,10% de falsos positivos), 99,80% em escrita criativa, 100% em ensaios com uma taxa de falsos positivos de 0,00% e 99,40% em recensões de produtos. A mesma página apresenta as pontuações que mediu para detetores concorrentes sobre os mesmos textos, e a comparação é mais equilibrada em alguns domínios do que a média de manchete sugere.

GPTZero: avaliação da deteção de IA, o padrão do setor em exatidão, transparência e equidade

O que diz a investigação independente sobre a precisão do GPTZero

O resultado independente mais forte para o GPTZero vem de um estudo revisto por pares publicado na Acta Neurochirurgica em 2025. Os investigadores reuniram 1.000 textos: 250 resumos e introduções escritos por pessoas, provenientes de quatro revistas de neurocirurgia de alto impacto publicadas antes do ChatGPT, mais 750 versões do mesmo material geradas pelo ChatGPT 3.5, GPT-4 e GPT-4o. Os detetores foram usados entre 1 e 15 de junho de 2024, o que data a versão do GPTZero testada. Com o GPTZero, a pontuação média de probabilidade de IA foi de 5,88% para os textos humanos, 81,71% para o GPT-3.5, 96,83% para o GPT-4 e 99,58% para o GPT-4o. No corte escolhido pelos investigadores, o GPTZero atingiu 100% de sensibilidade e 99,6% de especificidade.

Acta Neurochirurgica: exatidão e limitações dos detetores de textos de IA

É um resultado sólido, e continua a ser condicional. Descreve um corpus académico, de uma disciplina, com determinados comprimentos de texto, face a três versões do ChatGPT, sobre a versão do GPTZero disponível em junho de 2024 e com um limiar escolhido pelos autores. Não significa que o detetor tenha 99,6% de exatidão no teu texto, e o mesmo artigo observa que nenhum detetor avaliado foi fiável em todas as situações.

Trabalhos independentes anteriores mostram quanto essas condições podem variar. Um estudo preliminar publicado no Journal of Korean Medical Science em 2023 testou o GPTZero com 20 textos gerados pelo ChatGPT em resposta a perguntas médicas e 30 excertos retirados de artigos médicos já publicados. Declarou uma sensibilidade de 0,65 (intervalo de confiança de 95%: 0,41 a 0,85), uma especificidade de 0,90 (0,73 a 0,98) e uma exatidão de 0,80 (0,66 a 0,90), e concluiu que o GPTZero tinha uma taxa baixa de falsos positivos mas uma taxa alta de falsos negativos: raramente acusava a escrita humana e frequentemente deixava passar a escrita automática.

Journal of Korean Medical Science: desempenho do GPTZero com textos médicos gerados por IA (2023)

A distância entre esse retrato de 2023 e o estudo de 2025 não é uma contradição nem prova de que uma equipa foi descuidada. É o exemplo mais claro desta página de porque é que a precisão de um detetor tem de ser lida em conjunto com a sua versão e o seu corpus.

O GPTZero pode marcar escrita humana como IA?

Sim. Um falso positivo é escrita humana classificada como IA ou mista, e o GPTZero reconhece que esses casos existem. A sua documentação de apoio explica que a exatidão aumenta à medida que se envia mais texto, que o classificador é treinado sobretudo com prosa inglesa escrita por adultos e que por vezes pode marcar como escritos por IA outros textos gerados por máquinas ou muito procedimentais. Um excerto curto, uma passagem formulaica ou um texto muito afastado dessa distribuição de treino são os pontos onde esse risco se concentra.

GPTZero: quais são as limitações do seu classificador de IA?

A documentação pública do GPTZero vai mais longe do que a da maioria dos fornecedores quanto às consequências desse risco. Afirma que os resultados não devem ser usados para castigar estudantes, recomenda tratar uma classificação como um componente de uma avaliação mais ampla e defende que o detetor deve servir como ponto de partida de uma conversa e não como veredicto final. Em contextos académicos, a empresa afirma também que prefere deixar passar um uso de IA a acusar uma pessoa: a documentação da API desaconselha aumentar a sensibilidade do detetor para usos académicos, porque aí os falsos negativos são preferíveis aos falsos positivos.

O GPTZero pode deixar passar texto gerado por IA?

Sim, e o próprio equilíbrio escolhido pelo fornecedor torna isso explícito: um falso negativo é texto gerado por IA classificado como humano, e o GPTZero afirma que, em contexto académico, prefere errar nessa direção. O estudo médico de 2023 mediu o custo prático dessa mesma preferência, com uma sensibilidade de 0,65 no seu corpus: cerca de um terço dos textos escritos por máquina não foi sinalizado.

Vários fatores empurram uma passagem gerada para a classificação humana. O texto gerado e depois reescrito em profundidade à mão já não se parece com uma saída em bruto de um modelo, e a documentação do GPTZero observa que o classificador não foi treinado para identificar texto gerado por IA depois de uma modificação intensa. As ferramentas de paráfrase, os modelos pouco conhecidos, os géneros invulgares, as amostras curtas e as edições deliberadas para enganar o detetor estão na mesma zona. A empresa atualiza os modelos para estes casos, e é também por isso que um resultado de uma versão não passa automaticamente para a seguinte.

Porque é que a precisão do GPTZero varia

Quando dois estudos declaram números muito diferentes para a mesma ferramenta, a explicação costuma estar no desenho do teste e não na ferramenta. As variáveis abaixo cobrem a maior parte da diferença.

  • Versão do modelo: o detetor avaliado em 2023, o avaliado em junho de 2024 e o modelo atual são sistemas diferentes, e o próprio GPTZero documenta as mudanças de versão.
  • Construção do benchmark: que textos foram escolhidos, como foram pedidos os textos de IA e se as amostras estão equilibradas entre géneros condicionam o resultado.
  • Escrita humana usada como controlo: a prosa académica anterior ao ChatGPT, os ensaios de estudantes e a escrita da web são distribuições diferentes, e um classificador pode parecer excelente numa e fraco noutra.
  • Modelo gerador: o estudo da Acta Neurochirurgica mediu pontuações médias do GPTZero que subiam de 81,71% com o GPT-3.5 para 99,58% com o GPT-4o, por isso a mesma ferramenta lê modelos diferentes de forma diferente.
  • Género e idioma: o GPTZero afirma que rende melhor em textos longos e prosa em inglês, que é onde estão a maior parte dos seus dados de treino.
  • Comprimento do texto: mais texto significa mais provas, e é por isso que os resultados ao nível do documento são mais fiáveis do que os de frase.
  • Edição e paráfrase: uma reescrita humana intensa ou uma paráfrase automática afastam um texto dos padrões que o classificador aprendeu.
  • Limiar: todos os detetores convertem pontuações em decisões com algum corte, e movê-lo troca falsos positivos por falsos negativos. O estudo da Acta indica o seu próprio corte, e é uma das razões por que os seus números são precisos e não universais.
  • O que conta como acerto: os estudos tratam de forma diferente as classificações mistas, o texto de IA parcial e os documentos irregulares, por isso dois artigos podem medir a mesma ferramenta e entender coisas distintas por exatidão.

O comprimento do texto afeta a precisão do GPTZero?

Sim, e o GPTZero di-lo diretamente. A sua documentação afirma que a exatidão melhora quando se envia mais texto e que as classificações ao nível do documento são em geral mais fiáveis do que as de parágrafo, que por sua vez são mais fiáveis do que as de frase.

Vale a pena lembrar a consequência prática da próxima vez que vires uma frase destacada. Uma única frase destacada é um sinal fraco por si só, porque é o que traz menos provas de tudo o que o detetor examina. Uma classificação coerente ao nível do documento num ensaio completo, onde os mesmos padrões aparecem em vários parágrafos, merece mais peso. Se o texto que estás a verificar é curto, trata o resultado como provisório e verifica mais parte dele.

Como interpretar um resultado do GPTZero

O GPTZero não devolve um único número, e ler o seu resultado como “X por cento deste ensaio foi escrito por uma IA” é um mal-entendido. O sistema devolve uma classificação (só humano, misto ou só IA), uma probabilidade para cada uma dessas classes e uma categoria de confiança alta, média ou baixa. A probabilidade da classe prevista é descrita pela documentação do GPTZero como a probabilidade de o detetor acertar nessa previsão: um valor de 90% significa que, em documentos semelhantes, acerta cerca de 90% das vezes.

GPTZero: como transformo as probabilidades da API em resultados?

O GPTZero publica também o que significam as suas categorias de confiança na prática: com confiança alta, declara que 99,1% dos artigos humanos são classificados como humanos e que 98,4% dos artigos de IA são classificados como IA. Um resultado de confiança média ou baixa é, por construção, uma afirmação mais suave, e a documentação descreve limiares que podes ajustar para trocar sensibilidade por falsos positivos no teu próprio caso de uso.

Perguntas que vale a pena fazer antes de agir a partir de um resultado:

  • Qual é o comprimento do texto e o veredicto é ao nível do documento ou da frase?
  • A confiança é alta, média ou baixa?
  • Que passagens provocaram a classificação?
  • Quando lês essas passagens, a escrita parece mesmo repetitiva ou formulaica?
  • Outro detetor devolve um sinal semelhante sobre o mesmo texto?
  • Há provas do processo de escrita, como rascunhos, notas ou um histórico de versões?
  • O texto foi editado ou parafraseado de forma substancial depois de gerado?

O que um resultado do GPTZero não consegue estabelecer por si só é o plágio, a má conduta, a intenção ou a história exata de um documento. É uma prova sobre padrões no texto, e é mais útil quando se lê ao lado do próprio texto.

O professorado deve usar o GPTZero como prova de uso de IA?

Não como prova, e a própria documentação do GPTZero diz o mesmo. As suas páginas de apoio afirmam que nenhum detetor é totalmente preciso, que os resultados não devem ser usados para castigar estudantes e que uma classificação é melhor tratada como um elemento de uma avaliação mais ampla. A empresa documenta também a sua preferência em contextos académicos: prefere deixar passar escrita assistida por IA a acusar um estudante por engano, que é exatamente o contrário do que uma decisão disciplinar precisa.

Quando a autoria importa, um processo é mais forte do que uma pontuação. As provas úteis incluem o histórico de redação, as revisões do documento, as notas das fontes, trabalhos anteriores do mesmo estudante, citações que podem ser verificadas, conversa sobre o material e o que a política de IA do trabalho realmente permite. Um detetor pode apontar passagens que merecem uma conversa. Não pode substituir essa conversa.

O que fazer se o GPTZero sinalizar o teu texto

Se o resultado importa, percorre-o numa ordem fixa em vez de reescreveres por reflexo.

Uma sequência de revisão que podes repetir
  1. 1

    Lê

    Lê as passagens sinalizadas e avalia-as como escrita.

  2. 2

    Vê o nível

    Regista se a classificação é ao nível do documento ou da frase.

  3. 3

    Pondera a confiança

    Olha para a categoria de confiança, não apenas para o resultado de manchete.

  4. 4

    Compara

    Passa o mesmo texto por um segundo detetor.

  5. 5

    Provas

    Reúne rascunhos e histórico de versões se a autoria for questionada.

  6. 6

    Revê

    Reescreve apenas as passagens que realmente precisam de melhorar.

Às vezes a preocupação é justa: formas de frase repetidas, transições que não ligam nada, afirmações sem um único exemplo por trás. Quando uma passagem é mesmo formulaica, o Humanizador do AI-2-Human pode reescrevê-la num rascunho mais natural mantendo a tua intenção no centro, e depois editas o resultado com a tua própria voz.

Deves comparar o GPTZero com outro detetor de IA?

Sim, sobretudo quando o resultado tem consequências. Os detetores usam modelos diferentes, dados de treino diferentes e limiares de decisão diferentes, por isso a mesma passagem pode dar resultados distintos. Os estudos citados nesta página são, eles próprios, um exemplo de quanto as condições importam: a mesma ferramenta pontuou de forma muito diferente segundo o corpus e a versão.

A comparação ajuda nas duas direções. Quando dois detetores destacam a mesma passagem, essa passagem merece um olhar atento. Quando discordam de forma marcada, a discordância diz-te que o texto está perto de um limite de decisão e que a pontuação é suave, o que é útil saber antes de reescreveres seja o que for ou antes de outra pessoa agir a partir do resultado.

O Detetor do AI-2-Human comunica a sua própria leitura do texto e aponta as passagens que ainda parecem geradas, o que te dá duas interpretações para pôr lado a lado antes de decidires o que mudar.

Antes de entregar: uma lista de verificação prática

  • Verifiquei se o resultado é ao nível do documento ou da frase.
  • Tive em conta o comprimento e o tipo do texto verificado.
  • Olhei para a confiança do GPTZero, não apenas para a classificação de manchete.
  • Li as passagens que levantaram a dúvida.
  • Tratei o resultado como prova e não como demonstração.
  • Comparei com outro detetor porque o resultado importa.
  • Guardei rascunhos ou histórico de versões onde a autoria poderia ser questionada.
  • Verifiquei factos e citações em separado da deteção de IA.
  • Revisei apenas as passagens que realmente precisavam de melhorar.

Perguntas frequentes

Fontes e notas editoriais

O AI-2-Human não está associado ao GPTZero nem é apoiado por ele. A documentação, a informação de benchmark e a investigação citada do GPTZero foram consultadas a 20 de setembro de 2026. Os modelos de deteção e o seu desempenho podem mudar ao longo do tempo.

Atualizado

Queres uma segunda opinião?

Compara o teu resultado do GPTZero com outro detetor de IA.

Passa a mesma passagem pelo AI-2-Human, revê outro sinal de deteção e decide se a escrita precisa mesmo de ser revista.

Ver todos os guias