Pesquisador cria detector de textos de IA que promete 98% de acerto

Ele também define a “forma do slop”, série de critérios que permitem identificar a autoria por IA

Detector de IA
Sem comentários Facebook Twitter Flipboard E-mail
victor-bianchin

Victor Bianchin

Redator
victor-bianchin

Victor Bianchin

Redator

Victor Bianchin é jornalista.

2465 publicaciones de Victor Bianchin

O fato de estarmos cercados por textos escritos por uma IA já não surpreende ninguém. Nós, que queremos ler textos escritos por pessoas, passamos o dia inteiro com o radar ligado, procurando indícios para verificar se estamos lendo algo escrito por um humano ou por um robô. Mas, para além da questão da preferência, há áreas como a educação em que são necessárias boas ferramentas para detectar textos escritos por IA.

Só que muitas das ferramentas disponíveis ainda são bastante falhas, classificando textos humanos como “feitos por IA” e vice-versa. Um pesquisador chamado Jochen Madler se cansou disso e idealizou um sistema que não apenas diz se um texto foi escrito por IA ou não, mas também se foi escrito por um humano que simplesmente se dedicou a parafrasear o resultado fornecido pela IA. Segundo ele, a taxa de acertos fica próxima de 98%.

O estudo se intitula “SlopShape” e, nele, Madler explica que o sistema analisou uma série de textos que o modelo nunca havia visto e alcançou os já mencionados 98% de sucesso ao classificar se haviam sido escritos por uma IA ou por um humano do início ao fim.

Segundo o pesquisador, o sistema não lê o texto e emite um veredito. Em vez disso, um modelo de linguagem responde a um questionário com mais de 200 perguntas sobre a estrutura de cada publicação. Especificamente, analisa a ordem em que as ideias são apresentadas, se o artigo antecipa sua estrutura, observa onde a tese aparece, como as fontes são apresentadas, a orientação prática do artigo e se o texto termina repetindo ou reformulando a conclusão.

O experimento

Para colocar seu sistema à prova, Madler reuniu 2.250 posts de blogs de 268 empresas de comunicação, todos publicados antes do lançamento do ChatGPT e recuperados usando a Wayback Machine. Em seguida, pediu a cinco modelos (GPT-5.4, Claude Sonnet 4.6, Gemini 3 Flash, DeepSeek V3.2 e Kimi K2.5) que escrevessem sua própria versão a partir de um resumo do conteúdo original.

No total, foram 11.250 versões geradas por esses modelos, escritas e reescritas novamente, para verificar até que ponto seu sistema conseguia identificar mudanças, das mais profundas às menores. O resultado foi que, nos testes, obteve cerca de 97-98 de “macro F1”, uma métrica que combina precisão e cobertura para humanos e IA.

Jochen Madler Imagem: Jochen Madler

Quando os textos eram reescritos várias vezes usando a IA, esse macro F1 variava muito pouco. Só caiu significativamente quando características de estilo eram alteradas (com uma pontuação de 88,1). A conclusão é que a IA deixa uma marca na arquitetura do discurso, produzindo textos previsíveis, muito mastigados e com conclusões repetitivas. De fato, segundo os testes, em 79% das ocasiões o sistema conseguia até mesmo apontar qual modelo havia escrito cada texto com base nos “trejeitos” de cada um deles.

A forma do slop

E aqui está o ponto central: o que dá pistas à ferramenta é o que dá título à pesquisa, algo chamado de “forma do slop”. Segundo Madler, ela costuma ter estas características:

  • Forma muito ordenada, às vezes com bullet points iniciais que indicam as seções.
  • O título promete exatamente o que o artigo vai entregar, sem acrescentar contexto tangencial.
  • A introdução apresenta imediatamente a tese e depois segue uma estrutura de “definição, vantagens, etapas, erros e recomendações”, como se fosse um guia ou especialista.
  • A conclusão termina parafraseando a ideia que já havia sido anunciada na introdução.

Há outros fatores, como afirmações sem fontes, estatísticas sem contexto ou uma espécie de listas de prós e contras que são sempre equilibradas e não acrescentam nada.

No entanto, o fato de essas características serem cumpridas não demonstra sempre que um texto tenha sido escrito por uma IA. Na verdade, na imprensa e antes do ChatGPT, encontramos agências de comunicação que divulgavam mensagens seguindo essa estrutura tão corporativa. Isso faz sentido porque são os textos que foram usados no estudo e também aqueles com os quais as IAs das diferentes empresas foram treinadas (entre tantas e tantas coisas roubadas para esse treinamento, é claro).

Jochen Madler 2 O fato de uma entrevista apresentada de forma mais narrativa ter essa pontuação não pega bem para a ferramenta

Além disso, o estudo foi feito com artigos em inglês, portanto não pode ser aplicado a outros idiomas nem a qualquer texto escrito na Internet. A conclusão é que o que caracteriza as formações é a combinação repetida desses fatores e, sobretudo, os textos excessivamente longos que não apenas não acrescentam nada, mas também não apresentam uma progressão de ideias.

Por enquanto, o trabalho de Madler é apenas mais uma pesquisa sobre algo que, evidentemente, é um problema. Em uma era na qual, a cada dois segundos, são lançados mais e mais modelos de fronteira, são necessárias ferramentas para distinguir quem fez cada texto.

Imagens | Jochen Madler

Este texto foi traduzido/adaptado do site Xataka Espanha.


Inicio