1790977416 951 Pesquisadores encontram 13 mil pistas que podem denunciar textos escritos

Continua após a publicidade


Detectar um texto escrito por inteligência artificial pode ser muito mais complicado do que procurar travessões, frases excessivamente organizadas ou determinadas estruturas repetitivas. Uma nova pesquisa identificou cerca de 13 mil palavras e expressões que poderiam funcionar como pistas de conteúdo produzido por IA.

O levantamento foi realizado pela Graphite, uma empresa de marketing. Portanto, os resultados devem ser interpretados considerando a origem comercial da pesquisa.

Ainda assim, a análise encontrou diferenças curiosas entre textos produzidos por humanos e aqueles gerados por alguns dos modelos de inteligência artificial mais avançados disponíveis atualmente.

E uma das principais pistas é surpreendentemente simples: a expressão “this matters”, equivalente a “isso importa” ou “por que isso é importante”.

“Isso importa” virou uma das maiores pistas

Segundo a Graphite, a expressão “this matters” apareceu 116 vezes mais frequentemente nos textos produzidos por IA do que nas amostras escritas por humanos utilizadas na comparação.

O padrão foi particularmente evidente no Claude Opus 5.5, modelo da Anthropic.

Outras construções também apareceram com frequência elevada.

A expressão “looking ahead the” foi encontrada aproximadamente 40 vezes mais nos textos do Claude do que na escrita humana analisada.

Já estruturas equivalentes a “por que [algo] importa” apareceram 92 vezes mais frequentemente.

Até palavras aparentemente comuns podem funcionar como pistas estatísticas. O termo inglês “dependable”, que pode ser traduzido como “confiável”, apareceu 26 vezes mais nos textos do Claude do que nas amostras humanas.

Isso não significa que encontrar uma dessas expressões seja suficiente para concluir que um texto foi produzido por inteligência artificial.

O que os pesquisadores identificaram são diferenças de frequência observadas em grandes conjuntos de textos.

Astra tem seus próprios vícios de linguagem

O estudo também analisou o Astra, modelo da OpenAI, e encontrou padrões diferentes.

Uma das expressões que mais chamou atenção foi “does not establish”, equivalente a “não estabelece”.

Segundo a análise, ela apareceu 275 vezes mais frequentemente nos textos produzidos pelo Astra do que nas respostas do Claude utilizadas na comparação.

Os pesquisadores também encontraram diferenças mais amplas na maneira como os modelos constroem seus argumentos.

O Claude Opus 5.5 tende a fazer menos ressalvas ao apresentar determinadas afirmações e utiliza superlativos com maior frequência.

O Astra, por outro lado, apresenta uma tendência maior de qualificar afirmações e introduzir limitações ou ressalvas.

Essas características acabam criando uma espécie de impressão digital linguística para cada modelo.

Os travessões estão desaparecendo

Durante algum tempo, o uso excessivo do travessão longo, conhecido em inglês como em dash, tornou-se uma das características popularmente associadas aos textos gerados por IA.

Mas essa pista pode estar perdendo relevância.

Segundo o estudo, o Claude Opus 5.5 utiliza travessões 99% menos frequentemente do que seu antecessor, o Opus 5.

A mudança sugere que os modelos podem estar corrigindo padrões que passaram a ser associados à escrita artificial.

E isso cria um problema para quem tenta identificar conteúdo produzido por IA apenas observando determinados hábitos linguísticos.

Quando uma característica desaparece, outras podem surgir.

Claude estaria escrevendo cada vez mais como humanos

Uma das conclusões mais interessantes do levantamento é que os modelos não estão evoluindo todos na mesma direção.

Os textos produzidos pelo Claude estariam se aproximando progressivamente das amostras de escrita humana analisadas pela Graphite.

O Opus 5.5 parece ter eliminado ou reduzido algumas características encontradas em versões anteriores.

O Astra apresentou uma tendência diferente dentro da metodologia utilizada no estudo. Seus textos estariam ficando estatisticamente mais distintos das amostras humanas analisadas.

Isso não significa necessariamente que um modelo escreva “melhor” do que o outro. O levantamento mede padrões linguísticos e diferenças estatísticas, não a qualidade geral das respostas.

Detectores de IA enfrentam um problema crescente

As descobertas também ajudam a explicar por que identificar automaticamente textos escritos por inteligência artificial continua sendo uma tarefa complicada.

Nos últimos anos, surgiu um mercado de ferramentas que prometem determinar se determinado conteúdo foi escrito por uma pessoa ou por um modelo de linguagem.

Mas os próprios modelos estão mudando rapidamente.

Uma palavra ou estrutura que hoje aparece frequentemente em textos produzidos por IA pode praticamente desaparecer na próxima versão.

Além disso, seres humanos também podem utilizar exatamente as mesmas expressões.

Por isso, nenhuma dessas pistas isoladamente funciona como prova definitiva de autoria artificial.

A situação se parece com um jogo constante: quando um determinado padrão passa a denunciar um modelo, ele pode ser reduzido ou desaparecer, enquanto novos hábitos linguísticos surgem em seu lugar.

Se a tendência observada no Claude continuar, distinguir automaticamente textos humanos daqueles produzidos por inteligência artificial poderá se tornar ainda mais difícil.

 

Veja todas notícias sobre Tecnologia

Publicidade