Pesquisar no Blog

terça-feira, 29 de setembro de 2026

Pesquisa da USP usa análise linguística para determinar se fake news são criadas por humanos ou por inteligência artificia

 

“As notícias falsas não são novidade, mas, agora, as máquinas também
as produzem em larga escala e com uma fluência próxima à humana”,
afirma o pós-graduando
 Arquivo pessoal

Apresentado na 25ª Conferência EPIA, em Portugal, o estudo integra uma das frentes de pesquisa do projeto Synestech.ai

 

Imagine o cenário: em um dia comum, você recebe no aplicativo de mensagens o link de uma notícia. Ao abrir, suspeita que o conteúdo é falso – sem consistência jornalística, um endereço eletrônico falsificado, título apelativo. Consulta um site oficial de checagem de notícias e logo vê: trata-se de uma fake news. Mesmo com a verificação feita, uma pergunta permanece: aquela notícia foi escrita por uma pessoa ou gerada por uma inteligência artificial (IA)?  Foi para investigar essa questão que Pedro Lucas Castro de Andrade desenvolveu sua pesquisa de mestrado.

Orientada pelo professor Thiago Pardo e conduzida no Instituto de Ciências Matemáticas e de Computação (ICMC) da USP, em São Carlos, a pesquisa  foi apresentada na 25ª Conferência EPIA em Inteligência Artificial, realizada em Portugal de 2 a 4 de setembro. O estudo integra uma das frentes de pesquisa do projeto Synestech.ai, que além do ICMC, reúne o Instituto de Matemática, Estatística e Ciência da Computação (IME) e o Inova USP.

Separando o humano da máquina – Pedro utilizou a análise linguística para desenvolver um modelo que identifica as nuances gramaticais e estilísticas dos textos. A primeira camada é a lexical, que compreende a análise do vocabulário, assim como a complexidade das palavras, sua frequência e tamanho. A segunda é a morfossintática, que identifica as classes gramaticais de cada palavra, contabilizando a quantidade de substantivos, adjetivos, advérbios, entre outros. Já a terceira, é a sintática, que observa como as orações são construídas e como as palavras se relacionam. Por último, ocorre a análise de aspectos semânticos, em que a plataforma estuda a relação entre os significados, além de aspectos como coesão e coerência do texto.

A análise dessas características revelou diferenças importantes entre os textos humanos e aqueles gerados por máquinas. De modo geral, os textos humanos trazem construções mais simplificadas, vocabulário mais acessível, além de um estilo próprio. Já os gerados por IA tendem a utilizar palavras mais rebuscadas, orações coordenadas e uma escrita padronizada. “Percebemos que, em todas essas camadas, o humano tem uma variabilidade maior, ou seja, ele usa regras diferentes, desvios diferentes. O que diz muito sobre nós, seres humanos, porque eu escrevo de uma forma diferente do que o meu orientador escreve, por exemplo. E a máquina se mostrou ser mais uniforme”, destaca Pedro.

 

Resultados – Segundo o pesquisador, o sistema de identificação desenvolvido em seu estudo atingiu 98% de precisão. “Isso é algo que nos surpreendeu bastante, porque foi logo na primeira rodada de experimento. Não esperávamos conseguir um resultado tão assertivo”, avalia.

Para Thiago Pardo, a pesquisa é relevante tanto do ponto de vista científico quanto em suas possíveis contribuições para a sociedade. “É sobre caracterizar o discurso do humano e o da máquina e conseguir identificar quem é quem. Isso é muito interessante do ponto de vista de pesquisa científica”, ressalta o professor.

Pardo compara a aplicação da pesquisa a um trabalho de linguística forense, capaz de identificar a origem de conteúdos que circulam nos meios de comunicação. “Essa identificação pode contribuir para o processo de responsabilização pela produção de determinado conteúdo. É um trabalho interessante, que pouco aparece em outras línguas e do qual não havia nada em português”, ressalta.

Como nasceu a pesquisa – Intitulada Separating Human from Machine: Deep Linguistic Analysis and Automatic Classification of Fake News in Brazilian Portuguese, a pesquisa analisou 10.782 documentos: metade produzida por autores humanos e, a outra metade, por inteligência artificial. O conjunto de dados utilizado reúne notícias falsas dos datasets Fake.br, de autoria do professor Thiago Pardo, e FakeTrueBR, corpora em português brasileiro criados para o treinamento de modelos de detecção de desinformação. Junto das notícias falsas escritas por humanos, são analisadas versões equivalentes geradas pelo Sabiá-3, modelo brasileiro de IA generativa da empresa Maritaca AI.

Segundo Pedro, o crescimento do uso da IA amplia a capacidade de produzir e disseminar desinformação. Dados do 1º Panorama da Desinformação no Brasil, lançado pelo Observatório Lupa em 2026, mostram que a presença de inteligência artificial nos conteúdos falsos monitorados pela agência passou de 4,65%, em 2024, para 25,77%, em 2025. “É nesse contexto que entram as IAs generativas, como o ChatGPT, que servem como arma para criar novas notícias falsas. Com um prompt você escreve um texto que consegue se proliferar numa velocidade tremenda”, explica.

 

Synestech.Ai – O nome do Synestech.ai é inspirado na sinestesia, fenômeno em que o estímulo do sentido provoca uma experiência associada a outro. “O projeto carrega esse nome porque traz tanto a parte da linguagem quanto visão computacional e processamento de imagens”, explica Thiago Pardo.

Ao explorar abordagens de inteligência artificial unimodais e multimodais, o projeto busca fomentar a produção de pesquisas básicas e aplicadas. Pedro destaca que a integração entre as diferentes frentes do projeto também ampliam justamente as possibilidades de aplicação de seu trabalho: “É interessante porque o meu trabalho tem essa abordagem de identificar textos de máquina, hoje restrita a notícias falsas, mas que a gente pode expandir futuramente para diferentes gêneros textuais e talvez abordagens em que justamente os colegas do projeto estejam atuando”.

Uma das frentes do projeto é ampliar a capacidade das tecnologias de inteligência artificial para o contexto brasileiro. “Temos a ambição de melhorar o processamento da língua portuguesa no geral. Queremos ensinar a máquina a conseguir ler um texto em português, fazer tudo aquilo que a gente aprende na escola: análise morfológica, sintática, semântica, aplicando esse conhecimento em diferentes cenários”, explica Thiago.


Projeção internacional – A participação na 25ª Conferência EPIA em Inteligência Artificial, permitiu ao pesquisador observar tendências do processamento de linguagem natural em diferentes países. Entre elas, o desenvolvimento de modelos capazes de lidar com as características de cada língua, sem depender da mediação do inglês, por exemplo. “Isso mostra que essa preocupação que alguns pesquisadores e empresários do Brasil têm, também se reflete no português europeu”, observa.

Para Thiago Pardo, a participação em eventos internacionais amplia o alcance das pesquisas desenvolvidas no Brasil e promove o intercâmbio de pesquisadores. “É uma forma do mundo conhecer seu trabalho e de você ganhar visibilidade. Quando os artigos são publicados, as pessoas interessadas têm a oportunidade de ler, entrar em contato e contribuir para que a pesquisa continue caminhando”, conclui. 



Raquel Sampaio - Fontes Comunicação Científica


Fonte: https://www.icmc.usp.br/noticias/7702-pesquisa-da-usp-usa-analise-linguistica-para-determinar-se-fake-news-sao-criadas-por-humanos-ou-por-inteligencia-artificial



Nenhum comentário:

Postar um comentário

Posts mais acessados