![]() |
| “As notícias falsas não são novidade, mas, agora, as máquinas também as produzem em larga escala e com uma fluência próxima à humana”, afirma o pós-graduando Arquivo pessoal |
Apresentado na 25ª Conferência EPIA, em Portugal, o estudo integra uma das frentes de pesquisa do projeto Synestech.ai
Imagine o cenário: em um dia comum,
você recebe no aplicativo de mensagens o link de uma notícia. Ao abrir,
suspeita que o conteúdo é falso – sem consistência jornalística, um endereço
eletrônico falsificado, título apelativo. Consulta um site oficial de checagem
de notícias e logo vê: trata-se de uma fake news. Mesmo com a
verificação feita, uma pergunta permanece: aquela notícia foi escrita por uma
pessoa ou gerada por uma inteligência artificial (IA)? Foi para
investigar essa questão que Pedro Lucas Castro de Andrade
desenvolveu sua pesquisa de mestrado.
Orientada pelo professor Thiago
Pardo e conduzida no Instituto de Ciências
Matemáticas e de Computação (ICMC) da USP, em São Carlos, a pesquisa foi
apresentada na 25ª Conferência EPIA em
Inteligência Artificial,
realizada em Portugal de 2 a 4 de setembro. O estudo integra uma das frentes de
pesquisa do projeto Synestech.ai, que além do ICMC, reúne o Instituto de Matemática, Estatística e
Ciência da Computação (IME) e o Inova USP.
Separando o humano da máquina – Pedro utilizou a análise linguística para desenvolver um modelo que
identifica as nuances gramaticais e estilísticas dos textos. A primeira camada
é a lexical, que compreende a análise do vocabulário, assim como a complexidade
das palavras, sua frequência e tamanho. A segunda é a morfossintática, que
identifica as classes gramaticais de cada palavra, contabilizando a quantidade
de substantivos, adjetivos, advérbios, entre outros. Já a terceira, é a
sintática, que observa como as orações são construídas e como as palavras se
relacionam. Por último, ocorre a análise de aspectos semânticos, em que a
plataforma estuda a relação entre os significados, além de aspectos como coesão
e coerência do texto.
A análise dessas características
revelou diferenças importantes entre os textos humanos e aqueles gerados por
máquinas. De modo geral, os textos humanos trazem construções mais
simplificadas, vocabulário mais acessível, além de um estilo próprio. Já os
gerados por IA tendem a utilizar palavras mais rebuscadas, orações coordenadas
e uma escrita padronizada. “Percebemos que, em todas essas camadas, o humano
tem uma variabilidade maior, ou seja, ele usa regras diferentes, desvios
diferentes. O que diz muito sobre nós, seres humanos, porque eu escrevo de uma
forma diferente do que o meu orientador escreve, por exemplo. E a máquina se
mostrou ser mais uniforme”, destaca Pedro.
Resultados – Segundo o pesquisador, o sistema de identificação desenvolvido em seu
estudo atingiu 98% de precisão. “Isso é algo que nos surpreendeu bastante,
porque foi logo na primeira rodada de experimento. Não esperávamos conseguir um
resultado tão assertivo”, avalia.
Para Thiago Pardo, a pesquisa é
relevante tanto do ponto de vista científico quanto em suas possíveis contribuições
para a sociedade. “É sobre caracterizar o discurso do humano e o da máquina e
conseguir identificar quem é quem. Isso é muito interessante do ponto de vista
de pesquisa científica”, ressalta o professor.
Pardo compara a aplicação da pesquisa
a um trabalho de linguística forense, capaz de identificar a origem de
conteúdos que circulam nos meios de comunicação. “Essa identificação pode
contribuir para o processo de responsabilização pela produção de determinado
conteúdo. É um trabalho interessante, que pouco aparece em outras línguas e do
qual não havia nada em português”, ressalta.
Como nasceu a pesquisa – Intitulada Separating Human from Machine:
Deep Linguistic Analysis and Automatic Classification of Fake News in Brazilian
Portuguese, a pesquisa analisou 10.782
documentos: metade produzida por autores humanos e, a outra metade, por
inteligência artificial. O conjunto de dados utilizado reúne notícias falsas
dos datasets Fake.br, de autoria do professor Thiago Pardo, e FakeTrueBR, corpora em português brasileiro criados para o treinamento de modelos
de detecção de desinformação. Junto das notícias falsas escritas por humanos,
são analisadas versões equivalentes geradas pelo Sabiá-3, modelo brasileiro de
IA generativa da empresa Maritaca AI.
Segundo Pedro, o crescimento do uso da IA amplia a capacidade de produzir e disseminar desinformação. Dados do 1º Panorama da Desinformação no Brasil, lançado pelo Observatório Lupa em 2026, mostram que a presença de inteligência artificial nos conteúdos falsos monitorados pela agência passou de 4,65%, em 2024, para 25,77%, em 2025. “É nesse contexto que entram as IAs generativas, como o ChatGPT, que servem como arma para criar novas notícias falsas. Com um prompt você escreve um texto que consegue se proliferar numa velocidade tremenda”, explica.
Synestech.Ai – O nome do Synestech.ai é inspirado na sinestesia, fenômeno em
que o estímulo do sentido provoca uma experiência associada a outro. “O projeto
carrega esse nome porque traz tanto a parte da linguagem quanto visão
computacional e processamento de imagens”, explica Thiago Pardo.
Ao explorar abordagens de
inteligência artificial unimodais e multimodais, o projeto busca fomentar a
produção de pesquisas básicas e aplicadas. Pedro destaca que a integração entre
as diferentes frentes do projeto também ampliam justamente as possibilidades de
aplicação de seu trabalho: “É interessante porque o meu trabalho tem essa
abordagem de identificar textos de máquina, hoje restrita a notícias falsas,
mas que a gente pode expandir futuramente para diferentes gêneros textuais e
talvez abordagens em que justamente os colegas do projeto estejam atuando”.
Uma das frentes do projeto é ampliar
a capacidade das tecnologias de inteligência artificial para o contexto
brasileiro. “Temos a ambição de melhorar o processamento da língua portuguesa
no geral. Queremos ensinar a máquina a conseguir ler um texto em português,
fazer tudo aquilo que a gente aprende na escola: análise morfológica,
sintática, semântica, aplicando esse conhecimento em diferentes cenários”,
explica Thiago.
Projeção internacional – A participação na 25ª Conferência EPIA em Inteligência Artificial,
permitiu ao pesquisador observar tendências do processamento de linguagem
natural em diferentes países. Entre elas, o desenvolvimento de modelos capazes
de lidar com as características de cada língua, sem depender da mediação do
inglês, por exemplo. “Isso mostra que essa preocupação que alguns pesquisadores
e empresários do Brasil têm, também se reflete no português europeu”, observa.
Para Thiago Pardo, a participação em eventos internacionais amplia o alcance das pesquisas desenvolvidas no Brasil e promove o intercâmbio de pesquisadores. “É uma forma do mundo conhecer seu trabalho e de você ganhar visibilidade. Quando os artigos são publicados, as pessoas interessadas têm a oportunidade de ler, entrar em contato e contribuir para que a pesquisa continue caminhando”, conclui.
Raquel Sampaio - Fontes Comunicação Científica
Fonte: https://www.icmc.usp.br/noticias/7702-pesquisa-da-usp-usa-analise-linguistica-para-determinar-se-fake-news-sao-criadas-por-humanos-ou-por-inteligencia-artificial

Nenhum comentário:
Postar um comentário