Repositório Institucional da UFPI

Mineração de padrões textuais sobre seguraça pública: modelos e aplicações em plataformas de mídias sociais

DSpace/Manakin Repository

Show simple item record

dc.contributor.author ROCHA, Saul Sousa da
dc.date.accessioned 2026-07-24T13:54:42Z
dc.date.available 2026-07-24T13:54:42Z
dc.date.issued 2026-07-24
dc.identifier.uri http://hdl.handle.net/123456789/4212
dc.description Orientador: Prof. Dr. Glauber Dias Gonçalves Coorientador: Prof. Dr. Carlos Henrique Gomes Ferreira Examinador interno: Prof. Dr. Raimundo Santos Moura (UFPI) Examinador externo: Prof. Dr. Vinícius Fonseca Vieira (UFSJ) Examinador externo: Prof. Dr. Idílio Drago (UNITO) pt_BR
dc.description.abstract RESUMO: A crescente produção de conteúdo textual e audiovisual em plataformas de mídias sociais tem ampliado as possibilidades de investigação sobre a percepção pública em temas sensíveis, como violência urbana e operações policiais no Brasil, ao mesmo tempo em que introduz desafios associados à informalidade linguística, à ausência de bases anotadas e à forte heterogeneidade entre plataformas. Esta dissertação apresenta um arcabouço integrado para análise dessa percepção pública, estruturado em três eixos complementares que abordam desde a inferência de posicionamento em comentários até a identificação au- tomática de eventos reais em vídeos de violência urbana. No primeiro eixo, desenvolvemos e avaliamos modelos de detecção de posicionamento aplicados a comentários do YouTube, demonstrando que arquiteturas baseadas em transformers, especialmente o BERTimbau, superam abordagens tradicionais mesmo diante de textos ruidosos e heterogêneos. No segundo eixo, ampliamos a análise para um cenário interplataformas, utilizando dados do X/Twitter e do YouTube e introduzindo uma estratégia de anotação híbrida que combina rótulos humanos com validação automática por LLMs, garantindo maior consistência semântica e confiabilidade nas anotações. Os experimentos revelam que modelos treinados no X/Twitter generalizam melhor para o YouTube do que o inverso, evidenciando diferenças estruturais entre ecossistemas discursivos e reforçando a importância de considerar especificidades linguísticas no desenvolvimento de modelos de PLN em português brasileiro. No terceiro eixo, avançamos da análise textual para a organização de vídeos por evento real, propondo duas heurísticas não supervisionadas baseadas exclusivamente em atributos textuais, uma semântica e outra temporal. Os resultados mostram que a heurística temporal, fundamentada em janelas de publicação e recorrência de entidades nomeadas, supera tanto a heurística semântica quanto uma linha de base baseada em GPT-4, alcançando acurácia próxima de 0,90 e NMI superior a 0,95 em cenários de monitoramento contínuo. As contribuições desta dissertação incluem novas bases de dados anotadas em português, heurísticas originais para agrupamento de vídeos, um estudo sistemático sobre transferência entre plataformas e um arcabouço completo para monitoramento de percepções sobre segurança pública em larga escala. A principal contribuição deste trabalho é metodológica, por meio de um arcabouço de mineração textual aplicado à percepção sobre segurança pública. Os resultados demonstram que abordagens leves, adaptadas ao domínio e apoiadas por estratégias de anotação híbrida, podem superar métodos genéricos de última geração, reforçando o potencial das mídias sociais como fonte estruturada de conhecimento e forne- cendo subsídios metodológicos e práticos para pesquisas futuras e aplicações voltadas à análise e monitoramento de segurança no Brasil. ABSTRACT: The growing production of textual and audiovisual content on social media platforms has expanded the possibilities for investigating public perception on sensitive topics such as urban violence and police operations in Brazil, while simultaneously introducing challenges related to linguistic informality, the lack of annotated datasets, and strong cross-platform heterogeneity. This dissertation presents an integrated framework for analyzing public perception, structured into three complementary axes that span from stance inference in comments to the automatic identification of real-world events in videos depicting urban violence. In the first axis, we develop and evaluate stance detection models applied to YouTube comments, showing that transformer-based architectures, especially BERTimbau, outperform traditional approaches even in the presence of noisy and heterogeneous texts. In the second axis, we extend the analysis to a cross-platform setting using data from X/Twitter and YouTube, and introduce a hybrid annotation strategy that combines human labels with automatic validation by large language models (LLMs), thereby increasing the semantic consistency and reliability of annotations. Experiments reveal that models trained on X/Twitter generalize better to YouTube than the reverse, highlighting structural di!erences between discursive ecosystems and reinforcing the importance of accounting for linguistic specificities when developing NLP models for Brazilian Portuguese. In the third axis, we move from textual analysis to the organization of videos by real-world event, proposing two unsupervised heuristics based solely on textual attributes, one semantic and the other temporal. Results show that the temporal heuristic, grounded in publication windows and recurrence of named entities, outperforms both the semantic heuristic and a GPT-4-based baseline, achieving accuracy close to 0.90 and NMI above 0.95 in continuous monitoring scenarios. The contributions of this dissertation include new annotated datasets in Portuguese, original heuristics for video clustering, a systematic study of cross-platform transfer, and a complete framework for large-scale monitoring of public perceptions about security. The main contribution of this work is methodological, through a text mining framework applied to the analysis of public perceptions about security. Overall, the findings demonstrate that lightweight, domain-adapted approaches supported by hybrid annotation strategies can outperform generic state-of-the-art methods, reinforcing the potential of social media as a structured source of knowledge and providing methodological and practical insights for future research and applications focused on security analysis and monitoring in Brazil. pt_BR
dc.description.sponsorship Fundação de Amparo à Pesquisa do Estado do Piauí - FAPEPI pt_BR
dc.language.iso other pt_BR
dc.subject PLN pt_BR
dc.subject Detecção de Posicionamentos pt_BR
dc.subject Operações Policiais pt_BR
dc.subject Monitora- mento pt_BR
dc.subject Mídias Sociais pt_BR
dc.subject NLP pt_BR
dc.subject Monitoring pt_BR
dc.subject Social Media pt_BR
dc.subject Stance Detection pt_BR
dc.subject Police Operations pt_BR
dc.title Mineração de padrões textuais sobre seguraça pública: modelos e aplicações em plataformas de mídias sociais pt_BR
dc.type Preprint pt_BR


Files in this item

This item appears in the following Collection(s)

Show simple item record

Search DSpace


Advanced Search

Browse

My Account