Abstract:
RESUMO: A crescente produção de conteúdo textual e audiovisual em plataformas de mídias sociais tem ampliado as possibilidades de investigação sobre a percepção pública em temas sensíveis, como violência urbana e operações policiais no Brasil, ao mesmo tempo em que
introduz desafios associados à informalidade linguística, à ausência de bases anotadas
e à forte heterogeneidade entre plataformas. Esta dissertação apresenta um arcabouço
integrado para análise dessa percepção pública, estruturado em três eixos complementares
que abordam desde a inferência de posicionamento em comentários até a identificação au-
tomática de eventos reais em vídeos de violência urbana. No primeiro eixo, desenvolvemos
e avaliamos modelos de detecção de posicionamento aplicados a comentários do YouTube,
demonstrando que arquiteturas baseadas em transformers, especialmente o BERTimbau,
superam abordagens tradicionais mesmo diante de textos ruidosos e heterogêneos. No
segundo eixo, ampliamos a análise para um cenário interplataformas, utilizando dados do
X/Twitter e do YouTube e introduzindo uma estratégia de anotação híbrida que combina
rótulos humanos com validação automática por LLMs, garantindo maior consistência
semântica e confiabilidade nas anotações. Os experimentos revelam que modelos treinados
no X/Twitter generalizam melhor para o YouTube do que o inverso, evidenciando diferenças estruturais entre ecossistemas discursivos e reforçando a importância de considerar
especificidades linguísticas no desenvolvimento de modelos de PLN em português brasileiro.
No terceiro eixo, avançamos da análise textual para a organização de vídeos por evento
real, propondo duas heurísticas não supervisionadas baseadas exclusivamente em atributos
textuais, uma semântica e outra temporal. Os resultados mostram que a heurística temporal, fundamentada em janelas de publicação e recorrência de entidades nomeadas, supera
tanto a heurística semântica quanto uma linha de base baseada em GPT-4, alcançando
acurácia próxima de 0,90 e NMI superior a 0,95 em cenários de monitoramento contínuo.
As contribuições desta dissertação incluem novas bases de dados anotadas em português,
heurísticas originais para agrupamento de vídeos, um estudo sistemático sobre transferência
entre plataformas e um arcabouço completo para monitoramento de percepções sobre
segurança pública em larga escala. A principal contribuição deste trabalho é metodológica,
por meio de um arcabouço de mineração textual aplicado à percepção sobre segurança
pública. Os resultados demonstram que abordagens leves, adaptadas ao domínio e apoiadas
por estratégias de anotação híbrida, podem superar métodos genéricos de última geração,
reforçando o potencial das mídias sociais como fonte estruturada de conhecimento e forne-
cendo subsídios metodológicos e práticos para pesquisas futuras e aplicações voltadas à
análise e monitoramento de segurança no Brasil. ABSTRACT: The growing production of textual and audiovisual content on social media platforms has
expanded the possibilities for investigating public perception on sensitive topics such as
urban violence and police operations in Brazil, while simultaneously introducing challenges
related to linguistic informality, the lack of annotated datasets, and strong cross-platform
heterogeneity. This dissertation presents an integrated framework for analyzing public
perception, structured into three complementary axes that span from stance inference in
comments to the automatic identification of real-world events in videos depicting urban
violence. In the first axis, we develop and evaluate stance detection models applied to
YouTube comments, showing that transformer-based architectures, especially BERTimbau,
outperform traditional approaches even in the presence of noisy and heterogeneous texts.
In the second axis, we extend the analysis to a cross-platform setting using data from
X/Twitter and YouTube, and introduce a hybrid annotation strategy that combines human
labels with automatic validation by large language models (LLMs), thereby increasing
the semantic consistency and reliability of annotations. Experiments reveal that models
trained on X/Twitter generalize better to YouTube than the reverse, highlighting structural
di!erences between discursive ecosystems and reinforcing the importance of accounting
for linguistic specificities when developing NLP models for Brazilian Portuguese. In the
third axis, we move from textual analysis to the organization of videos by real-world event,
proposing two unsupervised heuristics based solely on textual attributes, one semantic
and the other temporal. Results show that the temporal heuristic, grounded in publication
windows and recurrence of named entities, outperforms both the semantic heuristic and a
GPT-4-based baseline, achieving accuracy close to 0.90 and NMI above 0.95 in continuous
monitoring scenarios. The contributions of this dissertation include new annotated datasets
in Portuguese, original heuristics for video clustering, a systematic study of cross-platform
transfer, and a complete framework for large-scale monitoring of public perceptions about
security. The main contribution of this work is methodological, through a text mining
framework applied to the analysis of public perceptions about security. Overall, the
findings demonstrate that lightweight, domain-adapted approaches supported by hybrid
annotation strategies can outperform generic state-of-the-art methods, reinforcing the
potential of social media as a structured source of knowledge and providing methodological
and practical insights for future research and applications focused on security analysis and
monitoring in Brazil.