Use este identificador para citar ou linkar para este item: http://repositorio.utfpr.edu.br/jspui/handle/1/41231
Título: Reconhecimento de expressões faciais com técnicas de visão computacional
Título(s) alternativo(s): Facial expression recognition with computer vision techniques
Autor(es): Casanova, Daniel Squinalli
Orientador(es): Paula Filho, Pedro Luiz de
Palavras-chave: Reconhecimento facial (Computação)
Redes neurais (Computação)
Visão por Computador
Human face recognition (Computer science)
Neural networks (Computer science)
Computer vision
Data do documento: 24-Jun-2025
Editor: Universidade Tecnológica Federal do Paraná
Câmpus: Medianeira
Citação: CASANOVA, Daniel Squinalli. Reconhecimento de expressões faciais com técnicas de visão computacional. 2026. Trabalho de Conclusão de Curso (Bacharelado em Ciência da Computação) - Universidade Tecnológica Federal do Paraná, Medianeira, 2025.
Resumo: Este trabalho investiga estratégias para o reconhecimento de expressões faciais por meio de Convolutional Neural Network (CNN) e Vision Transformer (ViT), avaliando diferentes formas de entrada: imagens faciais completas, pontos de referência (landmarks) e combinações mistas. Foram realizados experimentos com os conjuntos de dados Facial Expression Recognition 2013 Dataset (FER-2013), Facial Expression Recognition Plus (FER+) e Real-world Affective Faces Database (RAF-DB), aplicando abordagens com imagens originais, landmarks extraídos via MediaPipe e dlib, e configurações que mesclam essas fontes de informação. Os resultados demonstraram que o modelo ViT, com entrada baseada apenas em imagens completas, obteve o melhor desempenho geral, com F1-scores de até 0,8179 no RAF-DB. Em contrapartida, a CNN se mostrou mais eficiente em tempo de inferência, sendo indicada para aplicações em tempo real. As abordagens com landmarks apresentaram resultados inferiores, mas destacaram-se pela eficiência e preservação de privacidade, especialmente quando extraídos com MediaPipe. A abordagem mista, combinando imagem e landmarks, trouxe ganhos apenas em configurações específicas com CNN, sem superar consistentemente os métodos baseados apenas em imagem. A análise de perda de amostras revelou que o MediaPipe proporcionou maior robustez na extração de landmarks em comparação ao dlib. Conclui-se que, embora a entrada visual completa com ViT seja a mais precisa, abordagens geométricas e mistas ofere cem alternativas promissoras em contextos com restrições de privacidade ou processamento, sendo a escolha da abordagem ideal dependente do cenário de aplicação.
Abstract: This work investigates strategies for facial expression recognition using convolutional neural networks (CNN) and vision transformers (ViT), evaluating different types of input: full facial images, facial landmarks, and mixed combinations. Experiments were conducted on the FER 2013, FER+, and RAF-DB datasets, applying approaches based on original images, landmarks extracted via MediaPipe and dlib, and configurations that combine these sources. The results showed that the ViT model, using only full-image input, achieved the best overall performance, with F1-scores reaching up to 0.8179 on RAF-DB. In contrast, CNN proved to be more efficient in inference time, making it suitable for real-time applications. Landmark-based approaches showed lower performance but stood out for their efficiency and privacy preservation, especially when using MediaPipe. The mixed approach, combining images and landmarks, yielded gains only in specific CNN configurations, without consistently outperforming image-only methods. The image loss analysis revealed that MediaPipe provided greater robustness in landmark extraction compared to dlib. It is concluded that while full-image input with ViT is the most accurate, geometric and mixed approaches offer promising alternatives in contexts with privacy or processing constraints, with the ideal choice depending on the application scenario.
URI: http://repositorio.utfpr.edu.br/jspui/handle/1/41231
Aparece nas coleções:MD - Ciência da Computação

Arquivos associados a este item:
Arquivo Descrição TamanhoFormato 
reconhecimentoexpressoesfaciais.pdf12,02 MBAdobe PDFThumbnail
Visualizar/Abrir


Este item está licenciada sob uma Licença Creative Commons Creative Commons