Use este identificador para citar ou linkar para este item:
http://repositorio.utfpr.edu.br/jspui/handle/1/41231| Título: | Reconhecimento de expressões faciais com técnicas de visão computacional |
| Título(s) alternativo(s): | Facial expression recognition with computer vision techniques |
| Autor(es): | Casanova, Daniel Squinalli |
| Orientador(es): | Paula Filho, Pedro Luiz de |
| Palavras-chave: | Reconhecimento facial (Computação) Redes neurais (Computação) Visão por Computador Human face recognition (Computer science) Neural networks (Computer science) Computer vision |
| Data do documento: | 24-Jun-2025 |
| Editor: | Universidade Tecnológica Federal do Paraná |
| Câmpus: | Medianeira |
| Citação: | CASANOVA, Daniel Squinalli. Reconhecimento de expressões faciais com técnicas de visão computacional. 2026. Trabalho de Conclusão de Curso (Bacharelado em Ciência da Computação) - Universidade Tecnológica Federal do Paraná, Medianeira, 2025. |
| Resumo: | Este trabalho investiga estratégias para o reconhecimento de expressões faciais por meio de Convolutional Neural Network (CNN) e Vision Transformer (ViT), avaliando diferentes formas de entrada: imagens faciais completas, pontos de referência (landmarks) e combinações mistas. Foram realizados experimentos com os conjuntos de dados Facial Expression Recognition 2013 Dataset (FER-2013), Facial Expression Recognition Plus (FER+) e Real-world Affective Faces Database (RAF-DB), aplicando abordagens com imagens originais, landmarks extraídos via MediaPipe e dlib, e configurações que mesclam essas fontes de informação. Os resultados demonstraram que o modelo ViT, com entrada baseada apenas em imagens completas, obteve o melhor desempenho geral, com F1-scores de até 0,8179 no RAF-DB. Em contrapartida, a CNN se mostrou mais eficiente em tempo de inferência, sendo indicada para aplicações em tempo real. As abordagens com landmarks apresentaram resultados inferiores, mas destacaram-se pela eficiência e preservação de privacidade, especialmente quando extraídos com MediaPipe. A abordagem mista, combinando imagem e landmarks, trouxe ganhos apenas em configurações específicas com CNN, sem superar consistentemente os métodos baseados apenas em imagem. A análise de perda de amostras revelou que o MediaPipe proporcionou maior robustez na extração de landmarks em comparação ao dlib. Conclui-se que, embora a entrada visual completa com ViT seja a mais precisa, abordagens geométricas e mistas ofere cem alternativas promissoras em contextos com restrições de privacidade ou processamento, sendo a escolha da abordagem ideal dependente do cenário de aplicação. |
| Abstract: | This work investigates strategies for facial expression recognition using convolutional neural networks (CNN) and vision transformers (ViT), evaluating different types of input: full facial images, facial landmarks, and mixed combinations. Experiments were conducted on the FER 2013, FER+, and RAF-DB datasets, applying approaches based on original images, landmarks extracted via MediaPipe and dlib, and configurations that combine these sources. The results showed that the ViT model, using only full-image input, achieved the best overall performance, with F1-scores reaching up to 0.8179 on RAF-DB. In contrast, CNN proved to be more efficient in inference time, making it suitable for real-time applications. Landmark-based approaches showed lower performance but stood out for their efficiency and privacy preservation, especially when using MediaPipe. The mixed approach, combining images and landmarks, yielded gains only in specific CNN configurations, without consistently outperforming image-only methods. The image loss analysis revealed that MediaPipe provided greater robustness in landmark extraction compared to dlib. It is concluded that while full-image input with ViT is the most accurate, geometric and mixed approaches offer promising alternatives in contexts with privacy or processing constraints, with the ideal choice depending on the application scenario. |
| URI: | http://repositorio.utfpr.edu.br/jspui/handle/1/41231 |
| Aparece nas coleções: | MD - Ciência da Computação |
Arquivos associados a este item:
| Arquivo | Descrição | Tamanho | Formato | |
|---|---|---|---|---|
| reconhecimentoexpressoesfaciais.pdf | 12,02 MB | Adobe PDF | ![]() Visualizar/Abrir |
Este item está licenciada sob uma Licença Creative Commons

