Use este identificador para citar ou linkar para este item: http://repositorio.utfpr.edu.br/jspui/handle/1/41231
Registro completo de metadados
Campo DCValorIdioma
dc.creatorCasanova, Daniel Squinalli-
dc.date.accessioned2026-08-27T14:08:46Z-
dc.date.available2026-08-27T14:08:46Z-
dc.date.issued2025-06-24-
dc.identifier.citationCASANOVA, Daniel Squinalli. Reconhecimento de expressões faciais com técnicas de visão computacional. 2026. Trabalho de Conclusão de Curso (Bacharelado em Ciência da Computação) - Universidade Tecnológica Federal do Paraná, Medianeira, 2025.pt_BR
dc.identifier.urihttp://repositorio.utfpr.edu.br/jspui/handle/1/41231-
dc.description.abstractThis work investigates strategies for facial expression recognition using convolutional neural networks (CNN) and vision transformers (ViT), evaluating different types of input: full facial images, facial landmarks, and mixed combinations. Experiments were conducted on the FER 2013, FER+, and RAF-DB datasets, applying approaches based on original images, landmarks extracted via MediaPipe and dlib, and configurations that combine these sources. The results showed that the ViT model, using only full-image input, achieved the best overall performance, with F1-scores reaching up to 0.8179 on RAF-DB. In contrast, CNN proved to be more efficient in inference time, making it suitable for real-time applications. Landmark-based approaches showed lower performance but stood out for their efficiency and privacy preservation, especially when using MediaPipe. The mixed approach, combining images and landmarks, yielded gains only in specific CNN configurations, without consistently outperforming image-only methods. The image loss analysis revealed that MediaPipe provided greater robustness in landmark extraction compared to dlib. It is concluded that while full-image input with ViT is the most accurate, geometric and mixed approaches offer promising alternatives in contexts with privacy or processing constraints, with the ideal choice depending on the application scenario.pt_BR
dc.languageporpt_BR
dc.publisherUniversidade Tecnológica Federal do Paranápt_BR
dc.rightsopenAccesspt_BR
dc.rights.urihttp://creativecommons.org/licenses/by-nc-sa/4.0/pt_BR
dc.subjectReconhecimento facial (Computação)pt_BR
dc.subjectRedes neurais (Computação)pt_BR
dc.subjectVisão por Computadorpt_BR
dc.subjectHuman face recognition (Computer science)pt_BR
dc.subjectNeural networks (Computer science)pt_BR
dc.subjectComputer visionpt_BR
dc.titleReconhecimento de expressões faciais com técnicas de visão computacionalpt_BR
dc.title.alternativeFacial expression recognition with computer vision techniquespt_BR
dc.typebachelorThesispt_BR
dc.description.resumoEste trabalho investiga estratégias para o reconhecimento de expressões faciais por meio de Convolutional Neural Network (CNN) e Vision Transformer (ViT), avaliando diferentes formas de entrada: imagens faciais completas, pontos de referência (landmarks) e combinações mistas. Foram realizados experimentos com os conjuntos de dados Facial Expression Recognition 2013 Dataset (FER-2013), Facial Expression Recognition Plus (FER+) e Real-world Affective Faces Database (RAF-DB), aplicando abordagens com imagens originais, landmarks extraídos via MediaPipe e dlib, e configurações que mesclam essas fontes de informação. Os resultados demonstraram que o modelo ViT, com entrada baseada apenas em imagens completas, obteve o melhor desempenho geral, com F1-scores de até 0,8179 no RAF-DB. Em contrapartida, a CNN se mostrou mais eficiente em tempo de inferência, sendo indicada para aplicações em tempo real. As abordagens com landmarks apresentaram resultados inferiores, mas destacaram-se pela eficiência e preservação de privacidade, especialmente quando extraídos com MediaPipe. A abordagem mista, combinando imagem e landmarks, trouxe ganhos apenas em configurações específicas com CNN, sem superar consistentemente os métodos baseados apenas em imagem. A análise de perda de amostras revelou que o MediaPipe proporcionou maior robustez na extração de landmarks em comparação ao dlib. Conclui-se que, embora a entrada visual completa com ViT seja a mais precisa, abordagens geométricas e mistas ofere cem alternativas promissoras em contextos com restrições de privacidade ou processamento, sendo a escolha da abordagem ideal dependente do cenário de aplicação.pt_BR
dc.degree.localMedianeirapt_BR
dc.publisher.localMedianeirapt_BR
dc.contributor.advisor1Paula Filho, Pedro Luiz de-
dc.contributor.advisor-co1Hoffmann, Alessandra Bortoletto Garbelotti-
dc.contributor.referee1Silva, Hamilton Pereira da-
dc.contributor.referee2Aikes Junior, Jorge-
dc.contributor.referee3Paula Filho, Pedro Luiz de-
dc.publisher.countryBrasilpt_BR
dc.publisher.programCiência da Computaçãopt_BR
dc.publisher.initialsUTFPRpt_BR
dc.subject.cnpqCNPQ::CIENCIAS EXATAS E DA TERRA::CIENCIA DA COMPUTACAOpt_BR
Aparece nas coleções:MD - Ciência da Computação

Arquivos associados a este item:
Arquivo Descrição TamanhoFormato 
reconhecimentoexpressoesfaciais.pdf12,02 MBAdobe PDFThumbnail
Visualizar/Abrir


Este item está licenciada sob uma Licença Creative Commons Creative Commons