Use este identificador para citar ou linkar para este item:
http://repositorio.utfpr.edu.br/jspui/handle/1/41312| Título: | Comparativo de modelos de linguagem ampla no diagnóstico automático de erros em fundamentos de programação |
| Título(s) alternativo(s): | Comparison of wide language models in programming fundamentals automatic error diagnosis |
| Autor(es): | Zampier, Pedro Otávio Probst |
| Orientador(es): | Maschio, Eleandro |
| Palavras-chave: | Programação (Computadores) TypeScript (Linguagem de programação de computadores) Inteligência artificial - Aplicações educacionais Computer programming TypeScript (Computer program language) Artificial intelligence - Educational applications |
| Data do documento: | 2-Jul-2026 |
| Editor: | Universidade Tecnológica Federal do Paraná |
| Câmpus: | Guarapuava |
| Citação: | ZAMPIER, Pedro Otávio Probst. Comparativo de modelos de linguagem ampla no diagnóstico automático de erros em fundamentos de programação. 72 f. Trabalho de Conclusão de Curso (Graduação) – Universidade Tecnológica Federal do Paraná, Guarapuava, 2025. |
| Resumo: | Introdução: O ensino de programação em cursos superiores enfrenta desafios significativos relacionados às elevadas taxas de reprovação e evasão, parcialmente atribuídas às dificuldades no diagnóstico de erros conceituais em códigos produzidos por iniciantes. Modelos de linguagem ampla (LLMs) têm mostrado capacidades promissoras na análise automatizada de código, porém os estudos existentes concentram-se majoritariamente em modelos individuais, sem análises comparativas que considerem o contexto educacional e os custos operacionais envolvidos. Objetivo: Estabelecer um comparativo, sobre a capacidade de diagnóstico automatizado de um subconjunto de erros em fundamentos de programação, na linguagem TypeScript, por quatro modelos de linguagem ampla (GPT-4, Claude, Gemini e DeepSeek), correlacionando desempenho técnico, qualidade pedagógica do feedback e viabilidade econômica de cada modelo. Metodologia: O desenvolvimento da pesquisa foi dividido em duas fases: (1) avaliação comparativa: (a) seleção e configuração dos modelos; (b) definição do subconjunto de erros; (c) adaptação do subconjunto de erros à linguagem TypeScript; (d) composição de um conjunto padronizado (corpus) de códigos de teste; (e) avaliação quantitativa dos modelos; (d) análise qualitativa dos modelos; e (f) correlação das avaliações com os custos operacionais dos modelos; e (2) implementação do protótipo de MVP (API REST). Resultados: O Gemini apresentou o maior percentual de acertos (86,0%), menor índice de alucinações e melhores médias qualitativas gerais. GPT-4 e DeepSeek obtiveram desempenho idêntico em acertos (78,7%), enquanto o Claude registrou o menor índice (74,7%) e o maior custo médio por requisição (US$ 0,0752). O DeepSeek destacou-se pela relação custo-benefício, com custos até 34 vezes inferiores aos do Claude. A análise evidenciou ainda que assertividade técnica e qualidade pedagógica do feedback não são dimensões equivalentes, e que erros de natureza estilística representam desafio maior para os modelos do que erros de natureza estrutural ou lógica. Como produto da pesquisa, foi desenvolvido um protótipo MVP na forma de uma API REST em Laravel com MariaDB, que utiliza o Laravel AI SDK para integrar os quatro LLMs avaliados em um mesmo fluxo de diagnóstico automático de erros. |
| Abstract: | Introduction: Programming education in higher education courses faces significant challenges related to high failure and dropout rates, partially attributed to difficulties in diagnosing conceptual errors in code produced by beginners. Large language models (LLMs) have shown promising capabilities in automated code analysis; however, existing studies focus mostly on individual models, lacking comparative analyses that consider the educational context and the operational costs involved. Objective: To establish a comparison regarding the automated diagnosis capability of a subset of errors in programming fundamentals, in the TypeScript language, by four large language models (GPT-4, Claude, Gemini, and DeepSeek), correlating technical performance, pedagogical quality of the feedback, and the economic viability of each model. Methodology: The research was divided into two phases: (1) comparative evaluation: (a) selection and configuration of the models; (b) definition of the subset of errors; (c) adaptation of the subset of errors to the TypeScript language; (d) composition of a standardized set (corpus) of test codes; (e) quantitative evaluation of the models; (f) qualitative analysis of the models; and (g) correlation of the evaluations with the operational costs of the models; and (2) implementation of the MVP prototype (REST API). Results: Gemini presented the highest percentage of correct diagnoses (86.0%), the lowest hallucination rate, and the best overall qualitative averages. GPT-4 and DeepSeek achieved identical performance in correct diagnoses (78.7%), while Claude registered the lowest rate (74.7%) and the highest average cost per request (US$ 0.0752). DeepSeek stood out for its cost-benefit ratio, with costs up to 34 times lower than those of Claude. The analysis further evidenced that technical accuracy and pedagogical quality of the feedback are not equivalent dimensions, and that errors of a stylistic nature represent a greater challenge for the models than errors of a structural or logical nature. As a product of the research, an MVP prototype was developed in the form of a REST API in Laravel with MariaDB, which uses the Laravel AI SDK to integrate the four evaluated LLMs into a single automated error diagnosis flow. |
| URI: | http://repositorio.utfpr.edu.br/jspui/handle/1/41312 |
| Aparece nas coleções: | GP - Tecnologia em Sistemas para Internet |
Arquivos associados a este item:
| Arquivo | Descrição | Tamanho | Formato | |
|---|---|---|---|---|
| comparativomodeloslinguagemampla.pdf | 400,08 kB | Adobe PDF | ![]() Visualizar/Abrir |
Este item está licenciada sob uma Licença Creative Commons

