Use este identificador para citar ou linkar para este item:
http://repositorio.utfpr.edu.br/jspui/handle/1/41221| Título: | Uso de large language models (LLMs) com retrieval augmented generation (RAG) e web scraping no processamento de linguagem natural |
| Título(s) alternativo(s): | Use of large language models (LLMs) with retrieval-augmented generation (RAG) and web scraping in natural language processing |
| Autor(es): | Conti, João Vitor |
| Orientador(es): | Pizzini, Evando Carlos |
| Palavras-chave: | Processamento de linguagem natural (Computação) Redes neurais (Computação) Compressão de dados (Computação) Natural language processing (Computer science) Neural networks (Computer science) Data compression (Computer science) |
| Data do documento: | 17-Jun-2025 |
| Editor: | Universidade Tecnológica Federal do Paraná |
| Câmpus: | Medianeira |
| Citação: | CONTI, João Vitor. Uso de large language models (LLMS) com retrieval augmented generation (RAG) e web scraping no processamento de linguagem natural. 2026. Trabalho de Conclusão de Curso (Bacharelado em Ciência da Computação) - Universidade Tecnológica Federal do Paraná, Medianeira, 2025. |
| Resumo: | Este trabalho desenvolve e avalia a implementação de pipelines utilizando a arquitetura de Retrieval-Augmented Generation (RAG) para responder a dúvidas sobre uma instituição de ensino. O objetivo principal foi construir pipelines capazes de processar informações de diferentes formatos de documentos — JSON, PDF e HTML — coletados de forma automatizada e com o mínimo de manipulação possível pelo uso de diferentes ferramentas para o Web Scraping nos portais da instituição. Esse processo envolveu a construção de um dataset com dados extraídos, o processamento e a vetorização desses dados com diferentes modelos de embedding, e a integração com diferentes estratégias de RAG que foram consideradas de acordo com o escopo dos dados. Os Large Language Models (LLMs) Gemma-2b e Llama3.2- 1b foram utilizados para gerar texto com base no contexto recuperado pelos pipelines. Os resultados foram avaliados com o framework RAGAS e demonstraram que a sinergia entre todas as etapas do sistema é essencial, envolvendo a qualidade da fonte de dados, a precisão do recuperador de informações e a fdelidade do modelo LLM. Enquanto o pipeline para dados estruturados (JSON) obteve bom desempenho com o modelo Gemma-2b, a complexidade crescente dos pipelines de arquivos PDF e HTML expôs as limitações das estratégias de recuperação implementadas, que se mostraram insufcientes para lidar com o ruído semântico, resultando em uma queda signifcativa na performance. Conclui-se que a viabilidade de chatbots com LLMs de menor porte depende de estratégias de RAG cada vez mais robustas, capazes de fornecer um contexto limpo e preciso para compensar as limitações dos modelos. |
| Abstract: | This work develops and evaluates the implementation of pipelines using RAG architecture to answer questions about an academic institution. The main objective was to build pipelines capable of processing information from different document formats — JSON, PDF, and HTML — collected automatically and with minimal possible manipulation through different approaches and tools for data scraping from the institution’s portals. This process involved the construction of datasets with the extracted data, the processing and vectorization of this data with different embedding models, and the integration with different RAG strategies that were considered according to the scope of the data. The LLMs Gemma-2b and Llama3.2-1b were used to generate text based on the context retrieved by the pipelines. The results were evaluated with the RAGAS framework and demonstrated that the synergy between all stages of the system is essential, involving the quality of the data source, the precision of the information retriever, and the fdelity of the LLM model. While the pipeline for structured data (JSON) achieved good performance with the Gemma-2b model, the growing complexity of the PDF and HTML fles pipelines exposed the limitations of the implemented retrieval trategies, which proved insuffcient to handle semantic noise, resulting in a signifcant drop in performance. It is concluded that the viability of chatbots with smaller-scale LLMs depends on increasingly robust RAG strategies, capable of providing a clean and precise context to compensate the models’ limitations. |
| URI: | http://repositorio.utfpr.edu.br/jspui/handle/1/41221 |
| Aparece nas coleções: | MD - Ciência da Computação |
Arquivos associados a este item:
| Arquivo | Descrição | Tamanho | Formato | |
|---|---|---|---|---|
| retrievalaugmentedgenerationlinguagem.pdf | 2,64 MB | Adobe PDF | ![]() Visualizar/Abrir |
Este item está licenciada sob uma Licença Creative Commons

