Para citar este trabalho use um dos padrões abaixo:
The digitalization of public services has generated complex administrative documents, making Question Answering (QA) interfaces essential for citizen engagement. Retrieval-Augmented Generation (RAG) has emerged as the standard framework to ground these systems in proprietary knowledge bases while mitigating hallucinations. This paper evaluates three open-source embedding models, namely qwen3-embedding, bge-m3-embedding, and embedding-gemma, against proprietary OpenAI baselines within the Brazilian government's digital services catalog. We implemented four retrieval architectures: Dense, Hybrid (BM25 with Reciprocal Rank Fusion), and re-ranked variants using a cross-encoder. Evaluation used a synthetic dataset of 1,200 questions generated via the RAGAS framework, covering single-hop and multi-hop reasoning scenarios. Benchmarks show that open-source models with hybrid re-ranking achieve Recall@3 ≈ 0.82 and Recall@10 ≈ 0.93, matching proprietary performance. These findings demonstrate that open-source architectures are a technically viable and sovereign alternative for large-scale digital government initiatives.
Com ~200 mil publicações revisadas por pesquisadores do mundo todo, o Galoá impulsiona cientistas na descoberta de pesquisas de ponta por meio de nossa plataforma indexada.
Confira nossos produtos e como podemos ajudá-lo a dar mais alcance para sua pesquisa:
Esse proceedings é identificado por um DOI , para usar em citações ou referências bibliográficas. Atenção: este não é um DOI para o jornal e, como tal, não pode ser usado em Lattes para identificar um trabalho específico.
Verifique o link "Como citar" na página do trabalho, para ver como citar corretamente o artigo