arrow
返回

EduRAG: A Multimodal Explainable RAG System With Deterministic Token Grounding

delete2026-06-16
delete0
delete
OA
AI
S
S. Amal
A
A. R. Niranjan
M
M.G. Thushara
DOI:10.1109/ACCESS.2026.3704123delete
delete原文链接
delete原文求助
delete分享
delete收藏
摘要

摘要

En 中文
大型语言模型(Large Language Models)提供了快速的信息访问途径,但在学术应用中往往不可靠。由于这一原因,它们经常生成事实错误的信息(即事实性幻觉),且很少提供可靠的引文。本研究中,我们介绍了EduRAG,一种多模态、可解释的检索增强生成模型,专门设计用于在教育领域建立信任。它包含一个混合信息检索系统,结合了BM25词汇匹配的优势,并融合了FAISS向量空间嵌入,通过假设文档嵌入(HyDE)查询扩展和MS-MARCO上的交叉编码器重排进行微调,作为优于其他方法的替代方案。为解决与常规归因方法(如SHAP值)相关的高计算成本带来的约束,我们引入了一个多级归因框架,能够通过交叉编码器证据分数实现对块级证据的透明检查,利用确定性词元级归因热图进行幻觉检测,以及通过不同检索来源之间的来源不一致性来识别矛盾。使用包含97个教育查询的自定义数据集进行的受控实验结果表明,EduRAG实现了0.7784的Mean Reciprocal Rank(MRR)得分和0.8763的Recall@5得分。针对15个特定图表查询的定向视觉评估显示,视觉MRR为0.967,Recall@5为100%,验证了视觉语言模型(VLM)支持的多模态检索。模型生成的答案获得0.8952的BERTScore F1得分、0.8924的忠实度得分、94%的可验证来源的引文有效性率以及85.5%的词元归因准确率。通过涉及三种检索模型的消融研究,验证了所提系统中各组件的影响。
Keyword:
Retrieval-augmented generation
educational technology
hybrid retrieval
explainable AI
document grounding
evidence attribution
multimodal information retrieval
hypothetical document embeddings (HyDE)
vision-language models (VLM)

期刊

IEEE Access 封面图
IEEE Access
IF:
3.6
论文数:
9.8W
被引数:
29.4W

机构

A
Amrita Vishwa Vidyapeetham
学者数:
7.0K
论文数: 4.2K
被引数: 3.3K
引用论文

引用论文

暂无论文信息