返回
Deploying and evaluating a conversational agent using LLMs for academic library reference
DOI:10.1108/RSR-05-2025-0030.png)
摘要
En 中文
本研究有两个目的。首先,我们旨在实现一个基于RAG的GenAI系统,能够回答参考问题。其次,我们旨在开发一个评估协议,通过比较使用三种不同LLMs的实现来评估聊天机器人。初步测试了评估量表,以评估其作为评估工具的可行性。设计/方法/方法基于RAG的聊天机器人采用两步方法。首先,针对查询,系统从知识库中检索相关文档。每个文档被向量化并按相关性匹配。其次,检索到的数据与LLM的生成能力相结合,生成上下文感知的响应。测试了14个代表知识库不同领域的常见问题,使用聊天机器人版本。研究团队开发了评估量表,并根据准确性、依据性、引出性、完整性和进一步协助对聊天机器人的响应进行评分。通过计算评审员评分的标准差来评估量表。研究发现,RAG实现基本上成功地限制了聊天机器人的响应范围在知识库内。评估量表在评估模型方面是有效的,突出了每个模型的优点和缺点。尽管评估具有主观性,但评估员给出了相似的评分,其中引出性维度的变化最大。创新性/价值本研究提供了一种在图书馆环境中实现基于RAG的聊天机器人的技术描述,以及一个评估此类聊天机器人的多维度协议,这在以前的文献中尚未讨论。
Keyword:
Information services
Reference services
Technological innovation
Assessment
Service delivery
Technological change

