返回
Explainable Recommendation with Simulated Human Feedback
DOI:10.1145/3758091.png)
摘要
En 中文
近年来,可解释推荐领域的最新进展通过阐明决策制定的依据,极大地提升了用户体验。然而,现有方法因依赖传统监督学习范式处理稀疏交互数据,实际上未能为可能更好或更差的生成解释提供有效的反馈信号。为解决这些问题,我们提出了一种新颖的人类类反馈驱动的优化框架。该框架采用动态交互优化机制,在无需高昂人力成本的情况下实现以人为中心的可解释性要求。具体而言,我们提出利用大型语言模型(LLMs)作为人类模拟器,预测人类类反馈以指导学习过程。为使LLMs深入理解任务本质并满足用户多样化的个性化需求,我们引入了一种基于人类引导的定制化奖励评分方法,该方法有助于激发LLMs的语言理解与逻辑推理能力。此外,考虑到不同解释质量视角间的潜在冲突,我们引入了一种原则性的帕累托优化,将多视角质量提升任务转化为多目标优化问题,以改进解释性能。最后,为实現高效模型训练,我们设计了一个离策略优化流水线。通过引入回放缓冲区并处理数据分布偏差,能够有效提升数据利用率并增强模型泛化能力。在四个数据集上的广泛实验证明了我们方法的优势。
期刊
IF:
9.1
论文数:
1.2K
被引数:
4.7K
机构
暂无机构信息
引用论文
Hao Cheng, Shuo Wang, Wensheng Lu, Wei Zhang, Mingyang Zhou, Kezhong Lu, and Hao Liao. 2023. Explainable recommendation with personalized review retrieval and aspect learning. In 61st Annual Meeting of the Association for Computational Linguistics (ACL ’23). Association for Computational Linguistics, 51–64.Hao Cheng, Shuo Wang, Wensheng Lu, Wei Zhang, Mingyang Zhou, Kezhong Lu, and Hao Liao. 2023. 基于个性化评论检索和方面学习的可解释推荐。载于第61届计算语言学协会年度会议(ACL ’23)。计算语言学协会,51–64。
Jerrold H. Zar. 2005. Spearman rank correlation. Encyclopedia of Biostatistics, Vol. 7.Jerrold H. Zar. 2005. Spearman等级相关。生物统计学百科全书,第7卷。
UCEpic: Unifying Aspect Planning and Lexical Constraints for Generating Explanations in RecommendationUCEpic:统一方面规划和词汇约束以生成推荐解释

