arrow
返回

LLM-based feature generation from text for interpretable machine learning

delete2025-10-01
delete0
PRE
AI
V
Vojtěch Balek
L
Lukáš Sýkora
V
Vilém Sklenák
T
Tomáš Kliegr *
DOI:10.1007/s10994-025-06867-1delete
delete原文链接
delete原文求助
delete分享
delete收藏
摘要

摘要

En 中文
传统文本表示方法如嵌入和词袋模型,由于高维性和可理解性差,阻碍了规则学习和其他可解释机器学习方法。本文探讨了使用大型语言模型(LLMs)提取少量可解释文本特征的方法。我们提出了两种工作流程:一种由LLM完全自动完成(特征提案和值计算),另一种由用户定义特征而LLM计算值。这种基于LLM的特征提取使可解释规则学习成为可能,克服了词袋模型中出现的虚假可解释性等问题。我们在五个不同领域的数据集(包括科学计量学、银行业、仇恨言论和食品安全风险)上评估了所提出的方法。LLM生成的特征在预测性能上与SciBERT嵌入模型相当,但使用了远少且可解释的特征。人类用户认为大多数生成的特征对于相应的预测任务具有相关性。我们在一个案例研究中展示了其实用性,该研究专注于挖掘旨在提高研究论文质量和引用影响力的推荐行动规则。
Keyword:
Large language models
Feature extraction
Action rules

期刊

Machine Learning 封面图
Machine Learning
IF:
2.9
论文数:
2.7K
被引数:
3.4W

机构

D
Department of Information and Knowledge Engineering
学者数:
4
论文数: 2
被引数: 0
引用论文

引用论文

Predicting article quality scores with machine learning: The UK Research Excellence Framework用机器学习预测文章质量分数: 英国卓越研究框架
err2023-05-01
err9
errOAAI
errThelwall, Mike; Kousha, Kayvan; Wilson, Paul; Makita, Meiko; Abdoli, Mahshid; Stuart, Emma; Levitt, Jonathan; Knoth, Petr; Cancellieri, Matteo
err分享
err收藏
A survey on dataset quality in machine learning机器学习中数据集质量研究综述
err2023-10-01
err69
errOAAI
errGong, Youdi; Liu, Guangzhen; Xue, Yunzhi; Li, Rui; Meng, Lingzhong
err分享
err收藏
Why was this cited? Explainable machine learning applied to COVID-19 research literature
err2022-04-09
err12
errOAAI
errBeranova, Lucie; Joachimiak, Marcin P.; Kliegr, Tomas; Rabby, Gollam; Sklenak, Vilem
err分享
err收藏
Factors affecting number of citations: a comprehensive review of the literature
err2016-02-15
err470
PREAI
errTahamtan, Iman; Afshar, Askar Safipour; Ahamdzadeh, Khadijeh
err分享
err收藏
err分享
err收藏
Combining full-text analysis and bibliometric indicators.: A pilot study
err2005-03-01
err43
errOAAI
errGlenisson, P; Glänzel, W; Persson, O
err分享
err收藏
没有更多内容