返回
An efficient two-stage computing method for large-scale research interest mining
DOI:10.1016/j.future.2025.108117.png)
摘要
En 中文
语义分析对于学术数据在许多科学服务中至关重要,例如评审推荐、规划研究资金方向。研究兴趣分析在大型学术数据挖掘中面临挑战。传统的研究兴趣表示方法,如人工标注、使用统计或机器学习方法,存在局限性。特别是在大规模多源信息集成中,计算量不可接受。本文提出了一种基于大规模推荐系统原理的学者兴趣预测高效计算方法,包括粗排和精排。在粗排中,采用独热编码、卡方特征选择、TF-IDF特征提取以及基于SGD的分类器来获取若干顶级兴趣标签。在精排中,预训练的SciBERT模型输出最优兴趣标签。所提出的方法具有两大主要优势。首先,它提高了计算效率,因为直接使用BERT等预训练模型处理大规模数据会导致计算量过大。其次,该算法确保了更好的模型性能。粗排阶段的特征选择可以避免无关论文对预测精度产生的负面影响,这是直接使用预训练模型时存在的问题。
期刊
F
IF:
0
论文数:
642
被引数:
0

