返回
Semantic Text Kernels: A hybrid interpretable framework for deep semantic analysis in textual data
DOI:10.1016/j.engappai.2025.113568.png)
摘要
En 中文
文本核函数通过数学函数直接从文本计算相似性,从而允许对文本数据进行可解释且结构化的分析。传统上,文本核函数仅依赖句法特征,这限制了它们捕捉深层语义关系的能力。本研究引入了一个新颖的框架,将先进的人工智能技术(具体为语义词嵌入)与传统文本核函数相结合,以提高文本分类任务的准确性。核函数通过余弦相似度度量从深度词嵌入创建。由此创建的词嵌入核函数与其他文本核函数的结合产生了二十二种语义文本核函数。此外,采用基于主题空间的技术来减小文本数据集的规模,从而提升可扩展性和计算效率。所得的语义核函数应用于人工智能驱动的文本分类任务,在基准数据集上实现了性能提升。作为说明性结果,我们在Movie Review数据集上观察到绝对性能提升了4.19%,在Stanford Sentiment Treebank二元数据集上提升了0.96%,在Reuters八分类数据集上提升了1.20%,在20 Newsgroups数据集上提升了5.50%。这项工作代表了可解释文本分析和自然语言理解领域的重要进展,有效地弥合了传统文本核函数与现代基于深度学习的词嵌入之间的差距。
期刊
IF:
8
论文数:
5.7K
被引数:
3.5W
机构
引用论文
Generative non-autoregressive unsupervised keyphrase extraction with neural topic modeling生成式非自回归无监督关键词提取与神经主题建模
Automated Machine Learning for Text Classification: Creating Ensembles of Classifiers through Evolutionary Hyper-Heuristics自动化机器学习用于文本分类:通过进化超启发式创建分类器集成
Deep label relevance and label ambiguity based multi-label feature selection for text classification基于深度标签相关性和标签模糊性的多标签特征选择方法用于文本分类

