返回
Citation Context Extraction Using a Transformer-Based Model with a Question-Answering Task
DOI:10.1007/978-3-031-96262-2_19.png)
摘要
En 中文
准确提取引文上下文对于理解引文文献的影响和相关性至关重要,能够增强引文分析、文献综述自动化和知识图谱构建等科学计量任务。本文利用大型语言模型(RoBERTa)并在问答框架下对其进行微调,以有效提取科学文本中的引文上下文。传统的引文上下文提取方法采用固定窗口长度,往往难以捕捉引文上下文的细微特征和可变长度。我们利用RoBERTa等上下文感知Transformer模型的能力来克服这些限制,提高引文上下文提取的有效性。我们提出了一种新颖的方法,将下游任务视为类似问答任务的跨度提取问题,对RoBERTa模型进行微调。这种方法使模型能够根据特定的文本内引文动态识别和提取相关引文上下文,从而捕获更精确且上下文相关的文本片段。我们在两个基准数据集上,将我们的模型与使用固定窗口方法的四种基线方法进行了比较评估。我们的模型优于所有基线方法,在两个数据集上分别实现了95%和92%的F1分数。其对引文上下文可变性质的适应性带来了更准确的提取结果,证明了问答框架内跨度提取方法的有效性。这些结果表明,基于Transformer的模型有望显著提升从科学文献中提取引文上下文的能力。
Keyword:
Citation context extraction
Natural language processing
Transformers
期刊
机构
引用论文
Identification of citation and cited texts for fine‐grained citation content analysis识别引文和被引文本以进行细粒度引文内容分析
A Semantic Similarity-Based Identification Method for Implicit Citation Functions and Sentiments Information一种基于语义相似度的隐式引文功能及情感信息识别方法
Information
IF0
Cited text span identification for scientific summarisation using pre-trained encoders
SCIENTOMETRICS
IF3.5

