返回
Improved hybrid text summarization system using deep contextualized embeddings and statistical features
DOI:10.1007/s11042-024-19524-x.png)
摘要
En 中文
在当今这个数字世界中,互联网上每天产生的海量文本材料,使得自动生成类人摘要的系统需求极为迫切。过去,已提出多种抽取式文本摘要方法,这些方法或采用统计技术,或采用语义技术。因此,我们开发了一种新颖的文本摘要混合模型AttSum-Hybrid,该模型在创建文档抽取式摘要时,不仅考虑了语言语境和文本之间的关系,还捕捉了句子的结构信息。这一混合摘要框架结合了基于深度学习的语境模型与基于统计特征模型的框架。BERT(Transformer双向编码器表示)被用作语境化表示模型中的特征提取器。为了从文本序列中学习语义和句法关系,该模型还使用了卷积双向长短期记忆网络(Convolutional Bi-LSTM)。另一方面,我们开发了一个统计特征表示框架,该框架纳入了若干性能更优的句子评分特征。在Daily Mail语料库上,R-1、R-2、R-L指标的ROUGE召回分数分别为38.67、15.37、34.12;而在DUC 2002数据集上,ROUGE分数则分别为59.74、28.80、57.87。通过在合并的CNN/Daily Mail数据集上进行实验,获得了全长度ROUGE F1分数43.15、20.08和39.55。总体而言,我们提出的混合摘要模型相较于当前最先进的基线技术取得了更优的结果。这些结果进一步由三名人类专家执行的两种摘要验证任务(问答任务和抽取摘要中共同句子的数量)进行了验证。
Keyword:
Extractive text summarization
Contextualized word embeddings
Statistical features
BERT (Bidirectional Encoder Representations from Transformers)
Deep Learning
CNN (Convolution Neural Networks)
Bi-LSTM (Bidirectional Long Short Term Memory)
Attention mechanism
期刊
IF:
3
论文数:
2.0W
被引数:
3.2W
机构
引用论文
A Hierarchical Structured Self-Attentive Model for Extractive Document Summarization (HSSAS)
IEEE ACCESS
IF3.6

