返回
Contextual stroke embedding for Chinese sequence labeling
DOI:10.1016/j.csl.2026.102025.png)
摘要
En 中文
序列标注是自然语言处理中的一个基础而具有挑战性的任务。本文提出了一种基于笔画的方案的语言模型,称为上下文笔画嵌入(CSE),用于中文序列标注。所提出的方案基于汉字的内部结构,旨在从中文笔画序列中提取丰富的内部语义信息以及汉字间的上下文句法信息。该方案首先将汉字分解为笔画序列。然后,使用生成的序列训练一个笔画级语言模型,该模型包含一个两层BiLSTM网络架构以生成字符表示。该方法已在各种中文序列标注任务上进行了评估,包括命名实体识别、中文分词和词性标注,并与相关方法进行了比较。结果表明所设计的CSE具有显著意义。具体而言,CSE能够捕捉中文语义结构信息,从而显著提高所提方法在各种中文序列标注任务上的性能。此外,结果还表明,我们的方法在非BERT方法的中文序列标注中能达到最佳性能,并且与BERT协同工作良好。
Keyword:
Deep learning
Nature language processing
Sequence labeling
Language model

