返回
Named entity recognition and coreference resolution using prompt-based generative multimodal
DOI:10.1007/s40747-025-02122-1.png)
摘要
En 中文
命名实体识别(NER)和共指消解(CR)在自然语言处理领域均具有关键意义。代词和名词短语的准确检测已被证明对跨句子乃至跨模态的语义理解有直接影响。然而,现有方法在多模态场景中常因语义融合不足而引发文本-图像错配及指代消解错误等问题。本文提出一种结合目标检测与提示策略的多模态生成框架。首先,采用提示机制将实体类型嵌入视觉通道,利用目标检测结果及视觉Transformer提取的层次特征实现设计,以增强多模态NER。随后构建PGMCR模型,基于提示信息将NER识别的代词和名词短语与图像区域对齐,以实现生成式多模态共指消解。在公开CIN数据集上的实验结果表明,PGMNER在NER任务中达到96.55%的F1分数,显著高于代表性多模态模型;PGMCR在CR任务中取得62.53%的CoNLL F1分数,超越现有最优方法。这些结果验证了所提框架在跨模态命名实体识别与共指消解中的有效性,为复杂场景下的多模态语义理解提供了新见解。
Keyword:
Named entity recognition
Coreference resolution
Generative
Bert
Object detection
Multimodal
Visual grounding
AI总结
对已上传原文的论文进行重点信息的提取,主要内容包括:简要概述、研究摘要、背景介绍、关键亮点、图文解析、展望与总结。
期刊
IF:
4.6
论文数:
2.1K
被引数:
6.6K
机构
引用论文
Multi-granularity cross-modal representation learning for named entity recognition on social media面向社交媒体命名实体识别的多粒度跨模态表示学习
Topic mining and sentiment analysis for consumer reviews of automotive spare parts on e-commerce platforms电子商务平台上的汽车零部件消费者评论主题挖掘与情感分析
Segmentation-aware relational graph convolutional network with multi-layer CRF for nested named entity recognition具有多层CRF的分段感知关系图卷积网络用于嵌套命名实体识别
Multi-aspect Understanding with Cooperative Graph Attention Networks for Medical Dialogue Information Extraction基于合作图注意网络的多方面理解医学对话信息提取

