返回
Generative for few-shot visual information extraction
DOI:10.1016/j.patcog.2025.111624.png)
摘要
En 中文
视觉信息提取(VIE),旨在从视觉丰富的文档图像中提取结构化信息,在文档处理中发挥着关键作用。考虑到各种布局、语义范围和语言,VIE涵盖了广泛的类型,其数量可能达到数千种。然而,这些类型中的许多缺乏训练数据,这构成了显著挑战。在本文中,我们提出了一种名为Generative Compositor的新型生成模型,以解决少样本VIE的挑战。Generative Compositor是一种混合指针生成器网络,通过从源文本中检索单词并根据提供的提示进行组装,模拟排版人员的操作。此外,采用了三种预训练策略以增强模型对空间上下文信息的感知。另外,特别设计了一种提示感知重采样器,通过利用提示中包含的实体-语义先验知识,实现高效匹配。提示检索机制的引入和预训练策略使得模型能够在有限的训练样本下获取更有效的空间和语义线索。实验表明,所提出的方法在全样本训练中取得了极具竞争力的结果,同时在1-shot、5-shot和10-shot设置下显著优于基线模型。
Keyword:
Visual information extraction
Few-shot
OCR
期刊
IF:
7.6
论文数:
1.3W
被引数:
4.5W
机构
引用论文
Hyperbolic Contrastive Graph Representation Learning for Session-based Recommendation超图对比图表示学习用于基于会话的推荐
GraphRevisedIE: Multimodal information extraction with graph-revised network
PATTERN RECOGNITION
IF7.6
Information extraction from historical handwritten document images with a context-aware neural model使用上下文感知神经模型从历史手写文档图像中提取信息
PATTERN RECOGNITION
IF7.6
Reading order detection in visually-rich documents with multi-modal layout-aware relation prediction
PATTERN RECOGNITION
IF7.6
没有更多内容

