arrow
返回

Generative for few-shot visual information extraction

delete2025-04-24
delete0
PRE
AI
Z
Zhibo Yang
W
Wei Hua
S
Sibo Song
C
Cong Yao
Y
Yingying Zhu
W
Wenqing Cheng *
白
白翔 (Xiang Bai)
DOI:10.1016/j.patcog.2025.111624delete
delete原文链接
delete原文求助
delete分享
delete收藏
摘要

摘要

En 中文
视觉信息提取(VIE),旨在从视觉丰富的文档图像中提取结构化信息,在文档处理中发挥着关键作用。考虑到各种布局、语义范围和语言,VIE涵盖了广泛的类型,其数量可能达到数千种。然而,这些类型中的许多缺乏训练数据,这构成了显著挑战。在本文中,我们提出了一种名为Generative Compositor的新型生成模型,以解决少样本VIE的挑战。Generative Compositor是一种混合指针生成器网络,通过从源文本中检索单词并根据提供的提示进行组装,模拟排版人员的操作。此外,采用了三种预训练策略以增强模型对空间上下文信息的感知。另外,特别设计了一种提示感知重采样器,通过利用提示中包含的实体-语义先验知识,实现高效匹配。提示检索机制的引入和预训练策略使得模型能够在有限的训练样本下获取更有效的空间和语义线索。实验表明,所提出的方法在全样本训练中取得了极具竞争力的结果,同时在1-shot、5-shot和10-shot设置下显著优于基线模型。
Keyword:
Visual information extraction
Few-shot
OCR

期刊

Pattern Recognition 封面图
Pattern Recognition
IF:
7.6
论文数:
1.3W
被引数:
4.5W

机构

A
alibaba grp
学者数:
55
论文数: 24
被引数: 1
引用论文

引用论文

Hyperbolic Contrastive Graph Representation Learning for Session-based Recommendation超图对比图表示学习用于基于会话的推荐
err2024-01-01
err0
PREAI
errNaicheng Guo; Xiaolei Liu; Shaoshuai Li; Mingming Ha; Qiongxu Ma; Binfeng Wang; Yunan Zhao; Linxun Chen; Xiaobo Guo
err分享
err收藏
Hierarchical multimodal transformers for Multipage DocVQA
err2023-12-01
err10
errOAAI
errTito, Ruben; Karatzas, Dimosthenis; Valveny, Ernest
err分享
err收藏
Synthetic document generator for annotation-free layout recognition
err2022-08-01
err4
errOAAI
errRaman, Natraj; Shah, Sameena; Veloso, Manuela
err分享
err收藏
Reading order detection in visually-rich documents with multi-modal layout-aware relation prediction
err2024-06-01
err0
PREAI
errQiao, Liang; Li, Can; Cheng, Zhanzhan; Xu, Yunlu; Niu, Yi; Li, Xi
err分享
err收藏
没有更多内容