返回
Visual Document Matching for Zero-Shot Document Classification
DOI:10.1007/978-3-032-09368-4_12.png)
摘要
En 中文
文档的准确识别对于确保合规性和维持不同应用场景的一致性至关重要。因此,文档分类已被广泛研究。然而,文档的动态特性往往使简单的分类方法不足,需要频繁地重新训练模型。为减轻这种持续维护,将新文档与已知参考文档进行比较是一种更合适的方法。为解决零样本分类问题,我们提出了视觉文档匹配(VDM)。VDM专注于验证两个文档是否具有相同的视觉布局结构,在训练类别与推理时遇到的类别不一致的场景中尤其有效。尽管其潜力巨大,零样本学习(ZSL)方法在文档布局理解方面仍鲜有探索。为支持本研究,我们引入了“布局感知复杂文档信息处理”(LA-CDIP)数据集,该数据集包含4,993份文档,涵盖144个类别。我们重组了来自RVL-CDIP数据库的数据集,以强调视觉结构而非语义信息。我们的方法在对比学习框架中使用孪生网络,并在包括ResNet、EfficientNet和Vision Transformer(ViT)在内的多种骨干网络架构上进行基准测试。在零样本场景下,我们的方法在交叉验证的1对1验证中达到低于5%的等错误率(EER)。此外,我们的VDM方法优于较轻量的大型语言模型(LLMs),并与GPT-4o相媲美。这些发现凸显了专门的VDM技术在通用多模态模型之上的优越性,表明在显著减少参数的情况下仍能实现高精度,使我们的方法更适用于实际应用。
Keyword:
Zero-shot learning
Metric Learning
Document Understanding
Document Image Classification
Visual Document Matching
期刊
D
IF:
0
论文数:
22
被引数:
0
机构
引用论文
A hybrid partial fingerprint matching algorithm for estimation of Equal error rate一种用于估算等错误率的混合部分指纹匹配算法

