返回
Receipt Recognition Technology Driven by Multimodal Alignment and Lightweight Sequence Modeling
DOI:10.3390/electronics14091717.png)
摘要
En 中文
随着全球数字化转型进程的快速推进,企业和金融机构在管理和处理收据类财务文档方面面临日益增长的挑战。传统的手动文档处理方法已无法满足现代办公运营及业务扩张的需求。为解决这些问题,基于计算机视觉和深度学习技术的自动化文档识别系统应运而生。本文提出了一种基于多模态对齐和轻量级序列建模的收据识别技术,整合了CLIP(Contrastive Language-Image Pretraining)和Birectional Gated Recurrent Unit(BiGRU)框架。该框架旨在通过语义校正实现图像和文本信息的协同优化。通过利用动态阈值分类、几何回归损失和多模态特征对齐,该框架显著提升了复杂布局和低质量图像中的文本检测与识别准确率。实验结果表明,在CORD数据集上,该模型实现了93.1%的检测F1分数和5.1%的字符错误率(CER)。通过量化、剪枝和蒸馏的三阶段压缩策略,模型体积被压缩至18 MB,在Jetson AGX Orin边缘设备上实现了25 FPS的实时推理速度,且功耗稳定控制在12 W以下。该框架为自动化收据处理提供了一种高效、精准且边缘计算友好的解决方案。其实际应用价值包括提升财务审计效率、改善税务合规性以及简化金融机构的运营管理,使其成为收据自动化实际应用中的宝贵工具。
Keyword:
receipt recognition
multimodal alignment
lightweight sequence modeling
Contrastive Language-Image Pretraining (CLIP)
Bidirectional Gated Recurrent Unit (BiGRU)
期刊
IF:
2.6
论文数:
1.0W
被引数:
4.7W
机构
引用论文
Enhancing OCR in historical documents with complex layouts through machine learning通过机器学习增强复杂布局历史文档中的OCR
Enhancing Visual Information Extraction with Large Language Models Through Layout-Aware Instruction Tuning通过布局感知指令微调,利用大型语言模型增强视觉信息提取
Digital Transformation of Tax Administration and Compliance: A Systematic Literature Review on E-Invoicing and Prefilled Returns税收征管的数字化转型与合规:关于电子发票和预填申报表的系统文献综述
LayoutLM: Pre-training of Text and Layout for Document Image UnderstandingLayoutLM: 用于文档图像理解的文本和布局的预培训
ShuffleNet V2: Practical Guidelines for Efficient CNN Architecture DesignShuffleNet V2: 高效CNN架构设计的实用指南

