arrow
返回

Receipt Recognition Technology Driven by Multimodal Alignment and Lightweight Sequence Modeling

delete2025-04-23
delete0
delete
OA
AI
J
Jinming Yu
H
Huijun Ma
J
Jianlei Kong *
DOI:10.3390/electronics14091717delete
delete原文链接
delete原文求助
delete分享
delete收藏
摘要

摘要

En 中文
随着全球数字化转型进程的快速推进,企业和金融机构在管理和处理收据类财务文档方面面临日益增长的挑战。传统的手动文档处理方法已无法满足现代办公运营及业务扩张的需求。为解决这些问题,基于计算机视觉和深度学习技术的自动化文档识别系统应运而生。本文提出了一种基于多模态对齐和轻量级序列建模的收据识别技术,整合了CLIP(Contrastive Language-Image Pretraining)和Birectional Gated Recurrent Unit(BiGRU)框架。该框架旨在通过语义校正实现图像和文本信息的协同优化。通过利用动态阈值分类、几何回归损失和多模态特征对齐,该框架显著提升了复杂布局和低质量图像中的文本检测与识别准确率。实验结果表明,在CORD数据集上,该模型实现了93.1%的检测F1分数和5.1%的字符错误率(CER)。通过量化、剪枝和蒸馏的三阶段压缩策略,模型体积被压缩至18 MB,在Jetson AGX Orin边缘设备上实现了25 FPS的实时推理速度,且功耗稳定控制在12 W以下。该框架为自动化收据处理提供了一种高效、精准且边缘计算友好的解决方案。其实际应用价值包括提升财务审计效率、改善税务合规性以及简化金融机构的运营管理,使其成为收据自动化实际应用中的宝贵工具。
Keyword:
receipt recognition
multimodal alignment
lightweight sequence modeling
Contrastive Language-Image Pretraining (CLIP)
Bidirectional Gated Recurrent Unit (BiGRU)

期刊

Electronics 封面图
Electronics
IF:
2.6
论文数:
1.0W
被引数:
4.7W

机构

B
Beijing Technology and Business University
学者数:
4.1K
论文数: 1.7K
被引数: 1.6W
引用论文

引用论文

EAST: An Efficient and Accurate Scene Text Detector
err2017-07-01
err0
errOAAI
errXinyu Zhou; Cong Yao; He Wen; Yuzhi Wang; Shuchang Zhou; Weiran He; Jiajun Liang
err分享
err收藏
学者 查看更多内容