arrow
返回

HEADoC: Highly Efficient and Accurate Document Classifier Optimized Using Semantic Distances

delete2025-10-01
delete0
PRE
AI
M
Muhammad Usman Khan *
M
Muhammad Adnan Tariq
M
Muhammad Shaoor Siddique
DOI:10.1007/s13748-025-00411-xdelete
delete原文链接
delete原文求助
delete分享
delete收藏
摘要

摘要

En 中文
自动化文档分类是一个重要的研究领域,采用的方法包括使用文本特征(例如纯文本分析)、视觉特征(例如从文档图像中提取特征)或结合两种模态的混合技术,以捕捉文本和视觉特征来提升性能。我们的工作引入了两种混合模型,HEADoCBASE$_{BASE}$(具有2,770万个参数)和HEADoCLARGE$_{LARGE}$(具有9,058万个参数)。一项关键创新是我们的深度注意力机制,这是一种受传统注意力框架启发的简化且高效的方法,它促进了两种模态的平滑集成。在实验过程中,我们观察到ArcFace损失函数——一种适用于具有不同类内特征异构数据集的有效度量学习方法——由于标准基准测试中文档类别的同质性,在任务中表现不佳。两种模型均在RVL-CDIP和Tobacco3482数据集上进行了评估。在Tobacco3482数据集上,HEADoCBASE$_{BASE}$达到95.98%的准确率,而HEADoCLARGE$_{LARGE}$达到96.66%。对于RVL-CDIP数据集,准确率分别为92.95%和93.62%。HEADoCBASE$_{BASE}$不仅超越了众多当前最优模型,而且在对比中证明了自身是架构最紧凑的模型,凸显了在不牺牲性能的前提下实现高效性的优势。凭借在竞争模型中最小的尺寸,我们的模型比其他竞争架构训练得更快。
Keyword:
Document classification
Efficient deep learning
Ensemble
Deep attention
Arcface loss

期刊

P
Progress in Artificial Intelligence
IF:
2.4
论文数:
55
被引数:
0

机构

暂无机构信息
引用论文

引用论文

err
IF0
err
err0
PREAI
err
err分享
err收藏
EmmDocClassifier: Efficient Multimodal Document Image Classifier for Scarce Data
err2022-01-29
err0
errOAAI
errShrinidhi Kanchi; Alain Pagani; Hamam Mokayed; Marcus Liwicki; Didier Stricker; Muhammad Zeshan Afzal
err分享
err收藏
Document image classification: Progress over two decades文档图像分类: 二十年来的进展
err2021-09-01
err14
PREAI
errLiu, Li; Wang, Zhiyu; Qiu, Taorong; Chen, Qiu; Lu, Yue; Suen, Ching Y.
err分享
err收藏
err分享
err收藏
err
IF0
err
err0
PREAI
err
err分享
err收藏
err分享
err收藏
学者 查看更多内容