返回
HEADoC: Highly Efficient and Accurate Document Classifier Optimized Using Semantic Distances
DOI:10.1007/s13748-025-00411-x.png)
摘要
En 中文
自动化文档分类是一个重要的研究领域,采用的方法包括使用文本特征(例如纯文本分析)、视觉特征(例如从文档图像中提取特征)或结合两种模态的混合技术,以捕捉文本和视觉特征来提升性能。我们的工作引入了两种混合模型,HEADoCBASE$_{BASE}$(具有2,770万个参数)和HEADoCLARGE$_{LARGE}$(具有9,058万个参数)。一项关键创新是我们的深度注意力机制,这是一种受传统注意力框架启发的简化且高效的方法,它促进了两种模态的平滑集成。在实验过程中,我们观察到ArcFace损失函数——一种适用于具有不同类内特征异构数据集的有效度量学习方法——由于标准基准测试中文档类别的同质性,在任务中表现不佳。两种模型均在RVL-CDIP和Tobacco3482数据集上进行了评估。在Tobacco3482数据集上,HEADoCBASE$_{BASE}$达到95.98%的准确率,而HEADoCLARGE$_{LARGE}$达到96.66%。对于RVL-CDIP数据集,准确率分别为92.95%和93.62%。HEADoCBASE$_{BASE}$不仅超越了众多当前最优模型,而且在对比中证明了自身是架构最紧凑的模型,凸显了在不牺牲性能的前提下实现高效性的优势。凭借在竞争模型中最小的尺寸,我们的模型比其他竞争架构训练得更快。
Keyword:
Document classification
Efficient deep learning
Ensemble
Deep attention
Arcface loss
期刊
P
IF:
2.4
论文数:
55
被引数:
0
机构
暂无机构信息

