返回
PACM: Position-Aware Cross-Modality Decoder for Handwritten Mathematical Expression Recognition
DOI:10.1007/978-3-032-04614-7_6.png)
摘要
En 中文
尽管编码器-解码器架构已显著推动了手写数学表达式识别(HMER)的发展,但当前基于语言模型(LM)的校正方法存在固有局限性。尽管LM可通过文本语义缓解上下文错误,但其有效性最终受限于语义贫乏问题:数学表达式传达的复杂结构关系超越了单纯的语义项表示。本文认为,在纠正HMER系统输出时,视觉特征(如符号间的空间关系)应与语言信息同等重要。我们提出位置感知跨模态校正框架,通过创建视觉-语言等价关系实现错误修正。具体而言,我们设计双流融合模块,以并行方式整合符号级视觉特征与语言上下文,实现联合视觉-语言推理以解决由分割错误和符号误判引发的歧义。此外,引入位置感知模块,利用符号密度热图驱动的动态空间注意力机制,自适应地关注全局布局和局部符号交互。在两个常用基准数据集上的实验验证了本方法的优势,在CROHME 2014/2016/2019上取得62.32%/61.58%/63.38%的当前最优性能,在HME100K上达到70.81%。
Keyword:
Cross-Modality
Vision-Language Model
Handwritten Mathematical Expression Recognition
Transformer
期刊
D
IF:
0
论文数:
23
被引数:
0
机构
引用论文
Learning Phrase Representations using RNN Encoder–Decoder for Statistical Machine Translation使用RNN编码器-解码器学习统计机器翻译的短语表示
Error detection, error correction and performance evaluation in on-line mathematical expression recognition在线数学表达式识别中的错误检测,错误纠正和性能评估
PATTERN RECOGNITION
IF7.6

