返回
The MERIT dataset: Modelling and efficiently rendering interpretable transcripts
DOI:10.1016/j.patcog.2025.112502.png)
摘要
En 中文
本文介绍了MERIT数据集,这是一个包含学校成绩单的多模态、全标注数据集。该数据集包含超过400个标签和33k个样本,是训练在视觉丰富文档理解任务中的模型的重要资源。它包含多模态特征,这些特征将文本、视觉和布局领域中的模式联系起来。MERIT数据集还以受控方式包含偏差,使其成为评估语言模型中引入偏差的宝贵工具。本文概述了该数据集的生成流程,并强调了其在不同领域中的主要特征和模式。我们针对该数据集进行了标记分类基准测试,表明即使是SOTA模型也面临着重大挑战。

