arrow
返回

A Benchmark Arabic Dataset for Arabic Question Classification using AAFAQ Framework

delete2025-08-18
delete0
delete
OA
AI
M
M. Abdel-Aziz
M
Mohanad A. Deif *
S
Shabbab Ali Algamdi *
R
Rania Elgohary
DOI:10.1038/s41597-025-05688-0delete
delete原文链接
delete原文求助
delete分享
delete收藏
摘要

摘要

En 中文
阿拉伯语自然语言处理(NLP)仍然面临着该语言形态学的复杂性以及高质量标注资源有限可用性的挑战。本文介绍了一个开放领域的阿拉伯语标准语(MSA)数据集,包含5,009个问题,这些问题根据AAFAQ框架进行了标注,该框架包含11个语言学和认知层面,例如疑问词、疑问词类型、意图、答案类型、认知水平和时间语境。基于AAFAQ框架(阿拉伯语高级问题分析框架),该数据集旨在支持阿拉伯语问题分类及相关任务的语义和认知理解。通过微调当前最先进的模型验证了该数据集的有效性。AraBERT在疑问词类型分类上达到了100%的准确率,在意图分类上达到了94.95%。将数据集整合到一个包含Alpaca + Gemma-9B Unsloth的生成式问答系统中,提高了评估指标,包括BLEU(+37.6%)、ROUGE-1(+132%)和BERTScore(+17.3%),验证了该数据集在分类和生成任务中的价值。尽管覆盖范围广泛,该数据集仍包含代表性不足的类别,例如社会学和志愿服务,这些将在未来的扩展中予以考虑。AAFAQ是推动阿拉伯语问题理解进步的基础基准,具有在教育、认知计算和创建多语言AI系统方面的潜在应用。

期刊

Scientific Data 封面图
Scientific Data
IF:
6.9
论文数:
3.7K
被引数:
3.8W

机构

C
College of Information Technology
学者数:
81
论文数: 41
被引数: 0
F
Faculty of Computer and Information Sciences
学者数:
58
论文数: 34
被引数: 0
C
College of Computer Science and Engineering
学者数:
250
论文数: 113
被引数: 1
学者 查看更多机构
引用论文

引用论文