返回
Improving LLM-based event extraction with annotation guidelines
DOI:10.3389/frai.2026.1797435.png)
摘要
En 中文
事件抽取是信息抽取的基础任务;但依赖耗时且昂贵的人工标注严重限制了训练数据集的可获得性。虽然近期研究已探索将大语言模型(LLMs)作为示例驱动(或零样本)标注器;但它们在结构化抽取任务(如事件检测和论元抽取)上显著劣于监督技术;可能源于任务指令不明确。在此工作中,我们探究LLMs能在多大程度上受益于数据集特定的、详细的标注指南,这些指南能更精确地体现数据集的底层(人工)标注流程。为此,我们提出了一种基于指南的三阶段LLMs标注框架,用于事件抽取,该框架整合了详细的事件标注指南,并支持多个LLMs标注器以提高鲁棒性。以全面且记录详尽的ACE 2005英文事件标注指南作为参考文档,我们在三个符合指南的基准数据集上评估了四种LLMs。我们的发现表明,根据模型选择、指南的特定性以及数据集的相对标签准确性,采用详细指南可显著提升事件抽取性能,相较于常用的最低限度指令,F1分数最多可提升6.7个百分点,尤其对基于推理的模型改进显著。此外,我们证明,在软匹配评估下,利用LLMs生成的论元标注扩充现有数据集可提升论元抽取性能。总体而言,我们的实验强调了标注指南(及其特定性)对LLMs标注的重要性,为将LLMs作为符合指南的标注器提供了宝贵见解。
Keyword:
prompt engineering
LLM
information extraction
event extraction
synthetic annotation

