返回
CORAL: Collaborative Automatic Labeling System based on Large Language Models
DOI:10.14778/3685800.3685885.png)
摘要
En 中文
在大数据时代,数据标注是众多应用不可或缺的一部分。然而,它被广泛认为是繁琐且耗时的过程,显著阻碍了数据驱动应用的可扩展性和效率。为降低人力成本,我们提出CORAL,一种由大型语言模型(LLMs)驱动的协作式自动标注系统,该系统能以最少的人力投入实现高质量标注。首先,CORAL利用LLM自动标注海量数据集,生成粗粒度标签。随后,一个弱监督学习模块采用噪声标签学习技术训练小型语言模型(SLMs),从LLM的标注中提炼精确标签,同时允许对模型结果进行统计分析以识别潜在错误标签,从而减少错误检测所需的人力成本。此外,CORAL支持通过LLMs和SLMs对人工修正的标签进行迭代优化,进而确保标注质量和模型性能的持续提升。一个可视化界面可实现对标注过程的监控和结果分析。
期刊
P
IF:
3.3
论文数:
563
被引数:
1.2W
机构
引用论文
FreeAL: Towards Human-Free Active Learning in the Era of Large Language ModelsFreeAL:迈向大语言模型时代无需人工的主动学习
没有更多内容

