返回
摘要
En 中文
摘要本研究探讨了生成单句表示以用于Dialogue Act(DA)分类的过程,包括文本预处理和输入表示的几个方面,这些方面在文献中常被忽视或报道不足,例如词汇表中保留的词数量或输入序列的长度。我们使用一系列监督模型(这些模型代表了最常应用于该任务的模型)评估了这些因素,并基于两个DA标注语料库进行评估。此外,我们将无上下文词嵌入模型与通过预训练语言模型进行迁移学习的方法进行了比较,包括基于Transformer架构的模型,如Bidirectional Encoder Representations from Transformers(BERT)和XLNET,这些模型此前尚未广泛用于DA分类任务。我们的发现表明,这些文本预处理因素确实对分类准确率有显著影响。值得注意的是,我们发现可行的输入序列长度和词汇表大小可以远小于DA分类实验中通常使用的值,超出一定阈值后不会带来显著改进。我们还表明,在某些情况下,语言模型生成的上下文句表示并不总能可靠地优于监督方法。尽管BERT及其衍生模型确实代表了相对于监督方法和DA分类先前工作的显著改进。
期刊
暂无期刊信息
机构
暂无机构信息
引用论文
暂无论文信息

