返回
LLM-generated scientific content detection method
DOI:10.1007/s00521-026-12465-6.png)
摘要
En 中文
大型语言模型(LLMs),如ChatGPT、Gemini和LLaMA-3,能够生成与人工撰写文本高度相似的科技文本。尽管它们简化了研究论文和文章的撰写过程,但也引发了关于抄袭、虚假信息和学术不端的担忧。因此,检测AI生成内容对于维护科学诚信至关重要。本研究介绍了人工智能科技文本检测器(AISciDetector),该模型结合了BigBird嵌入与CNN-BiLSTM框架。BigBird捕捉科技文本中的长距离依赖关系,CNN提取局部特征,BiLSTM双向建模序列模式。该模型通过二分类区分人工撰写与LLM生成的文本。我们同时提出了LLMSciTxt数据集,包含人工作者撰写的科技文本以及ChatGPT、Gemini和LLaMA-3的输出。实验表明,AISciDetector达到91.5%的准确率和91.49%的F1分数,优于传统机器学习和基于转换器的模型。这些结果证明AISciDetector能有效识别LLM生成内容,支持学术出版物的诚信与可信度。
Keyword:
Large language models
Scientific content
Academic plagiarism detection
Transformer
Deep learning
期刊
IF:
4.5
论文数:
847
被引数:
3.2W

