arrow
返回

CodeS: Towards Building Open-source Language Models for Text-to-SQL

delete2024-05-30
delete0
delete
OA
AI
DOI:10.1145/3654930delete
delete原文链接
delete原文求助
delete分享
delete收藏
摘要

摘要

En 中文
语言模型在将自然语言问题翻译成SQL查询(Text-to-SQL)的任务中表现出有前景的性能。然而,大多数最先进(SOTA)的方法依赖于强大但闭源的生成式大型语言模型(LLMs),如ChatGPT和GPT-4,这些模型可能存在模型架构不明确、数据隐私风险和昂贵的推理开销等局限性。为解决这些局限性,我们介绍了CodeS,这是一系列参数规模从10亿到150亿不等的预训练语言模型,专门为Text-to-SQL任务设计。CodeS是一个完全开源的语言模型,在参数规模小得多的情况下实现了更高的准确率。本文研究了构建CodeS的研究挑战。为增强CodeS的SQL生成能力,我们采用了一种增量预训练方法,使用专门精选的以SQL为中心的语料库。在此基础上,我们通过策略性提示构造和双向数据增强技术解决了模式链接和快速领域适应的挑战。我们在多个数据集上进行了全面评估,包括广泛使用的Spider基准、新发布的BIRD基准、稳健性诊断基准(如Spider-DK、Spider-Syn、Spider-Realistic和Dr.Spider),以及为金融和学术应用创建的两个真实世界数据集。实验结果表明,我们的CodeS在几乎所有具有挑战性的Text-to-SQL基准上均达到了新的SOTA准确率和稳健性。

期刊

暂无期刊信息

机构

暂无机构信息
引用论文

引用论文

暂无论文信息