返回
Algorithmic Bias and Logical Inconsistency in LLM-Generated Code
DOI:10.3390/bdcc10090313.png)
摘要
En 中文
生成式人工智能使软件工程师和非程序员领域的专家能够轻松生成可执行代码。然而,软件工程师通常缺乏特定领域的专业知识来检测细微的AI逻辑错误,而领域专家通常缺乏生成算法所需的编程专业知识。因此,本研究探讨了生成函数执行过程中遇到的生成逻辑不稳定性、未提示的阈值注入和输出发散问题。我们构建了一个称为组合逻辑审计的框架,该框架识别生成函数中的输入变量,并使用组合输入生成来测试状态变化。我们在多个应用领域中提供了功能发散、数值阈值注入和生成逻辑不稳定性的证据,这些证据是在相同提示的多次执行中发现的。这项研究强调了开发者需要采用严格而全面的评估策略,以确保利用生成式AI构建代码的公平性、正确性和可靠性,并需要稳健且可扩展的审计框架来支持这些目标。本研究中记录的异常现象揭示了AI辅助软件生成中可能存在的伦理漏洞:如果不明确审计代理发散和阈值注入,就有大规模部署未经验证、具有歧视性逻辑的风险。
Keyword:
generative AI
code generation
Combinatorial Logic Auditing
generative instability
unprompted threshold injections
software fairness
ethical vulnerabilities
期刊
B
IF:
4.4
论文数:
1.3K
被引数:
2.4K
机构
引用论文
Yu, H.; Shen, B.; Ran, D.; Zhang, J.; Zhang, Q.; Ma, Y.; Liang, G.; Li, Y.; Wang, Q.; Xie, T. Codereval: A benchmark of pragmatic code generation with generative pre-trained models. In Proceedings of the 46th IEEE/ACM International Conference on Software Engineering; IEEE: New York, NY, USA, 2024; pp. 1–12. [Google Scholar] [CrossRef] [Scilit]Yu, H.; Shen, B.; Ran, D.; Zhang, J.; Zhang, Q.; Ma, Y.; Liang, G.; Li, Y.; Wang, Q.; Xie, T. Codereval:一种基于生成预训练模型的实用代码生成基准。发表于第46届IEEE/ACM国际软件工程会议 proceedings;IEEE:纽约,美国,2024年;第1-12页。[Google Scholar][CrossRef][Scilit]
The Invisible Hand: Unveiling Provider Bias in Large Language Models for Code Generation无形之手:揭示代码生成大型语言模型中的提供者偏见
Starcoder: may the source be with you! arXiv [preprint]. arXiv:2305.06161Starcoder:愿源码与你同在!arXiv [预印本]。arXiv:2305.06161

