返回
Predicting Data Science Programming Performance: Using Fair ML to detect Bias
DOI:10.1186/s40561-026-00436-2.png)
摘要
En 中文
这项研究调查了预测模型的性能和公平性,这些模型旨在使用来自DaTu解决数据科学任务的学生样本的细粒度日志数据来预测数据科学编程性能。我们的分析表明,逻辑回归在准确性方面优于其他模型。通过变量重要性分析,我们发现 “粘贴答案” 变量成为逻辑回归和KNeighbors分类器模型的关键预测因子,而多个变量对GaussianNB模型的预测能力的贡献相同。我们评估了公平性,重点关注变量 “聊天机器人访问” (有或没有访问聊天机器人),发现偏见的证据。这些模型显示了非特权组 (无AI访问) 的较低得分分布。为了减轻这种偏差,我们采用了各种技术: 重采样、重新加权和ROC枢轴。其中,只有重新加权才能显着改善公平性指标。作为替代方法,我们考虑了ceteris paribus截止方法,以最大程度地减少奇偶校验损失。总之,本研究强调了在教育预测模型中评估公平性的重要性。这项工作提供了一种细微差别和数据驱动的方法来评估学生的数据科学编程技能。
Keyword:
Artificial intelligence in education
Machine learning
Data science programming
Prediction
Performance
Fairness
Bias
AI总结
对已上传原文的论文进行重点信息的提取,主要内容包括:简要概述、研究摘要、背景介绍、关键亮点、图文解析、展望与总结。

