8月24日,卡迪夫大学和墨尔本大学联合发布的一项研究显示,生成式人工智能(GenAI)目前尚无法像人类教师一样可靠地评判学生的书面作业。研究团队使用ChatGPT的两个版本,对50篇生物科学专业本科生论文进行评分,以测试大模型评估学生作业的能力。
在该项研究中,ChatGPT需要按照7项标准批改论文,研究人员采用了4种不同的提示方式,并将大模型给出的分数与人工评分的平均分和分数波动情况进行对比。卡迪夫大学生物科学学院威廉·凯博士指出,研究结果显示模型给出的分数波动较大,无法准确预测人工评分。生成式AI与人类批改同一批论文时存在明显差异,虽然两者在论文总分上相对接近,但具体到每项评分标准和每一篇论文,差距相当明显。
数据显示,除一种情况外,AI模型给出的平均分普遍高于人工评分。平均分方面,AI模型与人工评分的最大差距达到16.1分;具体到单篇论文,最大差距达到40分。威廉·凯还发现,AI往往会压低高分论文的成绩,同时抬高低分作业的成绩,使分数系统性地向中间集中。研究结果说明,至少现阶段,即使经过大量训练,AI仍无法可靠地对主观性较强的书面作业给出与人类相当的分数。
研究人员表示,高等教育领域确实关注大模型能否利用模式识别能力,让学生作业评分更加客观,同时提高批改效率、减轻教职人员压力。但这项研究表明,目前并不适合这么做。此外,未经学生明确同意便将作业提交给AI工具,本身还涉及伦理问题,大模型也不能、也不应该被依赖来给学生的长篇书面作业评分。
威廉·凯博士表示,随着大模型继续发展,未来模仿人类判断的能力可能会提高。但从这项研究来看,要让AI给出的分数与人工评分真正保持一致,恐怕并不容易。该研究为教育领域应用生成式AI提供了参考依据,也提示相关技术在主观性评估场景中仍需谨慎使用。
该文观点仅代表作者本人,企服科学平台仅提供信息存储空间服务。