🌀 AIBB-Flywheel

新闻数据飞轮
← 返回文章列表
ithome 科技 教育 采集 2026-08-24T16:10:23+00:00

卡迪夫大学研究:AI 尚无法像人类教师一样可靠批改作业

原始标题:卡迪夫大学新研究:AI 尚无法像人类教师一样可靠地批改作业

来源
ithome
发布时间
2026-08-24T14:16:15
采集批次
2026-08-24-16
字数
758
URL 指纹
75375d7fbb55d99e

📌 AI 总结(255 字)

卡迪夫大学与墨尔本大学联合研究发现,生成式人工智能目前尚不能像人类教师一样可靠地评判学生书面作业。研究人员使用两个版本的ChatGPT,按照7项标准对50篇生物科学本科生论文进行评分,并采用4种提示方式。结果显示,AI给出的分数波动较大,无法准确预测人工评分;除一种情况外,AI平均分普遍高于人工评分,平均分最大差距达16.1分,单篇论文最大差距达40分。研究还发现AI倾向于压低高分、拉高低分,使分数向中间集中。研究者认为,现阶段大模型不适合取代教师为学生预测作业成绩,且未经学生同意提交作业还涉及伦理问题。
📄 正文(758 字)
IT之家8月24日消息,据外媒Phys.org报道,卡迪夫大学和墨尔本大学的一项新研究发现,生成式人工智能目前还无法像人类教师一样可靠地评判学生的书面作业。

研究人员使用ChatGPT的两个版本,对50篇生物科学专业本科生论文进行评分,以测试大模型评估学生作业的能力。ChatGPT需要按照7项标准批改这些论文,研究人员还采用了4种不同的提示方式,随后将大模型与人工评分的平均分和分数波动情况进行比较。

卡迪夫大学生物科学学院威廉·凯博士指出,研究结果显示,模型给出的分数波动很大,无法准确预测人工评分。生成式AI与人类批改同一批论文时存在明显差异。只看论文总分,两者给出的结果相对接近;一旦具体到每项评分标准和每一篇论文,大模型与人工评分之间的差距就相当明显。

除一种情况外,AI模型给出的平均分普遍高于人工评分。平均分方面,AI模型与人工评分的最大差距达到16.1分;具体到单篇论文,最大差距达到40分。

威廉·凯还发现,AI往往会压低高分论文的成绩,又把低分作业的成绩抬高,最终使分数系统性地向中间集中。

研究结果说明,至少现阶段,即使经过大量训练,AI仍无法可靠地对主观性较强的书面作业给出与人类相当的分数。研究人员表示,他们测试的大模型目前并不适合取代教师,为学生预测作业成绩。

研究人员指出,高等教育领域确实很关注大模型能否利用模式识别能力,让学生作业评分更加客观,同时提高批改效率、减轻教职人员压力。但这项研究表明,目前并不适合这么做。

此外,未经学生明确同意便把作业提交给AI工具,本身还涉及伦理问题;大模型也不能、也不应该被依赖来给学生的长篇书面作业评分。随着大模型继续发展,未来模仿人类判断的能力可能会提高,但从这项研究来看,要让AI给出的分数与人工评分真正保持一致,恐怕并不容易。

🔥 关联热点