欧洲经济政策研究中心(CEPR)6月2日发布编号为DP21577的讨论论文,基于对中国一个百万人口县26811名七至十二年级学生的30个月追踪数据,揭示了生成式AI在教育场景中的显著负面效应:AI工具使作业成绩平均提高18%,但闭卷月考成绩在六个月内下降20%,中考成绩下降24%,高考成绩下降18%。该研究由斯德哥尔摩大学的David Strömberg与香港大学的Victor Lei、Yanhui Wu共同完成,样本覆盖九门学科,数据包括每月闭卷月考、作业分数与完成时长,以及中考和高考等高风险考试结果。
研究采用双重差分法,利用不同学生接触AI工具的时间差构造自然实验,以剥离因果效应与相关性。数据显示,研究期间学生自报的AI使用率从接近零迅速攀升至约80%,爆发节点与DeepSeek V2.5和R1模型的发布时间高度吻合。学生最常用的AI工具包括豆包、DeepSeek、ChatGLM、文心和通义。论文题为《生成式AI的学习惩罚:来自中国中等教育的证据》,目前尚未经过正式同行评审。
研究核心发现可归纳为三组关键数据:作业端,使用AI后作业分数提高18%,完成时长从平均64分钟压缩至45分钟,节省约30%;月考端,闭卷考试分数在六个月内下降20%;升学考端,中考下降24%,高考下降18%,且完整的负面效应需约两年才全部显现。研究指出,过去作业成绩基本能预测考试成绩,但AI介入后这一关系发生反转——作业表现越“优秀”的学生,真实能力反而越存疑。
负面效应在人群分布上呈现显著不均衡。学科层面,社科类科目受损最重(政治、地理约下降27%),STEM学科次之(下降22%),英语下降17%,语文影响最轻(下降9%)。人群层面,成绩前三分之一的学生分数下降24%,后三分之一学生下降16%;初中生受损程度高于高中生,男生高于女生。剂量效应同样明显:每周使用AI不超过1小时,成绩损失约5%;每周使用超过5小时,损失扩大至30%。
论文通过行为模式将学生划分为两类。约80%的AI用户属于“外包型”,表现为作业完成时间异常短但分数异常高,即AI生成内容后直接复制提交,学习损失几乎全部集中在这一群体。使用满五个月AI的学生中,81%写作业速度超过最快的非AI用户。另一类“辅助型”学生将AI作为讲解工具,作业时长未明显缩短,思考过程仍保留在自身认知体系中,其考试损失接近零。研究者推测,尖子生受损最重的原因在于,AI介入生硬打断了他们原本通过自学构建知识心智模型的过程。
研究还引用1924年俄亥俄州立大学“教学机器”实验作为历史参照,该实验同样证明自动化会阻碍学习过程。论文作者强调,专家用于减轻认知负担的工具,不应被孩子用于替代学习过程本身。延迟性是此次研究发现的关键特征:月考损失需半年显现,升学考损失需两年才完全暴露。这意味着此前数周或数月的短期研究均系统性低估了AI对学习的负面影响。当前深度使用AI的学生群体,将在2027至2032年间集中进入升学考场,届时将首次面对无法借助AI的考试环境。
政策层面,多国已开始回应这一研究发现。挪威首相已宣布对6至13岁学生几乎全面禁用生成式AI,14至16岁学生须在教师督导下使用。英国教育部5月发布的指南要求学校AI工具默认不直接提供答案,学生须先进行真实尝试,并记录“卸载思考”的行为。世界银行已将论文列入2026年人力资本博客,作为防范“AI学习惩罚”的警示案例。对比数据显示,世界银行受控框架下的AI辅导效果为正0.31个标准差,而本研究中“野生使用”场景的效果为负1.4个标准差。
论文的局限性同样明确:作为讨论论文尚未经过正式同行评审,样本来自单一县域,30个月的追踪期恰逢AI工具快速迭代,研究捕捉的是早期工具与不规范使用方式结合的效果。论文并未建议全面禁用AI,辅助型用户成绩几乎无损的事实表明,问题的核心在于思考过程是否被替代。研究推论指出,学校应调整评估结构,将评分权重向闭卷考试倾斜,监控作业时长异常,并设计口头答辩、现场推导等AI无法替代的评估方式。作业分数这一沿用数十年的能力衡量指标,在AI时代已正式失效。
该文观点仅代表作者本人,企服科学平台仅提供信息存储空间服务。