虎嗅

答案变得廉价之后,学校该如何评价一个学生?

核心内容总结

丹麦为应对高中AI作弊推出口头答辩等措施,但这背后不只是反作弊——生成式AI动摇了传统教育评价的核心逻辑:学生提交的成果=真实能力。现在,AI让高质量作业变得“唾手可得”,且大量使用处于“辅助学习”和“直接代写”的灰色地带,传统靠最终成果判断能力的方式失灵了。各国开始从“查AI”转向“验能力”,通过校内受控任务、口头答辩、过程记录等重构评价体系,但改革也面临人力成本、公平性、隐私保护等挑战。

1. AI不只是作弊工具,它把传统评价的老底掀了

传统教育评价靠“最终成果”(论文、作业)判断能力,因为以前写好一篇论文得花几天查资料、组织思路,作弊(抄袭、代写)有门槛且易识别。但AI改变了这一切:

  • 成本暴跌:学生用AI几分钟就能生成选题、框架、论证,甚至调整文风,过去几天的工作量现在秒完成;
  • 灰色地带扩大:不是所有AI使用都是作弊——有的学生用AI查概念、改语法,有的直接复制,中间的“度”很难界定;
  • 数据说话:英国调查显示95%本科生用AI辅助考核任务,国内超85%学生用AI辅助学习,部分直接复制内容。

现在老师拿到一篇好论文,第一反应不是“学生能力强”,而是“这到底有多少是AI写的?学生真的懂吗?”

2. 想靠检测工具抓AI?根本追不上

一开始学校想用“AI检测工具”对付AI作弊,就像用查重对付抄袭,但这是场必输的技术竞赛:

  • AI生成内容是“全新的”:查重找的是和已有内容的相似性,AI生成的是从未出现过的文字,检测工具很难识别;
  • 修改后更难抓:只要人工改几句或用工具“人性化处理”,检测准确率就从39%跌到22%;
  • 误判风险大:容易抓到数字素养弱(不会改AI内容)的学生,而会用AI的学生反而能躲过,公平性成问题。

丹麦的聪明之处在于:不纠结“哪句是AI写的”,而是让学生当面解释论文——AI能生成结果,但答不出“为什么选这个资料”“结论换个条件还成立吗”这类追问。

3. 现在流行“验能力”:评价改革的几条新路子

各国开始重构评价体系,核心是“用多种证据证明学生真的会”,主要有4条路径:

  • 保留“无AI基线”:比如丹麦让更多作业在校内完成,老师盯着过程,确保学生能独立完成基础任务(比如写一段通顺的文字);
  • 增加“能力验真”:提交论文后必须答辩,老师随机追问细节(比如“你引用的这个数据来源可靠吗?”);
  • 过程性评价:记录学习轨迹——选题草稿、修改记录、和AI交互的聊天记录,让成果不再是“孤立文件”;
  • 合理用AI:不禁止AI,但要求披露使用情况(比如国际文凭组织要求像引用文献一样标注AI内容),评价重点变成“学生会不会用AI解决问题”(比如能不能发现AI的错误)。

4. 国内学校:别只划红线,得改评价逻辑

国内学校也在行动,但很多还停留在“禁止AI”或“用检测工具抓”,真正的改革要回到“评价目标”:

  • 规则升级:清华等高校要求学生披露AI使用情况,判断是否合理要看“任务原本要训练什么”——比如基础写作课不能用AI,但研究性论文可以用AI查资料;
  • 课堂实践:清华新闻课让学生实地采访写观察稿,AI能整理材料,但没法替代“去胡同和人聊天、发现细节”;
  • 分层规则:不同学科、年级要求不同——小学生练写字不能用AI,大学生做项目可以用AI辅助,但要说明怎么用。

5. 改革不是拍脑袋:成本、公平、隐私都是坎儿

评价改革听起来好,但落地难:

  • 人力成本高:批改100份论文和组织100场答辩,老师时间差十倍;
  • 公平问题:内向学生、语言障碍学生可能在答辩中吃亏,资源少的学校(大班额、老师少)没法搞答辩,会加剧教育不平等;
  • 隐私风险:屏幕监控、过程记录涉及学生隐私——学校能存多久数据?谁能看?误判了怎么申诉?

教育科技公司也得变:别再做“AI生成率检测”,要做“帮助老师收集证据”的工具——比如记录作业修改轨迹、生成答辩问题,让老师更容易判断学生的真实能力。

结语

丹麦的口头答辩不是最终答案,但它提醒我们:AI时代的教育评价,不能再盯着“成果是不是AI写的”,而要回到“学生到底学会了什么”。AI可以帮忙写论文,但提出问题、核验事实、承担责任,这些必须是学生自己的——教育真正要守住的,是“思考确实发生过”。