← 返回 CoEvo 博客

180万份答卷被"调包":印度高考"屏幕阅卷"翻车,AI自动评分到底行不行?

2026-08-01 · CoEvo 团队

一场波及180万考生的"屏幕阅卷"灾难

6月13日,印度中央中等教育委员会(CBSE)公布2026届毕业考成绩。德里考生韦丹特查完成绩,愣住了:物理65分,远低于预期。他申请复核,拿到的答卷扫描件,不是自己的笔迹

这不是个案。成绩公布后短短一周,超过40万名学生涌入CBSE申请答卷核查——相当于全部考生的五分之一以上。这是印度首次把毕业考全面搬上"屏幕阅卷":所有答卷扫描上传,由教师在电脑上评阅。一场旨在提效的技术升级,演变成波及180万考生的灾难。

官方承认存在"答卷错配",承诺为受影响学生重估分数。但重估过程被指标准混乱:有人分数上调30分,有人被改成满分状元,有人分毫未动。同一场考试,三种命运。

如果被"调包"的是你孩子的成绩单

这一幕离我们并不远。国内大型考试,扫描阅卷早已是常态;AI直接参与评分,也不再是科幻——ETS的自动评分系统给托福作文打分已二十年,国内部分作文考试也在试点机器评分。

想象一下:孩子十二年寒窗换来的成绩单,被一个流程bug或一行代码改写。复核通道能找回多少?印度用40万份申请回答了这个问题——当"系统不会错"的信任崩塌,每个人都只能靠自己死磕

更让人不安的是:连"人坐在电脑前看扫描件"这种最温和的数字化,都能出这么大事故;而"让AI直接给作文打分",正在全球高校和中学悄悄试点。自动评分,到底靠得住吗?

数据与研究:AI评分到底行不行,四篇论文给出证据

先把事件的规模摆出来。

2026印度两场高考风波:波及考生数(万人) 数据来源:中国新闻周刊报道(CBSE屏幕阅卷 / NEET-UG泄题) 228 NEET泄题考生 180 CBSE答卷错配 40 一周内复核申请 复核申请约占CBSE受影响考生的22%,且一周内涌入

22%的考生在成绩公布一周内就发起复核——这不是个别家庭对分数的执念,而是系统性不信任的信号。而5月的医学院入学考试(NEET-UG)又爆出泄题:228万考生的"医学梦",被一张传遍社交媒体的答案卷动摇。技术想解决的"公平",反而以另一种方式被击穿。

那么,AI直接评分,证据怎么说?我们检索了2026年最新的四项研究。

第一项:自动评分在中学会考上的可行性。Frontiers in Education 7月29日发表的Olaoye团队研究,直接拿中学毕业考(SSCE)经济学试题做实验:AI软件自动评分,与12位人类专家比对,相关性显著,软件信度Cronbach α=0.86。作者结论:在"标准明确的题目"上,自动评分可以做到和人类高度一致。

第二项:AI给自己都打不出稳定的分。The Law Teacher 7月29日发表的MarkGPT试点(Sneddon),用定制GPT给法学论文评分,与模块团队的人工评分对比。结论耐人寻味:

"截至2025年夏天,ChatGPT缺乏与自身保持一致的能力,也缺乏与人类评分员保持一致的能力。"
同一篇作文,让AI评两次,分数都可能不一样;但AI生成的评语,主题上与人类评语高度重合。

第三项:评分标准(rubric)是决定性变量。土耳其研究者Taşçı的研究,让ChatGPT 4.0和DeepSeek R1评162篇英语作文,与两位人类评分员对比(人类双评达到近完美一致,作为基准)。两个关键发现:加入明确的评分标准后,AI与人类的一致性大幅提升;不同体裁差异显著——观点文一致性最高,议论文最弱

第四项:把能力拆细,机器才够得着。2026年7月28日IJIEE的Firdausi团队,把"批判性思维"拆成FRISCO六维(聚焦、理由、推断、情境、清晰、综述),用深度学习给高中物理议论文评分,与人类评分达到强一致性。结论:结构越清晰,机器越可靠。

根因分析:机器评分为什么"挑食"

AI与人类评分一致性:随作文体裁变化 相对水平示意(基于Taşçı 2025:162篇作文,观点文最高、议论文最弱) 观点文 说服文 议论文 加入评分标准(rubric)后,各体裁AI-人类一致性整体大幅提升

为什么机器评分如此"挑食"?四篇论文拼出一个共同机制:AI评分本质是模式匹配,不是理解

议论文考的是"论证链":前提是否支撑结论、推理有没有漏洞——这需要全局理解,恰是当前模型最弱的地方;观点文考的是"立场加理由",句式套路化,模式匹配轻松拿下。所以体裁一变,一致性就从"高"掉到"低"。这是第一个机制。

第二个机制是高利害放大:假设系统准确率99%,在180万考生的考试里,就有1.8万人的分数可能有问题——1.8万个家庭,1.8段被改写的人生。低利害场景下可容忍的误差,在高利害考试里就是不可接受的。

第三个机制最容易被忽略:印度这次翻车,根子不在AI,而在流程。答卷扫描、上传、匹配,任何一个环节出错,都会造成"张冠李戴"。技术解决了"人评卷的主观性",却引入了"流程的客观错误"——后者更隐蔽、更难自查。

第四个机制:反馈不等于分数。MarkGPT的评语和人类高度相似,但分数对不上——说明AI能"说出道理",却算不准"该得几分"。把"给反馈"和"定分数"混为一谈,是很多试点翻车的共同原因。

方案:不是不用,是分层用

那自动评分是不是该一禁了之?四篇论文给出的答案更聪明:不是不用,是分层用

第一层:AI初评 + 人工仲裁。机器先当"第一道筛子",人类抽检并复核边界样本。Olaoye的研究本质就是"AI打分、专家比对"的可行性验证——它证明AI适合当筛子,不适合当终审法官。

第二层:评分标准先行。这是Taşçı的核心结论:rubric写得越细,人机一致性越高。很多AI评分翻车,是因为评分标准本身模糊——人类评委都各执一词,机器更学不会。把"什么样的作文得5分"写到可操作,是AI可靠的前提。

第三层:结构化拆解。Firdausi的FRISCO路径:不评"整体感觉",评六个有明确定义的维度。批判性思维、论证质量这类高阶能力,只有拆成可判定的子项,机器才够得着。

第四层:分数归人,反馈归AI。MarkGPT的教训最值钱:AI的批注、点评、建议,做得和人类一样好;但最终分数必须由人复核决定。"AI助理 + 人类法官",是目前证据支持的最优组合。

最后,所有部署AI评分的地方,都要做到三件事:公开错误率、保留复核通道、公示申诉流程。印度事件最大的教训不是"别用技术",而是"用了技术却没有任何兜底"。

行动指南:三个可以立刻用上的教训

作为家长、学生或教育者,可以从这次事件里拿走三样东西:

技术走进考场是必然,但"分数即命运"的高利害场景,必须把最后的判断权留给人。机器可以当最勤快的助手,不该当一言九鼎的法官。

AI阅卷考试公平自动评分高利害考试教育数字化

知道自己在学什么,而不是在消费什么

CoEvo 刻意进化学习 —— 从AI对话到客观验证,15分钟完成一次真正有效的学习循环。

开启刻意进化 →

如果不想被AI取代,你需要刻意进化