一场波及180万考生的"屏幕阅卷"灾难
6月13日,印度中央中等教育委员会(CBSE)公布2026届毕业考成绩。德里考生韦丹特查完成绩,愣住了:物理65分,远低于预期。他申请复核,拿到的答卷扫描件,不是自己的笔迹。
这不是个案。成绩公布后短短一周,超过40万名学生涌入CBSE申请答卷核查——相当于全部考生的五分之一以上。这是印度首次把毕业考全面搬上"屏幕阅卷":所有答卷扫描上传,由教师在电脑上评阅。一场旨在提效的技术升级,演变成波及180万考生的灾难。
官方承认存在"答卷错配",承诺为受影响学生重估分数。但重估过程被指标准混乱:有人分数上调30分,有人被改成满分状元,有人分毫未动。同一场考试,三种命运。
如果被"调包"的是你孩子的成绩单
这一幕离我们并不远。国内大型考试,扫描阅卷早已是常态;AI直接参与评分,也不再是科幻——ETS的自动评分系统给托福作文打分已二十年,国内部分作文考试也在试点机器评分。
想象一下:孩子十二年寒窗换来的成绩单,被一个流程bug或一行代码改写。复核通道能找回多少?印度用40万份申请回答了这个问题——当"系统不会错"的信任崩塌,每个人都只能靠自己死磕。
更让人不安的是:连"人坐在电脑前看扫描件"这种最温和的数字化,都能出这么大事故;而"让AI直接给作文打分",正在全球高校和中学悄悄试点。自动评分,到底靠得住吗?
数据与研究:AI评分到底行不行,四篇论文给出证据
先把事件的规模摆出来。
22%的考生在成绩公布一周内就发起复核——这不是个别家庭对分数的执念,而是系统性不信任的信号。而5月的医学院入学考试(NEET-UG)又爆出泄题:228万考生的"医学梦",被一张传遍社交媒体的答案卷动摇。技术想解决的"公平",反而以另一种方式被击穿。
那么,AI直接评分,证据怎么说?我们检索了2026年最新的四项研究。
第一项:自动评分在中学会考上的可行性。Frontiers in Education 7月29日发表的Olaoye团队研究,直接拿中学毕业考(SSCE)经济学试题做实验:AI软件自动评分,与12位人类专家比对,相关性显著,软件信度Cronbach α=0.86。作者结论:在"标准明确的题目"上,自动评分可以做到和人类高度一致。
第二项:AI给自己都打不出稳定的分。The Law Teacher 7月29日发表的MarkGPT试点(Sneddon),用定制GPT给法学论文评分,与模块团队的人工评分对比。结论耐人寻味:
"截至2025年夏天,ChatGPT缺乏与自身保持一致的能力,也缺乏与人类评分员保持一致的能力。"同一篇作文,让AI评两次,分数都可能不一样;但AI生成的评语,主题上与人类评语高度重合。
第三项:评分标准(rubric)是决定性变量。土耳其研究者Taşçı的研究,让ChatGPT 4.0和DeepSeek R1评162篇英语作文,与两位人类评分员对比(人类双评达到近完美一致,作为基准)。两个关键发现:加入明确的评分标准后,AI与人类的一致性大幅提升;不同体裁差异显著——观点文一致性最高,议论文最弱。
第四项:把能力拆细,机器才够得着。2026年7月28日IJIEE的Firdausi团队,把"批判性思维"拆成FRISCO六维(聚焦、理由、推断、情境、清晰、综述),用深度学习给高中物理议论文评分,与人类评分达到强一致性。结论:结构越清晰,机器越可靠。
根因分析:机器评分为什么"挑食"
为什么机器评分如此"挑食"?四篇论文拼出一个共同机制:AI评分本质是模式匹配,不是理解。
议论文考的是"论证链":前提是否支撑结论、推理有没有漏洞——这需要全局理解,恰是当前模型最弱的地方;观点文考的是"立场加理由",句式套路化,模式匹配轻松拿下。所以体裁一变,一致性就从"高"掉到"低"。这是第一个机制。
第二个机制是高利害放大:假设系统准确率99%,在180万考生的考试里,就有1.8万人的分数可能有问题——1.8万个家庭,1.8段被改写的人生。低利害场景下可容忍的误差,在高利害考试里就是不可接受的。
第三个机制最容易被忽略:印度这次翻车,根子不在AI,而在流程。答卷扫描、上传、匹配,任何一个环节出错,都会造成"张冠李戴"。技术解决了"人评卷的主观性",却引入了"流程的客观错误"——后者更隐蔽、更难自查。
第四个机制:反馈不等于分数。MarkGPT的评语和人类高度相似,但分数对不上——说明AI能"说出道理",却算不准"该得几分"。把"给反馈"和"定分数"混为一谈,是很多试点翻车的共同原因。
方案:不是不用,是分层用
那自动评分是不是该一禁了之?四篇论文给出的答案更聪明:不是不用,是分层用。
第一层:AI初评 + 人工仲裁。机器先当"第一道筛子",人类抽检并复核边界样本。Olaoye的研究本质就是"AI打分、专家比对"的可行性验证——它证明AI适合当筛子,不适合当终审法官。
第二层:评分标准先行。这是Taşçı的核心结论:rubric写得越细,人机一致性越高。很多AI评分翻车,是因为评分标准本身模糊——人类评委都各执一词,机器更学不会。把"什么样的作文得5分"写到可操作,是AI可靠的前提。
第三层:结构化拆解。Firdausi的FRISCO路径:不评"整体感觉",评六个有明确定义的维度。批判性思维、论证质量这类高阶能力,只有拆成可判定的子项,机器才够得着。
第四层:分数归人,反馈归AI。MarkGPT的教训最值钱:AI的批注、点评、建议,做得和人类一样好;但最终分数必须由人复核决定。"AI助理 + 人类法官",是目前证据支持的最优组合。
最后,所有部署AI评分的地方,都要做到三件事:公开错误率、保留复核通道、公示申诉流程。印度事件最大的教训不是"别用技术",而是"用了技术却没有任何兜底"。
行动指南:三个可以立刻用上的教训
作为家长、学生或教育者,可以从这次事件里拿走三样东西:
- 成绩与预期出入大,第一时间走复核。印度40万人的教训是:在官方承认错配之前,谁都觉得"系统不会错"。你的坚持,可能就是那30分。
- 写作训练,优先练议论文。它是AI最难评、也最见真功夫的文体——论证链没法靠套路糊弄。在机器评分普及的时代,这是区分度所在,也是孩子真实能力的护城河。
- 教育者部署自动评分前,先过三关。拿往年真实试卷做样本验证、设计异常分数抽检、公开错误率。没有这三样,别上线。
技术走进考场是必然,但"分数即命运"的高利害场景,必须把最后的判断权留给人。机器可以当最勤快的助手,不该当一言九鼎的法官。