清华大学求真书院2026级预科班,一批学生因考核未通过面临清退,人数接近总人数的20%,其中不乏全国中学生数学奥林匹克竞赛(CMO)金、银牌得主。7月10日,丘成桐回应媒体时说了一句话,直接点燃舆论:"大部分人考了80分,居然有几个学生考28分、30分。"
更耐人寻味的是另一个细节:本届预科班首次增设了论文汇报和作业题现场讲解环节,目的写得很直白——"检验作业是否由学生本人独立完成、防止借助AI代做"。一边是奥赛金牌得主在高等数学考核中拿到28分,一边是学校开始专门设防AI代写作业。两件事放在一起,指向同一个问题:在刷题工业和生成式AI的双重加持下,考试分数还能证明什么?
这场清退,戳破的不只是几个人
先把事件本身捋清楚。领军计划由丘成桐发起,面向全球初三至高三选拔数学人才,每年招生不超过100人,入选者通过预科考核后可免高考进入清华,走"3+2+3"本博贯通培养。2026级预科班今年2月底开班,6月中旬参加数学分析、代数、物理三门核心课程期末考试,6月27日部分未通过者参加第二次考核——这次用的是难度相对较低的2026年北京高考数学试卷。
随后社交媒体流传出"补考数学高考试卷均分仅110分"的说法,拟被清退的学生被贴上"水货""假天才"的标签。7月2日,一份拟被清退学生家长的请愿书开始流传,称书院领导曾公开表示预科淘汰率非常低,"除非孩子完全不上课、不交作业、不学习"。一边是书院强调考核的严肃性,一边是家庭难以接受的心理落差。
而这场风波的背面,是一条完整的产业链。近年专门针对领军计划的培训机构兴起:寒暑假集训一周收费四五千元,线上一对一面试课每小时1200元。机构研究考试规律,高校就调整考核方式、增加难以短期突击的内容——今年二试依然采用"现学现考"模式,学生先学陌生专题再考试,意在筛出真正有自学能力的人。培训机构和选拔方,陷入了一场典型的"军备竞赛"。
数据与研究:分数与能力之间的裂缝,比想象中大
先说一个最新的实验,它几乎是为这场风波量身定做的。2026年7月30日,布朗大学两位研究者(Topaz & Bahl)发表了一项分析:2026年春季学期,该校一位经济学教授布置了一次开卷(take-home)期中考试,成绩异常地高;于是期末考试改为现场监考。结果触目惊心:59名完成课程的学生,期中平均分95.7分(满分100),期末平均分暴跌到48.8分;同一名学生的期中、期末成绩相关系数只有0.06——几乎等于零。个体变化从+4分到-100分不等。排列检验显示:期中成绩对期末成绩没有任何统计上可检测的预测力。
研究者明确说:数据并不能证明每个学生都用了AI,但可以证明的是——当"作业可以外包"时,开卷分数对真实掌握程度几乎不携带信息。中间那道分数与能力之间的连接,被某种机制切断了。这正是求真书院今年增设"作业现场讲解"的原因:堵住那条断口。
第二项证据,来自一篇刚刚发表的STEM资优生识别系统综述(Tang, Bi & Wei, 2026年7月24日,Journal of Intelligence)。研究者按照PRISMA框架,从9个数据库筛出26篇实证研究,发现K-12阶段识别数学/科学天才的主流方法包括:智力与空间能力测试、学业成就测量、创造力与问题解决评估、作品集评价、学科竞赛、教师与家长推荐。结论值得细品:竞赛只是六种识别手段之一,而且研究者指出,认知推理、创造力、空间能力和问题解决才是核心指标——竞赛成绩并不能独立代表数学天赋。
第三项证据来自俄罗斯。一项对MGIMO(莫斯科国际关系学院)30名3-4年级本科生的半结构化访谈研究(Gulov, 2026年7月17日)发现,大学生参与学术奥赛的准备资源分化极其严重:从有导师支持的系统化团队训练,到完全个人化、零散式的备考,中间的差距是一条鸿沟。研究者警告:奥赛正在成为"教育不平等的放大器和选拔场"——它筛选出来的,一部分是天赋,一部分是资源。
根因分析:为什么刷题能拿金牌,却考不了28分
把三块证据拼起来,答案其实很朴素。
第一,刷题训练产出的是"模式匹配",不是"问题解决"。套路化培训的本质,是让学生在大量重复中记住"看到什么题,就用什么方法"。奥赛题训练得好,是因为机构研究透了历年出题规律,把题目喂成了熟面孔。但预科班的数学分析、代数,考的是陌生语境下的推理能力——没有现成套路可套。当考核从"熟题识别"切换到"陌生问题求解",模式匹配能力瞬间失效。28分和80分的差距,不是努力程度,而是训练类型。
第二,AI代做让"作业=能力证明"这条链彻底失效。布朗大学实验里的相关系数0.06,就是一个教科书级的信号:当作业可以被外包给工具,交上来的作业就不再是学习过程的证据,而成了"能调用什么工具"的证据。求真书院增设现场讲解,本质上是在做同一件事——把考核从"可外包的产物"拉回"不可外包的过程"。这不是针对某个学生的技术问题,而是整个评估体系正在经历的结构性危机。
第三,"军备竞赛"让高分越来越贵,也越来越假。机构研究规律,高校就换考核方式;机构再研究新规律,高校再换——每一次升级的成本,都摊在备考家庭头上:四五千元一周的集训、1200元一小时的面试课。更麻烦的是,这场竞赛奖励的是"最擅长猜测考核方意图"的人,而不是"数学能力最强"的人。当考核方把"现学现考"摆上台面,本质上是承认:靠刷题军备竞赛堆出来的高分,已经失去了选拔意义。
方案:分数会被稀释,但能力不会
这场风波真正的价值,是给所有家庭上了一堂"什么是真能力"的公开课。结合证据,可以拆出几条可操作的思路:
1. 对选拔方:用"不可外包的过程"校准评估。今年7月28日Review of Education上的一篇综述(Ogunleye等,103篇文献)系统梳理了"AI时代的真实评估",结论是:真实评估要对抗的不是AI本身,而是"可外包性"——凡是能直接交给工具完成的产出物,都不再是可靠的学习证据。方案包括:现场讲解、口试答辩、过程性作品集、以及让AI成为评估的一部分(比如让AI先批改、老师复核过程)。求真书院的"现学现考+现场讲解",恰好踩在这条路上。
2. 对学生:把训练目标从"题型覆盖率"换成"陌生问题求解力"。奥赛本身不是敌人——它是极好的问题解决训练场。问题出在"为考而刷"的模式化培训:反复做熟题,把推理过程压缩成条件反射。真正有效的训练是:刻意接触陌生问题、先自己推导再对照答案、能讲清楚每一步为什么。STEM资优识别综述里的四个核心指标——认知推理、创造力、空间能力、问题解决——每一项都是"过程能力",靠刷题刷不出来。
3. 对家长:警惕"资源军备竞赛"的陷阱。MGIMO研究揭示的分化逻辑在国内同样成立:1200元一小时的面试课,买的是"对考核规律的猜测权",不是数学能力。与其把预算砸向集训营,不如观察孩子面对陌生问题时的第一反应:是兴奋地动手尝试,还是条件反射式地找套路、等答案。后者才是真正需要补的课。
4. 对所有人:重新理解"高分"。布朗大学实验最有冲击力的地方,不是分数跌了一半,而是同一批学生的期中期末相关只有0.06——这意味着在某类考核下,高分可以完全不含能力信息。这提醒我们:看到任何一份亮眼的成绩单,先问一句"这份分数是怎么来的"——是现场推理出来的,还是靠套路、靠工具、靠资源堆出来的?答案不同,含金量天差地别。
给家长和学生的5件小事
- 做一次"现场讲解"实验:让孩子把最近一道做对的难题,不看书讲给你听。能讲清"为什么这么做",才是真会;只记得"这题老师讲过",就是套路。
- 每周安排一次"陌生题时间":找一道孩子没见过的题型,限制时间、不许查资料,观察他如何拆解问题。解决问题的能力,只在这类情境里生长。
- 把"过程痕迹"当作业:草稿纸、演算过程、改错的思路——这些不可外包的东西,才是学习真正的证据。家里可以定期翻看,而不是只盯着最终答案。
- 给培训降温:花大钱之前先问:这个班是教"解题思维",还是教"出题规律"?后者买的是短期分数,透支的是长期能力。
- 重新定义"考得好":下次考试后,多问一句"这题如果换个数、换个场景,你还会吗"——现场能迁移,才是真正属于孩子的分数。
28分的金牌得主,未必不是人才;80分的大多数,也未必都靠实力。清华这场清退风波真正撕开的,是刷题工业和AI时代共同制造的裂缝:分数越来越容易制造,能力越来越需要证明。对每个孩子来说,最稳妥的投资从来不是更贵的班、更新的工具,而是那些无法外包的、长在脑子里的推理能力——它可能不会让你在某个下午考出最高分,但它会让你在任何一张陌生的考卷前,都稳得住。