本文要点
- 讨论从是否允许学生用ChatGPT,转向不同干预分别改变什么指标。
- ChatGPT访问被单独测量,因果推理训练也被单独测量。
- 评价对象从最终分数扩展到想法差异性和解释质量。
阅读辅助
先看数字、证据和来源,再读正文。
8月27日新增事实是OpenAI发布与博科尼合作的学生随机实验。
2024-05-30 · OpenAI发布ChatGPT Edu,把高校作为教育场景的机构入口。
OpenAI在8月27日发布了一项与博科尼大学研究者合作的学生随机实验。这次增量清楚落在实验设计上:研究者把两类干预拆开测量,一类是给学生ChatGPT访问,另一类是给学生因果推理训练。
实验的设计比结论更值得先看。它覆盖超过1000名博科尼大学大一学生,任务是真实世界商业案例作业。学生被随机分到四组:有ChatGPT访问、接受因果推理训练、两者都有、两者都没有。ChatGPT访问使用的是GPT-4o。
评估也不只看学生自评。OpenAI披露,提交内容由受训人类评分员按5分制rubric评分,并配合文本分析。公告摘录称,有ChatGPT访问的学生在5分制上“almost a full point higher”,中文应写成接近提高1分,而不是长期学习能力提高一档。
因果推理训练带来的变化不体现在同一个分数里。它让学生提出更宽的原创想法,并更会解释方案为什么有效以及何时会失败;但用户给出的任务口径明确要求写清:这项训练没有提高rubric分数。PDF已经可访问,但本文没有逐项复核全部附录回归表,也没有找到独立博科尼页面;长期追踪和更细效应量仍需后续材料确认。
对教师和学校管理者来说,这项实验最直接的启发是评估对象要拆层。成品质量、想法差异性、解释能力和过程证据可能被不同干预影响。把这些东西压成一个总分,会遮住AI工具和思维训练的分工。
实验设计先看分组
这项研究的基本设计比许多教育AI讨论更强。研究者没有依赖学生事后回忆“感觉是否更会思考”,而是在同一类真实商业案例任务中随机分配干预,并让人类评分员用rubric给作品打分。随机化让“谁本来就更强”这个干扰因素降低,真实作业又比抽象问卷更接近课堂场景。
四组设置也很关键。只有ChatGPT访问的组,可以观察工具本身对成品质量的影响。只有因果推理训练的组,可以观察思维框架是否改变想法结构。两者都有的组,则回答一个现实问题:如果学校既允许使用AI,又教学生如何拆解因果关系,结果会不会互补。
| 分组 | 干预内容 | 公告披露的主要变化 | 证据边界 |
|---|---|---|---|
| 对照组 | 无ChatGPT访问,无因果训练 | 作为比较基线 | 不代表所有高校学生 |
| ChatGPT组 | 使用GPT-4o完成商业案例 | 5分制评分接近提高1分 | 不能证明长期能力提升 |
| 因果训练组 | 接受因果推理训练 | 想法差异性和解释能力增强 | 不应写成rubric分数提高 |
| 组合组 | 同时获得工具和训练 | 覆盖更高质量和更广想法范围 | 交互效应需看完整统计表 |
这个表格也解释了为什么这条新闻值得进深度。学校争论“能不能用AI”时,经常把工具访问、任务设计、评分标准和学习迁移混成一个问题。OpenAI与博科尼这次至少把其中两项拆开了:ChatGPT访问改善产出质量,因果训练影响思路范围和解释方式。
实验任务是商业案例,这一点也要保留。商业案例天然看重问题结构、方案质量、证据解释和可执行性。它适合观察“答案是否更连贯、更接近专家建议”,但它不能代表数学证明、文学写作、编程项目或实验室技能训练。不同学科的学习目标不同,AI工具可能改变的指标也不同。
结果不是单一分数故事
OpenAI公告的标题用了“Better answers, broader thinking”。对应到中文,比较稳妥的翻译是“答案更好,思路更广”。前半句指向ChatGPT访问带来的作业质量提升,后半句指向批判性或因果推理训练带来的想法范围变化。
最硬的数字是接近1分。因为评分量表是5分制,接近一分不是小差异。它说明在这类真实商业案例任务中,让学生使用GPT-4o,确实可能显著改善最终提交物的质量、连贯性和接近专家建议的程度。
但这不是一个可以简单宣传的“AI让学生更会学习”结论。人类评分员看到的是提交物。文本分析看到的是作品中的特征。它们都能说明作业表现变化,却不能自动说明学生在无工具环境下也获得了同等能力。
因果推理训练的结果更有教育含义。它没有提高rubric总分,却让学生提出更广的原创想法,并更能解释解决方案为什么可能有效、在什么条件下会失败。这说明传统rubric可能更偏爱清晰、完整、贴近标准答案的成品,而不是一定能奖励探索范围和反事实解释。
如果只看5分制总分,ChatGPT访问会显得更“有效”。如果把评价拆成原创性、差异性、解释深度和失败条件,因果训练的价值就会显现。教育机构更应该吸收的结论是:评分体系需要区分成品质量和推理质量,不能把“上ChatGPT就能提高成绩”当成完整答案。
证据矩阵与信源边界
本篇主事实来自OpenAI当日官方公告和本次采集到的正文摘录。RSS提供发布时间、标题和摘要锚点;CDP正文采集提供实验设计和关键数字。它们共同确认这是2026年8月27日的新发布。
博科尼大学的参与来自OpenAI公告和PDF。普通检索没有找到可稳定引用的独立博科尼研究公告页;PDF文件已经可访问,但本文没有逐项复核全部附录回归表。因此,正文只使用公告和PDF中可直接核对的样本、分组、模型和评分口径,不展开研究者姓名、回归模型、显著性水平或完整rubric维度。
OpenAI的ChatGPT Edu和Study Mode页面只提供背景。它们能说明OpenAI长期把高校和学习场景作为产品方向,却不能证明这项实验的任何效果。MIT高校AI教学报告和Microsoft Research关于生成式AI与批判性思考的研究也只用于解释教育治理问题,不能替OpenAI实验背书。
这种来源结构决定了本文的置信边界:发布事实和公告中的关键数字为高置信;对高校评估制度的含义属于编辑判断;对长期学习迁移、不同学科适用性和真实课堂推广效果保持开放。
高校评分面临的核心挑战
高校最难处理的问题,是作业到底在测什么,而不只是学生有没有点开ChatGPT。如果目标是让学生交出更接近专家建议的商业分析,工具访问本身就可能明显提高成品。如果目标是训练学生发现因果机制、解释边界条件和提出原创方案,单纯放开工具未必足够。
这项实验把“高质量答案”和“宽思路”放在同一张桌上比较。前者容易被rubric捕捉,因为评分员可以看到结构、论据、结论和表达是否成熟。后者更难被总分捕捉,因为想法差异性和失败条件解释可能分散在文本细节里,不一定被传统作业分数充分奖励。
这会倒逼课程设计变化。教师需要决定哪些环节允许AI参与,哪些环节要求学生留下过程证据。比如,最终报告可以允许使用ChatGPT,但要求学生提交问题框架、备选方案、反事实推理和舍弃方案理由。这样才能判断学生是在整理模型输出,还是在用模型支持自己的分析。
对学生来说,最有用的训练可能不是“提示词技巧”本身。更关键的是知道该把问题拆到什么层次。因果推理训练的价值正在这里:它要求学生说明变量之间的关系、干预为什么会产生结果、方案在什么条件下失效。这些问题比“让答案更漂亮”更接近可迁移能力。
对学校管理者来说,政策也要避免两个极端。完全禁用AI会把真实工作流挡在课堂外;完全放开又可能让学生把短期成品改善误认为能力增长。更可行的路线是明确任务类型:哪些作业考查表达和整合,哪些作业考查思路生成,哪些作业考查无工具情况下的基础能力。
这项实验最有价值的部分,是它没有把ChatGPT和批判性思维放在同一个评价桶里。ChatGPT访问带来的是更好的可提交作品;因果推理训练带来的是更宽的想法空间和更清楚的解释。两者都重要,但它们服务的教育目标不同。
早报判断是,学校未来会把AI使用规则从“允许或禁止”改成“在哪个环节允许、留下什么证据、用什么rubric评估”。如果rubric只奖励最终成品,ChatGPT会显得压倒性有效;如果rubric把原创性、反事实推理和失败条件纳入评分,教师才看得到学生自己的认知增量。
这也给OpenAI的教育产品一个清晰方向。学习模式、ChatGPT Edu和教师版都在争取学校信任,但学校需要的不只是更会输出答案的聊天框。更有长期价值的是课程基础设施:它能帮助教师区分工具贡献和学生贡献,也能把过程记录、评价口径和隐私边界做细。
保守的一面也不能忽略。公开材料目前只能证明短期商业案例作业中的表现差异。没有独立复核、完整数据和长期追踪前,任何关于“学生批判性思维整体提升”“AI长期改善学习能力”的表述都超出了证据范围。
接下来看什么
后续最需要补齐的是更易复核的数据、代码和附录统计表。每组样本数、随机化平衡、rubric细项、评分员一致性、统计显著性和文本分析方法都应能被外部读者复查;否则结论仍主要停留在公告和PDF披露层。
长期追踪同样关键。一个商业案例作业上的高分,和学生在下一个任务中独立迁移能力,是两件不同的事。教育实验如果只测即时作品,很容易高估工具对学习能力的贡献。
课堂政策是否开始改rubric也值得观察。若高校继续用单一成品分数评估学生,ChatGPT访问会自然占优。若rubric把方案多样性、因果解释、失败条件和过程记录拆成明确维度,因果训练的价值才可能被制度看见。
不同学生群体未必受益相同。大一学生、商科案例、GPT-4o、博科尼教学环境共同构成这次实验的边界。基础能力较弱或较强的学生,非商科任务,非英语或多语言课堂,都可能得到不同结果。
教育产品能否把研究结论转成功能,决定这条线索是否继续发酵。OpenAI可以把这项研究用于推广学习模式和高校产品,但有用的功能应该帮助学生解释自己的选择,而不只是把最终报告写得更流畅。