ChatGPT 让答案更好,批判性思维让想法更宽
OpenAI 刚放出一项和 Bocconi 大学合作的实验摘要:一千多名一年级学生,做同一份真实营销案例,随机分到「有 ChatGPT / 有批判性思维训练 / 都有 / 都没有」四组。
结论不玄乎,但对教育、产品和自己用 AI 的方式都刺得很准:
ChatGPT 让答案更好;批判性思维训练让想法更宽;两者叠在一起,增益面最宽。
实验在测什么

任务不是写空泛作文,而是给学校周边商品店提营销建议——有真实业务语境。
批判性思维这边,教的不是「怎么提示 ChatGPT」,而是因果推理:把因果串起来,说清为什么方案可能有效、在什么条件下会失效。训练形式是游戏、例子、问答和反馈,跟 AI 课无关。
评分两套并行:
- 人工五分制量表(偏「是否对准提知名度、促使用」这类常规营销目标)
- 自动文本分析:想法数量与多样性、因果推理痕迹、与专家方案的相似度
这套设计的价值在于:能把「AI 介入」和「思维训练」拆开看,也能看叠加。
AI 补的是「像样」
有 ChatGPT(GPT‑4o)的学生,量表上几乎高出将近一分(满分五)。答卷想法更多、逻辑更顺,也更像专家写的建议。
换句话说:新手被抬到更接近专业输出的水位。
但文章特意点了一句:学生并不是把作业整份甩给模型。他们仍要决定问什么、筛什么、把什么写进终稿。AI 缩的是「从零搓出像样结构」的成本,不是替你完成判断。
这对个人工作流的直译是:把 AI 当打磨与扩写引擎,把「选题、取舍、拍板」留在自己手里——否则你只是在批量生产可替换的光滑答案。
思维训练补的是「不一样」
批判性思维组有个反直觉结果:量表分没明显更高,但文本分析里,他们更会解释「为什么有效 / 何时失败」,而且想法在同学之间更独特、覆盖面更广。
量表看不见原创,并不等于没有增益。传统 rubric 天生偏爱「结构清楚、对准标准 KPI」的答卷,容易漏掉别人没写过的那一刀。

这跟很多人日常用 AI 的坑是同一件事:模型很擅长把你推向「看起来最安全、最常规」的答案。若你没有因果链和质疑假设的习惯,输出会越用越同质。
两者不是对立,是互补
实验里「AI + 训练」组:
- 想法多样性 ≈ 只做训练的组
- 量表分与想法数量 ≈ 只用 ChatGPT 的组
- 逻辑连贯、找解释、质疑假设 —— 更强
所以教育辩论里常见的二选一——「让学生自己想」还是「让学生用 AI」——被数据拍扁了:两个都要,而且测法要升级。
真正的雷:只看终稿
AI 让「打磨过的标准答案」变便宜之后,只看终稿质量,越来越测不到学生懂了什么。
学校若还用「像不像标准好答案」当唯一尺子,会系统性奖励可被模型代劳的部分,惩罚或忽略原创与推理过程。
对企业和独立开发者同样成立:
- 评估要加维度:过程假设、失败条件、差异化想法,而不只是文案光泽度。
- 产品别只做人用 Tab:交互可以收敛到 AI 层,但能力本身仍要可调用、可检验。
- 个人能力栈:因果推理 + 把话说清楚,仍是 AI 时代最硬的杠杆——问得好、筛得好,终稿才属于你。
带走一句
AI 让答案更好;批判性思维让想法更宽。
工具负责抬水位,训练负责拓地图。缺一边,你会要么又同质、要么又粗糙;两边一起练,才是这篇实验真正想说的准备方式。
来源:OpenAI — What students gain from ChatGPT and critical-thinking training
评论