大多数关于「AI 会不会让人变笨」的讨论都问错了问题。真正的问题不是用不用 AI,而是你把哪一层思考交给了它。这一篇想把这句话拆到能落地的程度——用三篇一手论文做支点。
一句话主线
AI 时代思考能力的分水岭,不在于用不用工具,而在于你外包的是「机械的执行」还是「判断与综合」。前者是杠杆,后者是借债。
这不是一句鸡汤。它有一个可复现的判据,也有神经科学和大规模元分析的证据。下面从证据到判据,一层层搭。
一、无差别卸载的代价:一笔看不见的「认知债」
先看最扎心的一篇。MIT Media Lab 的 Kosmyna 等人做了一个 EEG(脑电)实验,标题直接叫 Your Brain on ChatGPT(arXiv:2506.08872,2025)。
设计很干净:54 名参与者写同一类命题作文,分三组——
- LLM 组:用 ChatGPT 写;
- 搜索引擎组:只能用搜索;
- 纯脑组:不给任何工具。
每组连做三轮,戴着脑电帽记录写作时的脑区连接强度。结果呈现出一条清晰的梯度:
纯脑组的脑网络最强、最分布式;搜索引擎组居中;LLM 组的脑连接最弱。认知活动的强度,随外部工具的介入而单调下降。
真正的钩子在第四轮。研究者把两组人对调:一直用 LLM 的人被要求裸写(LLM→Brain),一直裸写的人开始用 LLM(Brain→LLM)。
- LLM→Brain:alpha 和 beta 波连接偏低,表现出「投入不足」的状态——像是肌肉已经松了。
- Brain→LLM:记忆提取和前额叶/枕顶叶激活反而更高——先自己想过,再用工具,脑子是热的。
还有两个行为层的细节值得记:LLM 组对自己文章的归属感最低,而且引用不出自己刚写的句子。作者给这种现象起了个名字——认知债(cognitive debt):当下省下的力气,是从未来的理解力里预支的。
需要立刻接住一个反对意见(绿灯思维):这篇论文尚未经过正式同行评审,样本只有 54 人(第四轮仅 18 人),任务也单一(英文作文)。所以别把它读成「ChatGPT 让人变笨」的定论。它能稳稳支撑的结论要弱一些、也更有用:当你把「构思—组织—表达」这条完整的思考链整段外包出去时,大脑确实会「下线」,而且这种下线有惯性。 记住这个限定词——整段。它是下一节的伏笔。
二、人机组合不是稳赢:取决于你在什么任务上组合
如果说第一篇讲的是「卸载有代价」,那第二篇讲的是「卸载的收益并不均匀」——这篇分量更重,因为它发在 Nature Human Behaviour。
Vaccaro、Almaatouq 和 Malone(MIT)做了一篇人机协作的系统性元分析(arXiv:2405.06087;Nat Hum Behav, 2024),汇总了 100 多个实验、300 多个效应量。他们只问一个问题:人 + AI,到底比「人单干」或「AI 单干」里更强的那个,是更好还是更差?
结论反直觉到值得抄下来:
平均而言,人机组合显著劣于「人单干」与「AI 单干」中更强的那一个。
也就是说,「1 + 1 > 2」不是默认值,很多时候连 max(1, 1) 都不到。但平均值背后藏着一条决定性的分界线:
| 任务类型 | 人机组合的效果 |
|---|---|
| 决策类(判断对错、做分类、下结论) | 平均变差 |
| 创作类(生成内容、产出方案) | 平均变好 |
还有一条更锋利的规律:
当人本来就比 AI 强时,组合会带来增益;当 AI 本来就比人强时,组合反而带来损失。
把这条翻译成人话:在 AI 已经比你强的地方硬要「把关」,你多半是在添乱;而在你比 AI 强的地方让 AI 打下手,才可能出协同。人插在回路里不是永远加分——插错地方就是减分。
这恰好解释了第一篇的「整段外包」为什么危险,也顺手指出了它的边界:外包本身不是原罪,外包错了层次才是。
三、把两篇拼起来:一个能随身带走的判据
现在把两篇论文叠在一起看,一条主线浮出来了。我把任何一次「思考」粗分成三层:
第 3 层 综合与判断 ← 定义问题、取舍、下结论、对结果负责
第 2 层 组织与推理 ← 搭结构、串逻辑、验证一致性
第 1 层 机械执行 ← 检索、罗列、套格式、初稿、翻译
- MIT 的 EEG 实验说明:把整栈(1+2+3)一次性外包,大脑会整体下线,欠下认知债。
- Nature 的元分析说明:在 AI 已经更强的层次上非要人来把关,是净损失;在人更强的层次上让 AI 打下手,才是净增益。
两条合起来,就是那句主线的完整版,也是可以贴在显示器上的判据:
让 AI 承包第 1 层(它比你快、比你强),你把省下的力气重投到第 3 层(它还替不了你)。唯独不能做的,是把第 3 层也一起交出去——那不是省力,是预支理解力。
这就是「杠杆」和「借债」的分界:
- 杠杆:外包机械层 → 释放的注意力回流到判断层 → 你整体变强(对应 Brain→LLM 那组「脑子是热的」)。
- 借债:外包判断层 → 注意力无处可去、就地蒸发 → 你以为变快,其实变空(对应 LLM→Brain 那组「肌肉松了」)。
四、落到日常:四个可以马上用的动作
主线讲完,给四个具体动作,避免停在抽象(呼应「具体优于抽象」)。
-
先想后问(Brain-first)。 拿到问题,先自己写下 30 秒的粗答案或提纲,再丢给 AI。这一步复刻了实验里 Brain→LLM 组的优势:先激活自己的检索和判断,工具就成了放大器而非替代品。代价极小,收益是「脑子始终在线」。
-
卸载执行,保留判断。 让 AI 写初稿、查资料、列选项、翻译、补样板代码——这些是第 1 层,交出去是纯赚。但「这个方案对不对」「该选哪条」「结论能不能这么下」——这些是第 3 层,必须自己过一遍。判断权一旦外包,认知债就开始计息。
-
对高置信度输出更警惕,而不是更放松。 元分析里最危险的场景是「AI 比人强、人还来把关」。现实中的镜像是:AI 说得越流畅、越像对的,你越容易停止思考。把「它听起来很有道理」当成一个需要主动核查的信号,而不是一个可以放松的理由。
-
定期「裸跑」。 像第一篇警告的那样,能力会因长期外包而萎缩。所以周期性地关掉 AI,纯脑做一次同类任务——写一段、推一次、debug 一回。这是在还「认知债」的利息,防止 LLM→Brain 组那种「一撤工具就下线」的状态变成你的默认状态。
灰度收尾:这不是要你少用 AI
最后必须讲清适用边界,避免落进「AI 有害 / AI 无害」的假二元对立(灰度思维)。
这篇的主张不是「少用 AI」,恰恰相反——在第 1 层,你应该比现在用得更狠、更彻底。它也不是「AI 生成的东西不可信」,而是「越可信的输出,越值得你把省下的判断力投回去复核」。
真正的主张只有一句:AI 时代最该练的能力,不是学会用工具,而是学会分层——清楚哪一层可以外包、哪一层必须自留。 会分层的人,AI 是杠杆;不分层的人,AI 是高利贷。
三个月后再看这篇,工具会换、模型会更强,但这条判据不会过时——因为它约束的不是某个模型,而是你和任何一个比你快的外部系统之间,注意力该怎么分配。
本文观点基于以下一手论文(用 scrapling 抓取并消化其摘要与结论):
- Kosmyna, N. et al. (2025). Your Brain on ChatGPT: Accumulation of Cognitive Debt when Using an AI Assistant for Essay Writing Task. arXiv:2506.08872.(尚未同行评审)
- Vaccaro, M., Almaatouq, A., & Malone, T. (2024). When combinations of humans and AI are useful: A systematic review and meta-analysis. Nature Human Behaviour. arXiv:2405.06087.