读 AI 论文最容易掉进的坑,是把每篇都当成一个孤立的新知识点去背。攒到一定程度,人会累、会懵、会怀疑”是不是我底子不够”。但真正的高手不是记得更多,而是握着几副望远镜——几条跨越时代都成立的顶级原理。拿着它去看任何设计,不管是 1980 年代的专家系统还是明天的新架构,都能一眼看穿”它在这条原理上做文章”。这篇,就是把这副望远镜交到你手里。
先给你山巅上的那一句话
如果整部 AI 史只能压成一句话,我会写成这样:
几乎每一个 AI 系统,都是在某种「表示」上,用「搜索/优化」去逼近一个「目标」,并赌它能「泛化」到没见过的情况。
symbolic AI、支持向量机、卷积网络、AlphaGo、GPT——全都是这句话的变体。区别只在于:用什么表示、优化什么目标、怎么搜索、怎么保证泛化。
这句话就是山顶。下面 12 条原理,是从山顶望下去能看到的 12 条主要山脊。我把它们分成三层:智能是什么 → 怎么学会 → 怎么变强。每条都配一个横跨 AI 全史的例子(老 AI → 今天),和一个透镜问题——以后读设计时,对着问就行。
第一层:智能”是什么”
1. 搜索与优化 —— 智能≈在巨大空间里找好解。 从走迷宫、下棋的 minimax、A*、Deep Blue,到今天的梯度下降、强化学习、AlphaGo 的蒙特卡洛树搜索——本质都是在一个大到无法穷举的空间里,高效地找到好的解。 › 透镜:它的”解空间”是什么?用什么方法在里面找路?
2. 表示决定成败 —— 换个表示,难题变易题。 AI 的艺术,一大半是选表示。同一个问题,用谓词逻辑、用手工特征(SIFT/HOG)、还是用学出来的向量(word2vec、embedding,让”意义”变成几何上的远近),难度天差地别。深度学习打败旧 AI 的核心,就是让特征自己被学出来,而不是人手工设计。 › 透镜:这里的知识/意义,被编码成了什么?
3. 目标函数即命运 —— 你度量什么,就得到什么。 模型最终会长成”你优化的那个数字”的形状。所以定义损失/奖励,就是在定义模型的灵魂。反面推论很锋利:度量错了,就得到怪物——这就是 Goodhart 定律、reward hacking。 › 全史:遗传算法的适应度函数 → 交叉熵损失 → 强化学习奖励 / RLHF。 › 透镜:它在优化哪个数字?如果这个数字被钻空子会怎样?
4. 泛化才是终点 —— 没见过的数据上表现好,才算数。 训练集上的分数是自欺欺人,整个机器学习都在跟”过拟合”搏斗。从统计学习理论的偏差-方差权衡,到正则化、dropout,再到大模型的”死记 vs 真会”——目的地永远是没见过的数据。 › 透镜:它防过拟合、赌泛化的手段是什么?
第二层:怎么”学会”
5. 从规则到数据 —— AI 史的主旋律。 一句话概括 AI 七十年的路:不断把”人写规则”换成”让数据自己说”。专家系统靠人手写成千上万条规则;统计学习从数据里估参数;深度学习干脆端到端全交给数据。 › 透镜:这套系统的知识,来自人的设计,还是数据?
6. 归纳偏置 / 没有免费的午餐 —— 每个模型都偷偷假设了世界的样子。 “没有免费午餐”定理说:不存在对所有问题都最好的模型。所以选模型 = 选假设。CNN 假设”局部相关”,RNN 假设”有时间顺序”,Transformer 假设”任意两点都可能相关”,图神经网络假设”图结构”。偏置越强越省数据但越窄。 › 透镜:它悄悄假设了世界的什么规律?这假设对不对?
7. 可微即可学 —— 只要可导,梯度就能自动学。 把整个系统写成处处可求导的函数,梯度下降就能把误差”反向传播”回每个参数去修正。可微,是”能被学习”的入场券——这就是为什么现代架构都被设计成可微的。反过来,遇到不可微的地方(比如”答案对不对”这种离散信号),就得用强化学习之类的手段绕过去。 › 透镜:它怎么保持可训练?哪里插了不可微的东西、又是怎么绕的?
8. 不确定性要建模 —— 输出的是分布,不是答案。 AI 在不确定中推理,它吐出来的从来是一个概率分布,不是一个确定答案。从贝叶斯、隐马尔可夫模型、概率图模型,到 softmax + 采样(temperature/top-k),再到生成模型(GAN、扩散、大语言模型本质都在拟合一个分布)——概率是贯穿始终的语言。 › 透镜:它建模的是哪个概率分布?
第三层:怎么”变强”、怎么”进化”
9. 规模、涌现与苦涩的教训 —— 通用方法 + 算力,打败人工巧劲。 Rich Sutton 的”苦涩的教训”:长期看,堆算力的通用方法总是赢过人类精心设计的规则和结构;而且规模够大,会涌现出小模型完全没有的新能力。 › 全史:感知机(太小没用)→ AlexNet(2012,GPU 点燃深度学习)→ GPT / R1(涌现出推理)。 › 透镜:这靠的是人工巧劲,还是通用方法 + 规模?哪个更可能赢?
10. 用算力换智能(训练 + 推理)—— 变强有两个旋钮。 一个是训练时堆规模(第 9 条),另一个常被忽略:推理时”多想一会儿”(搜索 / 思维链)。让模型在回答前多花计算去推演,准确率就上去。 › 全史:Deep Blue 靠搜索深度、AlphaGo 靠 MCTS、思维链和推理模型靠”多想几步”。 › 透镜:它的性能,是花在训练、还是花在推理换来的?
11. 反馈闭环:从交互中学习 —— 智能体自己造经验。 前面几条大多默认”有一个现成的数据集”。但最强的学习不是被动看数据,而是”行动 → 拿到反馈 → 修正”的闭环,智能体在与环境的互动里自己生成经验。这是被动学习和主动智能的分水岭。 › 全史:维纳的控制论反馈 → 强化学习的试错 → AlphaGo 自我对弈(自己跟自己下棋造训练数据)→ 今天的 agent、RLHF、自我改进。 › 透镜:它是被动喂数据,还是在闭环里自己产生经验?
12. 组合与复用:知识可迁移、可重组 —— 站在别人肩上。 智能靠积木:学一次的东西能迁移、能拼装,不必每次从零。这解释了整个基础模型时代的经济学——“预训练一个通才,再到处适配”,而不是每个任务从头训。 › 全史:子程序/符号规则的组合 → 迁移学习、预训练 → 基座模型 + 微调 / LoRA / 蒸馏 → 神经符号、工具调用、多智能体。 › 透镜:它复用/组合了什么现成的能力?
一张图记住它
flowchart TD
S["一句话山巅:<br/>在【表示】上,用【搜索/优化】<br/>逼近一个【目标】,并赌它【泛化】"]
S --> T1["第一层 · 智能是什么"]
S --> T2["第二层 · 怎么学会"]
S --> T3["第三层 · 怎么变强/进化"]
T1 --> P1["1 搜索与优化"]
T1 --> P2["2 表示决定成败 ★"]
T1 --> P3["3 目标函数即命运 ★"]
T1 --> P4["4 泛化才是终点"]
T2 --> P5["5 从规则到数据"]
T2 --> P6["6 归纳偏置/没有免费午餐"]
T2 --> P7["7 可微即可学"]
T2 --> P8["8 不确定性要建模"]
T3 --> P9["9 规模·涌现·苦涩的教训 ★"]
T3 --> P10["10 用算力换智能"]
T3 --> P11["11 反馈闭环:从交互学习"]
T3 --> P12["12 组合与复用"]
(打 ★ 的三条,是我认为最该背下来的核心,见下。)
如果只能带三条下山
12 条记不住没关系。真要精简,这三条能帮你对约 80% 的 AI 设计说清”它为什么长这样”:
- ③ 目标函数即命运 —— 决定它想成为什么(方向)
- ② 表示决定成败 —— 决定它怎么看世界(视角)
- ⑨ 规模与苦涩的教训 —— 决定谁笑到最后(趋势)
一个讲方向,一个讲视角,一个讲趋势。
两条”影子原理”
它们不在主清单里,但值得你单独记住:
- 对齐 / 规约(Alignment):第 ③ 条的影子。你写进目标里的(proxy)和你真正想要的(intent)之间,永远有一道缝;钻这道缝,就是 reward hacking、幻觉、不安全。这是当代 AI 最硬的开放问题,只是它本质是”目标函数即命运”的必然推论。
- 瓶颈塑造设计(Systems Bottleneck):工程层的元原理。真正决定一个系统架构长相的,往往是它最稀缺的资源——经典 AI 是组合爆炸(所以才需要启发式剪枝),今天是显存、带宽、上下文窗口(所以才有 KV cache、PagedAttention)。想读懂一个系统,先找它在跟哪个瓶颈搏斗。
怎么用这副望远镜
回到开头那个”读到发懵”的困境。从今往后,读任何一篇 AI 论文、看任何一个设计,别急着逐行硬啃,先问一句:
它主要在这 12 条里的哪几条上做文章?
十有八九,一篇让你懵的前沿论文,拆开就是其中三四条的组合。举个例子——
- DeepSeek-R1 = ③ 换了目标(奖励从”像人”变”答对”)+ ⑪ 反馈闭环(RL 试错)+ ⑨ 苦涩的教训(简单规则奖励打败了精巧的 PRM/MCTS)+ ⑩ 推理时算力(思考变长)+ ⑫ 复用(蒸馏进小模型)。
- AlexNet(2012) = ⑨ 规模(GPU)+ ⑥ 归纳偏置(卷积假设局部相关)+ ⑦ 可微(端到端反向传播)。
- 专家系统 = ⑤ 规则(人手写)+ ② 符号表示 + ① 搜索(推理机)——正因为它死死站在第 5 条”人写规则”的那一端,才注定被数据驱动的方法取代。
看,三个跨了四十年的系统,用同一副望远镜就能看穿。你会发现自己不是在背知识点,而是在同一张地图上,给每篇论文标出它的坐标。
所以,如果哪天你又觉得”听不懂、是不是底子不够”——大概率不是底子的问题,而是某一条原理你还没命名。把它映射到这 12 条上,那团雾,往往就是你还没起名字的那条透镜。
姊妹篇:如果说这 12 条原理是”思想的望远镜”,那么支撑这些原理的数学,也有一张同样的地图——见《AI 数学全景拆解:从研究前沿一路拆到小学算术》,把 AI 用到的全部数学拆到不能再拆。