技术无优劣,时代有偏好
你说’大模型好’或’旧算法不行’的时候,你以为你在做技术判断,其实你只是反映你所处时代的约束条件。
一、引子
1980 年代,连接主义(Connectionism)被学界主流抛弃。
不是因为它不对,是因为当时的算力跑不动它的想法。BP 算法理论上能训练多层网络,但训练一个像样的模型需要几周甚至几个月——在那个用 8086 处理器做浮点运算的年代,这叫"不实用"。
三十年后,同样一批算法,在 GPU 上只需要几小时。同样的数学结构,从"不切实际的空想"变成了"改变世界的技术"。
技术没有变,变的是约束条件。
这个现象不是个案。在技术史上反复出现——某个技术在一个时代被放弃,在另一个时代被追捧。技术本身没有突然变好,而是它所处的"约束条件坐标系"变了。真正决定一个技术"好不好"的,不是技术本身的优劣,而是当前算力、算法、数据三条线的交点。
二、三条约束线
任何技术的"好坏"都不独立存在,它永远是一个三维坐标系的产物。
算力线
计算成本决定了什么技术能"活下来"。
Transformer 在 2017 年就被提出了。但直到 GPT-3 用上千张 GPU 训练出令人惊艳的效果之前,它在工业界的影响力远不如 LSTM——不是 Transformer 不好,是当时的算力成本让它的优势无法兑现。
算力的核心逻辑:同一项技术,在算力匮乏时是"昂贵的玩具",在算力充裕时是"改变游戏规则的工具"。技术本身没有变,是它的"可承受成本线"下移了。
算法线
没有配套理论支撑时,光有算力推不动。
深度学习的几次寒冬,很大程度上不是因为算力不够,而是因为算法理论没跟上——梯度消失问题不解决,给你再多 GPU 也训练不了深层网络。Batch Normalization、ResNet、Attention 这些算法层面的突破,才让已有的算力真正变得有用。
算法的核心逻辑:算力是硬件上限,算法是硬件利用率的乘数。二者不是替代关系,是协同关系。
数据线
数据量级决定了模型的天花板。
N-gram 语言模型在 1990 年代是最好的方案之一,但它的能力上限受限于语料库的规模。互联网爆发后,可用文本量从几百万词跃升到几十亿词,神经网络语言模型的优势才开始显现——不是统计方法变差了,是数据量级超过了它的承载上限。
数据的核心逻辑:数据和算法的关系,就像燃料和引擎——你有一个好引擎但没有足够燃料,它飞不起来。
三条线的交叉
这三条约束线不是独立运作的。它们共同构成了技术时代的"筛子"——就像趋同进化中,物理定律和环境压力共同筛选出"在当时最适配"的设计。
- 算力线决定了什么计算在成本上可行
- 算法线决定了算力能被利用到什么程度
- 数据线决定了模型能力的上限
三条线交叉的那个点,就是我们常说的"技术先进"——但那不是绝对好坏的判断,只是一个时代偏好的快照。
三、筛子思维
趋同进化给我们最重要的启示是:演化没有目标,但筛子筛了五亿年。
鲨鱼和海豚起源完全不同,但在相同的海洋环境中进化出了流线型身体、背鳍、尾鳍——不是因为它们有共同的祖先,而是因为海洋环境的物理约束使"流线型"成为局部最优解。
技术演化的逻辑高度相似。
当一个技术的"约束条件"改变时,不一定是它变好了,而是筛子变了:
-
为什么同一颗 GPU 在 2012 年做 AlexNet 训练要一周,2022 年跑 LLaMA 可以训数百亿参数? 不全是 GPU 变快了——算法(Attention)和数据(互联网语料)两端的筛子同时也变了。
-
为什么 LSTM 统治 NLP 近十年,Transformer 只用三年就把它替代了? 不是 LSTM 变差了,是训练数据的规模突破了一个临界点——当数据量大到一定程度,LSTM 的序列计算瓶颈让它无法承受,Transformer 的并行计算优势才真正兑现。
-
为什么知识图谱在 2010 年代被吹捧为"AI 的基础设施",现在几乎没人提了? 不是知识图谱的理论错了。是数据量和算力的增长让端到端模型不需要显式知识建模就能达到更好效果——“显式知识"这条路径在当时的约束下是最优解,当约束变了,最优解也变了。
筛子思维的核心:不要问"这个技术好不好”,问"在当前约束条件下,哪个技术最适配"。答案会随时间变化——不是因为技术变了,是筛子变了。
四、启示
不迷恋最新,不鄙视最旧
深度学习不是第一次用"神经网络"这个名字。1950 年代的感知机、1980 年代的 BP 网络、2000 年代的深度信念网络——每次都被吹捧为革命,每次都在期望值高峰后坠入低谷。最终让它真正起飞的,不是技术本身改了,是约束条件到位了。
关键问题不是"哪个最好"
做技术选型时,最容易被忽视的问题是:你当前所处的约束条件是什么?
- 你的算力预算在哪个量级?
- 你的团队在哪个算法水平上有积累?
- 你的数据量够不够支撑这个方案?
这三个问题的答案,比你选的模型名称更能决定最终结果。
判断力 = 识别时代筛子的能力
真正有价值的能力不是"了解多少新模型",而是"判断当前的约束条件组合下,哪个方案最可能胜出"。
这个判断力的训练方法很简单:对每个你听说过的"好技术",问自己——它今天被追捧,是因为它真的改变了什么,还是因为三条约束线的交汇恰好让它显得合理?
📚 延伸阅读
-
AI = 世界的简化
一个理解 AI 本质的反直觉框架
-
地图不是疆域
AI 给的是一个地图,不是真实世界。问题不在你反复调的那个层面,在你从未怀疑过的地基上。
-
元简化
最高阶的能力不是优化一个方案,而是管理、组合、发现简化维度本身。