本文根据作者汪涛2026年7月18日在复旦大学中国研究院《人工智能与环境白皮书》国际研讨会上的发言资料整理完善而成。
2025年,当英伟达发布Blackwell架构GPU时,整个科技界再次陷入了一种近乎宗教般的狂热。单卡峰值算力相较十年前提升了约2,000倍——这个数字被反复吟诵,仿佛它就是人工智能通往通用智能(AGI)的通天塔。然而,在这串耀眼数字的背后,一个更为深刻的问题却被有意无意地忽略了:这2,000倍的提升,究竟有多少是真实的硬件进步?有多少是精度的”魔术”?又有多少,仅仅是行业在对摩尔定律正常运行形成的算力过剩时代的一种纠偏?
本文将基于英伟达数据中心GPU从2015年到2025年的算力演进数据,结合Bill Dally教授提出的性能归因框架,深入剖析AI底座发展的真实空间。我们将看到,“黄氏定律”——这个被包装为”AI时代摩尔定律”的概念——其四个发动机中,已有两个甚至更多正在熄火。更重要的是,我们将揭示一个被主流叙事长期掩盖的历史真相:在摩尔定律正常运行的年代,整个计算产业并非在追求效率,而是在系统性地浪费算力。WINTEL联盟通过降低硬件利用效率来制造升级需求,制造了一个效率被长期压制的时代。
当算力增长的天花板日益逼近,AI泡沫的破裂进入倒计时,我们需要重新审视:人工智能的未来,究竟建立在怎样的底座之上?
让我们首先直面那组最震撼的数字:2015年至2025年,英伟达数据中心GPU的单卡峰值算力提升了约2,000倍。按照MIT FutureTech的研究,同口径FP16算力约每1.44年翻倍。这意味着,如果我们以传统的晶体管密度摩尔定律(18-24个月翻倍)来衡量,AI算力的翻倍速度快了将近6倍——这就是被英伟达CEO黄仁勋反复宣扬的”黄氏定律”。
然而,这组数字经不起细究。根据Bill Dally教授(斯坦福大学计算机科学系教授、英伟达首席科学家)提出的归因框架,这2,000倍的提升可以分解为四个要素的乘积:
第一,低精度数值表示(贡献约32倍,占总提升的46%)。 从FP32(单精度浮点)到FP16(半精度),再到FP8,直至最新的FP4,每一次位宽的减半,都在同等面积和功耗下实现了算力的近似翻倍。Blackwell架构甚至引入了原生FP4/FP6的硬件支持。这无疑是过去十年AI算力增长的最大功臣——但它本质上是”换精度”,而非同口径的硬件进步。就像把一把尺子从毫米刻度换成厘米刻度,虽然读数快了10倍,但测量的精度也下降了10倍。
第二,张量核心与复杂指令(贡献约12.5倍,占总提升的33%)。 从FMA(融合乘加)到HMMA(半精度矩阵乘加),再到IMMA(整数矩阵乘加),直至Hopper架构的Transformer Engine,单条指令完成的计算量呈指数级增长。2017年Volta架构首次引入Tensor Core,到2025年的Blackwell,这条路径贡献了超过三分之一的性能提升。但这也是架构层面的优化,而非底层晶体管密度的提升。
第三,制程与先进封装(贡献约2.5倍,占总提升的12%)。 从28nm到16nm、12nm、7nm,再到4N/4NP工艺,传统摩尔定律的制程红利在这十年间仅贡献了2.5倍的提升。更值得注意的是,Blackwell架构为了维持这一份额,不得不采用双die拼接(NV-HBI)技术,并将功耗从250W大幅提升至1400W。这意味着,纯制程缩微的贡献已经极为有限,行业不得不依靠”堆料”和”堆功耗”来维持增长。
第四,结构化稀疏(贡献约2倍,占总提升的9%)。 自2020年Ampere架构起,英伟达支持2:4稀疏性——每4个权重中剪去2个,从而实现吞吐量的直接翻倍。但这本质上是一种”作弊”:它假设模型可以承受50%的权重稀疏而不显著损失精度,而这一假设并非对所有工作负载都成立。
将这四个要素相乘:32 × 12.5 × 2.5 × 2 ≈ 2,000。这就是那组耀眼数字的全部秘密。其中,超过79%的提升(46%+33%)来自精度和架构层面的”技巧”,而非传统意义上的硬件进步。如果我们排除低精度表示和张量核心,仅看制程和稀疏性带来的提升,十年间真实的硬件进步仅约5倍(2.5×2)。
黄仁勋将AI算力的增长称为”黄氏定律”,宣称其全栈综合FP16等效吞吐的翻倍周期仅为6个月,速度是传统摩尔定律的6倍。然而,这一”定律”正面临前所未有的挑战。
让我们仔细审视黄氏定律的”四个发动机”:
发动机一:低精度数值表示。 从FP32到FP16,再到FP8、FP4,这条路径已经走到了尽头。FP4意味着每个数值仅用4个比特表示,只能表达16个不同的数值。继续压缩到FP2(2比特,仅4个数值)在绝大多数AI场景中已不可行,因为量化误差将导致模型精度崩溃。事实上,业界已经在FP4上遇到了显著的精度损失问题,需要配合复杂的量化感知训练和动态范围缩放技术才能勉强使用。这个发动机,已经处于熄火的边缘。
发动机二:张量核心与复杂指令。 从FMA到HMMA、IMMA,再到Transformer Engine,指令的复杂度已经逼近物理极限。Transformer Engine本质上是为Transformer架构定制的硬件加速器,但AI模型架构正在快速演变——Mamba、RWKV、RetNet等新架构的出现,使得为特定架构优化的硬件面临”架构锁定”的风险。此外,单条指令完成的计算量不可能无限增长,受限于内存带宽和片上缓存的物理约束。这个发动机,也在显著减速。
发动机三:制程与先进封装。 这是传统摩尔定律的核心,也是当前最疲软的发动机。3nm以下的制程面临量子隧穿效应、漏电流激增、光刻技术极限等多重挑战。台积电的2nm工艺N2在2025年底量产(3nm的N3量产时间是2022年底,花了正好3年时间),目前在产能爬坡阶段,是全球首个实现规模化投产的 GAA 芯片。但是,晶体管密度的提升已远非线性。更严峻的是,先进制程的成本呈指数级上升——根据IBS的数据,3nm晶圆的成本已超过2万美元,而2nm预计将超过3万美元。“经济摩尔定律”——即每晶体管成本持续下降——在2020年已经永久消失。Blackwell的双die拼接和1400W功耗,正是制程红利枯竭后的无奈之举。
发动机四:结构化稀疏。 2:4稀疏性已经是较为激进的剪枝比例,进一步推广到1:4或更极端的稀疏模式,将严重影响模型精度。此外,稀疏性带来的性能提升依赖于特定的硬件支持和软件栈优化,通用性有限。这个发动机,从未真正全速运转过。
四个发动机中,低精度表示和制程缩微这两个最核心的引擎已经明显熄火或减速。张量核心和稀疏性虽然仍在运转,但边际收益递减的趋势不可逆转。这就是为什么,尽管英伟达单卡原生FP16张量算力在前7年(2015-2022)保持了1.4-1.8年的翻倍周期,但近3年(2022-2025)已经放缓至3.5-4年。黄氏定律的”6个月翻倍”,已经成为历史。
让我们将AI算力的增长置于更宏观的历史坐标系中审视。
传统晶体管密度摩尔定律在早年(1970s-2000s)确实保持了18-24个月的翻倍周期。但过去10年,这一周期已拉长至约3年。根据行业共识,2032年前翻倍周期将进一步延长至3.5-4年,2032-2038年为5-6年,2038年后硅基平面微缩将彻底失效,翻倍周期可能长达8-10年。
AI算力的”黄氏定律”虽然在前十年(2015-2025)通过”换精度”和架构创新实现了看似超越摩尔定律的增长,但其底层驱动力正在快速枯竭。未来5年,英伟达芯片性能提升将进入平台期,黄氏定律的速度将从6个月翻倍周期迅速拉长,1年、2年、4年,甚至8年。这不是危言耸听,而是基于物理极限和经济学规律的必然推断。
更值得关注的是,自2020年起,成本同步下降的”经济摩尔定律”已经永久消失。这意味着,即使晶体管密度仍在缓慢增长,每单位算力的成本甚至功耗都不再下降,甚至可能上升。对于依赖算力规模扩张的AI产业而言,这是一个致命的信号。
在深入讨论AI算力的未来之前,我们必须首先澄清一个被主流叙事长期掩盖的历史真相:在摩尔定律正常运行的年代,整个计算产业并非在追求效率,而是在系统性地压制和降低效率。
20世纪80年代末至21世纪初,是摩尔定律的黄金时代。CPU性能每18个月翻倍,晶体管数量指数级增长。然而,这种增长并未带来相应的效率提升。相反,业界的主流逻辑是:既然算力增长如此之快,何必费心优化软件效率?
一个广为流传的段子是:业界甚至有人呼吁CPU不要增长那么快,“486够用了”。这并非玩笑。在Windows 95时代,一台配备486处理器的PC已经足以运行当时的绝大多数应用软件。如果软件效率保持恒定,用户没有动力升级硬件。而硬件厂商——尤其是Intel和微软组成的WINTEL联盟——的商业模式恰恰建立在持续升级之上。
于是,一个奇特的产业生态形成了:硬件厂商竭尽所能地提升晶体管密度,而软件厂商则竭尽所能地”消耗”这些新增的算力。Windows操作系统的每一代新版本都比上一代更加臃肿,Office软件的功能堆砌远超实际需求,网页浏览器的内存占用呈指数级增长。这不是技术进步,而是一种精心设计的通过”人为制造的计划性淘汰”——通过降低软件效率来制造硬件升级需求。
最能说明这一问题的,是一个被计算机科学界反复引用的测试案例。
有人设计了这样一个实验:在Linux操作系统上,运行一个Windows仿真平台(如Wine或虚拟机),再在这个仿真平台上运行Windows的应用软件。按照直觉,直接在Windows平台上运行其原生应用软件,肯定要比这种”叠层架屋”的方式更顺畅。毕竟,每增加一层抽象,就增加一层开销。
然而,测试结果让人大跌眼镜:Linux+Windows仿真平台上的软件运行速度,比直接在Windows上运行快了近10倍。
这个结果看似荒诞,实则深刻揭示了WINTEL联盟的效率压制机制。Windows操作系统本身的设计,就包含了大量为兼容旧硬件、旧软件而保留的冗余代码,以及为维持向后兼容性而牺牲的性能优化空间。更关键的是,Windows的底层架构决策——如内存管理、进程调度、系统调用接口——在很大程度上是为了适配Intel的硬件特性,而非追求极致效率。Intel的CPU设计,同样为了兼容x86指令集的历史包袱,保留了大量在现代计算中早已过时的复杂指令和微架构设计。
这种”硬件-软件”的共谋,形成了一个低效率的锁定状态。Linux操作系统由于没有历史包袱,其内核设计更加精简高效;而Windows仿真平台在Linux上运行时,实际上剥离了Windows原生环境下的大量冗余开销。这就是为什么,看似多了一层抽象,实际性能反而提升了近10倍。
这个测试案例发生在20世纪初期,但它揭示的结构性问题贯穿了整个摩尔定律时代。在算力过剩的背景下,效率优化不仅得不到奖励,反而被视为”不必要的工作”。
存储结构的非常不合理也人为制造了巨大的低效率。我当年曾是王码电脑(惠州)的总工程师,在开发数据库软件时做了一个测试:利用当时DOS平台上的一个硬盘仿真器,在内存中虚拟出一个硬盘来。然后将全部数据库软件和数据全部装到这个在内存中虚拟的硬盘中。仅仅就是这么一个简单的改变,整个运行效率居然提升了10到20倍!后来我又进行了大量实验,并将结果写成“海量内存计算机”的研究文章发表在1998年的《计算机世界报》上。十年之后SAP公司提出“内存计算”,原理与我提出的“海量内存计算”完全一样。
另一个被长期忽视的效率维度,是并行计算。
大规模并行处理的效率计算,早在1967年就被Gene Amdahl以”阿姆达尔定律”的形式精确描述:无论增加多少处理器,程序的加速比受限于串行部分的比例。如果一个程序有10%的代码必须串行执行,假设无限增加处理器数量,最大加速比可达10倍。中间取一个折中,通过增加处理器数量是可以有效提升总体性能的。
然而,Intel对多核技术的态度堪称”迟钝”。尽管阿姆达尔定律在学术界早就广为人知,尽管多核架构在服务器和高性能计算领域早已成熟,Intel直到2005年才推出第一款面向消费市场的双核CPU(Pentium D),而主流的双核处理器(Core Duo)直到2006年才大规模上市。
为什么?因为在单核性能仍能按照摩尔定律稳定增长的时代,推广多核意味着承认单核性能增长即将见顶,意味着需要软件生态的根本性重构(多线程编程的复杂性远高于单线程),更意味着可能削弱Intel在单核性能上的垄断优势。与其冒险推动多核革命,不如继续沿着单核性能提升的舒适区缓慢前行。
这种战略拖延,导致整个产业在并行计算效率上浪费了至少十年时间。直到2005年后,当单核性能增长明显放缓,Intel才被迫转向多核路线。而此时,软件生态的并行化改造已经严重滞后,大量应用至今仍无法充分利用多核CPU的潜力。
回顾摩尔定律生效的时代,我们可以清晰地看到一条”效率压制”的主线:
• 芯片层:x86指令集的复杂性和历史包袱,导致大量晶体管被用于解码和兼容,而非实际计算。Intel的CPU设计中,用于维持向后兼容的电路占比长期居高不下。
• 硬件系统层:内存墙(Memory Wall)问题早在20世纪90年代就被提出,但直到近十年,高带宽内存(HBM)、近存计算(Near-Memory Computing)等技术才开始被重视。在算力过剩的年代,内存带宽的瓶颈被简单地用”等待”来解决。这导致在以往的计算系统中,事实上95%以上的时间,CPU是处于等待数据存储的状态。这是为什么我提出的“海量内存计算”可以极大提升效率的原因所在。
• 软件层:操作系统、编译器、应用软件的优化动力严重不足。“硬件会解决这个问题”成为软件工程师的口头禅。Java、Python等高级语言的普及,虽然提升了开发效率,但也以牺牲运行效率为代价。
• 系统层:分布式计算、云计算的资源浪费触目惊心。大量数据中心的服务器利用率长期低于20%,但因为没有经济激励,优化动力匮乏。
这种系统性的效率压制,在摩尔定律生效的时代被掩盖了——反正算力每18个月翻倍,谁在乎效率?但正是这种掩盖,为今天的困境或黄氏定律等改进空间埋下了伏笔:当摩尔定律接近完全失效时,我们才发现原来过去的硬件效率居然差到这种程度。黄氏定律不是英伟达进步的速度有多快,而是以往摩尔定律占主导的时代,效率被压制得太变态了。
2010年,是一个转折点。
这一年,Intel的32nm工艺开始量产,但晶体管密度的增长已经明显放缓。更关键的是,CPU的时钟频率在2004年左右触及”功耗墙”(Power Wall)后,已经停滞了近6年。摩尔定律的”免费午餐”——即通过制程进步自动获得性能提升——正式结束。
业界被迫开始”补课”:既然硬件的物理增长受限,那就必须在效率上下功夫。
这一时期的效率提升工作,大致可以分为几个层面:
制程层面:FinFET(鳍式场效应晶体管)在2011年引入,通过三维结构改善栅极控制,延缓了短沟道效应。GAA(全环绕栅极)晶体管在2022年后逐步量产,进一步提升了栅极控制能力。但这些属于”延续摩尔定律”的技术,而非突破性的新范式。
架构层面:多核成为主流,异构计算(CPU+GPU)开始普及。ARM架构凭借低功耗优势在移动领域崛起,反过来推动x86阵营的反思。RISC-V等开源指令集的出现,打破了x86和ARM的垄断,为定制化、高效率的芯片设计开辟了新路径。
软件层面:编译器优化、并行编程框架(如CUDA、OpenCL)、内存管理技术的进步,开始弥补历史欠账。容器化(Docker)、微服务架构、Serverless计算,本质上都是通过更精细的资源调度来提升系统级效率。
算法层面:深度学习领域的算法效率提升尤为显著。从AlexNet(2012)到ResNet(2015),再到Transformer(2017),模型架构的演进不仅提升了精度,也在一定程度上优化了计算效率。但真正的算法效率革命,要等到20世纪20年代才全面爆发。
集成电路发展最初期的液冷技术,今天又被翻了出来。
大内存成为主要解决CPU等待问题的方法之一。
......
在效率觉醒的浪潮中,中国企业的贡献不容忽视。华为海思总裁何庭波提出的”何庭波定律”,虽然不像摩尔定律或黄氏定律那样普遍,但其核心理念——在工艺受限的情况下,通过架构创新和系统优化来维持性能增长——代表了后摩尔定律时代的正确方向。
华为在面临美国制裁、先进制程获取受限的极端环境下,通过芯片架构的重新设计、系统级优化的深度挖掘、以及软硬件协同的极致调优,通过逻辑折叠来持续缩减信号传递的时间延迟,实现了在7nm甚至14nm工艺上接近国际先进水平的性能表现。这种”以效率换性能”的思路,与WINTEL时代”以硬件换性能”的逻辑形成了鲜明对比。
何庭波定律的本质是:当制程红利枯竭时,架构创新、系统优化和生态协同成为硬件层性能增长的主要来源。这一定律不仅适用于华为,也适用于整个后摩尔定律时代的半导体产业。
然而,我们必须清醒地认识到:所有的效率提升工作,都有其物理极限和边际收益递减的规律。
从2010年到现在,效率提升的工作已经进行了近15年。制程层面,FinFET到GAA的演进已经逼近硅基材料的物理极限;在实际线宽缩短到22nm之后,事实上就很难再继续缩减了。现在所谓的5nm、3nm、2nm都已经不是真正的线宽,而是等效的线宽。台积电2nm 的GAA晶体管实际物理栅极长度 Lg(开关沟道宽度)大约在10-12nm。晶体管的大小早就已经很难再继续缩小了。
架构层面,多核、异构、近存计算等技术已经大规模部署,但内存墙和功耗墙的问题仍未根本解决;
软件层面,编译器优化的空间日益收窄,并行编程的复杂性限制了多核潜力的充分释放;
更重要的是,效率提升的”低垂果实”已经被摘完。剩下的优化空间,要么需要颠覆性的技术突破(如量子计算、光计算、神经形态计算),要么需要产业生态的系统性重构(如全新的编程模型、内存体系、互连架构)。这些都不是5-10年内可以实现的。
因此,一个不可避免的结论是:未来5到10年,效率提升的工作也将遇到瓶颈和极限,趋于平稳。黄氏定律也将如摩尔定律一样进入平台期。何庭波定律也是如此。
在硬件增长见顶的背景下,算法层面的效率提升成为AI产业自救的重路径之一。DeepSeek的崛起,正是这一逻辑的最佳注脚。既然算力增长越来越难,那就想办法用更少的算力。
2025年1月20日,DeepSeek发布了R1模型。与OpenAI的O1模型相比,R1在同等任务质量下,算力需求仅为其1/10至1/20,成本仅为其1/27。这一数字震惊了业界——它意味着,通过算法创新,可以在不增加硬件投入的情况下,实现数量级的性能提升。
2026年4月24日,DeepSeek发布了V4模型。相对于R1,V4在相同工作负载下的算力需求进一步降低了1/3。这意味着,在不到一年半的时间里,DeepSeek通过算法优化,将同等任务的算力需求压缩到了O1的约1/30至1/60。成本仅为其不到1%。
DeepSeek的成功并非偶然。它代表了AI领域”算法效率”这一第二增长曲线的全面崛起。当硬件算力的增长放缓时,算法效率的提升就成为维持AI能力增长的关键。这类似于石油危机后,汽车工业从”大排量”转向”高效率”的历史转折。
然而,算法效率的提升也有其极限。因此,如何在最初的源头上将知识与信息进行压缩就成为终极的手段。人类创造的知识与获得的信息存在更大的冗余。要理解这一点,我们需要深入探讨人类知识信息的冗余问题。
根据《柳叶刀》2009年发表的一项著名研究(Chalmers & Glasziou),全球科研投入中约有85%被浪费。浪费的源头包括:重复研究、低价值选题、研究不发表或发表不完整、以及报告不可用。这意味着,在每年数千亿美元的全球科研投入中,仅有约15%真正产生了有价值的知识增量。
这种冗余在多个层面表现得淋漓尽致:
文献层面:同一科学结论,往往被成百上千篇论文反复表述。每一篇新论文都在前人的基础上做微小的修改或扩展,但核心贡献可能早已被充分阐述。一本教科书,本质上是对数万甚至数十万篇原始论文的高度去冗余——它将分散在各处的有效信息,压缩成一个连贯的知识体系。
网络信息层面:网页内容的重复率普遍估计在30%-50%。镜像网站、转载内容、洗稿文章、以及SEO驱动的低质量内容,构成了互联网信息的巨大冗余。搜索引擎虽然通过索引和排名机制部分缓解了这一问题,但并未从根本上消除冗余。
语言表达层面:人类语言的冗余度约为50%-75%。这意味着,在典型的文本中,有一半到四分之三的字符或词汇,对于传达核心信息并非严格必要。语言冗余的存在有其合理性——它提供了容错性、情感表达和文化语境——但从信息论的角度,它确实代表了巨大的知识信息冗余和潜在压缩空间。
根据我所建立的"统一测量学",因为近代科学革命开始后只是数学有统一的术语系统,而实验与测量没有统一的术语系统,这导致了整个人类不同学科领域存在巨量的知识冗余。
综合以上三个层面,人类知识信息本身的冗余总量级估计在1,000至10,000倍之间。这意味着,如果我们能够建立一种高度去冗余的知识表示体系,同等存储容量可以容纳的知识量,将是当前的千倍乃至万倍。
有趣的是,大语言模型(LLM)本身,就是一个巨大的信息压缩器。我们可以从三个口径来理解其压缩能力:
字节级压缩:训练语料的总体积与模型权重的体积之比,约为80:1。这意味着,一个经过训练的LLM,将其数万亿字节的训练数据,压缩到了数十亿至数百亿字节的权重参数中。
记忆级压缩:考虑到每个参数实际存储的信息量(约3.6比特),语料与模型实际存储信息之比约为200:1。这进一步考虑了参数精度(如FP16、FP8)对信息容量的影响。
知识级压缩:去除冗余后的有效知识与模型记忆容量之比,约为15-25:1。这是最严格的口径,它假设模型不仅存储了信息,还理解了信息之间的关联,形成了可迁移的知识表示。
以”猪”为例,英语中与”猪”相关的常用词汇就有数十个:pig(最常用)、swine(正式/集合名词)、hog(大猪)、porcine(形容词)、Suidae(猪科)、piggy/piglet(小猪昵称)、boar(公猪/野猪)、sow(母猪)、gilt(青年母猪)、shoat(刚断奶仔猪)、barrow(阉割公猪)……再加上部位和制品相关词汇(pork、bacon、ham、sausage、lard、trotter等),总计超过30个词汇指向同一个核心概念。这种概念的过度分化,正是知识冗余的典型表现。
面对知识冗余的汪洋大海,我们正努力做的工作是:创建一门名为”文明学”的学术平台,以系统性的方式重建整个人类的知识体系。
“文明学”的核心理念是:以最小化的、去冗余的概念体系,重新组织和表达人类文明的全部知识。它类似于数学中的公理化方法——从最少的公理出发,推导出整个理论体系。在”文明学”的框架下,每一个知识点理论上都会被精确地定位在其逻辑网络中的唯一位置,消除重复表述和概念混淆。
大语言模型已经展示了知识压缩的惊人能力。如果我们能够进一步将LLM的”隐式知识”转化为”显式结构”,建立一套标准化的、机器可读的知识表示语言,那么人类知识的组织和传播效率将迎来数量级的提升。
文明学是人工智能未来发展的必须,也是人类面对人工智能挑战必须作出的应对。它不仅是可以改进人工智能,而且可以使人类自身可以在人工智能时代具备与其相匹配的全科型知识学习和应用能力。
今天的AI智力水平进步的确是惊人的。我在前不久用KiMi K3的测试版本,在两天之内生成了5篇万字高水平论文,包括摘要、关键词、前言综述、图表、参考文献、正文中对参考文献的引用标注等都是自动生成,且格式非常规范。
这一能力确实令人印象深刻。它表明,在”形式规范”和”信息整合”的维度上,AI已经达到了甚至超越了大多数人类研究者的水平。当然,这种论文快速生成的的结果水平高度取决于输入指令的水平。它类似于一个计算机平台,输入的指令类于编程的软件。你输入的是什么软件,它就能运行出什么结果。
美国科技界近年来大谈”技术奇点”(Technological Singularity)和”通用人工智能”(AGI),其隐含的假设是:只要算力持续增长,AI的智力水平将指数级提升,最终超越人类,引发文明的质变。
然而,基于前文对硬件增长和算法效率的分析,这一假设的根基正在动摇:人工智能芯片的算力以及整体系统的算力很快将进入平台期,而不是越过一个奇点。没有底层硬件的持续指数增长,“奇点”的算力前提就不复存在。这不是悲观的预测,而是对物理极限和经济学规律的尊重。在平台期,AI的能力仍将缓慢增长,但不再是指数级的爆发式增长。这意味着,AGI(如果它真的存在的话)的实现时间表,需要被大幅推迟——从某些乐观者预测的”2027年”或”2030年”,推迟到”不确定的未来”。
当硬件增长进入平台期,算法效率的边际收益递减,而资本市场的预期仍然停留在”指数增长”“奇点来临”的叙事中时,泡沫的破灭就成为必然。
当前AI产业的泡沫,主要体现在以下几个层面:
估值泡沫:AI相关公司的市值,很大程度上建立在”算力即权力”的叙事之上。英伟达的市盈率长期维持在高位,反映了市场对其持续超高速增长的预期。然而,一旦硬件增长放缓被证实,估值的修正将是剧烈的。
投资泡沫:全球AI领域的风险投资在2023-2025年间达到了前所未有的规模。大量资金涌入基础模型训练、AI芯片设计、以及各类AI应用初创公司。然而,许多投资的前提是”算力成本将持续下降”,而这一前提正在失效。
应用泡沫:在消费端,AI应用的留存率和付费转化率远低于预期。许多被包装为”AI原生”的产品,其核心价值并非来自AI技术,而是来自传统的产品设计和运营能力。在 enterprise 端,AI的落地同样面临数据质量、集成成本、合规风险等现实障碍。
叙事泡沫:“AGI即将实现”、“AI将取代所有白领工作”、“算力是新时代的石油”等叙事,在媒体和社交网络上被反复强化。这些叙事虽然具有一定的启发性,但其过度简化和对技术极限的忽视,正在制造危险的预期落差。
AI泡沫的破裂,可能由以下一个或多个触发点引发:
硬件增长不及预期:如果英伟达下一代架构(如Rubin)的性能提升显著低于市场预期,或者制程进步遭遇不可逾越的物理障碍,资本市场对AI算力增长的信心将迅速崩塌。
算法效率触及瓶颈:如果DeepSeek等公司的后续模型无法继续保持算力需求的数量级下降,市场将意识到”算法效率”也有其极限,从而重新评估AI产业的成本结构。
宏观经济逆风:如果全球经济进入衰退周期,企业和消费者对AI投资的意愿将大幅下降。AI作为”锦上添花”的技术,在经济下行期往往首当其冲被削减预算。
监管收紧:随着AI技术的社会影响日益显现,各国政府对AI的监管正在收紧。如果监管措施显著增加AI开发和部署的成本,将加速泡沫的破裂。
泡沫破裂的路径,可能类似于2000年的互联网泡沫:短期内估值大幅回调,大量初创公司倒闭,投资热情迅速冷却。但与互联网泡沫不同的是,AI泡沫破裂后,行业的复苏可能更加缓慢——因为互联网泡沫破裂后,光纤和宽带基础设施的过剩为后续的Web 2.0革命提供了基础,而AI泡沫破裂后,算力基础设施的过剩并不必然转化为新的应用爆发(因为算力成本不再下降)。
泡沫的破裂虽然痛苦,但并非坏事。它将迫使AI产业从”叙事驱动”转向”价值驱动”,从”规模竞赛”转向”效率竞赛”。
在后泡沫时代,以下几个趋势将成为主导:
小模型崛起:当算力不再廉价,参数规模不再是唯一的竞争维度。针对特定任务优化的、数十亿参数级别的小模型,将比万亿参数的通用模型更具商业价值。
边缘计算普及:将AI推理从云端推向边缘设备,不仅可以降低延迟、保护隐私,更可以显著降低算力成本。这要求模型的小型化和硬件的高效化。
垂直应用深耕:通用AI助手的市场将趋于饱和,而针对医疗、法律、金融、制造等垂直领域的深度应用,将成为价值创造的主要来源。这些应用的成功,取决于领域知识的深度整合,而非算力的简单堆砌。
开源生态繁荣:当商业投资的热情冷却,开源社区将成为AI技术进步的主要推动力。类似于Linux在互联网泡沫后的崛起,开源AI模型和工具将在后泡沫时代扮演关键角色。
让我们回到本文的起点,总结几个核心结论:
第一,关于算力增长:2015年至2025年,英伟达单卡峰值算力提升约2,000倍,但对应的黄氏定律”四个发动机”即将大部分或全面熄火,未来5年算力增长将进入平台期。
第二,关于历史教训:摩尔定律生效的时代,WINTEL联盟通过系统性地降低软硬件效率来制造升级需求。2010年后,全行业被迫开始效率补课,但这一补课即将在5-10年内触及瓶颈。
第三,关于精减算力路径:DeepSeek等公司通过算法创新实现了数量级的效率提升。但这一路径的空间也是有限的,边际收益同样在递减。
第四,关于AI智力:AI在形式规范和信息整合上已达到很高水平,但原创性研究、因果推理、常识获取等核心能力仍有显著差距。“奇点”和”AGI”的叙事,缺乏底层硬件持续指数增长的支撑。
第五,关于泡沫与未来:随着硬件进入平台期,算法效率触及瓶颈,而资本市场预期仍停留在指数增长叙事中,AI泡沫的破裂将成为必然。后泡沫时代,AI产业将回归效率与价值,小模型、边缘计算、垂直应用和开源生态将成为主导。
第六,以文明学为核心的知识与信息压缩,是未来长期提升的关键。
对于政策制定者而言,需要认识到:AI产业的竞争力,不再仅仅取决于算力规模,而取决于算法效率、数据质量和应用落地能力。继续大规模投资建设智算中心,而忽视算法创新和生态培育,将造成巨大的资源浪费。同时,应支持”文明学”等长期知识基础设施的建设,为后硬件时代的知识增长奠定基础。
对于投资者而言,需要调整预期:AI领域的超额回报期可能已经结束。未来的投资机会,将更多地出现在算法效率工具、垂直行业应用、以及AI与传统产业深度融合的领域,而非基础模型和算力基础设施的”军备竞赛”。
对于技术从业者而言,这是一个”回归工程本质”的时代。当算力不再免费,每一个FLOP都需要被精打细算。模型压缩、推理优化、硬件—软件协同设计、以及领域知识的深度整合,将成为核心技术竞争力。同时,跨学科的知识结构——既懂AI算法,又懂行业知识,还懂系统优化——将比单纯的”大模型调参”更有价值。
我们正站在一个时代的边缘。过去十年,AI产业享受了算力指数增长的红利,创造了令人目眩的增长神话。当黄氏定律的”四个发动机”逐一熄火,当摩尔定律的补课进入瓶颈,当算法效率的边际收益递减,我们被迫面对一个不那么glamorous(迷人的;特别富有魅力的)但更为真实的未来:AI不是通往奇点的火箭,而是人类工具箱中一件日益精密的工具。它的价值,不在于取代人类,而在于增强人类;不在于追求无限的增长,而在于在有限的资源中创造最大的价值。
在平台的边缘,我们或许能够放下对”指数增长”的执念,重新审视技术的本质:技术不是目的,而是手段;算力不是权力,而是资源;AI不是神,而是镜——它映照出人类的智慧,也映照出人类的局限。
未来5年,AI产业将经历痛苦的调整。但调整之后,我们将迎来一个更加成熟、更加务实、也更加可持续的AI时代。那个时代,或许没有”奇点”的绚烂,但会有”效率”的踏实;没有”通用智能”的狂想,但会有”专用智能”的深耕;没有”算力即一切”的傲慢,但会有”知识即力量”的谦逊;没有隔行如隔山的学科围栏,但会有“文明学”的通晓型知识创造的辉煌未来。
这,才是AI底座发展的真正空间,也是AI的未来所在。
15.52万 热度
7.16万 热度
1.18亿 热度
119.02万 热度
98.98万 热度
AI泡沫何时破灭?从算力狂欢到效率觉醒
本文根据作者汪涛2026年7月18日在复旦大学中国研究院《人工智能与环境白皮书》国际研讨会上的发言资料整理完善而成。
引言:一个被算力神话遮蔽的时代
2025年,当英伟达发布Blackwell架构GPU时,整个科技界再次陷入了一种近乎宗教般的狂热。单卡峰值算力相较十年前提升了约2,000倍——这个数字被反复吟诵,仿佛它就是人工智能通往通用智能(AGI)的通天塔。然而,在这串耀眼数字的背后,一个更为深刻的问题却被有意无意地忽略了:这2,000倍的提升,究竟有多少是真实的硬件进步?有多少是精度的”魔术”?又有多少,仅仅是行业在对摩尔定律正常运行形成的算力过剩时代的一种纠偏?
本文将基于英伟达数据中心GPU从2015年到2025年的算力演进数据,结合Bill Dally教授提出的性能归因框架,深入剖析AI底座发展的真实空间。我们将看到,“黄氏定律”——这个被包装为”AI时代摩尔定律”的概念——其四个发动机中,已有两个甚至更多正在熄火。更重要的是,我们将揭示一个被主流叙事长期掩盖的历史真相:在摩尔定律正常运行的年代,整个计算产业并非在追求效率,而是在系统性地浪费算力。WINTEL联盟通过降低硬件利用效率来制造升级需求,制造了一个效率被长期压制的时代。
当算力增长的天花板日益逼近,AI泡沫的破裂进入倒计时,我们需要重新审视:人工智能的未来,究竟建立在怎样的底座之上?
第一部分:算力演进——2,000倍背后的真相
1.1 数字的魔术:从FP32到FP4的”精度游戏”
让我们首先直面那组最震撼的数字:2015年至2025年,英伟达数据中心GPU的单卡峰值算力提升了约2,000倍。按照MIT FutureTech的研究,同口径FP16算力约每1.44年翻倍。这意味着,如果我们以传统的晶体管密度摩尔定律(18-24个月翻倍)来衡量,AI算力的翻倍速度快了将近6倍——这就是被英伟达CEO黄仁勋反复宣扬的”黄氏定律”。
然而,这组数字经不起细究。根据Bill Dally教授(斯坦福大学计算机科学系教授、英伟达首席科学家)提出的归因框架,这2,000倍的提升可以分解为四个要素的乘积:
第一,低精度数值表示(贡献约32倍,占总提升的46%)。 从FP32(单精度浮点)到FP16(半精度),再到FP8,直至最新的FP4,每一次位宽的减半,都在同等面积和功耗下实现了算力的近似翻倍。Blackwell架构甚至引入了原生FP4/FP6的硬件支持。这无疑是过去十年AI算力增长的最大功臣——但它本质上是”换精度”,而非同口径的硬件进步。就像把一把尺子从毫米刻度换成厘米刻度,虽然读数快了10倍,但测量的精度也下降了10倍。
第二,张量核心与复杂指令(贡献约12.5倍,占总提升的33%)。 从FMA(融合乘加)到HMMA(半精度矩阵乘加),再到IMMA(整数矩阵乘加),直至Hopper架构的Transformer Engine,单条指令完成的计算量呈指数级增长。2017年Volta架构首次引入Tensor Core,到2025年的Blackwell,这条路径贡献了超过三分之一的性能提升。但这也是架构层面的优化,而非底层晶体管密度的提升。
第三,制程与先进封装(贡献约2.5倍,占总提升的12%)。 从28nm到16nm、12nm、7nm,再到4N/4NP工艺,传统摩尔定律的制程红利在这十年间仅贡献了2.5倍的提升。更值得注意的是,Blackwell架构为了维持这一份额,不得不采用双die拼接(NV-HBI)技术,并将功耗从250W大幅提升至1400W。这意味着,纯制程缩微的贡献已经极为有限,行业不得不依靠”堆料”和”堆功耗”来维持增长。
第四,结构化稀疏(贡献约2倍,占总提升的9%)。 自2020年Ampere架构起,英伟达支持2:4稀疏性——每4个权重中剪去2个,从而实现吞吐量的直接翻倍。但这本质上是一种”作弊”:它假设模型可以承受50%的权重稀疏而不显著损失精度,而这一假设并非对所有工作负载都成立。
将这四个要素相乘:32 × 12.5 × 2.5 × 2 ≈ 2,000。这就是那组耀眼数字的全部秘密。其中,超过79%的提升(46%+33%)来自精度和架构层面的”技巧”,而非传统意义上的硬件进步。如果我们排除低精度表示和张量核心,仅看制程和稀疏性带来的提升,十年间真实的硬件进步仅约5倍(2.5×2)。
1.2 黄氏定律的”四个发动机”与熄火危机
黄仁勋将AI算力的增长称为”黄氏定律”,宣称其全栈综合FP16等效吞吐的翻倍周期仅为6个月,速度是传统摩尔定律的6倍。然而,这一”定律”正面临前所未有的挑战。
让我们仔细审视黄氏定律的”四个发动机”:
发动机一:低精度数值表示。 从FP32到FP16,再到FP8、FP4,这条路径已经走到了尽头。FP4意味着每个数值仅用4个比特表示,只能表达16个不同的数值。继续压缩到FP2(2比特,仅4个数值)在绝大多数AI场景中已不可行,因为量化误差将导致模型精度崩溃。事实上,业界已经在FP4上遇到了显著的精度损失问题,需要配合复杂的量化感知训练和动态范围缩放技术才能勉强使用。这个发动机,已经处于熄火的边缘。
发动机二:张量核心与复杂指令。 从FMA到HMMA、IMMA,再到Transformer Engine,指令的复杂度已经逼近物理极限。Transformer Engine本质上是为Transformer架构定制的硬件加速器,但AI模型架构正在快速演变——Mamba、RWKV、RetNet等新架构的出现,使得为特定架构优化的硬件面临”架构锁定”的风险。此外,单条指令完成的计算量不可能无限增长,受限于内存带宽和片上缓存的物理约束。这个发动机,也在显著减速。
发动机三:制程与先进封装。 这是传统摩尔定律的核心,也是当前最疲软的发动机。3nm以下的制程面临量子隧穿效应、漏电流激增、光刻技术极限等多重挑战。台积电的2nm工艺N2在2025年底量产(3nm的N3量产时间是2022年底,花了正好3年时间),目前在产能爬坡阶段,是全球首个实现规模化投产的 GAA 芯片。但是,晶体管密度的提升已远非线性。更严峻的是,先进制程的成本呈指数级上升——根据IBS的数据,3nm晶圆的成本已超过2万美元,而2nm预计将超过3万美元。“经济摩尔定律”——即每晶体管成本持续下降——在2020年已经永久消失。Blackwell的双die拼接和1400W功耗,正是制程红利枯竭后的无奈之举。
发动机四:结构化稀疏。 2:4稀疏性已经是较为激进的剪枝比例,进一步推广到1:4或更极端的稀疏模式,将严重影响模型精度。此外,稀疏性带来的性能提升依赖于特定的硬件支持和软件栈优化,通用性有限。这个发动机,从未真正全速运转过。
四个发动机中,低精度表示和制程缩微这两个最核心的引擎已经明显熄火或减速。张量核心和稀疏性虽然仍在运转,但边际收益递减的趋势不可逆转。这就是为什么,尽管英伟达单卡原生FP16张量算力在前7年(2015-2022)保持了1.4-1.8年的翻倍周期,但近3年(2022-2025)已经放缓至3.5-4年。黄氏定律的”6个月翻倍”,已经成为历史。
1.3 与传统摩尔定律的对比:一个时代的终结
让我们将AI算力的增长置于更宏观的历史坐标系中审视。
传统晶体管密度摩尔定律在早年(1970s-2000s)确实保持了18-24个月的翻倍周期。但过去10年,这一周期已拉长至约3年。根据行业共识,2032年前翻倍周期将进一步延长至3.5-4年,2032-2038年为5-6年,2038年后硅基平面微缩将彻底失效,翻倍周期可能长达8-10年。
AI算力的”黄氏定律”虽然在前十年(2015-2025)通过”换精度”和架构创新实现了看似超越摩尔定律的增长,但其底层驱动力正在快速枯竭。未来5年,英伟达芯片性能提升将进入平台期,黄氏定律的速度将从6个月翻倍周期迅速拉长,1年、2年、4年,甚至8年。这不是危言耸听,而是基于物理极限和经济学规律的必然推断。
更值得关注的是,自2020年起,成本同步下降的”经济摩尔定律”已经永久消失。这意味着,即使晶体管密度仍在缓慢增长,每单位算力的成本甚至功耗都不再下降,甚至可能上升。对于依赖算力规模扩张的AI产业而言,这是一个致命的信号。
第二部分:被掩盖的历史——摩尔定律时代的效率压制
2.1 WINTEL联盟的”人为降低效率”
在深入讨论AI算力的未来之前,我们必须首先澄清一个被主流叙事长期掩盖的历史真相:在摩尔定律正常运行的年代,整个计算产业并非在追求效率,而是在系统性地压制和降低效率。
20世纪80年代末至21世纪初,是摩尔定律的黄金时代。CPU性能每18个月翻倍,晶体管数量指数级增长。然而,这种增长并未带来相应的效率提升。相反,业界的主流逻辑是:既然算力增长如此之快,何必费心优化软件效率?
一个广为流传的段子是:业界甚至有人呼吁CPU不要增长那么快,“486够用了”。这并非玩笑。在Windows 95时代,一台配备486处理器的PC已经足以运行当时的绝大多数应用软件。如果软件效率保持恒定,用户没有动力升级硬件。而硬件厂商——尤其是Intel和微软组成的WINTEL联盟——的商业模式恰恰建立在持续升级之上。
于是,一个奇特的产业生态形成了:硬件厂商竭尽所能地提升晶体管密度,而软件厂商则竭尽所能地”消耗”这些新增的算力。Windows操作系统的每一代新版本都比上一代更加臃肿,Office软件的功能堆砌远超实际需求,网页浏览器的内存占用呈指数级增长。这不是技术进步,而是一种精心设计的通过”人为制造的计划性淘汰”——通过降低软件效率来制造硬件升级需求。
2.2 Linux+Windows仿真平台比原生Windows快10倍的荒诞
最能说明这一问题的,是一个被计算机科学界反复引用的测试案例。
有人设计了这样一个实验:在Linux操作系统上,运行一个Windows仿真平台(如Wine或虚拟机),再在这个仿真平台上运行Windows的应用软件。按照直觉,直接在Windows平台上运行其原生应用软件,肯定要比这种”叠层架屋”的方式更顺畅。毕竟,每增加一层抽象,就增加一层开销。
然而,测试结果让人大跌眼镜:Linux+Windows仿真平台上的软件运行速度,比直接在Windows上运行快了近10倍。
这个结果看似荒诞,实则深刻揭示了WINTEL联盟的效率压制机制。Windows操作系统本身的设计,就包含了大量为兼容旧硬件、旧软件而保留的冗余代码,以及为维持向后兼容性而牺牲的性能优化空间。更关键的是,Windows的底层架构决策——如内存管理、进程调度、系统调用接口——在很大程度上是为了适配Intel的硬件特性,而非追求极致效率。Intel的CPU设计,同样为了兼容x86指令集的历史包袱,保留了大量在现代计算中早已过时的复杂指令和微架构设计。
这种”硬件-软件”的共谋,形成了一个低效率的锁定状态。Linux操作系统由于没有历史包袱,其内核设计更加精简高效;而Windows仿真平台在Linux上运行时,实际上剥离了Windows原生环境下的大量冗余开销。这就是为什么,看似多了一层抽象,实际性能反而提升了近10倍。
这个测试案例发生在20世纪初期,但它揭示的结构性问题贯穿了整个摩尔定律时代。在算力过剩的背景下,效率优化不仅得不到奖励,反而被视为”不必要的工作”。
存储结构的非常不合理也人为制造了巨大的低效率。我当年曾是王码电脑(惠州)的总工程师,在开发数据库软件时做了一个测试:利用当时DOS平台上的一个硬盘仿真器,在内存中虚拟出一个硬盘来。然后将全部数据库软件和数据全部装到这个在内存中虚拟的硬盘中。仅仅就是这么一个简单的改变,整个运行效率居然提升了10到20倍!后来我又进行了大量实验,并将结果写成“海量内存计算机”的研究文章发表在1998年的《计算机世界报》上。十年之后SAP公司提出“内存计算”,原理与我提出的“海量内存计算”完全一样。
2.3 多核技术的”迟到”:阿姆达尔定律的遗忘
另一个被长期忽视的效率维度,是并行计算。
大规模并行处理的效率计算,早在1967年就被Gene Amdahl以”阿姆达尔定律”的形式精确描述:无论增加多少处理器,程序的加速比受限于串行部分的比例。如果一个程序有10%的代码必须串行执行,假设无限增加处理器数量,最大加速比可达10倍。中间取一个折中,通过增加处理器数量是可以有效提升总体性能的。
然而,Intel对多核技术的态度堪称”迟钝”。尽管阿姆达尔定律在学术界早就广为人知,尽管多核架构在服务器和高性能计算领域早已成熟,Intel直到2005年才推出第一款面向消费市场的双核CPU(Pentium D),而主流的双核处理器(Core Duo)直到2006年才大规模上市。
为什么?因为在单核性能仍能按照摩尔定律稳定增长的时代,推广多核意味着承认单核性能增长即将见顶,意味着需要软件生态的根本性重构(多线程编程的复杂性远高于单线程),更意味着可能削弱Intel在单核性能上的垄断优势。与其冒险推动多核革命,不如继续沿着单核性能提升的舒适区缓慢前行。
这种战略拖延,导致整个产业在并行计算效率上浪费了至少十年时间。直到2005年后,当单核性能增长明显放缓,Intel才被迫转向多核路线。而此时,软件生态的并行化改造已经严重滞后,大量应用至今仍无法充分利用多核CPU的潜力。
2.4 效率压制的系统性后果
回顾摩尔定律生效的时代,我们可以清晰地看到一条”效率压制”的主线:
• 芯片层:x86指令集的复杂性和历史包袱,导致大量晶体管被用于解码和兼容,而非实际计算。Intel的CPU设计中,用于维持向后兼容的电路占比长期居高不下。
• 硬件系统层:内存墙(Memory Wall)问题早在20世纪90年代就被提出,但直到近十年,高带宽内存(HBM)、近存计算(Near-Memory Computing)等技术才开始被重视。在算力过剩的年代,内存带宽的瓶颈被简单地用”等待”来解决。这导致在以往的计算系统中,事实上95%以上的时间,CPU是处于等待数据存储的状态。这是为什么我提出的“海量内存计算”可以极大提升效率的原因所在。
• 软件层:操作系统、编译器、应用软件的优化动力严重不足。“硬件会解决这个问题”成为软件工程师的口头禅。Java、Python等高级语言的普及,虽然提升了开发效率,但也以牺牲运行效率为代价。
• 系统层:分布式计算、云计算的资源浪费触目惊心。大量数据中心的服务器利用率长期低于20%,但因为没有经济激励,优化动力匮乏。
这种系统性的效率压制,在摩尔定律生效的时代被掩盖了——反正算力每18个月翻倍,谁在乎效率?但正是这种掩盖,为今天的困境或黄氏定律等改进空间埋下了伏笔:当摩尔定律接近完全失效时,我们才发现原来过去的硬件效率居然差到这种程度。黄氏定律不是英伟达进步的速度有多快,而是以往摩尔定律占主导的时代,效率被压制得太变态了。
第三部分:效率觉醒——从2010年至今的补课
3.1 摩尔定律放缓:效率优化的被迫启动
2010年,是一个转折点。
这一年,Intel的32nm工艺开始量产,但晶体管密度的增长已经明显放缓。更关键的是,CPU的时钟频率在2004年左右触及”功耗墙”(Power Wall)后,已经停滞了近6年。摩尔定律的”免费午餐”——即通过制程进步自动获得性能提升——正式结束。
业界被迫开始”补课”:既然硬件的物理增长受限,那就必须在效率上下功夫。
这一时期的效率提升工作,大致可以分为几个层面:
制程层面:FinFET(鳍式场效应晶体管)在2011年引入,通过三维结构改善栅极控制,延缓了短沟道效应。GAA(全环绕栅极)晶体管在2022年后逐步量产,进一步提升了栅极控制能力。但这些属于”延续摩尔定律”的技术,而非突破性的新范式。
架构层面:多核成为主流,异构计算(CPU+GPU)开始普及。ARM架构凭借低功耗优势在移动领域崛起,反过来推动x86阵营的反思。RISC-V等开源指令集的出现,打破了x86和ARM的垄断,为定制化、高效率的芯片设计开辟了新路径。
软件层面:编译器优化、并行编程框架(如CUDA、OpenCL)、内存管理技术的进步,开始弥补历史欠账。容器化(Docker)、微服务架构、Serverless计算,本质上都是通过更精细的资源调度来提升系统级效率。
算法层面:深度学习领域的算法效率提升尤为显著。从AlexNet(2012)到ResNet(2015),再到Transformer(2017),模型架构的演进不仅提升了精度,也在一定程度上优化了计算效率。但真正的算法效率革命,要等到20世纪20年代才全面爆发。
集成电路发展最初期的液冷技术,今天又被翻了出来。
大内存成为主要解决CPU等待问题的方法之一。
......
3.2 华为的”何庭波定律”:中国路径的效率哲学
在效率觉醒的浪潮中,中国企业的贡献不容忽视。华为海思总裁何庭波提出的”何庭波定律”,虽然不像摩尔定律或黄氏定律那样普遍,但其核心理念——在工艺受限的情况下,通过架构创新和系统优化来维持性能增长——代表了后摩尔定律时代的正确方向。
华为在面临美国制裁、先进制程获取受限的极端环境下,通过芯片架构的重新设计、系统级优化的深度挖掘、以及软硬件协同的极致调优,通过逻辑折叠来持续缩减信号传递的时间延迟,实现了在7nm甚至14nm工艺上接近国际先进水平的性能表现。这种”以效率换性能”的思路,与WINTEL时代”以硬件换性能”的逻辑形成了鲜明对比。
何庭波定律的本质是:当制程红利枯竭时,架构创新、系统优化和生态协同成为硬件层性能增长的主要来源。这一定律不仅适用于华为,也适用于整个后摩尔定律时代的半导体产业。
3.3 效率提升的瓶颈:边际收益递减
然而,我们必须清醒地认识到:所有的效率提升工作,都有其物理极限和边际收益递减的规律。
从2010年到现在,效率提升的工作已经进行了近15年。制程层面,FinFET到GAA的演进已经逼近硅基材料的物理极限;在实际线宽缩短到22nm之后,事实上就很难再继续缩减了。现在所谓的5nm、3nm、2nm都已经不是真正的线宽,而是等效的线宽。台积电2nm 的GAA晶体管实际物理栅极长度 Lg(开关沟道宽度)大约在10-12nm。晶体管的大小早就已经很难再继续缩小了。
架构层面,多核、异构、近存计算等技术已经大规模部署,但内存墙和功耗墙的问题仍未根本解决;
软件层面,编译器优化的空间日益收窄,并行编程的复杂性限制了多核潜力的充分释放;
更重要的是,效率提升的”低垂果实”已经被摘完。剩下的优化空间,要么需要颠覆性的技术突破(如量子计算、光计算、神经形态计算),要么需要产业生态的系统性重构(如全新的编程模型、内存体系、互连架构)。这些都不是5-10年内可以实现的。
因此,一个不可避免的结论是:未来5到10年,效率提升的工作也将遇到瓶颈和极限,趋于平稳。黄氏定律也将如摩尔定律一样进入平台期。何庭波定律也是如此。
第四部分:DeepSeek路径与知识压缩——算法层面的自救
4.1 DeepSeek R1与V4:算法效率的革命
在硬件增长见顶的背景下,算法层面的效率提升成为AI产业自救的重路径之一。DeepSeek的崛起,正是这一逻辑的最佳注脚。既然算力增长越来越难,那就想办法用更少的算力。
2025年1月20日,DeepSeek发布了R1模型。与OpenAI的O1模型相比,R1在同等任务质量下,算力需求仅为其1/10至1/20,成本仅为其1/27。这一数字震惊了业界——它意味着,通过算法创新,可以在不增加硬件投入的情况下,实现数量级的性能提升。
2026年4月24日,DeepSeek发布了V4模型。相对于R1,V4在相同工作负载下的算力需求进一步降低了1/3。这意味着,在不到一年半的时间里,DeepSeek通过算法优化,将同等任务的算力需求压缩到了O1的约1/30至1/60。成本仅为其不到1%。
DeepSeek的成功并非偶然。它代表了AI领域”算法效率”这一第二增长曲线的全面崛起。当硬件算力的增长放缓时,算法效率的提升就成为维持AI能力增长的关键。这类似于石油危机后,汽车工业从”大排量”转向”高效率”的历史转折。
4.2 知识信息的冗余:被忽视的压缩空间
然而,算法效率的提升也有其极限。因此,如何在最初的源头上将知识与信息进行压缩就成为终极的手段。人类创造的知识与获得的信息存在更大的冗余。要理解这一点,我们需要深入探讨人类知识信息的冗余问题。
根据《柳叶刀》2009年发表的一项著名研究(Chalmers & Glasziou),全球科研投入中约有85%被浪费。浪费的源头包括:重复研究、低价值选题、研究不发表或发表不完整、以及报告不可用。这意味着,在每年数千亿美元的全球科研投入中,仅有约15%真正产生了有价值的知识增量。
这种冗余在多个层面表现得淋漓尽致:
文献层面:同一科学结论,往往被成百上千篇论文反复表述。每一篇新论文都在前人的基础上做微小的修改或扩展,但核心贡献可能早已被充分阐述。一本教科书,本质上是对数万甚至数十万篇原始论文的高度去冗余——它将分散在各处的有效信息,压缩成一个连贯的知识体系。
网络信息层面:网页内容的重复率普遍估计在30%-50%。镜像网站、转载内容、洗稿文章、以及SEO驱动的低质量内容,构成了互联网信息的巨大冗余。搜索引擎虽然通过索引和排名机制部分缓解了这一问题,但并未从根本上消除冗余。
语言表达层面:人类语言的冗余度约为50%-75%。这意味着,在典型的文本中,有一半到四分之三的字符或词汇,对于传达核心信息并非严格必要。语言冗余的存在有其合理性——它提供了容错性、情感表达和文化语境——但从信息论的角度,它确实代表了巨大的知识信息冗余和潜在压缩空间。
根据我所建立的"统一测量学",因为近代科学革命开始后只是数学有统一的术语系统,而实验与测量没有统一的术语系统,这导致了整个人类不同学科领域存在巨量的知识冗余。
综合以上三个层面,人类知识信息本身的冗余总量级估计在1,000至10,000倍之间。这意味着,如果我们能够建立一种高度去冗余的知识表示体系,同等存储容量可以容纳的知识量,将是当前的千倍乃至万倍。
4.3 大语言模型:一个巨大的信息压缩器
有趣的是,大语言模型(LLM)本身,就是一个巨大的信息压缩器。我们可以从三个口径来理解其压缩能力:
字节级压缩:训练语料的总体积与模型权重的体积之比,约为80:1。这意味着,一个经过训练的LLM,将其数万亿字节的训练数据,压缩到了数十亿至数百亿字节的权重参数中。
记忆级压缩:考虑到每个参数实际存储的信息量(约3.6比特),语料与模型实际存储信息之比约为200:1。这进一步考虑了参数精度(如FP16、FP8)对信息容量的影响。
知识级压缩:去除冗余后的有效知识与模型记忆容量之比,约为15-25:1。这是最严格的口径,它假设模型不仅存储了信息,还理解了信息之间的关联,形成了可迁移的知识表示。
以”猪”为例,英语中与”猪”相关的常用词汇就有数十个:pig(最常用)、swine(正式/集合名词)、hog(大猪)、porcine(形容词)、Suidae(猪科)、piggy/piglet(小猪昵称)、boar(公猪/野猪)、sow(母猪)、gilt(青年母猪)、shoat(刚断奶仔猪)、barrow(阉割公猪)……再加上部位和制品相关词汇(pork、bacon、ham、sausage、lard、trotter等),总计超过30个词汇指向同一个核心概念。这种概念的过度分化,正是知识冗余的典型表现。
4.4 “文明学”:重建人类知识体系的雄心
面对知识冗余的汪洋大海,我们正努力做的工作是:创建一门名为”文明学”的学术平台,以系统性的方式重建整个人类的知识体系。
“文明学”的核心理念是:以最小化的、去冗余的概念体系,重新组织和表达人类文明的全部知识。它类似于数学中的公理化方法——从最少的公理出发,推导出整个理论体系。在”文明学”的框架下,每一个知识点理论上都会被精确地定位在其逻辑网络中的唯一位置,消除重复表述和概念混淆。
大语言模型已经展示了知识压缩的惊人能力。如果我们能够进一步将LLM的”隐式知识”转化为”显式结构”,建立一套标准化的、机器可读的知识表示语言,那么人类知识的组织和传播效率将迎来数量级的提升。
文明学是人工智能未来发展的必须,也是人类面对人工智能挑战必须作出的应对。它不仅是可以改进人工智能,而且可以使人类自身可以在人工智能时代具备与其相匹配的全科型知识学习和应用能力。
第五部分:AI的智力水平——被高估与被低估
5.1 “两天五篇万字论文”的启示
今天的AI智力水平进步的确是惊人的。我在前不久用KiMi K3的测试版本,在两天之内生成了5篇万字高水平论文,包括摘要、关键词、前言综述、图表、参考文献、正文中对参考文献的引用标注等都是自动生成,且格式非常规范。
这一能力确实令人印象深刻。它表明,在”形式规范”和”信息整合”的维度上,AI已经达到了甚至超越了大多数人类研究者的水平。当然,这种论文快速生成的的结果水平高度取决于输入指令的水平。它类似于一个计算机平台,输入的指令类于编程的软件。你输入的是什么软件,它就能运行出什么结果。
5.2 被高估的”奇点”与被低估的”平台”
美国科技界近年来大谈”技术奇点”(Technological Singularity)和”通用人工智能”(AGI),其隐含的假设是:只要算力持续增长,AI的智力水平将指数级提升,最终超越人类,引发文明的质变。
然而,基于前文对硬件增长和算法效率的分析,这一假设的根基正在动摇:人工智能芯片的算力以及整体系统的算力很快将进入平台期,而不是越过一个奇点。没有底层硬件的持续指数增长,“奇点”的算力前提就不复存在。这不是悲观的预测,而是对物理极限和经济学规律的尊重。在平台期,AI的能力仍将缓慢增长,但不再是指数级的爆发式增长。这意味着,AGI(如果它真的存在的话)的实现时间表,需要被大幅推迟——从某些乐观者预测的”2027年”或”2030年”,推迟到”不确定的未来”。
第六部分:AI泡沫的必然破灭
6.1 泡沫的构成:资本、叙事与现实的背离
当硬件增长进入平台期,算法效率的边际收益递减,而资本市场的预期仍然停留在”指数增长”“奇点来临”的叙事中时,泡沫的破灭就成为必然。
当前AI产业的泡沫,主要体现在以下几个层面:
估值泡沫:AI相关公司的市值,很大程度上建立在”算力即权力”的叙事之上。英伟达的市盈率长期维持在高位,反映了市场对其持续超高速增长的预期。然而,一旦硬件增长放缓被证实,估值的修正将是剧烈的。
投资泡沫:全球AI领域的风险投资在2023-2025年间达到了前所未有的规模。大量资金涌入基础模型训练、AI芯片设计、以及各类AI应用初创公司。然而,许多投资的前提是”算力成本将持续下降”,而这一前提正在失效。
应用泡沫:在消费端,AI应用的留存率和付费转化率远低于预期。许多被包装为”AI原生”的产品,其核心价值并非来自AI技术,而是来自传统的产品设计和运营能力。在 enterprise 端,AI的落地同样面临数据质量、集成成本、合规风险等现实障碍。
叙事泡沫:“AGI即将实现”、“AI将取代所有白领工作”、“算力是新时代的石油”等叙事,在媒体和社交网络上被反复强化。这些叙事虽然具有一定的启发性,但其过度简化和对技术极限的忽视,正在制造危险的预期落差。
6.2 泡沫破裂的触发点与路径
AI泡沫的破裂,可能由以下一个或多个触发点引发:
硬件增长不及预期:如果英伟达下一代架构(如Rubin)的性能提升显著低于市场预期,或者制程进步遭遇不可逾越的物理障碍,资本市场对AI算力增长的信心将迅速崩塌。
算法效率触及瓶颈:如果DeepSeek等公司的后续模型无法继续保持算力需求的数量级下降,市场将意识到”算法效率”也有其极限,从而重新评估AI产业的成本结构。
宏观经济逆风:如果全球经济进入衰退周期,企业和消费者对AI投资的意愿将大幅下降。AI作为”锦上添花”的技术,在经济下行期往往首当其冲被削减预算。
监管收紧:随着AI技术的社会影响日益显现,各国政府对AI的监管正在收紧。如果监管措施显著增加AI开发和部署的成本,将加速泡沫的破裂。
泡沫破裂的路径,可能类似于2000年的互联网泡沫:短期内估值大幅回调,大量初创公司倒闭,投资热情迅速冷却。但与互联网泡沫不同的是,AI泡沫破裂后,行业的复苏可能更加缓慢——因为互联网泡沫破裂后,光纤和宽带基础设施的过剩为后续的Web 2.0革命提供了基础,而AI泡沫破裂后,算力基础设施的过剩并不必然转化为新的应用爆发(因为算力成本不再下降)。
6.3 后泡沫时代:回归常规商业理性与价值
泡沫的破裂虽然痛苦,但并非坏事。它将迫使AI产业从”叙事驱动”转向”价值驱动”,从”规模竞赛”转向”效率竞赛”。
在后泡沫时代,以下几个趋势将成为主导:
小模型崛起:当算力不再廉价,参数规模不再是唯一的竞争维度。针对特定任务优化的、数十亿参数级别的小模型,将比万亿参数的通用模型更具商业价值。
边缘计算普及:将AI推理从云端推向边缘设备,不仅可以降低延迟、保护隐私,更可以显著降低算力成本。这要求模型的小型化和硬件的高效化。
垂直应用深耕:通用AI助手的市场将趋于饱和,而针对医疗、法律、金融、制造等垂直领域的深度应用,将成为价值创造的主要来源。这些应用的成功,取决于领域知识的深度整合,而非算力的简单堆砌。
开源生态繁荣:当商业投资的热情冷却,开源社区将成为AI技术进步的主要推动力。类似于Linux在互联网泡沫后的崛起,开源AI模型和工具将在后泡沫时代扮演关键角色。
第七部分:结论——在平台的边缘重新审视AI的未来
7.1 核心结论回顾
让我们回到本文的起点,总结几个核心结论:
第一,关于算力增长:2015年至2025年,英伟达单卡峰值算力提升约2,000倍,但对应的黄氏定律”四个发动机”即将大部分或全面熄火,未来5年算力增长将进入平台期。
第二,关于历史教训:摩尔定律生效的时代,WINTEL联盟通过系统性地降低软硬件效率来制造升级需求。2010年后,全行业被迫开始效率补课,但这一补课即将在5-10年内触及瓶颈。
第三,关于精减算力路径:DeepSeek等公司通过算法创新实现了数量级的效率提升。但这一路径的空间也是有限的,边际收益同样在递减。
第四,关于AI智力:AI在形式规范和信息整合上已达到很高水平,但原创性研究、因果推理、常识获取等核心能力仍有显著差距。“奇点”和”AGI”的叙事,缺乏底层硬件持续指数增长的支撑。
第五,关于泡沫与未来:随着硬件进入平台期,算法效率触及瓶颈,而资本市场预期仍停留在指数增长叙事中,AI泡沫的破裂将成为必然。后泡沫时代,AI产业将回归效率与价值,小模型、边缘计算、垂直应用和开源生态将成为主导。
第六,以文明学为核心的知识与信息压缩,是未来长期提升的关键。
7.2 对政策制定者与投资者的启示
对于政策制定者而言,需要认识到:AI产业的竞争力,不再仅仅取决于算力规模,而取决于算法效率、数据质量和应用落地能力。继续大规模投资建设智算中心,而忽视算法创新和生态培育,将造成巨大的资源浪费。同时,应支持”文明学”等长期知识基础设施的建设,为后硬件时代的知识增长奠定基础。
对于投资者而言,需要调整预期:AI领域的超额回报期可能已经结束。未来的投资机会,将更多地出现在算法效率工具、垂直行业应用、以及AI与传统产业深度融合的领域,而非基础模型和算力基础设施的”军备竞赛”。
7.3 对技术从业者的启示
对于技术从业者而言,这是一个”回归工程本质”的时代。当算力不再免费,每一个FLOP都需要被精打细算。模型压缩、推理优化、硬件—软件协同设计、以及领域知识的深度整合,将成为核心技术竞争力。同时,跨学科的知识结构——既懂AI算法,又懂行业知识,还懂系统优化——将比单纯的”大模型调参”更有价值。
7.4 写在最后:在平台的边缘,看见真实的未来
我们正站在一个时代的边缘。过去十年,AI产业享受了算力指数增长的红利,创造了令人目眩的增长神话。当黄氏定律的”四个发动机”逐一熄火,当摩尔定律的补课进入瓶颈,当算法效率的边际收益递减,我们被迫面对一个不那么glamorous(迷人的;特别富有魅力的)但更为真实的未来:AI不是通往奇点的火箭,而是人类工具箱中一件日益精密的工具。它的价值,不在于取代人类,而在于增强人类;不在于追求无限的增长,而在于在有限的资源中创造最大的价值。
在平台的边缘,我们或许能够放下对”指数增长”的执念,重新审视技术的本质:技术不是目的,而是手段;算力不是权力,而是资源;AI不是神,而是镜——它映照出人类的智慧,也映照出人类的局限。
未来5年,AI产业将经历痛苦的调整。但调整之后,我们将迎来一个更加成熟、更加务实、也更加可持续的AI时代。那个时代,或许没有”奇点”的绚烂,但会有”效率”的踏实;没有”通用智能”的狂想,但会有”专用智能”的深耕;没有”算力即一切”的傲慢,但会有”知识即力量”的谦逊;没有隔行如隔山的学科围栏,但会有“文明学”的通晓型知识创造的辉煌未来。
这,才是AI底座发展的真正空间,也是AI的未来所在。