存算一体:破解冯诺依曼瓶颈的下一个芯片战场
打开任何一个半导体行业的投融资报告,近三年出现频率最高的关键词,一定有存算一体。大模型火了之后,所有人都在找能降低AI能耗的方案,绕来绕去,最后都盯上了这个半个世纪前就提出来的技术方向。现在训练大模型的功耗有多夸张?说出来吓死人,一个千亿参数模型训练一次,耗电能烧掉上千万度电,一大半都没花在计算上,全花在把数据从内存搬到计算单元的路上了。这就是所有人都在说的冯诺依曼瓶颈,也叫存储墙。痛点太痛了。
冯诺依曼架构与存算一体架构对比示意图
对大多数人来说,可能很难理解这个改变的意义。我举个最简单的例子,你要整理一个仓库的货物,原来的模式是你坐在办公桌前,每次要一件货,都叫仓管员去仓库帮你搬过来,你看完再让他搬回去。一天下来,你没干多少整理的活,仓管员跑了几万步,累个半死,还慢。存算一体就是让你直接去仓库里面整理,不用来回搬了。省了脚力,也快了很多。
说实话,这个思路真不是新东西。早在上个世纪70年代就有人提了,为什么直到今天才火?很简单,之前没有这么强的需求啊。那时候大家用电脑最多打打字、上上网,谁在乎那点功耗?现在AI大模型把需求拉满了,端侧设备要做本地AI,功耗不能高,体积不能大,原来的架构根本满足不了。需求催着技术往前走,就这么简单。
存算一体AI芯片晶圆实拍图
不过话说回来,现在行业里讲故事的多,真落地的少。最大的瓶颈是什么?第一个就是成本和良率。走新型非易失性存储路线的存算一体,现在良率还上不去,单片芯片的成本比传统方案高好几倍,只能做小批量的特殊场景,根本没法大规模铺消费级市场。
第二个就是软件生态。现在全世界的AI开发者都是对着GPU、NPU做优化,存算一体芯片想要兼容现有框架,要改的东西太多,开发者没动力适配,芯片就卖不动,陷入死循环。第三个就是精度。目前存算一体大部分只能做到8比特甚至更低的精度,做大模型的推理勉强够用,训练根本玩不转。距离冲击数据中心的大模型加速,还有很长的路要走。
未来3-5年:存算一体的战场在哪里
很多投资人都在问,存算一体会不会颠覆现有的GPU格局?我的判断是,至少未来5年,不可能。存算一体最大的优势是低功耗、高带宽,适合做AI推理,不适合做需要高灵活性的训练。所以未来3年,最先起量的市场,一定是消费电子、物联网、汽车电子这些端侧场景。
现在传统的端侧AI芯片,功耗降不下来,存算一体替代的空间很大。比如智能手表,原来做本地AI心率检测、运动识别,一天就要掉一半电,用存算一体之后,功耗能砍三分之二,体验提升是实实在在的。
3到5年之后,会有一批针对大模型推理优化的存算一体加速卡进入数据中心。现在数据中心做大模型推理,能耗成本已经占了运营成本的大头,存算一体能把推理的能耗降一半,就算精度差一点,很多场景也愿意用。它不会替代GPU,会成为GPU的补充,给不同需求的客户做分层方案。
当然,风险也摆在这。现在资本很热,什么团队都能拿融资,都吹自己能做下一代AI芯片,泡沫已经出来了。再过两三年,行业挤泡沫的时候,至少会有一半以上的创业公司死掉。
另外,存算一体普及之后,带来的监管问题也值得重视。因为大部分计算都能放在端侧完成,用户数据不用上传云端,本来是好事,能保护隐私。可反过来,一些违法的AI应用,比如深度伪造、非法人脸识别,也能更容易地在本地运行,监管难度会比现在大很多,行业和监管都要提前准备。
存算一体是不是下一代芯片的方向?我觉得是。但它不是什么包治百病的神药。它就是行业走到今天,解决存储墙问题的一个必然选择。路要一步一步走,骨头要一块一块啃。别急。
被遗忘半个世纪的技术,怎么突然成了香饽饽
冯诺依曼架构统治了计算机行业快一百年,核心逻辑就是存储和计算分开干活。计算单元要数据,就去内存里拿,算完再送回去。几十年前,计算单元慢,内存也慢,这个模式没毛病。现在不一样了,计算单元的性能十几年涨了几千倍,内存的读写速度增长连零头都不到,差距越拉越大。中间传输的通道就成了堵车的高速路口,不仅慢,还费电。 存算一体的思路说穿了一点都不复杂——让计算直接在存储里面做,不用来回搬了。从技术路线分,现在业内主流的两个方向,一个是近存计算,把存储放得离计算单元近一点,缩短传输距离;另一个就是真正的存内计算,直接利用存储单元的物理特性做计算。
冯诺依曼架构与存算一体架构对比示意图
对大多数人来说,可能很难理解这个改变的意义。我举个最简单的例子,你要整理一个仓库的货物,原来的模式是你坐在办公桌前,每次要一件货,都叫仓管员去仓库帮你搬过来,你看完再让他搬回去。一天下来,你没干多少整理的活,仓管员跑了几万步,累个半死,还慢。存算一体就是让你直接去仓库里面整理,不用来回搬了。省了脚力,也快了很多。
说实话,这个思路真不是新东西。早在上个世纪70年代就有人提了,为什么直到今天才火?很简单,之前没有这么强的需求啊。那时候大家用电脑最多打打字、上上网,谁在乎那点功耗?现在AI大模型把需求拉满了,端侧设备要做本地AI,功耗不能高,体积不能大,原来的架构根本满足不了。需求催着技术往前走,就这么简单。
产业化落地:哪些已经跑通,哪些还在讲故事
现在跑通的第一批场景,全都在端侧低功耗AI领域。不信你拆开今年新出的旗舰智能手表,里面的AI加速芯片,可能就用了存算一体技术。智能音箱的离线唤醒、安防摄像头的人脸识别、汽车座舱的手势识别,这些对功耗敏感、对算力要求不算极高的场景,已经有批量出货的存算一体芯片了。 国内现在做存算一体的团队,差不多能拉出几十家,有大厂的自研部门,也有从高校出来的创业公司,上游的存储厂商也在跟进。长江存储、长鑫存储都在做针对存算一体优化的存储颗粒,国际大厂三星、美光、西部数据也都亮出了自己的技术路线。
存算一体AI芯片晶圆实拍图
不过话说回来,现在行业里讲故事的多,真落地的少。最大的瓶颈是什么?第一个就是成本和良率。走新型非易失性存储路线的存算一体,现在良率还上不去,单片芯片的成本比传统方案高好几倍,只能做小批量的特殊场景,根本没法大规模铺消费级市场。
第二个就是软件生态。现在全世界的AI开发者都是对着GPU、NPU做优化,存算一体芯片想要兼容现有框架,要改的东西太多,开发者没动力适配,芯片就卖不动,陷入死循环。第三个就是精度。目前存算一体大部分只能做到8比特甚至更低的精度,做大模型的推理勉强够用,训练根本玩不转。距离冲击数据中心的大模型加速,还有很长的路要走。
未来3-5年:存算一体的战场在哪里
未来3-5年:存算一体的战场在哪里
很多投资人都在问,存算一体会不会颠覆现有的GPU格局?我的判断是,至少未来5年,不可能。存算一体最大的优势是低功耗、高带宽,适合做AI推理,不适合做需要高灵活性的训练。所以未来3年,最先起量的市场,一定是消费电子、物联网、汽车电子这些端侧场景。
现在传统的端侧AI芯片,功耗降不下来,存算一体替代的空间很大。比如智能手表,原来做本地AI心率检测、运动识别,一天就要掉一半电,用存算一体之后,功耗能砍三分之二,体验提升是实实在在的。
3到5年之后,会有一批针对大模型推理优化的存算一体加速卡进入数据中心。现在数据中心做大模型推理,能耗成本已经占了运营成本的大头,存算一体能把推理的能耗降一半,就算精度差一点,很多场景也愿意用。它不会替代GPU,会成为GPU的补充,给不同需求的客户做分层方案。
当然,风险也摆在这。现在资本很热,什么团队都能拿融资,都吹自己能做下一代AI芯片,泡沫已经出来了。再过两三年,行业挤泡沫的时候,至少会有一半以上的创业公司死掉。
另外,存算一体普及之后,带来的监管问题也值得重视。因为大部分计算都能放在端侧完成,用户数据不用上传云端,本来是好事,能保护隐私。可反过来,一些违法的AI应用,比如深度伪造、非法人脸识别,也能更容易地在本地运行,监管难度会比现在大很多,行业和监管都要提前准备。
存算一体是不是下一代芯片的方向?我觉得是。但它不是什么包治百病的神药。它就是行业走到今天,解决存储墙问题的一个必然选择。路要一步一步走,骨头要一块一块啃。别急。