【赛迪网讯】当"抢算力"的狂热退潮,"算得值不值"的账本被摆上台面。2026 云栖大会给出的信号是:AI 基础设施竞赛正在从军备竞赛转向精算竞赛。
历次云栖大会,聚光灯永远属于更卡的 GPU、更大的集群、更激进的资本开支。今年也不例外——阿里云持续加码 AI 基础设施,海外巨头同样在囤货:据行业公开报道,AWS 宣布新增约 200 万个 NVIDIA GPU 的算力规划。数字越报越大,采购清单越拉越长,仿佛谁先把算力堆到规模门槛,谁就拿到了下一个时代的门票。

但如果把镜头从展台移开,对准 CIO 和 CTO 的真实办公桌,画面其实是另一番景象。一位负责跨境业务的央企技术负责人在近两年的交流中反复提到同一个词——ROI。采购审批表上,"我需要多少张卡"正在被"我为什么需要、什么时候能用满、用不满怎么退"三问取代。这不是个别现象,而是市场情绪的整体转向:中国企业正从"计算焦虑"(怕算力不够、怕被卡脖子、怕错过窗口期)走向"计算理性"(怕买错、怕闲置、怕为峰值需求付全年账单)。

Akamai 大中华区副总裁 张珂
Akamai 大中华区副总裁张珂对此的判断相当直白:"训练靠集中,推理靠分布"——多云不是选择题,而是必答题。 这句话之所以值得拆开来看,是因为它同时点破了两件事:一是 AI 工作负载在生命周期上出现了结构性分裂,二是单一云厂商的架构范式已经难以同时回答"全球算力密度"与"本地毫秒级响应"这两个方向相反的诉求。所谓"多云经济学",本质是一场关于"把什么算力、放在哪里、为谁服务"的重新精算。
算力分配的分工逻辑:训练集中,推理分布
过去三年,很多企业的默认动作是"复制架构"——训练用什么规模的集中式 GPU 集群,线上推理就在同样的地方、用同样的拓扑再摆一套。这在业务早期尚可运转,但一旦走向全球化部署,矛盾立刻暴露。
拆开看,训练和推理是两种性格完全不同的工作负载。训练(尤其是预训练)需求高度集中、计算密集、可以被任务化调度,数据在集群内部高速互联即可完成,对"离用户多远"几乎不敏感——这正是超大规模云厂商集中式 GPU 集群的主场。推理则相反:它必须 7×24 在线、贴着用户跑、对延迟极度敏感,而且流量分布跟着业务走,天然离散。把推理强行按训练的架构"就近复制在中心",结果往往是让每一次用户请求都去跨越半个地球回传数据中心,延迟、成本、稳定性三头受气。
张珂给出的建议因此指向一个方向:推理应优先向边缘部署,而不是照搬训练时的中心架构。 这不是要不要用大云的问题,而是承认"不同生命周期阶段的算力,值得被安置在物理位置上不同的地方"。集中与分布各司其职,正是多云架构成立的第一个前提。
"一刀切"是最大的成本陷阱
如果说架构错位是第一层浪费,那么"为所有推理买最贵的卡"则是第二层、也往往是最隐蔽的一层。
一个反复被引用的案例是 GoVeda:在业务早期,其推理需求用 CPU 就足以满足;随着规模上来才迁移到 GPU,最终实现了性能提升约 30%、成本降低约 20% 的效果(此为企业披露口径)。这个案例的价值不在于数字本身,而在于它推翻了一个想当然的假设——"AI 推理 = 必须上 GPU"。现实是,并非所有推理都需要 GPU。
更细的分层来自负载的性质差异。输入密集型任务(例如对长合同、长文档做摘要,算力主要消耗在处理海量输入上,瓶颈在内存带宽与容量)与生成密集型任务(例如交互式代码生成,逐 token 输出,对算力持续性和响应速度要求更高)对内存和算力的需求截然不同。把它们塞进同一种最贵的资源配置里,等于用训练卡的单价去支付摘要任务的账单——买得越"保险",浪费越彻底。
这背后是一条朴素却常被忽略的原则:算力选型要按场景精算,而不是按恐惧采购。 恐惧驱动的采购倾向于"一步到位买最好的",而精算驱动的采购会先问"这个场景真实的资源画像是什么"。
ROI 困境,恰恰是多云价值的显影剂
行业数据把"买了很多、赚得很少"的尴尬摆到了台面上。据 Akamai 援引的行业观察口径:约 75%–95% 的 AI 算力投资未能转化为可衡量的财务回报,真正实现规模化正 ROI 的公司仅占约 16%–25%。无论这些区间的精确来源如何,它描述的方向感是清晰的:多数企业的 AI 账单,跑得比 AI 收益快。
问题的关键,往往不在硬件不够多,而在架构不对路。两个典型的"隐形漏斗"值得单拎出来:其一是缺乏智能调度导致的 GPU 闲置——卡买回来了,却在等待队列里空转,昂贵的周期被大量低优先级任务占着或被闲置吞掉;其二是跨区域数据回传产生的隐性网络成本——用户看到的是"响应慢了一点",企业账单上多出来的则是长年累月、却从不被单独审计的回传流量费。这两笔钱都不会出现在"我买了多少张卡"的采购表里,却实实在在吃掉了 ROI。
这恰恰解释了为什么"再多买几张大云上的卡"解决不了问题:如果调度不智能、数据不回传的路径不经济,那么堆再多算力,也只是把闲置和回传成本放大。多云与边缘架构的价值,正是在这里显影——它不是替代大云,而是给"该在哪算、该不该算、算完往哪送"这三问提供更经济的解。
解法拼图:从边缘底座到智能调度
作为这一思路的供给侧方案,Akamai 给出的组合拳可以从"底座"和"调度"两层来看(以下资源规模均为企业披露口径)。
底座层,是一张本就为分发而生的网络:覆盖 1200 多家运营商、约 440 万个边缘节点、26 个核心云节点,让推理可以在离用户足够近的地方完成,而不必长距离回传中央数据中心。算力产品线则做了多层切分——CPU、GPU 到专用 VPU——以便按场景精准匹配,正面回应"为推理买最贵训练卡"的痛点。
调度层是与 NVIDIA 深度集成的 AI Grid:用算法把工作负载自动分配到最优位置,并叠加语义缓存、推测解码、意图路由等手段,把宝贵的 Blackwell GPU 周期留给真正复杂的推理任务。这套逻辑的要点是"让对的任务去对的地方",把上一节提到的闲置和回传两个漏斗同时收紧。
而整个方案的定位本身,透露出多云经济学的核心姿态:全球分布式架构天然支持与超大规模云厂商互补共存而非替代。也就是说,多云的价值主张不是"从 A 云搬到 B 云",而是在保留大云集中算力的同时,用边缘与分布式资源去补上低延迟与成本精算这两块短板。"多云"的重心,从来不在"多",而在"各得其所"。
对出海企业与 AI 公司的现实意义
抽象的架构讨论,落到两类主体身上是两笔具体的账。
对出海企业而言,多云最直接的收益是摆脱一个伪二选一:不必再在"贵而快的自建集群"和"慢而便宜的单一公有云"之间硬选。全球用户的低延迟诉求可以交给边缘,核心训练与重算力诉求仍可依托大云——快和便宜这对冤家,第一次可以不完全对立。
对AI 创业公司而言,多云给的是一条"轻资产起步、按规模演进"的路径:早期用第三方分布式推理云控制成本、验证 PMF,避免过早把融资烧成重资产;等流量和负载画像真正稳定下来,再评估"自建 + 云"的混合方案。把算力投入从"一次性豪赌"改造成"跟着业务曲线增长的可选项",本身就是一种抗风险的财务纪律。
冷思考:多云不是免费午餐,先算清这三笔账
作为一篇分析,如果止步于"多云万岁",反而辜负了"计算理性"这个题眼。冷静下来,至少有三个反向变量值得摆上台面。
其一,"多云"自身也有复杂度成本。 跨云、跨边缘、跨区域的调度,意味着多套计费口径、多套安全策略、多套运维与可观测性体系。架构上"各得其所"的收益,很可能被工程与人力上的"到处都要会"部分抵消。对团队规模有限、跨境业务尚未起量的公司,"先把一朵云用透"未必劣于"同时接三朵云"。
其二,供应商话术与真实收益之间要留一道验证。 上文中的性能提升 30%、成本降低 20%、正 ROI 占比 16%–25% 等数字,多为方案商或行业报告的披露口径,样本、周期与统计边界并未公开。理性的做法是把这些当作"值得复现的假设",而非"可以直接抄进 PPT 的结论"——任何架构决策,最终都要回到企业自己那一笔可核算的真实账单上。
其三,边缘部署并非处处可行。 数据主权、跨境合规、行业监管往往会硬性规定某些数据"不能出境、不能出某区域、只能落在本地",这让"贴着用户就近算"在某些场景里让位于"贴着合规就近存"。真正成熟的多云精算,必须把合规与数据流动的约束当成一等变量,而不是事后才发现的拦路石。
一句话,张珂"多云是必答题"的判断,方向上是对的——它精准命中了"训练与推理分裂""一刀切买卡""调度与回传吃掉 ROI"三个真实痛点;但"必答"不等于"立刻全答",更不等于"多多益善"。答案的颗粒度,取决于企业愿意为复杂度付多少学费。
云栖大会的展台上,更大的集群依然会吸引最多的目光;但真正的产业分水岭,正在从"谁有更多算力"悄悄移向"谁能把算力用得更值"。当 GPU 不再稀缺到"抢到就是赚到",精算能力就会取代采购魄力,成为下一阶段的分水岭。
所谓"多云经济学",说到底是一门关于"位置"的学问:把集中的留给训练,把分布的交给推理,把最贵的周期留给最难的活。它不是要企业在云上做减法或加法,而是要在"贵而快"与"近而省"之间,找到一条随业务生命周期动态再平衡的路。算力竞赛的上半场比的是胆量,下半场比的,是这本账算得够不够细。
4001102288 欢迎批评指正
All Rights Reserved 新浪公司 版权所有