万亿网格 ″算″ 出火箭回收密码:十万卡AI超集群如何叩开商业航天的大

万亿网格 ″算″ 出火箭回收密码:十万卡AI超集群如何叩开商业航天的大
2026年10月10日 17:06 看点资讯

【赛迪网讯】商业航天正在被推升至前所未有的战略高度。从国家层面密集出台的产业政策,到民营火箭公司接连斩获融资,一个清晰信号已经释放:重复使用火箭,这个曾经由SpaceX"星舰" 以一己之力验证的技术方向,如今已成为中国商业航天必须跨越的关口。而火箭要重复使用,前提是先 "算得清"。33台发动机并联喷出的超高温尾焰如何相互干扰,如何不震坏箭体、不烧穿防热层,这背后是百亿乃至万亿网格的高性能计算需求。算力,正在成为商业航天研发链条上不可或缺的 "数字试验场"。

就在近期,中科曙光联合西安交通大学科研团队,依托全国产十万卡AI超集群曙光8000,完成了超大规模多喷口超声速射流高精度数值模拟,以6.774万亿单元的网格规模刷新国际已知最大同类仿真纪录,为这场"算力 × 航天"的产业叙事写下了极具分量的注脚。

一个 "任务关键性工程" 难题

把视角拉回火箭回收的本质。火箭33台发动机并联推进,多股射流在喷出瞬间相互干扰、相互作用,形成剧烈的压力波动与热量分布,国际公开文献将其定义为 "任务关键性工程"(mission critical problem)。西安交通大学航天航空学院教授、博导,陕西省先进飞行器服役环境与控制重点实验室副主任姬兴接受赛迪网采访时解释:"每一股射流相互干扰,会对起飞、回收等任务的成败产生关键影响。"

为什么必须要靠仿真?姬兴指出,极端环境下试验手段几乎无能为力:发动机内部温度高达 3000K(约 2700℃),常规传感器一放进去就会被烧毁,外部摄像机又只能拍到火焰外围。仿真因此具有不可替代性,它能给出三维流动细节,与有限的试验数据互为补充,"试验 + 仿真" 结合,才能支撑火箭方案的快速迭代。

而支撑这一仿真的核心,正是曙光8000提供的国产高端算力。

打破通信瓶颈:把 "厨房" 效率推到极致

超大规模并行计算的最大挑战,从来不是算力,而是通信。西安交通大学博士生张红接受赛迪网采访时,用了一个形象的比喻:"把一张加速卡想象成厨房,冷库存放数据,厨师是计算单元。厨师很多,但搬运工少,每次取菜都要等待。" 卡数增加后,每张卡的计算规模下降,通信数据量却随网格块的 "表面积" 同步上升,通信压力成倍增长。

为此,团队选择单步时空耦合的高精度推进方法。姬兴表示,这一方法能够减少多阶段计算带来的数据读写与通信开销。更为关键的是,它精准匹配了曙光8000的异构计算特性,是"精挑细选的适配方案"。

张红补充,团队针对国产平台进行了专门的架构适配与网格切分,力求每张卡计算量、通信距离与数据量大致均衡,最终在数万张国产智能芯片上实现大于99%的弱扩展效率,这意味着资源与任务规模同步增长时,系统仍能保持接近理想的扩展效率。

全系统协同与稳定性的考验

如此大规模的高性能计算,对集群的考验是全方位的。中科曙光研发工程师梁超接受赛迪网采访时指出,超大规模CFD计算更关注计算、通信、存储、调度的全系统协同,"几万张卡协同运行,对系统稳定性提出了极高的要求,有一张出错,整个结果就都错了"。为此,团队在设计中即面向超大规模布局:采用国产高速网络保障低延迟与大规模MPI通信效率;依托多年积累的存储经验保证IO稳定性;通过长期维护的调度系统灵活分配海量节点资源。

更值得注意的是集群的 "自愈" 能力。梁超介绍,曙光8000配备数字孪生系统,可对计算、网络、存储全链路可视化观测,一旦发现链路故障,后台自动切换至正常链路,系统短暂波动后即可恢复。这种从设计源头就内置的稳定性规划,加上团队多年高性能计算运维经验的沉淀,构成了支撑万亿网格仿真的坚实底座。

从 "跑通" 到 "智用"

面向未来,姬兴将项目划分为 "研、算、智、用" 四个阶段。"研" 即研制基础算法根技术,"算" 即完成软件对国产集群的大规模并行适配,并且这两个阶段已经到了里程碑式的节点。接下来 "智用" 阶段,团队希望依托曙光的超智融合能力,将海量仿真数据(几十至几百TB)训练成高效的AI代理模型,实现快速预测,真正服务于火箭的研发,并向广阔的商业航天市场拓展。

从火箭回收的数字实验,到国产芯片算力突围的案例,也明显揭示了一条清晰的路径:当算法创新与国产硬件深度耦合,商业航天的前沿工程难题,正被 "算" 出越来越多的确定性答案。而这也正是国产高性能计算平台从"能用" 迈向 "好用"的关键一跃。

财经自媒体联盟更多自媒体作者

新浪首页 语音播报 相关新闻 返回顶部