AI / 资讯
华为重磅发布NPO超节点,昇腾960提前落地,国产算力底座成型
在 AI 算力竞争日趋白热化的当下,算力集群内部的数据传输瓶颈,已经成为制约大模型训练效率的关键卡点。很多人只盯着芯片本身的算力参数,却忽略了上万张 AI 卡组成集群时,芯片之间的互联、功耗、稳定性,才是决定整套智算中心能不能跑起来、跑高效的核心。 在本次大会上,汪涛带来了一连串重磅消息,华为正式推出业界首个搭载 NPO 近封装光学技术的昇腾 960 超节…
在 AI 算力竞争日趋白热化的当下,算力集群内部的数据传输瓶颈,已经成为制约大模型训练效率的关键卡点。很多人只盯着芯片本身的算力参数,却忽略了上万张 AI 卡组成集群时,芯片之间的互联、功耗、稳定性,才是决定整套智算中心能不能跑起来、跑高效的核心。
在本次大会上,汪涛带来了一连串重磅消息,华为正式推出业界首个搭载 NPO 近封装光学技术的昇腾 960 超节点,同时官宣昇腾 960 芯片研发进度超出预期,将提前至 2027 年一季度发布,性能实现全面翻番;另外,openEuler 服务器操作系统的市场地位也得到确认,已经成为国内服务器操作系统份额第一名。几项成果叠加在一起,勾勒出国产算力软硬件全栈闭环的清晰轮廓。
很多人会好奇 NPO 技术到底解决了什么痛点。传统大规模算力集群,大量依赖可插拔光模块完成芯片之间的数据交互,当集群规模扩张到数千卡级别,海量光模块会带来几个难以回避的难题:布线错综复杂、整机功耗居高不下,同时信号传输距离拉长,延迟随之上升,硬件故障率也会变高。
NPO,也就是近封装光学技术,简单来说就是把光引擎放到离芯片封装很近的位置,缩短电信号传输路径,实现光电转换的就近完成。华为自研的 Hi-ONE 就是这款 NPO 光引擎,也是业界首款量产的 NPO 产品,单引擎传输容量达到 7.2T,同时做到内置光源,在技术路线上走在了行业前面。
昇腾 960 超节点就是这套 NPO 技术落地的载体。整套超节点最多可以扩展至 4096 卡规模,单节点能够提供 8E FP8 算力,搭配 1PB 的 HBM 高速内存。最直观的优势体现在硬件成本与能耗上,这套超节点只需要 5500 个 Hi-ONE 光引擎,就能替代过去方案里 48000 颗 800G 传统光模块。
光模块数量的大幅缩减,直接把整套系统功耗降低超过 550 千瓦,硬件简化之后,系统无故障运行时间直接翻倍,系统可用度达到 99.8%。对于动辄上万卡的大型智算中心来说,功耗下降、稳定性提升,意味着长期运营成本会显著降低,集群连续跑大模型训练的可靠性也更有保障。
这套超节点依托灵衢 UnifiedBus 互联架构,能够实现跨服务器内存统一编址。通俗来讲,集群里几千张昇腾芯片不再是各自独立的硬件,而是被这套互联体系整合,逻辑上相当于一台巨型计算机。以往训练十万亿参数的超大模型,经常会遇到跨节点访问内存延迟高、算力利用率上不去的问题,而灵衢架构搭配 NPO 光引擎,大幅降低跨卡通信延迟,把集群算力利用率提升到新台阶。
除了 AI 算力的昇腾超节点,华为同时升级了鲲鹏超节点,把这套超节点架构延伸到通用计算领域,实现人工智能算力与通用算力的协同调度,满足政企、科研、工业场景多样化的算力需求。
芯片层面,昇腾 960 的发布时间调整是本次大会另一大亮点。按照最初规划,这款芯片原定更晚时间推出,现在研发进展超预期,昇腾 960DT 版本将提前到 2027 年一季度就绪,性能相比上一代实现翻番。
它 FP8 算力达到 2PFLOPS,FP4 算力 4PFLOPS,HBM 内存容量提升至 288GB,访存带宽达到 9.6TB/s,互联带宽提升至 2.2TB/s。同时芯片支持自研 HiF4 数据格式,在 4bit 低精度推理场景,兼顾推理吞吐与精度,适配海量 AI 应用的推理需求。
另一款面向高密度算力场景的昇腾 960PR 版本,则计划在 2027 年三季度推出。华为也明确了后续产品路线,昇腾 970、980 会按节奏依次登场,保持一年一代、算力持续倍增的迭代节奏,为长期 AI 发展预留算力储备。
硬件芯片与集群架构之外,操作系统是算力底座不可或缺的软件根基。汪涛在会上确认,openEuler 已经拿下国内服务器操作系统市场份额第一。
服务器操作系统是整个算力集群的底层基石,芯片、服务器、存储、网络硬件,都要依靠操作系统调度管理。早些年国内服务器市场,底层系统长期依赖海外产品,不仅存在供应链安全隐患,也很难深度适配国产芯片的特性。
openEuler 作为开源操作系统,经过多年社区共建、政企落地,在鲲鹏、昇腾硬件上做了大量深度适配优化,能够充分释放国产芯片的算力潜力。如今市场份额登顶,代表国内服务器领域已经完成底层操作系统的自主替代,从操作系统、芯片、互联架构,再到整机集群,国产算力软硬件生态已经形成完整链条。
AI 产业的竞争,早已不是单颗芯片参数的比拼,而是整套算力基础设施体系的较量。海外厂商过去依靠芯片 + 生态 + 互联方案形成完整壁垒,而华为现在的思路,是从底层操作系统、AI 芯片、高速光互联,到超节点整机方案做系统性创新。
NPO 技术解决大规模集群互联的能耗与延迟难题,昇腾芯片持续迭代提升单卡算力,openEuler 筑牢软件底层,三者相互配合,解决国产算力过去 “硬件强、软件弱,单卡强、集群弱” 的短板。
当然,这套方案走向大规模商用,依然需要持续完善生态。大模型厂商、科研机构、政企客户,需要基于 openEuler 系统,在昇腾硬件上完成模型移植、调优,应用软件、开发工具链的完善还需要产业链伙伴共同参与。但从这次发布的一系列成果来看,国内算力产业已经从单纯追赶硬件指标,进入到体系化创新的阶段。
超大模型持续演进,对算力规模、带宽、功耗的需求只会越来越高。NPO 这类新一代光互联技术,被行业普遍视作未来智算集群的核心方向,华为不仅率先实现量产落地,还推动 NPO 技术在国际标准组织立项,参与行业标准制定,在技术路线上掌握话语权。
昇腾 960 芯片提前落地,意味着国产高性能 AI 芯片迭代节奏提速,能够更快跟上国内大模型产业爆发带来的算力需求。openEuler 拿下服务器操作系统第一,则证明国产底层软件已经具备规模化商用能力。
软硬件多点突破,共同搭建起自主可控的算力底座,为国内人工智能产业长期稳定发展提供坚实支撑。