|
梦想的第四维
一、核心结论与市场空间:规模四年翻四倍,铜延寿、光延后
市场规模大幅上修
受AI资本开支上调与集群规模扩容驱动,Scale-Up后端网络市场规模预计2030年达到730亿美元,较去年同期预测(2029年170亿美元)扩容超4倍;2026-2030年复合增速达46%。
核心技术判断
铜互连的生命周期被市场持续低估,通过SerDes、信号调理技术迭代仍将长期主导短距场景;CPO(共封装光学)是长期终局方向,但规模化渗透晚于市场预期,2028年仅小规模试水,2029年英伟达Feynman世代起才会实现显著落地,近期板块因渗透预期回调属于过度下跌。
架构格局
行业不存在统一技术路线,NVLink、以太网、UALink、PCIe等多架构长期并存,买方集中度高,单一路线落地即可创造可观产业机会。
二、Scale-Up市场增长的核心驱动力
1.AI集群规模爆发式扩张
AI模型复杂度提升推动集群规模持续翻倍: 英伟达Blackwell世代实现单柜72GPUScale-Up; Vera Rubin世代扩至单集群144GPU,Rubin Ultra进一步提升至576GPU; 下一代Feynman世代集群规模有望翻倍至1152GPU; 谷歌TPU、亚马逊Trainium等非英伟达生态同步推进集群扩容,全行业共同拉动互连需求。
2.I/O瓶颈取代算力成为系统核心约束
过去30年AI硬件算力增长600万倍(每2年翻3倍),而互连带宽23年仅增长450倍(每2年增长1.6倍),数据移动效率已成为大规模AI系统的性能瓶颈。
核心矛盾:SerDes单lane速率从当前100G向200G、400G升级,电信号的有效传输距离持续缩短;但AI集群规模扩张又要求GPU间通信距离不断增加,二者反向演进形成行业“铜墙”效应,推动光互连长期替代趋势。
三、技术演进路径:铜尽其用,光按需入场
1.铜互连的持续续命能力
铜互连凭借低延迟、低功耗、低成本与成熟生态,仍是短距场景首选。行业通过多轮技术迭代持续延长铜的使用寿命: 已落地技术:PAM4调制、高性能DSP信号校正、重定时器(Retimer)、连接器与封装升级; 在研下一代技术:448GSerDes、PAM6调制、200G重定时器等,博通已演示下一代铜方案可支持6米传输距离,挑战英伟达跨机柜CPO路线。
2.主流传输技术对比
技术方案 | 传输距离 | 单lane速率 | 功耗水平 | 成本 | 核心优劣势 | DAC(直连铜缆) | <1米 | 25-50GPAM4 | 极低 | 最低 | 结构简单成本低,但高速下距离衰减极快 | ACC(有源铜缆) | 2-2.5米 | 50-106GPAM4 | 2.5-5W | 低 | 低功耗结构简单,均衡能力有限 | AEC(有源电铜缆) | 3-7米,最长约9米 | 50-106GPAM4 | 6-12W(800G) | 中等 | 长距离高可靠,但功耗与成本高于ACC | AOC(有源光缆) | 5-30米 | 50-106GPAM4 | 10-18W | 高 | 长距离抗电磁干扰,短距场景性价比低 | CPO(共封装光学) | 2-10米(封装内) | >100GPAM4/256G | <5pJ/bit | 极高 | 带宽密度极高、单位比特能耗极低,但封装复杂、成本高、供应链不成熟 |
3.光互连渗透的四大核心催化剂
光互连在Scale-Up场景的落地并非由速率单点驱动,而是由架构变革推动,核心触发因素包括:
多机柜Scale-Up架构普及; 电接口I/O功耗持续攀升; 带宽密度要求不断提升; 大模型通信负载持续增长,带宽需求长期扩容。
4.CPO渗透节奏:2028试水,2029起规模化
2028年之前:铜互连主导Scale-Up场景,CPO仅小规模试点; 2028年:CPO开始小范围落地,主要对应英伟达Rubin Ultra的有限部署; 2029年起:英伟达Feynman世代推动CPO实现显著渗透,成为行业核心拐点; 2030年:预计CPO在Scale-Out端口渗透率达30-35%,在Scale-Up端口渗透率达25-30%。
四、主流XPU厂商的技术路线图
英伟达:行业光互连引领者
Rubin Ultra(2027年):混合架构过渡方案,单柜内72GPU仍采用铜NVLink互连,机柜间通过光链路组成576GPU的NVLink域,兼顾铜的成本延迟优势与光的长距离能力。 Feynman(2028年):首次实现全光Scale-Up互连大规模部署,NVLink域扩容至1152GPU,是CPO规模化渗透的核心催化剂,实际放量集中在2029年。
其他厂商节奏:普遍落后英伟达1-2年
AMD:MI550/MI650平台预计2027-2028年落地光Scale-Up方案; 亚马逊:Trainium5(2028年后)为最早光方案落地节点,Trainium4采用UALink+NVLink Fusion双轨策略; 博通:定制ASIC客户预计2028年后采用光方案,对CPO态度最保守,认为SerDes技术迭代可继续延长铜寿命; 谷歌:TPU采用OCS光电路交换环型拓扑,不依赖传统交换式Scale-Up网络,对CPO的需求可能延后或降低。
五、互连Fabric生态格局:多路线并行,格局尚未定型
五大主流互连架构
NVLink(英伟达):封闭生态,提供最高带宽与最低延迟,是当前Scale-Up市场的主导方案;NVLink Fusion扩展支持第三方CPU/XPU/ASIC接入,通过协议转换芯片兼容NV Switch,合作伙伴包括Marvell、Astera Labs、联发科等。
SUE/ESUN(博通、Marvell等):以太网路线,基于博通Tomahawk交换芯片,通过OCP生态推进,具备开放性与成熟生态优势。
PCIe(Astera Labs、博通、Marvell):过渡性方案,通过PCIe交换芯片实现Scale-Up互连,Astera的Scorpio系列已落地亚马逊Trainium平台,是原生AI互连普及前的主流过渡选择。
UALink(AMD牵头):开放内存语义互连标准,2.0规范已正式发布,2027年起商用硅片落地,是非英伟达生态最核心的候选标准,得到超大规模云厂商与Astera、Marvell等厂商支持。
OCS光电路交换:光层交换方案,直接路由光信号,功耗更低、延迟更小、长期升级成本更优;其中MEMS方案最成熟、切换速度快,适合近期规模化部署,LCoS方案寿命更长但切换速度慢。
市场格局演进节奏
2026年:非英伟达生态起步,NVLink仍占据主导地位;PCIe是规模最大的非NV路线,Astera Labs、博通率先受益。 2027年:以太网成为增速最快的路线,PCIe仍保持最大非NV规模;UALink落地进度是核心变量,决定后续格局走向。 2028年:市场全面扩容,以太网、UALink、NVLink Fusion三条路线并行竞争,客户多方案并行验证,行业标准尚未收敛。
六、核心光学技术路线详解
1.CPO(共封装光学)
将光引擎与交换ASIC集成在同一封装内,将电路径从十几厘米缩短至几毫米,可降低光互连功耗50-80%,同时提升面板带宽密度。产业价值向光引擎、硅光子、外激光器、先进封装环节转移,核心参与者包括博通、英伟达(平台侧),Lumentum、Coherent、AyarLabs等(光器件侧),台积电、格芯等(晶圆制造侧)。
技术演进路径:从当前2.5DCPO起步,2030年后向3DCPO升级。
2.NPO(近封装光学)
介于可插拔模块与CPO之间的过渡方案,光引擎靠近ASIC但位于封装外部。相比CPO,NPO架构更开放、可维护性更强、厂商锁定风险更低,适合暂不接受全CPO复杂度的非英伟达架构;性能与功耗优于传统可插拔模块,低于全CPO,是光渗透过程中的重要中间形态。
3.有源铜缆(ACC/AEC)
ACC(有源铜缆):采用模拟重驱方案,侧重2米内机柜内场景,极致低功耗、低成本、低延迟; AEC(有源电铜缆):采用重定时器与均衡方案,支持5-7米传输,是跨机柜短距场景的主流选择,功耗比可插拔光模块低约50%。
有源铜与光方案为互补关系而非直接竞争,AI数据中心将根据距离、功耗、延迟、可维护性需求采用异构互连方案。
4.OCS光电路交换
属于光层网络补充方案,核心价值是扩展光厂商的收入边界,从光模块、CPO光源延伸至高精度光学组件(MEMS微镜、LCoS开关、准直器阵列等),与可插拔、NPO、CPO形成并行增长曲线。
七、行业热点争议解答
CPO最大障碍是技术还是厂商锁定?
成本与技术可行性优先级高于厂商锁定风险;供应链成熟度、良率与失效风险是核心顾虑,部分厂商(如谷歌)认为功耗节省不足以覆盖质量与运维风险。
CPO能否被长期规避?
若集群规模不再扩张,CPO渗透可长期推迟;OCS可部分承载大象流传输需求。但只要集群持续扩容、I/O瓶颈加剧,跨机柜场景必然向光互连演进,CPO/NPO是长期必然方向。
Scale-Up以太网对品牌交换机厂商吸引力如何?
单机柜场景交换逻辑简单,白盒方案主导,品牌厂商价值有限;2028年后多机柜方案落地后,品牌交换机的价值才会显著提升。
推理场景是否需要大规模Scale-Up集群?
训练场景对集群规模与低延迟的需求更强,但前沿大模型推理仍需百级以上XPU的Scale-Up网络,持续推动架构升级。
NPO/OCS等路线分化会影响光厂商受益逻辑吗?
不会。光内容价值量核心与带宽需求正相关,无论采用CPO、NPO还是OCS,带宽增长都会带动光用量提升;LITE、COHR、GLW三家核心厂商均能受益于光向Scale-Up渗透的大趋势。
亚马逊RNG网络架构的影响?
亚马逊RNG采用准随机图拓扑替代传统胖树架构,可减少69%路由器数量、提升33%吞吐量、降低40%网络功耗,已成为AWS新数据中心默认架构。但该方案依赖亚马逊自研软件能力,暂不具备向行业扩散的条件。
八、核心风险
AI资本开支增速不及预期,集群扩容节奏放缓; CPO/NPO技术落地延迟,供应链良率爬坡慢于预期; 铜互连技术迭代超预期,进一步推迟光渗透节奏; 关税与地缘政治影响供应链成本与产能布局; 行业竞争加剧,价格与利润率承压。
|