OCS 全光交换:TPU 集群的 3.3 倍性能,到底从哪来?(OCS全光交换机上市公司) ypxx.net

九月落幕的第27届中国国际光电博览会上,光模块带宽迭代之外,OCS 全光交换成了算力组网的新看点——UTStarcom 发布面向 AI 数据中心的 OCS 方案,行业从技术验证走向量产落地。

谷歌早已在 TPU v4 集群里引入这套全光交换架构。OCP 白皮书引用的测算显示,按训练任务动态重构 TPU 集群的连接拓扑,训练大型语言模型可获得 3.3 倍性能提升。

这 3.3 倍来自一次清晰的分工重构:两端的光模块负责收发光信号,光信号全程走光纤,OCS 只在网络中间层完成光路切换——不换节点上的硬件卡板,不动机房里的物理光缆,用软件定义的方式把固定的网络拓扑变成随任务灵活调整的动态光路。

01不读数据包的交换机

常规交换机的工作方式:光信号进端口,先转成电,查完转发表决定输出端口,再转回光发出去——每一跳都是一次光-电-光转换,要收发、要缓存、要查表,功耗和时延都花在这上面。OCS(Optical Circuit Switch,全光交换机)把这一整套拿掉:光从输入端口进来,在里面只被反射、转向,从输出端口出去,全程以光的形式存在——没有包缓冲,也没有存储转发。

它更像铁路道岔,而不是交换机。以量产主流的 MEMS 路线为例:机器里有两组微镜阵列,每片镜子都能在两个方向独立倾转;一束光进来,输入侧的镜子把它偏到某个方向,输出侧的镜子把它接到指定端口,一条光路就通了,切换耗时毫秒级。谷歌 TPU 集群用的 Palomar OCS 有 136×136 个端口,128 个在用、8 个备用,还用环形器让一根光纤同时收发两个方向,端口数省了一半。

正因为光只被反射、不被读取,OCS 有电交换机给不了的两条特性:协议无关、速率无关。光在镜子里不带任何「这是什么业务」的信息,换速率、换协议,OCS 本体不用动。

02四千块卡怎么连线

先看谷歌 TPU v4 ( Tensor Processing Unit v4 第四代张量处理单元) 超级集群的规模:64 个 Cube(3D立方体单元),每个 Cube 里 64 颗 TPU 排成 4×4×4 的立方体,共 4096 颗。每个 Cube 六个面各引出 16 条链路,相对的两个面成对,接到 48 台 OCS 上,三个维度各 16 台。这些卡之间怎么互连,不再由布线一次性定死,而是交给 OCS 决定。

一条链路的完整路径值得看一遍(图 1):TPU 托盘前面板的笼子里插着光模块,电信号进模块转成光;光纤把光送到 OCS,微镜转向后接进另一条光纤;回到对端光模块,转回电信号进 TPU。中间没有任何电交换环节——「全光」两个字的本义。这条路径对光模块从业者的另一层含义,第 4 节展开。

▲ 图 1 | 一条光路的完整路径

再看账面:OCS 连同配套的光模块、光纤,占系统总成本不到 5%、总功耗不到 3%。谷歌把 Jupiter 网络的 spine 层换成 OCS 后,整个网络的功耗降低 41%、建设成本降低 30%——这是量产部署的数据。

03三倍性能从哪来

「可重构」是关键。静态网络的拓扑布好就固定了,训练任务却各有各的互连形状——谷歌的切片规模,小任务 4 颗 TPU 就能开,大任务配到 2048 颗——加上集群里总有卡在维修,静态配置只能削足适履。OCS 的做法是按任务组网:训练开始前,调度系统按任务需要的互连形状下发配置,微镜各就各位,把光路接成任务要的形状;任务结束,光路重新组织,交给下一个任务。

OCP 白皮书引用的测算很直接:同一批 TPU v4 跑大模型训练,按任务动态重构拓扑,比静态配置提升 3.3 倍性能、降低 9% 功耗。可用性的例子更好懂(图 2):服务器可用度按 99.9% 算,1024 颗 TPU 的切片里几乎必然有几颗是坏的——静态拓扑只能拿到 25% 的有效吞吐,可重构的 OCS 把坏卡隔离、光路绕行重接,能拿到 75%。大模型训练平均只用到约六成峰值算力,网络层面的按需重构,正是补这块缺口的一条解法。

▲ 图 2 | 99.9% 可用度下 1024 颗 TPU 切片的有效吞吐

04省什么、不省什么

对建网络的人,OCS 一项很实际的价值是代际兼容:镜子不认速率,交换侧从上一代光模块换成下一代,OCS 本体和光纤原样保留,网络翻新只动一半。

对做光模块的人,要点更直接——OCS 不省光模块。光路两端依然是模块收发,TPU 侧的模块照插在托盘前面板,一颗不会少;省掉的是交换机侧每一跳的光-电-光转换,和配套的电交换芯片。

局限同样清楚:OCS 接通的是点对点电路,接上就保持占用,不能像分组交换那样按包扇出——它适合流量可以提前调度的大模型训练,不适合突发难料的业务流量;运行中重新配置要几秒;没有 QoS 与遥测;光每过一台 OCS 都有插损,实用部署一两跳封顶,再多就得加光放大补损耗。

05写在最后

2026 年 4 月,OCP 发布 OCS 白皮书,把 OCS 定调为超大规模数据中心网络的基石技术之一——它已从谷歌一家的内部实践,走进整个产业的工具箱。路线上除 MEMS 外还有机械式、液晶、压电、硅光 MZI、超构表面五条,切换速度从秒级到纳秒级不等,各有取舍。国内也在推进:2026 年 9 月的中国光博会(CIOE)上,UTStarcom 发布了面向 AI 数据中心的 OCS 方案;OCS 整机商芯信光完成数千万元 Pre-A 轮融资。

对光模块行业,这个趋势的读法一句话就够:交换的方式在变,光的收发不变——每次换路,两端的模块都在位。这也是这个系列始终盯住模块两端的原因。

作者声明:仅为行业观测,不构成采购或投资建议。