AI 集群正在逼近电交换架构的承载上限:真正的瓶颈往往不是 GPU,而是布线、重构和功耗。
GPU 节点数量持续攀升,每增加一层电交换 spine,功耗、时延与成本均成倍上升。传统超售胖树架构已难以经济地扩展至下一代集群。
训练、微调与推理的流量模式各不相同,固定拓扑难以匹配:结果或为带宽闲置,或按最坏情况过度配置。
高基数电交换 spine 下,成千上万条光纤链路均需人工安装、记录与重接。集群规模扩大后,人工重布线效率低且易出错。
用光电路交换机搭建透明的软件定义光层,替代部分电交换 spine。
OCS 位于 Dragonfly 架构的 spine 层,构成 N+1 冗余的全互联。
OCS 的位置:数据中心交换架构。大型 AI/HPC 集群仍以电交换架构将数千颗 GPU 连接在一起,每一跳均进行光-电-光转换:功耗高且难以扩展。三石园基于 MEMS 的 OCS 以透明的光层替代部分电交换 spine:微镜将每根入纤直接导向出纤,建立端到端的全光通路,无 OEO 转换、无存储转发。
在 Dragonfly 拓扑中,OCS 位于 spine 层,构建 N+1 冗余的全互联,pod 可以按需加入或退出网络。通路对协议与速率透明,同一张物理网络既能承载现有的 400G/800G 收发器,也支持平滑升级;重新配置在毫秒级完成,可通过 NETCONF、SNMPv3、TL1、Web GUI 和 REST API 远程控制,无需进入机房手动重接光纤。
一根光纤实现双向传输,TX/RX 由环形器分离。
单纤双向由环形器实现。OCS 链路要尽量少占光纤。我们的平面与阵列环形器使一根光纤同时承载收发:两个方向在环形器内部按端口分离,凭借高隔离度与低插损,TX 与 RX 共用一根光纤,在高端口密度的数据中心内节省光纤与跳线成本。
从分立三端口器件到阵列化集成,三石园覆盖 OCS 链路所需的全部环形器。8-in-1 阵列环形器将八路双向通路封装于一个高密度器件,是 OCS 端口的标准配套。远端,2D 光纤准直器阵列将高端口 OCS 耦合进紧凑网格,光纤 Shuffle 机架在 OCS 与线卡之间实现高密度链路重映射,批次间的插损与回损保持稳定。
一台 OCS 供所有仪器共享,具备任意连接、无阻塞与软件路由能力。
OCS 作为测试设备:一台交换机供所有仪器共享。在实验室或产线上,被测件(DUT)与测量仪器(光源、误码仪、功率计等)在每次更换测试方案时均需人工重接。中间加一台无阻塞 OCS 后,任意仪器都能通过软件路由到对侧的任意 DUT:一台 OCS 供所有测试工位共用。
仪器端口与 DUT 端口一一对应,交叉通路在软件里建立和拆除,测试拓扑配置一次就能为多颗器件复用。这与数据中心网络的核心光交换同源,此处用于切换测试资源。三石园 OCS 全部自研,包括核心的 2D FAU 准直器阵列,任意端口间的通路插损稳定,可长期作为可靠的测试设备使用。
所有产品均符合 Telcordia GR-1221 / GR-1073 可靠性体系。
评估样机全球发货,支持定制波长范围、连接器类型与机箱选项。
sales@triple-stone.com
+86 137 0968 6019