摘要
- IETF 当前的
draft-xu-idr-fare-in-mpson-01正文标注日期为 2026 年 8 月 16 日;它把 FARE-BGP 的带宽加权 ECMP 思路扩展到多平面 scale-out 网络中的 RoCE NIC(RNIC)。 - 草案同时面对两个运营问题:RNIC 必须在相互隔离的 CLOS 平面之间作选择,而主机路由状态不能无止境地保存在所有节点上。
IETF Datatracker 记录把该文件列为 Fully Adaptive Routing Ethernet in Multi-Plane Scale-Out Networks。它是意向为 Standards Track 的 Internet-Draft。这个标签限制了结论的范围:IETF 将 Internet-Draft 定义为可被修改、替换或到期的工作文件,而不是已经作出的标准决定。
第 -01 版正文描述的架构中,每块 RNIC 分别连接到每个平面的独立 CLOS fabric;平面之间没有互联,因此由 RNIC 为每个流或数据包决定使用哪个平面。草案将 FARE-BGP 的机制——以 Path Bandwidth Extended Community 支持加权 ECMP——从交换机延伸至这类接口。它要求 RNIC 与各平面的 leaf switch 分别建立 BGP 会话,以学习远端可达性及用于加权选择的路径带宽信息。
这会改变控制面的落点。问题不再只是 fabric 交换机如何分配等价路径流量,也包括送到主机接口的值是否完整、可比,并能在一个平面失去可达性时及时撤销。草案没有证明某个 AI 集群会因而取得更好结果;它提出的是一种机制,用来表达隔离平面架构本已交给接口的选择。
规模是另一条约束。文中以 10 万块 GPU、四个平面作说明:每个平面最多可能传播 10 万条主机路由,总量为 40 万条。草案认为这些路由不适合保存在每块 RNIC 上,也不宜完整保留在交换机中,于是提出路由表抑制。但聚合路由可能在远端 RNIC 已无法通过某平面到达后仍然存在。为避免黑洞,草案把聚合与显式的主机不可达通告配对;其中一种方式是 Path Bandwidth 值为零。这里描述的是设计方向,不是部署或互操作性证据。
会员简报
档案背景详情
使用相应会员等级登录,即可解锁完整简报与来源注释。
仅限 Strategic Circle
Strategic Circle
所有读者均可浏览。加入并登录后可解锁档案简报。
加入 Strategic Circle仅限 Leadership Alliance
Leadership Alliance
符合条件的 IP 资产所有者和管理层可登录查看 Leadership Alliance 简报。
加入 Leadership Alliance

