上篇:Spine-Leaf 架构
一、什么是 Spine-Leaf
Spine-Leaf(脊-叶)是现代数据中心普遍采用的两层 Clos 网络架构,由 Charles Clos 在 1953 年提出的电路交换理论演化而来,用于替代传统的三层(核心-汇聚-接入)树形架构。
整个网络只有两层:Spine(脊交换机)和 Leaf(叶交换机,也叫 ToR Top of Rack)。每一台 Leaf 都连到每一台 Spine,但 Leaf 之间不互联,Spine 之间也不互联。这种"二分图全连接"是 Clos 网络的核心。

[ 图1:Spine-Leaf 两层 Clos 架构拓扑图 ]
二、四大核心特征
特征 1:两层结构 + 全互联
整个网络只有 Spine 和 Leaf 两层。每台 Leaf 都连到每台 Spine,不存在主备之分,所有链路同时工作。
特征 2:三跳到达任意服务器
任意两台服务器之间通信,最多经过 Leaf → Spine → Leaf,固定 3 跳,延迟和带宽可预测。传统三层架构跨核心可能需要 5~7 跳。
特征 3:ECMP 等价多路径
由于 Leaf 同时连接多台 Spine,到任何目的 Leaf 都存在 N 条等价路径(N = Spine 数量)。通过 ECMP(基于五元组哈希)可以把流量均匀分布到所有 Spine,带宽可水平扩展。
特征 4:横向扩容
需要更多带宽?加 Spine 即可。需要更多服务器接入?加 Leaf 即可。不需要更换已有设备。
三、Spine 与 Leaf 角色对比
四、与传统三层架构对比
五、Underlay 与 Overlay
现代 Spine-Leaf 几乎都采用 Underlay + Overlay 分离设计:
Underlay(底层):提供 Spine 和 Leaf 之间纯 IP 可达,跑路由协议(eBGP 每台交换机一个 AS,最常用;也可用 OSPF 或 IS-IS)。
Overlay(叠加):承载租户业务,做 L2/L3 虚拟化和多租户隔离,使用 VXLAN 封装 + BGP EVPN 控制面。
为什么需要 Overlay?Underlay 是纯 L3 路由网络,但业务(虚拟机迁移、容器网络)需要 L2 大二层。VXLAN 把 L2 帧封装到 UDP 里跨 L3 网络传输,BGP EVPN 负责通告 MAC/IP 路由,从而在 L3 物理网络上"画"出一张逻辑大二层。
六、收敛比设计
收敛比 = Leaf 下行总带宽 :上行总带宽,反映网络的"超售"程度。
七、优势与代价
优势:带宽线性扩展(加 Spine 即加带宽)、延迟可预测(固定 3 跳)、故障域小(单设备故障最多损失 1/N 容量)、东西向带宽大(匹配现代云计算流量模型)、自动化友好(拓扑规整、适合 NetDevOps 批量管理)。
代价:端口和光模块成本高(全互联需要大量高速光模块)、布线复杂(N×M 条主干光纤)、规模有上限(受限于 Spine 端口数,超大规模需要扩展为 5-stage Clos)、运维门槛高(需要熟悉 BGP/EVPN/VXLAN)。
八、超大规模扩展:5-stage Clos
当单组 Spine-Leaf 容量不够(一般支持几千到上万台服务器)时,会引入第三层 Super Spine,把多组 Spine-Leaf 作为一个 PoD(Point of Delivery),多个 PoD 通过 Super Spine 互联,形成 5-stage Clos。这是 Meta、Google 等超大规模数据中心的标准做法,可支撑 10 万+ 服务器。

[ 图2:5-stage Clos 多 PoD + Super Spine 拓扑图 ]
小结:Spine-Leaf 不是某种特定的设备或协议,而是一种网络架构范式。它解决了云计算时代东西向流量爆发、传统三层架构带宽和延迟瓶颈的问题,现在已经是数据中心的事实标准。
下篇:主流云厂商数据中心网络架构
本部分基于主流云厂商公开文档、技术博客及 SIGCOMM/NSDI 学术论文整理,属于对外公开信息的概念性总览。
一、整体四层架构
主流云厂商的数据中心网络从下到上可分为四层:物理基础网络 → 虚拟化网络(SDN Overlay)→ 用户可见的网络产品 → 跨域和对外互联。每一层都建立在下一层之上,对上层透明。

[ 图3:数据中心网络分层全景图 ]
二、第一层:物理基础网络(Underlay)
2.1 三级地理层次:Region → AZ → Cluster/PoD
| Region(地域) | |||
| AZ(可用区) | |||
| Cluster / PoD |
2.2 网络拓扑:5-stage Clos
主流云厂商数据中心普遍采用 5-stage Clos(Spine-Leaf 的扩展版),具体分层见上篇"超大规模扩展"。
2.3 交换机层级命名:ASW / PSW / DSW / MC
头部云厂商在公开论文(如 HPN、Sailfish、Achelous 等 SIGCOMM 论文)中,使用了一套自有的交换机命名体系,比通用 Spine-Leaf 命名更精细,精确对应 5-stage Clos 各层角色:

[ 图4:ASW / PSW / DSW / MC 交换机层级拓扑图 ]
| ASW | ||||
| PSW | ||||
| DSW | ||||
| MC |
命名口诀:A 接服务器、P 管 PoD、D 管 DC、M 管城域。
业界对照表:
典型流量路径:
2.4 路由协议:BGP-only DC
主流云厂商的数据中心 Underlay 普遍采用 BGP(每台交换机一个私有 ASN),这与 Meta/Google 的实践同源(参见 RFC 7938《Use of BGP for Routing in Large-Scale Data Centers》)。配合 ECMP 实现东西向横向扩展。
2.5 高性能网络:RDMA / RoCE / HPN
针对 AI 训练、分布式存储场景,主流云厂商推出了高性能网络(HPN, High Performance Network)产品,核心特征:
三、第二层:虚拟化网络(SDN Overlay)
主流云厂商均自研有 SDN 平台,是承载 VPC、负载均衡、NAT、跨 VPC 互通等所有网络产品能力的底座。整体遵循经典的"控制面 + 数据面"分离设计。
3.1 控制面(Controller)
负责接收用户的网络配置(创建 VPC、添加路由、绑定公网 IP 等),下发到数据面节点。需要解决多 Region 一致性、配置规模(数十亿规则)、秒级生效等挑战。
3.2 数据面(vSwitch / DPU 卸载)
DPU 卸载的意义:把虚拟化的网络/存储 IO 从 Hypervisor 卸载到专用硬件(DPU),云服务器可以做到接近物理机的网络性能(百万 PPS、25Gbps+ 单流),同时还能享受云的弹性。
3.3 网关集群(Gateway)
分布式 vSwitch 解决了宿主机内部和同 VPC 内的流量转发,但跨 VPC、出公网、负载均衡等场景需要专门的网关集群。主流云厂商均自研有分布式 SDN 网关,承担以下角色:
3.4 Overlay 封装:VXLAN / GENEVE
每个 VPC 分配一个 VNI(VXLAN Network Identifier),云服务器网卡发出的原始包在宿主机 vSwitch 处被 VXLAN 封装,外层 IP 是宿主机的物理 IP(Underlay IP),到对端宿主机解封装后投递给目标 VM。这样实现了:租户 IP 完全自定义(不同 VPC 可以重叠 IP 段)、VM 跨物理机迁移不变 IP、Underlay 物理网络无需感知租户。
VPC 内一次访问的完整链路:VM-A(VPC1,子网1@AZ1)→ 宿主机 vSwitch 查流表 → 命中 VPC1 规则 → 找到 VM-B 所在宿主机 IP → VXLAN 封装 → 物理网络(ASW → PSW → 跨 AZ DCI → PSW → ASW)按外层 IP 转发 → 对端宿主机 vSwitch 解封装 → 投递给 VM-B。
全程对用户透明,用户只看到 VM-A → VM-B 的二层通路。
四、第三层:网络产品组件
用户在控制台/API 看到的所有网络资源,本质都是底层 SDN 平台的能力封装:
| VPC | ||
| VSwitch / Subnet | ||
| 弹性网卡(ENI) | ||
| 负载均衡(SLB/ALB/NLB) | ||
| 弹性公网 IP(EIP) | ||
| NAT 网关 | ||
| 转发路由器(TR) | ||
| 云企业网(CEN) | ||
| 边界路由器(VBR)/ 物理专线 | ||
| VPN / PrivateLink |
五、第四层:对外互联
5.1 公网出口 / BGP 多线
每个 Region 的核心机房接入多个运营商(电信、联通、移动等),EIP 公网段通过 BGP 向各运营商宣告,访问者从最近运营商入口进入,实现"BGP 多线"质量。
5.2 自有骨干网
主流云厂商自建有覆盖全球的骨干光纤网络(包括海缆资源),用于跨 Region 同步(对象存储、数据库、云企业网跨域互联)、CDN 回源加速、用户付费的跨域带宽包。
5.3 专线接入(IDC ↔ 云)
5.4 CDN 与边缘节点
主流云厂商在全球部署数千个边缘节点,回源到 Region 内的源站。边缘节点通过自有骨干和公网回源,配合全站加速、边缘安全加速等产品。
六、四层架构总结
七、设计哲学:为什么这样分层
关注点分离 — 物理网络团队保证 Underlay 稳定不丢包;SDN 团队保证 Overlay 灵活可编程;产品团队对客户暴露简洁 API。
规模无关性 — 每层独立扩展:物理层加 PoD/Super Spine,SDN 层加网关集群,产品层加 Region/AZ。
变更隔离 — 升级 SDN 不影响物理网络;调整产品只改控制面,不动物理布线。
故障域可控 — 单台 Spine 挂掉损失 1/N 带宽,单 AZ 故障不影响其他 AZ,单 Region 故障不影响其他 Region。
一句话总结:主流云厂商的数据中心网络是"5-stage Clos 物理 + SDN 虚拟化 + 丰富的网络产品 + 骨干互联"四层叠加而成的体系。每一层都用业界最佳实践(Spine-Leaf、BGP-only、VXLAN Overlay、DPU 卸载),上层不感知下层的实现细节,实现了从云服务器网卡到全球骨干的完整覆盖。
— END —




