暂无图片
暂无图片
暂无图片
暂无图片
暂无图片

数据中心网络架构全解析

OpenCurve 2026-06-04
306
从 Spine-Leaf 到主流云厂商四层体系,一文讲透!

上篇:Spine-Leaf 架构

一、什么是 Spine-Leaf

Spine-Leaf(脊-叶)是现代数据中心普遍采用的两层 Clos 网络架构,由 Charles Clos 在 1953 年提出的电路交换理论演化而来,用于替代传统的三层(核心-汇聚-接入)树形架构。

整个网络只有两层:Spine(脊交换机)和 Leaf(叶交换机,也叫 ToR Top of Rack)。每一台 Leaf 都连到每一台 Spine,但 Leaf 之间不互联,Spine 之间也不互联。这种"二分图全连接"是 Clos 网络的核心。

[ 图1:Spine-Leaf 两层 Clos 架构拓扑图 ]

二、四大核心特征

特征 1:两层结构 + 全互联

整个网络只有 Spine 和 Leaf 两层。每台 Leaf 都连到每台 Spine,不存在主备之分,所有链路同时工作。

特征 2:三跳到达任意服务器

任意两台服务器之间通信,最多经过 Leaf → Spine → Leaf,固定 3 跳,延迟和带宽可预测。传统三层架构跨核心可能需要 5~7 跳。

特征 3:ECMP 等价多路径

由于 Leaf 同时连接多台 Spine,到任何目的 Leaf 都存在 N 条等价路径(N = Spine 数量)。通过 ECMP(基于五元组哈希)可以把流量均匀分布到所有 Spine,带宽可水平扩展

特征 4:横向扩容

需要更多带宽?加 Spine 即可。需要更多服务器接入?加 Leaf 即可。不需要更换已有设备。

三、Spine 与 Leaf 角色对比

对比项
Spine(脊交换机)
Leaf(叶交换机 ToR)
位置
核心层,机房中间
机柜顶部(Top of Rack)
主要功能
高速转发,无终端接入
接入服务器、存储、防火墙
端口配置
全部为高速口(100G/400G/800G)
下行 25G/100G,上行 100G/400G
路由角色
只做 Underlay 路由转发
VTEP、网关、ACL 策略点
是否接服务器
不接
直接接入

四、与传统三层架构对比

维度
传统三层架构
Spine-Leaf
层级
3 层
2 层
跳数
5~7 跳,延迟不固定
固定 3 跳,延迟可预测
流量模型
南北向为主(用户↔服务器)
东西向为主(服务器↔服务器)
链路利用率
STP 阻塞备份链路,约 50%
ECMP 全活,接近 100%
扩容方式
纵向 Scale-Up
横向 Scale-Out
故障影响
核心/汇聚故障半径大
单 Spine 故障只损失 1/N 带宽
典型协议
STP VRRP HSRP
BGP EVPN + VXLAN

五、Underlay 与 Overlay

现代 Spine-Leaf 几乎都采用 Underlay + Overlay 分离设计:

Underlay(底层):提供 Spine 和 Leaf 之间纯 IP 可达,跑路由协议(eBGP 每台交换机一个 AS,最常用;也可用 OSPF 或 IS-IS)。

Overlay(叠加):承载租户业务,做 L2/L3 虚拟化和多租户隔离,使用 VXLAN 封装 + BGP EVPN 控制面。

为什么需要 Overlay?
 Underlay 是纯 L3 路由网络,但业务(虚拟机迁移、容器网络)需要 L2 大二层。VXLAN 把 L2 帧封装到 UDP 里跨 L3 网络传输,BGP EVPN 负责通告 MAC/IP 路由,从而在 L3 物理网络上"画"出一张逻辑大二层。

六、收敛比设计

收敛比 = Leaf 下行总带宽 :上行总带宽,反映网络的"超售"程度。

场景
推荐收敛比
配置示例
AI 训练 HPC / 高性能存储
1 : 1(无收敛)
32×400G ↓ / 32×400G ↑
云计算通用区
2 : 1 ~ 3 : 1
48×25G ↓ / 8×100G ↑
大数据 / 存储
2 : 1
48×100G ↓ / 12×200G ↑
普通业务 / 办公
4 : 1 ~ 8 : 1
48×10G ↓ / 2×100G ↑

七、优势与代价

优势:带宽线性扩展(加 Spine 即加带宽)、延迟可预测(固定 3 跳)、故障域小(单设备故障最多损失 1/N 容量)、东西向带宽大(匹配现代云计算流量模型)、自动化友好(拓扑规整、适合 NetDevOps 批量管理)。

代价:端口和光模块成本高(全互联需要大量高速光模块)、布线复杂(N×M 条主干光纤)、规模有上限(受限于 Spine 端口数,超大规模需要扩展为 5-stage Clos)、运维门槛高(需要熟悉 BGP/EVPN/VXLAN)。

八、超大规模扩展:5-stage Clos

当单组 Spine-Leaf 容量不够(一般支持几千到上万台服务器)时,会引入第三层 Super Spine,把多组 Spine-Leaf 作为一个 PoD(Point of Delivery),多个 PoD 通过 Super Spine 互联,形成 5-stage Clos。这是 Meta、Google 等超大规模数据中心的标准做法,可支撑 10 万+ 服务器。

[ 图2:5-stage Clos 多 PoD + Super Spine 拓扑图 ]

小结:
Spine-Leaf 不是某种特定的设备或协议,而是一种网络架构范式。它解决了云计算时代东西向流量爆发、传统三层架构带宽和延迟瓶颈的问题,现在已经是数据中心的事实标准。

下篇:主流云厂商数据中心网络架构

本部分基于主流云厂商公开文档、技术博客及 SIGCOMM/NSDI 学术论文整理,属于对外公开信息的概念性总览。

一、整体四层架构

主流云厂商的数据中心网络从下到上可分为四层:物理基础网络 → 虚拟化网络(SDN Overlay)→ 用户可见的网络产品 → 跨域和对外互联。每一层都建立在下一层之上,对上层透明。

[ 图3:数据中心网络分层全景图 ]

二、第一层:物理基础网络(Underlay)

2.1 三级地理层次:Region → AZ → Cluster/PoD

层级
含义
规模
延迟
Region(地域)
一个独立地理区域(如华东、华北等)
含 2~多个 AZ
跨 Region 几十~上百 ms
AZ(可用区)
独立机房/电力/制冷/网络出口
多个 Cluster/PoD 组成
同 Region AZ 间 ≤ 2ms
Cluster / PoD
一组 Spine-Leaf + 下挂服务器
几千~万台服务器
PoD 内 μs 级

2.2 网络拓扑:5-stage Clos

主流云厂商数据中心普遍采用 5-stage Clos(Spine-Leaf 的扩展版),具体分层见上篇"超大规模扩展"。

2.3 交换机层级命名:ASW / PSW / DSW / MC

头部云厂商在公开论文(如 HPN、Sailfish、Achelous 等 SIGCOMM 论文)中,使用了一套自有的交换机命名体系,比通用 Spine-Leaf 命名更精细,精确对应 5-stage Clos 各层角色:

[ 图4:ASW / PSW / DSW / MC 交换机层级拓扑图 ]

缩写
全称
通用名
位置
职责
ASW
Access Switch
Leaf / ToR
机柜顶部
接入服务器,下行 25G/100G,上行 100G/400G
PSW
PoD Switch
Spine(PoD 内)
PoD 汇聚层
全互联 PoD 内所有 ASW,向上连 DSW
DSW
DC Switch
Super Spine
DC 核心层
互联多个 PoD 的 PSW,不接服务器
MC
Mesh Core
DCI 核心
DC 之间
互联同城多座 DC,对接骨干网

命名口诀:A 接服务器P 管 PoDD 管 DCM 管城域

业界对照表:

DC 内命名
标准 Clos
Meta
Google
ASW
Leaf / ToR
RSW
ToR
PSW
Spine(in PoD)
FSW
EBB
DSW
Super Spine
SSW
Spine Block
MC
DCI Core
CSW
Stargate / B4

典型流量路径:

场景
路径
跳数
延迟
同 ASW(同机柜)
Server → ASW → Server
1 跳
μs 级
同 PoD 跨 ASW
→ ASW → PSW → ASW →
3 跳
数 μs
同 DC 跨 PoD
→ ASW → PSW → DSW → PSW → ASW →
5 跳
十几 μs
跨 DC 同城
→ DSW → MC → DSW →
7 跳
1~2 ms
跨 Region
→ MC → 骨干网 → 对端 MC →
9+ 跳
几十~上百 ms

2.4 路由协议:BGP-only DC

主流云厂商的数据中心 Underlay 普遍采用 BGP(每台交换机一个私有 ASN),这与 Meta/Google 的实践同源(参见 RFC 7938《Use of BGP for Routing in Large-Scale Data Centers》)。配合 ECMP 实现东西向横向扩展。

2.5 高性能网络:RDMA / RoCE / HPN

针对 AI 训练、分布式存储场景,主流云厂商推出了高性能网络(HPN, High Performance Network)产品,核心特征:

特性
说明
无收敛 1:1 拓扑
Leaf 下行:上行 = 1:1,避免链路拥塞
RDMA / RoCEv2
绕过内核协议栈,时延 μs 级,单流可达 200Gbps+
双平面 / Rail-Optimized
GPU 到对端 GPU 通过独立 rail 直达,避免哈希极化
DCQCN / PFC
无损以太网 + 端到端拥塞控制
万卡级集群
支撑万卡级 AI 大模型训练

三、第二层:虚拟化网络(SDN Overlay)

主流云厂商均自研有 SDN 平台,是承载 VPC、负载均衡、NAT、跨 VPC 互通等所有网络产品能力的底座。整体遵循经典的"控制面 + 数据面"分离设计。

3.1 控制面(Controller)

负责接收用户的网络配置(创建 VPC、添加路由、绑定公网 IP 等),下发到数据面节点。需要解决多 Region 一致性、配置规模(数十亿规则)、秒级生效等挑战。

3.2 数据面(vSwitch / DPU 卸载)

位置
组件
职责
宿主机内
vSwitch / Host Agent
转发、安全组、流表匹配、VXLAN 封装
智能网卡
自研 DPU / MoC 卡
把 vSwitch 卸载到硬件,释放主 CPU
裸金属
裸金属云服务器
"软件定义+硬件加速",VPC 性能接近物理机
DPU 卸载的意义:
把虚拟化的网络/存储 IO 从 Hypervisor 卸载到专用硬件(DPU),云服务器可以做到接近物理机的网络性能(百万 PPS、25Gbps+ 单流),同时还能享受云的弹性。

3.3 网关集群(Gateway)

分布式 vSwitch 解决了宿主机内部和同 VPC 内的流量转发,但跨 VPC、出公网、负载均衡等场景需要专门的网关集群。主流云厂商均自研有分布式 SDN 网关,承担以下角色:

网关角色
承担的产品
VPC 网关
云服务器出公网(NAT/EIP)、跨 VPC 转发
负载均衡集群
L4 / L7 负载均衡、TLS 卸载
NAT 网关
SNAT/DNAT、公网映射
互联网关
专线、跨 Region 互联的转发面

3.4 Overlay 封装:VXLAN / GENEVE

每个 VPC 分配一个 VNI(VXLAN Network Identifier),云服务器网卡发出的原始包在宿主机 vSwitch 处被 VXLAN 封装,外层 IP 是宿主机的物理 IP(Underlay IP),到对端宿主机解封装后投递给目标 VM。这样实现了:租户 IP 完全自定义(不同 VPC 可以重叠 IP 段)、VM 跨物理机迁移不变 IP、Underlay 物理网络无需感知租户。

VPC 内一次访问的完整链路:

VM-A(VPC1,子网1@AZ1)→ 宿主机 vSwitch 查流表 → 命中 VPC1 规则 → 找到 VM-B 所在宿主机 IP → VXLAN 封装 → 物理网络(ASW → PSW → 跨 AZ DCI → PSW → ASW)按外层 IP 转发 → 对端宿主机 vSwitch 解封装 → 投递给 VM-B。

全程对用户透明,用户只看到 VM-A → VM-B 的二层通路。

四、第三层:网络产品组件

用户在控制台/API 看到的所有网络资源,本质都是底层 SDN 平台的能力封装:

产品
定位
底层映射
VPC
(专有网络)
租户的私有网络容器
VNI + vSwitch 流表 + 控制器策略
VSwitch / Subnet
VPC 内子网,绑定可用区
逻辑子网 + AZ 亲和
弹性网卡(ENI)
VM 的虚拟网卡
绑定到 vSwitch 的内网 IP
负载均衡(SLB/ALB/NLB)
L4/L7 负载均衡
网关集群中的 LB 实例
弹性公网 IP(EIP)
公网 IP,可绑定到各资源
BGP 出口宣告的公网段 + DNAT
NAT 网关
多 VM 共享公网
网关集群中的 NAT 实例
转发路由器(TR)
跨 VPC、跨 Region 中心路由
类似 AWS Transit Gateway
云企业网(CEN)
跨 Region 互联
骨干网 + 多个 TR 组合
边界路由器(VBR)/ 物理专线
IDC 接入云上
专线接入交换机的逻辑接口
VPN / PrivateLink
加密接入 / 跨 VPC 私网访问
网关 VPN 实例 / ENI 反向代理

五、第四层:对外互联

5.1 公网出口 / BGP 多线

每个 Region 的核心机房接入多个运营商(电信、联通、移动等),EIP 公网段通过 BGP 向各运营商宣告,访问者从最近运营商入口进入,实现"BGP 多线"质量。

5.2 自有骨干网

主流云厂商自建有覆盖全球的骨干光纤网络(包括海缆资源),用于跨 Region 同步(对象存储、数据库、云企业网跨域互联)、CDN 回源加速、用户付费的跨域带宽包。

5.3 专线接入(IDC ↔ 云)

方式
说明
物理专线
用户 IDC 到云接入点之间拉一根光纤,1G/10G/40G/100G
边界路由器 + 专线汇聚
同地域多 VPC 共享专线
边界路由器 + 转发路由器
跨地域、多 VPC 互通场景
智能接入网关(CPE)
小型分支机构、门店通过 4G/宽带上云

5.4 CDN 与边缘节点

主流云厂商在全球部署数千个边缘节点,回源到 Region 内的源站。边缘节点通过自有骨干和公网回源,配合全站加速、边缘安全加速等产品。

六、四层架构总结

层级
核心目标
关键技术
用户感知
① 物理网络
大带宽、低延迟、高可用
5-stage Clos、BGP+ECMP、HPN/RDMA
不感知
② 虚拟化 SDN
多租户隔离、弹性
控制器+vSwitch+DPU+网关+VXLAN
不感知
③ 网络产品
暴露给用户的能力
VPC/SLB/NAT/EIP/CEN/TR 等
控制台直接操作
④ 对外互联
跨域、跨网、出海
骨干网、BGP 多线、CEN、专线、CDN
感知带宽、延迟、价格

七、设计哲学:为什么这样分层

关注点分离 — 物理网络团队保证 Underlay 稳定不丢包;SDN 团队保证 Overlay 灵活可编程;产品团队对客户暴露简洁 API。

规模无关性 — 每层独立扩展:物理层加 PoD/Super Spine,SDN 层加网关集群,产品层加 Region/AZ。

变更隔离 — 升级 SDN 不影响物理网络;调整产品只改控制面,不动物理布线。

故障域可控 — 单台 Spine 挂掉损失 1/N 带宽,单 AZ 故障不影响其他 AZ,单 Region 故障不影响其他 Region。

一句话总结:
主流云厂商的数据中心网络是"5-stage Clos 物理 + SDN 虚拟化 + 丰富的网络产品 + 骨干互联"四层叠加而成的体系。每一层都用业界最佳实践(Spine-Leaf、BGP-only、VXLAN Overlay、DPU 卸载),上层不感知下层的实现细节,实现了从云服务器网卡到全球骨干的完整覆盖。

— END —


文章转载自OpenCurve,如果涉嫌侵权,请发送邮件至:contact@modb.pro进行举报,并提供相关证据,一经查实,墨天轮将立刻删除相关内容。

评论