!!!
2022–2023 年主流智算理念与设备
2022 年至 2023 年,大模型(如 GPT-4、LLaMA)的爆发式增长,让“智算”成为炙手可热的话题。
这一时期的智算体系通常以 GPU 加速计算为底座,以高速网络为神经,
以分布式训练为业务方向。
一、当时主流的智算理念
1. 加速计算 + 智能中心
传统 CPU 已难以满足 TensorFlow、PyTorch 等框架的大规模矩阵运算,GPU 成为智算的第一选择。地方与企业纷纷建设智算中心,以 GPU 集群为核心提供算力服务。
2. Scale-up 与 Scale-out 并重
- Scale-up 单机内通过 NVLink 将 8 块 GPU 组成高带宽域,减少数据拷贝。
- Scale-out 通过 InfiniBand / RoCE 连接多台服务器,支撑千卡甚至万卡集群。
3. 网络即计算
NVIDIA 等公司将网络计算能力集成到智能网卡和 DPU 中。ConnectX-7 支持 RDMA、GPUDirect、SHARP 网内聚合,可在网络中直接完成部分归约操作,降低 GPU 和 CPU 的负载。
4. 全栈软件生态
从底层 CUDA / cuDNN,到分布式训练框架 NCCL / DeepSpeed / Ray,再到容器化部署,软件与硬件深度协同是一条主线。
二、标志性算力设备:NVIDIA A100
A100 属于安培(Ampere)架构。虽然发布于 2020 年,但直到 2022–2023 年,它仍是许多智算中心的主力设备。
| 关键参数 | A100 SXM4 80GB |
|---|---|
| 架构 | Ampere,GA100 |
| 显存 | 80GB HBM2e,带宽 2,039 GB/s |
| FP32 | 19.5 TFLOPS |
| TF32 Tensor Core | 156 TFLOPS(稀疏 312 TFLOPS) |
| FP16 / BF16 Tensor Core | 312 TFLOPS(稀疏 624 TFLOPS) |
| INT8 Tensor Core | 624 TOPS(稀疏 1,248 TOPS) |
| 功耗 | 400W(SXM)/ 250W(PCIe 版) |
| 互联 | NVLink 3.0,带宽 600 GB/s |
为什么 A100 是主流? H100 发布后,A100 仍凭借稳定的供应链、成熟的软件栈和更合适的成本,成为智算集群的务实选择。
三、标志性网络设备:NVIDIA ConnectX-7
ConnectX-7(简称 CX7)是 NVIDIA 推出的 400G 智能网卡 / HCA,广泛用于 AI 训练的 RDMA 网络。它同时支持 InfiniBand 与以太网,是构建智算集群的重要网络节点。
| 关键参数 | ConnectX-7 |
|---|---|
| 端口速率 | 单口 / 双口,最高 400Gb/s |
| PCIe 接口 | PCIe 5.0 ×16,单卡带宽约 128 GB/s |
| 支持协议 | InfiniBand NDR / HDR、RoCEv2、TCP/UDP |
| 关键特性 | RDMA、GPUDirect 存储、SHARP 网内聚合 |
| 典型应用 | 分布式训练、高性能存储、超算及云数据中心 |
CX7 与 A100 的关系:标准 DGX A100 通常配备 ConnectX-6,而 DGX H100 标配 ConnectX-7。部分 2023 年智算系统会采用 A100 负责计算、CX7 负责高速网络入口的混合升级方案。
四、典型智算服务器架构
- 计算单元:8 × A100 SXM4 80GB,通过 NVLink 全互联。
- 系统互联:每张 A100 可配 CX7 网卡,通过 PCIe 5.0 连接。
- 外部网络:采用 Quantum-2 或 Spectrum-4 交换机构建无拥塞胖树拓扑。
- 软件栈:CUDA / NCCL + PyTorch / DeepSpeed + Slurm / Kubernetes。
核心思想是计算与网络解耦,再通过 RDMA 将多节点 GPU 显存连接成更大的资源池,以支持模型并行训练。
五、2023 年之后的演进
随着 H100、H200 等 GPU 出现,A100 逐步退居二线,但“A100 + CX7”仍代表着 2022–2023 年智算基础设施的典型技术栈。
更大规模的智算中心开始采用 H100 + ConnectX-7 + Quantum-2,并向液冷、GPU 直连网络和全栈 DPU 方向演进。
!!!