!!!

2022–2023 年主流智算理念与设备

2022 年至 2023 年,大模型(如 GPT-4、LLaMA)的爆发式增长,让“智算”成为炙手可热的话题。
这一时期的智算体系通常以 GPU 加速计算为底座,以高速网络为神经,
分布式训练为业务方向。

一、当时主流的智算理念

1. 加速计算 + 智能中心

传统 CPU 已难以满足 TensorFlow、PyTorch 等框架的大规模矩阵运算,GPU 成为智算的第一选择。地方与企业纷纷建设智算中心,以 GPU 集群为核心提供算力服务。

2. Scale-up 与 Scale-out 并重

  • Scale-up 单机内通过 NVLink 将 8 块 GPU 组成高带宽域,减少数据拷贝。
  • Scale-out 通过 InfiniBand / RoCE 连接多台服务器,支撑千卡甚至万卡集群。

3. 网络即计算

NVIDIA 等公司将网络计算能力集成到智能网卡和 DPU 中。ConnectX-7 支持 RDMA、GPUDirect、SHARP 网内聚合,可在网络中直接完成部分归约操作,降低 GPU 和 CPU 的负载。

4. 全栈软件生态

从底层 CUDA / cuDNN,到分布式训练框架 NCCL / DeepSpeed / Ray,再到容器化部署,软件与硬件深度协同是一条主线。

二、标志性算力设备:NVIDIA A100

A100 属于安培(Ampere)架构。虽然发布于 2020 年,但直到 2022–2023 年,它仍是许多智算中心的主力设备。

关键参数A100 SXM4 80GB
架构Ampere,GA100
显存80GB HBM2e,带宽 2,039 GB/s
FP3219.5 TFLOPS
TF32 Tensor Core156 TFLOPS(稀疏 312 TFLOPS)
FP16 / BF16 Tensor Core312 TFLOPS(稀疏 624 TFLOPS)
INT8 Tensor Core624 TOPS(稀疏 1,248 TOPS)
功耗400W(SXM)/ 250W(PCIe 版)
互联NVLink 3.0,带宽 600 GB/s

为什么 A100 是主流? H100 发布后,A100 仍凭借稳定的供应链、成熟的软件栈和更合适的成本,成为智算集群的务实选择。

三、标志性网络设备:NVIDIA ConnectX-7

ConnectX-7(简称 CX7)是 NVIDIA 推出的 400G 智能网卡 / HCA,广泛用于 AI 训练的 RDMA 网络。它同时支持 InfiniBand 与以太网,是构建智算集群的重要网络节点。

关键参数ConnectX-7
端口速率单口 / 双口,最高 400Gb/s
PCIe 接口PCIe 5.0 ×16,单卡带宽约 128 GB/s
支持协议InfiniBand NDR / HDR、RoCEv2、TCP/UDP
关键特性RDMA、GPUDirect 存储、SHARP 网内聚合
典型应用分布式训练、高性能存储、超算及云数据中心

CX7 与 A100 的关系:标准 DGX A100 通常配备 ConnectX-6,而 DGX H100 标配 ConnectX-7。部分 2023 年智算系统会采用 A100 负责计算、CX7 负责高速网络入口的混合升级方案。

四、典型智算服务器架构

  • 计算单元:8 × A100 SXM4 80GB,通过 NVLink 全互联。
  • 系统互联:每张 A100 可配 CX7 网卡,通过 PCIe 5.0 连接。
  • 外部网络:采用 Quantum-2 或 Spectrum-4 交换机构建无拥塞胖树拓扑。
  • 软件栈:CUDA / NCCL + PyTorch / DeepSpeed + Slurm / Kubernetes。

核心思想是计算与网络解耦,再通过 RDMA 将多节点 GPU 显存连接成更大的资源池,以支持模型并行训练。

五、2023 年之后的演进

随着 H100、H200 等 GPU 出现,A100 逐步退居二线,但“A100 + CX7”仍代表着 2022–2023 年智算基础设施的典型技术栈。

更大规模的智算中心开始采用 H100 + ConnectX-7 + Quantum-2,并向液冷、GPU 直连网络和全栈 DPU 方向演进。

核心结论:算力、网络与软件协同优化,才是真正的大规模智能计算。
整理于 2025 年 · 技术资料仅供学习参考,具体数据以官方发布为准

!!!

最后修改:2026 年 08 月 17 日
如果觉得我的文章对你有用,请随意赞赏