AI 超級電腦的高速公路:從 GB200/GB300 看懂 RDMA 網路
只要你大概知道「CPU、記憶體、網路」是什麼,就能從頭讀到尾。我們會從「為什麼 AI 需要網路」講起,一路深入到 NVIDIA GB200 / GB300 機櫃裡的三層網路架構,以及 RDMA 這項讓十萬顆 GPU 像一台電腦一樣工作的關鍵技術。
一、AI 的瓶頸,很多時候不是算力,而是「塞車」
大家談 AI 晶片,通常都在討論 GPU 跑多快、記憶體有多大。但一個很違反直覺的事實是:在大型 AI 訓練叢集裡,GPU 有大量時間花在「等網路」,而不是在計算。叢集規模愈大,等待的比例愈高:有教科書級的量測估計,單節點 8 顆 GPU 時,通訊約佔每步訓練時間的 25%;擴大到數千顆 GPU 時,通訊與同步合計可能吃掉約八成(實務上會用通訊與計算重疊等技巧壓低這個比例,但網路仍是最關鍵的瓶頸之一)。1
為什麼?因為今天的大型語言模型(LLM)動輒數千億、甚至上兆個參數,沒有任何一顆 GPU 塞得下。訓練時必須把模型和資料切開,分給成千上萬顆 GPU 一起算。而這些 GPU 每算完一小步,就必須互相交換結果(術語叫 AllReduce 等「集體通訊」),對齊之後才能算下一步。
你可以想像成一場超大型的分組報告:
- 每個組員(GPU)各自負責一部分。
- 每隔幾分鐘,所有人都要停下來開會對答案,任何一個人遲到,全部人都得等。
- 開會(網路傳輸)愈慢,大家「乾等」的時間愈多,再貴的人力(GPU)都在浪費。

分散式訓練的節奏:每算完一步就要在 AllReduce 同步點等齊所有 GPU——最慢的一環決定整體速度,叢集愈大,「乾等」的比例愈高
業界也常引用 NVIDIA 執行長黃仁勳的一個說法:InfiniBand 約佔 AI 叢集成本的 20%,卻能比一般乙太網路(不含 Spectrum-X)帶來約 20% 的效能提升,所以「InfiniBand 等於是免費的」。這個說法的重點不是推銷,而是點出:網路,就是 AI 超級電腦的隱形地基。
而這個地基的核心技術,就是本文的主角:RDMA(Remote Direct Memory Access,遠端直接記憶體存取)。
二、什麼是 RDMA?先從「傳統網路為什麼慢」說起
2.1 傳統 TCP/IP:每個包裹都要過好幾道海關
我們平常上網用的 TCP/IP 協定,資料傳輸的流程大概是這樣:
- 應用程式把資料交給作業系統核心(kernel)。
- 作業系統把資料複製到系統記憶體的緩衝區,切成封包、加上表頭、計算檢查碼。
- 網卡把封包送出去;對方收到後,再反過來做一次:CPU 中斷、解封包、複製回應用程式的記憶體。
這套流程非常穩健(網際網路就是靠它運作的),但有三個代價:
- CPU 很忙:每個封包都要 CPU 參與處理,高速傳輸時 CPU 可能光處理網路就飽和了。
- 一直複製:資料在「應用程式記憶體 → 核心緩衝區 → 網卡」之間搬來搬去。
- 延遲高:整趟流程走完是毫秒或次毫秒等級。
對日常上網來說完全夠用,但對「每秒要交換數百 GB 梯度資料」的 AI 訓練來說,這就像用市區道路跑 F1。2
2.2 RDMA:讓網卡直接「隔空取物」
RDMA 的核心概念只有一句話:
讓一台電腦的網卡,直接讀寫另一台電腦的記憶體,全程不打擾兩邊的 CPU 和作業系統。
具體做了三件事:
- Kernel Bypass(繞過作業系統):應用程式直接對網卡下指令,不經過作業系統核心。
- Zero Copy(零複製):資料直接從來源記憶體送到目的記憶體,不在中間緩衝區複製來複製去。
- 硬體卸載(Offload):封包的切割、重組、可靠傳輸全部由網卡的專用硬體處理,CPU 幾乎零負擔。
用比喻來說:傳統 TCP/IP 像是「你寫信 → 交給郵局 → 對方郵局收信 → 送到收件人手上」;RDMA 則像是兩棟大樓之間直接架了一條氣送管,文件咻一聲直達對方桌上,兩邊的櫃檯人員(CPU)完全不用經手。結果就是:延遲從毫秒級降到微秒級,CPU 佔用趨近於零。2

傳統 TCP/IP 與 RDMA 的資料路徑對比:TCP/IP 每站都要經過核心與複製;RDMA 繞過作業系統與 CPU,由網卡直達遠端記憶體
2.3 GPUDirect RDMA:連 CPU 的記憶體都不用經過
在 AI 伺服器裡,NVIDIA 又把這件事推進一步。傳統上 GPU 要把資料送出去,得先搬到 CPU 的系統記憶體(所謂 bounce buffer),再交給網卡。GPUDirect RDMA 讓網卡透過 PCIe 直接讀寫 GPU 的顯示記憶體(HBM),資料路徑變成:
傳統:GPU 記憶體 → CPU 系統記憶體 → 網卡 → 網路 → 對方網卡 → CPU 記憶體 → GPU 記憶體
GPUDirect RDMA:GPU 記憶體 → 網卡 → 網路 → 對方網卡 → GPU 記憶體

GPUDirect RDMA vs. 傳統路徑:資料直接在兩端 GPU 記憶體(HBM)之間傳輸,完全繞過 CPU 系統記憶體
NVIDIA 官方數據是這能帶來最高 10 倍的傳輸效能提升。3這就是「A 機櫃裡的 GPU,直接把梯度寫進 B 機櫃 GPU 的記憶體」的技術基礎,整個 AI 叢集因此能像一顆巨大的 GPU 一樣運作。
三、認識主角:GB200 與 GB300 到底是什麼?
3.1 不是一張卡,而是一整個機櫃
很多人以為 GB200 是「一顆 GPU」,其實它是機櫃級(rack-scale)的超級電腦:
- GB200 超級晶片:1 顆 Grace CPU(Arm 架構)+ 2 顆 Blackwell GPU,用 NVLink-C2C 直接封裝互連。4
- GB200 NVL72:一個機櫃塞進 36 顆 Grace CPU + 72 顆 Blackwell GPU(18 個運算抽屜 + 9 個 NVLink 交換器抽屜),全機櫃液冷,功耗約 120kW。5
- GB300 NVL72:2025 下半年登場的升級版,換上 Blackwell Ultra GPU:單卡 HBM3e 記憶體從 192GB 升到 288GB、FP4 算力提升 1.5 倍,並將網卡升級為 ConnectX-8(800Gb/s),主打長上下文推理與「AI 推理(reasoning)」工作負載。6
3.2 重點來了:一個機櫃裡有「三種網路」
理解 GB200/GB300 網路的關鍵,是知道機櫃裡其實同時存在三套完全不同的網路,各司其職7 8:
| 網路 | 範圍 | 技術 | 白話比喻 |
|---|---|---|---|
| NVLink(Scale-Up,向上擴展) | 機櫃內 72 顆 GPU 之間 | NVLink 5 + NVSwitch,銅纜背板 | 同一棟辦公室內的「內線電話」,快到像在隔壁喊話 |
| RDMA 運算網路(Scale-Out,向外擴展) | 機櫃與機櫃之間,GPU 對 GPU | InfiniBand 或 Spectrum-X 乙太網路 + ConnectX 網卡 | 城市之間的「高鐵」,連接成千上萬顆 GPU |
| 前端/儲存/管理網路(North-South) | 對外服務、讀資料、管理 | 一般乙太網路 + BlueField-3 DPU | 一般聯外道路:收發包裹、水電維運 |
這三層是互補而非取代:NVLink 負責讓一個機櫃內的 72 顆 GPU「融合成一顆巨型 GPU」;RDMA 網路負責把幾十、幾百個機櫃串成一座「AI 工廠」;前端網路則處理其他所有雜事。以下逐層拆解。
四、第一層 NVLink:把 72 顆 GPU 焊成一顆
GB200/GB300 機櫃內採用第五代 NVLink:
- 每顆 GPU 有 18 條 NVLink 連線,合計 1.8 TB/s 雙向頻寬,是 PCIe Gen5 的 14 倍以上。9
- 72 顆 GPU 透過 9 個 NVSwitch 交換器抽屜全互連(任兩顆 GPU 之間只隔一跳),全機櫃 NVLink 總頻寬 130 TB/s。5
- 機櫃背板整合了超過 5,000 條銅纜。為什麼用銅不用光纖?因為距離夠短,銅纜不需要耗電的光電轉換模組(DSP/雷射),依產業分析估計,一個機櫃可省下約 20kW 電力,而且更便宜、更可靠。10
- NVLink 還支援記憶體一致性:72 顆 GPU 可以互相直接存取彼此的 HBM,加上 Grace CPU 的記憶體,形成一個 13.4TB HBM3e + 17TB LPDDR5X(NVIDIA 官方規格)的巨大共用記憶體池。4

NVLink Scale-Up:機櫃內 72 顆 GPU 透過 NVSwitch 全互連(每 GPU 1.8 TB/s、全櫃 130 TB/s),等效於一顆巨型 GPU
一句話總結:在機櫃裡面,GPU 之間根本不需要「網路」,因為 NVLink 讓它們像同一顆晶片的不同區塊。 真正的挑戰在機櫃之外,這時就輪到 RDMA 登場了。
五、第二層 RDMA Scale-Out 網路:AI 工廠的高速公路系統
當你要訓練的模型大到一個機櫃(72 顆 GPU)也不夠用時,就得把幾十、幾百個 NVL72 機櫃連起來。這條「機櫃間 GPU 高速公路」有幾個設計重點:
5.1 一顆 GPU 配一張網卡(1:1)
GB200/GB300 的每顆 GPU 都配有專屬的 RDMA 網卡(GB200 用 ConnectX-7 400Gb/s,GB300 升級為 ConnectX-8 800Gb/s),確保每顆 GPU 都有自己的專用出口匝道,不用跟別人搶。ConnectX-8 還內建 PCIe Gen6 交換器(48 lanes),讓網卡直連 GPU,儼然成為運算抽屜的 I/O 樞紐。11

一顆 GPU 配一張專屬 RDMA 網卡:共用網卡會互搶出口造成壅塞;1:1 配置讓每顆 GPU 都有自己的專用車道(GB200 400Gb/s、GB300 800Gb/s)
5.2 Rail-Optimized 拓撲:同號 GPU 走同一條軌道
機櫃間採用 leaf-spine(葉脊)架構+軌道最佳化(rail-optimized)拓撲:所有機櫃的「1 號 GPU」連到同一組交換器、「2 號 GPU」連到另一組,以此類推。因為 AI 集體通訊的流量模式非常規律(同號 GPU 之間最常互傳),這樣設計能讓大部分流量只經過一層交換器就到達,跳數最少、延遲最低。7

RDMA Scale-Out:rail-optimized leaf-spine 拓撲:各機櫃的「同號 GPU」連到同一組 Rail 交換器,多數流量只經過一層交換器
5.3 兩條技術路線:InfiniBand vs. Spectrum-X 乙太網路
這是目前 AI 網路界最重要的「路線之爭」,NVIDIA 兩邊都押注:
路線一:InfiniBand,為 HPC 而生的純種賽車
InfiniBand 是專為超級電腦設計的網路,原生就是 RDMA、天生無損(lossless,靠 credit 機制保證不丟包):
- Quantum-2(NDR):400Gb/s,GB200 世代的主力。
- Quantum-X800(XDR):800Gb/s,144 個 port,搭配 GB300 與 ConnectX-8,是新一代 AI 工廠的旗艦。
- SHARP 網內計算(In-Network Computing):InfiniBand 的殺手鐧。交換器本身能執行加總、平均等「歸約運算」。原本 AllReduce 要 GPU 之間把資料傳來傳去好幾輪,現在交換器在資料經過時順手就把加法做完了(Quantum-X800 的 SHARP v4 提供 14.4 TFLOPS 網內算力)。12這就像高速公路收費站直接在你經過時完成報稅,不用再跑一趟國稅局。
- 延遲低於 1 微秒,搭配 NCCL/MPI 幾乎不用改程式就能受益。
代價是:InfiniBand 雖是開放標準(IBTA),但高階交換器與網卡實質上只有 NVIDIA 一家供應、需要專門的維運技能、成本較高。
路線二:Spectrum-X,把國道升級成賽道的乙太網路
乙太網路便宜、開放、全世界的網管都會用,但傳統乙太網路跑 RDMA(透過 RoCEv2,RDMA over Converged Ethernet)在大規模 AI 場景會遇到嚴重問題:AI 流量是少數幾條超大流(elephant flows),傳統的 ECMP 路由會讓它們撞在同一條路徑上大塞車,依 NVIDIA 公布的測試,有效吞吐量常常只剩約 60%。13
NVIDIA 的解法是 Spectrum-X 平台(Spectrum-4/SN5600 交換器 + BlueField-3 或 ConnectX SuperNIC 端到端搭配),核心技術有三:
- 自適應路由+封包噴灑(Adaptive Routing / Packet Spraying):交換器根據即時壅塞狀況,逐封包選擇最空的路徑,把大流打散到所有可用道路上。
- 接收端重排序(Direct Data Placement):封包走不同路徑會亂序到達,由目的端 SuperNIC 硬體負責把資料按正確順序直接放進記憶體,應用程式完全無感。
- 硬體級壅塞控制:交換器透過帶內遙測(in-band telemetry)即時回報網路狀態,網卡以次微秒級的回饋迴路調節流速,避免任何一條路真的塞死,同時保證多租戶之間的效能隔離。
結果:依 NVIDIA 公布的數據,Spectrum-X 能把乙太網路的有效吞吐量拉到約 95%,同時保留乙太網路的開放生態與成本優勢。13

兩條 RDMA 路線:InfiniBand 原生無損+SHARP 網內計算;Spectrum-X 用自適應路由+封包噴灑+接收端重排,把乙太網路有效吞吐拉到約 95%
該選哪條路?
| 面向 | InfiniBand(Quantum) | Spectrum-X 乙太網路 |
|---|---|---|
| 效能 | 最高、延遲最低、有 SHARP 網內計算 | 有效吞吐可達約 95%(NVIDIA 數據),無 SHARP 網內計算 |
| 生態 | 開放標準,但供應集中於 NVIDIA、需專門人才 | 開放乙太網路標準、網管人才充足 |
| 成本 | 較高 | 較低,可沿用既有維運體系 |
| 典型用戶 | 頂級研究實驗室、追求極致的訓練叢集 | 雲端服務商、多租戶 AI 雲、企業 |
業界現況是「雙軌並行」:例如 CoreWeave 的 GB300 執行個體同時提供 Quantum-X800 InfiniBand 版和 Spectrum-X RoCE 版;Oracle OCI 的 GB200/GB300 也同時支援兩種 RDMA 網路。14 15
六、GB200 → GB300:網路到底升級了什麼?
| 項目 | GB200 NVL72 | GB300 NVL72 |
|---|---|---|
| GPU | Blackwell(192GB HBM3e) | Blackwell Ultra(288GB HBM3e) |
| 每 GPU 網卡 | ConnectX-7,400Gb/s | ConnectX-8,800Gb/s(頻寬翻倍) |
| 網卡介面 | PCIe Gen5 | PCIe Gen6 x48,內建 PCIe 交換器 |
| 對應交換器 | Quantum-2(NDR 400G)/Spectrum-4 | Quantum-X800(XDR 800G)/Spectrum-X 800G |
| NVLink | NVLink 5,1.8TB/s/GPU、130TB/s/櫃 | 同為 NVLink 5 世代 |
有個有趣的產業內幕:GB200 首發時,因為新一代 224G SerDes 網路晶片還沒就緒,初期出貨沿用了 H100 世代的 ConnectX-7 與 Quantum-2;真正的端到端 800G 世代要到 GB300 才算完整到位。10 11這也說明了一件事:在 AI 基礎設施的世界,網路的世代交替與 GPU 同樣關鍵,甚至常常是出貨時程的決定因素。
七、真實世界的案例
xAI Colossus:10 萬顆 GPU 的乙太網路豪賭
馬斯克的 xAI 在孟菲斯建造的 Colossus 超級電腦,用 Spectrum-X 乙太網路串連 10 萬顆 NVIDIA Hopper GPU(後續擴至 20 萬顆),從動工到開始訓練只花了 122 天。NVIDIA 公布的數據:全叢集維持 95% 的資料吞吐率、零因流量碰撞造成的丟包,證明了乙太網路路線在超大規模下的可行性,也是「AI 工廠」概念最具代表性的實例。16
雲端大廠的選擇
- Oracle OCI:為 GB200/GB300 NVL72 開發了專屬 API,把整個機櫃當成「一台超級電腦」來配置,NVLink + InfiniBand 或 Spectrum-X RoCE 全自動優化。15
- CoreWeave:GB300 提供 InfiniBand 與 Spectrum-X 雙版本,每 GPU 800Gbps。14
- Meta 與 Oracle 已宣布在其 AI 資料中心網路採用 Spectrum-X 交換器;微軟、CoreWeave、OCI 也已陸續部署 GB300 NVL72。13
- Google Cloud:沒買 Spectrum-X,而是把 NVIDIA 網卡接進自家體系。從 A3 Ultra(H200)起改用 Titanium ML 網卡+標準 RoCE(取代早期魔改 TCP 的 GPUDirect-TCPX)17 18;A4X(GB200 NVL72)每櫃 28.8 Tbps、A4X Max(GB300)再翻倍到每 GPU 800Gbps,外層由自研 Jupiter fabric 串成數萬顆 GPU 的無阻塞叢集,傳輸層還自研 Falcon 並開源給 OCP。TPU 更是平行宇宙:pod 內不用乙太網路也不用 InfiniBand,而是自研 ICI + OCS 光路交換(Ironwood 單一 superpod 直連 9,216 顆晶片),TPU v4 論文原話是比 InfiniBand「更便宜、更省電、更快」。19 20 21 22 23
- AWS:連網卡與傳輸協定都自研,EFA(Nitro 晶片)+ SRD 逐封包噴灑到最多 64 條路徑、容忍亂序到達、微秒級重傳(與 Spectrum-X「自適應路由+接收端重排」同款思路,但 2019 年就上線),對外則是自研 10p10u fabric(數十 Pb/s 吞吐、往返延遲低於 10 微秒)。24 25 26P6e-GB200 UltraServers 櫃內仍是 NVL72、櫃間跑 EFAv4(每櫃 28.8 Tbps + GPUDirect RDMA);連 NVIDIA 自家的 Project Ceiba(20,736 顆 B200)與為 Anthropic 打造的 Project Rainier(近 50 萬顆 Trainium2、櫃內 NeuronLink)走的都是 EFA 而非 InfiniBand。27 28 29
把 GCP、AWS 與前面的 InfiniBand/Spectrum-X 對照,會發現一個驚人的收斂:無論誰來做,答案都是「多路徑封包噴灑+亂序容忍+硬體卸載的壅塞控制」。RDMA 語意是共同的終點,差別只在於:這條高速公路,是向 NVIDIA 買,還是自己修。
八、下一步:當一棟資料中心也不夠用
AI 叢集的擴張已經撞到新的天花板:單一建築的供電上限。NVIDIA 的答案是在 scale-up(機櫃內)、scale-out(機櫃間)之後的第三個維度:scale-across(跨資料中心)。
- Spectrum-XGS Ethernet(2025 年發表):用「距離自適應」的壅塞控制演算法,把分散在不同地點的多座資料中心連成一座「Giga 級 AI 超級工廠」,跨資料中心的 NCCL 集體通訊效能提升約 1.9 倍。CoreWeave 是首批部署者。30
- 矽光子(Silicon Photonics/CPO):把光學元件直接封裝進交換器晶片,Quantum-X InfiniBand Photonics 與 Spectrum-X Photonics(最高 409.6 Tb/s)將大幅降低超大規模網路的功耗,2026 年起陸續登場,目標是百萬 GPU 等級的叢集。
- 下一代已在路上:ConnectX-9 SuperNIC(1.6 Tb/s/GPU)與 NVLink 6(3.6 TB/s/GPU、NVL72 全櫃 260 TB/s)將伴隨 Rubin 平台推出,頻寬大約每代翻倍的節奏仍在繼續。9
九、總結
回顧全文:AI 的競賽早已不只是晶片競賽,更是網路競賽。當模型大到單一 GPU、單一機櫃、甚至單一資料中心都裝不下,「讓上萬顆 GPU 高效協作」的網路能力,就直接決定了訓練的成本與速度。而支撐這一切的基石正是 RDMA:繞過作業系統、零複製、讓網卡直接讀寫遠端 GPU 記憶體,把延遲壓到微秒級、把 CPU 負擔壓到趨近於零,讓十萬顆 GPU 能像一台電腦一樣工作。
落實到 GB200/GB300,這套能力具體展開成三層網路架構:機櫃內用 NVLink 把 72 顆 GPU 焊成一顆巨型 GPU;機櫃間用 InfiniBand 或 Spectrum-X 乙太網路(兩者都跑 RDMA)把數十、數百個機櫃串成一座 AI 工廠;未來再由 Spectrum-XGS 把多座工廠連成跨資料中心的超級工廠。下次看到 AI 超級電腦的新聞時,除了 GPU 的算力數字,也別忘了那條看不見的高速公路。它才是決定這座 AI 工廠能跑多快的隱形地基。
附錄
| 名詞 | 白話解釋 |
|---|---|
| RDMA | 遠端直接記憶體存取。網卡直接讀寫遠端記憶體,不經過 CPU 與作業系統。 |
| GPUDirect RDMA | 網卡直接讀寫 GPU 顯示記憶體,連 CPU 系統記憶體都跳過。 |
| RoCE | 在乙太網路上跑 RDMA 的協定(RDMA over Converged Ethernet)。 |
| NVLink / NVSwitch | 機櫃內 GPU 之間的超高速互連(scale-up)。 |
| InfiniBand | 專為超算設計、原生 RDMA 的網路(Quantum 系列交換器)。 |
| Spectrum-X | NVIDIA 為 AI 優化的乙太網路平台(交換器+SuperNIC 端到端搭配)。 |
| SHARP | 讓交換器在資料經過時順便做加總運算的「網內計算」技術。 |
| EFA/SRD | AWS 自研的高速網卡與傳輸協定(實作於 Nitro 晶片),以多路徑噴灑+亂序容忍在乙太網路上實現 RDMA 式傳輸。 |
| Falcon | Google 自研並開源給 OCP 的硬體傳輸層,可在一般乙太網路上承載 RDMA。 |
| ICI/OCS | Google TPU 的晶片間互連與光路交換技術,在 pod 內取代乙太網路與 InfiniBand。 |
| AllReduce | 分散式訓練中「大家交換並彙總梯度」的集體通訊操作。 |
| Scale-up / Scale-out / Scale-across | 機櫃內擴展/跨機櫃擴展/跨資料中心擴展。 |
參考資料