AI 超級電腦的高速公路:從 GB200/GB300 看懂 RDMA 網路

AI 超級電腦的高速公路:從 GB200/GB300 看懂 RDMA 網路

只要你大概知道「CPU、記憶體、網路」是什麼,就能從頭讀到尾。我們會從「為什麼 AI 需要網路」講起,一路深入到 NVIDIA GB200 / GB300 機櫃裡的三層網路架構,以及 RDMA 這項讓十萬顆 GPU 像一台電腦一樣工作的關鍵技術。

一、AI 的瓶頸,很多時候不是算力,而是「塞車」

大家談 AI 晶片,通常都在討論 GPU 跑多快、記憶體有多大。但一個很違反直覺的事實是:在大型 AI 訓練叢集裡,GPU 有大量時間花在「等網路」,而不是在計算。叢集規模愈大,等待的比例愈高:有教科書級的量測估計,單節點 8 顆 GPU 時,通訊約佔每步訓練時間的 25%;擴大到數千顆 GPU 時,通訊與同步合計可能吃掉約八成(實務上會用通訊與計算重疊等技巧壓低這個比例,但網路仍是最關鍵的瓶頸之一)。1

為什麼?因為今天的大型語言模型(LLM)動輒數千億、甚至上兆個參數,沒有任何一顆 GPU 塞得下。訓練時必須把模型和資料切開,分給成千上萬顆 GPU 一起算。而這些 GPU 每算完一小步,就必須互相交換結果(術語叫 AllReduce 等「集體通訊」),對齊之後才能算下一步。

你可以想像成一場超大型的分組報告:

  • 每個組員(GPU)各自負責一部分。
  • 每隔幾分鐘,所有人都要停下來開會對答案,任何一個人遲到,全部人都得等。
  • 開會(網路傳輸)愈慢,大家「乾等」的時間愈多,再貴的人力(GPU)都在浪費。

分散式訓練的節奏:每算完一步就要在 AllReduce 同步點等齊所有 GPU——最慢的一環決定整體速度,叢集愈大,「乾等」的比例愈高

分散式訓練的節奏:每算完一步就要在 AllReduce 同步點等齊所有 GPU——最慢的一環決定整體速度,叢集愈大,「乾等」的比例愈高

業界也常引用 NVIDIA 執行長黃仁勳的一個說法:InfiniBand 約佔 AI 叢集成本的 20%,卻能比一般乙太網路(不含 Spectrum-X)帶來約 20% 的效能提升,所以「InfiniBand 等於是免費的」。這個說法的重點不是推銷,而是點出:網路,就是 AI 超級電腦的隱形地基。

而這個地基的核心技術,就是本文的主角:RDMA(Remote Direct Memory Access,遠端直接記憶體存取)

二、什麼是 RDMA?先從「傳統網路為什麼慢」說起

2.1 傳統 TCP/IP:每個包裹都要過好幾道海關

我們平常上網用的 TCP/IP 協定,資料傳輸的流程大概是這樣:

  1. 應用程式把資料交給作業系統核心(kernel)
  2. 作業系統把資料複製到系統記憶體的緩衝區,切成封包、加上表頭、計算檢查碼。
  3. 網卡把封包送出去;對方收到後,再反過來做一次:CPU 中斷、解封包、複製回應用程式的記憶體。

這套流程非常穩健(網際網路就是靠它運作的),但有三個代價:

  • CPU 很忙:每個封包都要 CPU 參與處理,高速傳輸時 CPU 可能光處理網路就飽和了。
  • 一直複製:資料在「應用程式記憶體 → 核心緩衝區 → 網卡」之間搬來搬去。
  • 延遲高:整趟流程走完是毫秒或次毫秒等級。

對日常上網來說完全夠用,但對「每秒要交換數百 GB 梯度資料」的 AI 訓練來說,這就像用市區道路跑 F1。2

2.2 RDMA:讓網卡直接「隔空取物」

RDMA 的核心概念只有一句話:

讓一台電腦的網卡,直接讀寫另一台電腦的記憶體,全程不打擾兩邊的 CPU 和作業系統。

具體做了三件事:

  1. Kernel Bypass(繞過作業系統):應用程式直接對網卡下指令,不經過作業系統核心。
  2. Zero Copy(零複製):資料直接從來源記憶體送到目的記憶體,不在中間緩衝區複製來複製去。
  3. 硬體卸載(Offload):封包的切割、重組、可靠傳輸全部由網卡的專用硬體處理,CPU 幾乎零負擔。

用比喻來說:傳統 TCP/IP 像是「你寫信 → 交給郵局 → 對方郵局收信 → 送到收件人手上」;RDMA 則像是兩棟大樓之間直接架了一條氣送管,文件咻一聲直達對方桌上,兩邊的櫃檯人員(CPU)完全不用經手。結果就是:延遲從毫秒級降到微秒級,CPU 佔用趨近於零。2

傳統 TCP/IP 與 RDMA 的資料路徑對比:TCP/IP 每站都要經過核心與複製;RDMA 繞過作業系統與 CPU,由網卡直達遠端記憶體

傳統 TCP/IP 與 RDMA 的資料路徑對比:TCP/IP 每站都要經過核心與複製;RDMA 繞過作業系統與 CPU,由網卡直達遠端記憶體

2.3 GPUDirect RDMA:連 CPU 的記憶體都不用經過

在 AI 伺服器裡,NVIDIA 又把這件事推進一步。傳統上 GPU 要把資料送出去,得先搬到 CPU 的系統記憶體(所謂 bounce buffer),再交給網卡。GPUDirect RDMA 讓網卡透過 PCIe 直接讀寫 GPU 的顯示記憶體(HBM),資料路徑變成:

傳統:GPU 記憶體 → CPU 系統記憶體 → 網卡 → 網路 → 對方網卡 → CPU 記憶體 → GPU 記憶體
GPUDirect RDMA:GPU 記憶體 → 網卡 → 網路 → 對方網卡 → GPU 記憶體

GPUDirect RDMA vs. 傳統路徑:資料直接在兩端 GPU 記憶體(HBM)之間傳輸,完全繞過 CPU 系統記憶體

GPUDirect RDMA vs. 傳統路徑:資料直接在兩端 GPU 記憶體(HBM)之間傳輸,完全繞過 CPU 系統記憶體

NVIDIA 官方數據是這能帶來最高 10 倍的傳輸效能提升。3這就是「A 機櫃裡的 GPU,直接把梯度寫進 B 機櫃 GPU 的記憶體」的技術基礎,整個 AI 叢集因此能像一顆巨大的 GPU 一樣運作。

三、認識主角:GB200 與 GB300 到底是什麼?

3.1 不是一張卡,而是一整個機櫃

很多人以為 GB200 是「一顆 GPU」,其實它是機櫃級(rack-scale)的超級電腦

  • GB200 超級晶片:1 顆 Grace CPU(Arm 架構)+ 2 顆 Blackwell GPU,用 NVLink-C2C 直接封裝互連。4
  • GB200 NVL72:一個機櫃塞進 36 顆 Grace CPU + 72 顆 Blackwell GPU(18 個運算抽屜 + 9 個 NVLink 交換器抽屜),全機櫃液冷,功耗約 120kW。5
  • GB300 NVL72:2025 下半年登場的升級版,換上 Blackwell Ultra GPU:單卡 HBM3e 記憶體從 192GB 升到 288GB、FP4 算力提升 1.5 倍,並將網卡升級為 ConnectX-8(800Gb/s),主打長上下文推理與「AI 推理(reasoning)」工作負載。6

3.2 重點來了:一個機櫃裡有「三種網路」

理解 GB200/GB300 網路的關鍵,是知道機櫃裡其實同時存在三套完全不同的網路,各司其職7 8

網路 範圍 技術 白話比喻
NVLink(Scale-Up,向上擴展) 機櫃內 72 顆 GPU 之間 NVLink 5 + NVSwitch,銅纜背板 同一棟辦公室內的「內線電話」,快到像在隔壁喊話
RDMA 運算網路(Scale-Out,向外擴展) 機櫃與機櫃之間,GPU 對 GPU InfiniBand 或 Spectrum-X 乙太網路 + ConnectX 網卡 城市之間的「高鐵」,連接成千上萬顆 GPU
前端/儲存/管理網路(North-South) 對外服務、讀資料、管理 一般乙太網路 + BlueField-3 DPU 一般聯外道路:收發包裹、水電維運

這三層是互補而非取代:NVLink 負責讓一個機櫃內的 72 顆 GPU「融合成一顆巨型 GPU」;RDMA 網路負責把幾十、幾百個機櫃串成一座「AI 工廠」;前端網路則處理其他所有雜事。以下逐層拆解。

四、第一層 NVLink:把 72 顆 GPU 焊成一顆

GB200/GB300 機櫃內採用第五代 NVLink

  • 每顆 GPU 有 18 條 NVLink 連線,合計 1.8 TB/s 雙向頻寬,是 PCIe Gen5 的 14 倍以上。9
  • 72 顆 GPU 透過 9 個 NVSwitch 交換器抽屜全互連(任兩顆 GPU 之間只隔一跳),全機櫃 NVLink 總頻寬 130 TB/s5
  • 機櫃背板整合了超過 5,000 條銅纜。為什麼用銅不用光纖?因為距離夠短,銅纜不需要耗電的光電轉換模組(DSP/雷射),依產業分析估計,一個機櫃可省下約 20kW 電力,而且更便宜、更可靠。10
  • NVLink 還支援記憶體一致性:72 顆 GPU 可以互相直接存取彼此的 HBM,加上 Grace CPU 的記憶體,形成一個 13.4TB HBM3e + 17TB LPDDR5X(NVIDIA 官方規格)的巨大共用記憶體池。4

NVLink Scale-Up:機櫃內 72 顆 GPU 透過 NVSwitch 全互連(每 GPU 1.8 TB/s、全櫃 130 TB/s),等效於一顆巨型 GPU

NVLink Scale-Up:機櫃內 72 顆 GPU 透過 NVSwitch 全互連(每 GPU 1.8 TB/s、全櫃 130 TB/s),等效於一顆巨型 GPU

一句話總結:在機櫃裡面,GPU 之間根本不需要「網路」,因為 NVLink 讓它們像同一顆晶片的不同區塊。 真正的挑戰在機櫃之外,這時就輪到 RDMA 登場了。

五、第二層 RDMA Scale-Out 網路:AI 工廠的高速公路系統

當你要訓練的模型大到一個機櫃(72 顆 GPU)也不夠用時,就得把幾十、幾百個 NVL72 機櫃連起來。這條「機櫃間 GPU 高速公路」有幾個設計重點:

5.1 一顆 GPU 配一張網卡(1:1)

GB200/GB300 的每顆 GPU 都配有專屬的 RDMA 網卡(GB200 用 ConnectX-7 400Gb/s,GB300 升級為 ConnectX-8 800Gb/s),確保每顆 GPU 都有自己的專用出口匝道,不用跟別人搶。ConnectX-8 還內建 PCIe Gen6 交換器(48 lanes),讓網卡直連 GPU,儼然成為運算抽屜的 I/O 樞紐。11

一顆 GPU 配一張專屬 RDMA 網卡:共用網卡會互搶出口造成壅塞;1:1 配置讓每顆 GPU 都有自己的專用車道(GB200 400Gb/s、GB300 800Gb/s)

一顆 GPU 配一張專屬 RDMA 網卡:共用網卡會互搶出口造成壅塞;1:1 配置讓每顆 GPU 都有自己的專用車道(GB200 400Gb/s、GB300 800Gb/s)

5.2 Rail-Optimized 拓撲:同號 GPU 走同一條軌道

機櫃間採用 leaf-spine(葉脊)架構+軌道最佳化(rail-optimized)拓撲:所有機櫃的「1 號 GPU」連到同一組交換器、「2 號 GPU」連到另一組,以此類推。因為 AI 集體通訊的流量模式非常規律(同號 GPU 之間最常互傳),這樣設計能讓大部分流量只經過一層交換器就到達,跳數最少、延遲最低。7

RDMA Scale-Out:rail-optimized leaf-spine 拓撲:各機櫃的「同號 GPU」連到同一組 Rail 交換器,多數流量只經過一層交換器

RDMA Scale-Out:rail-optimized leaf-spine 拓撲:各機櫃的「同號 GPU」連到同一組 Rail 交換器,多數流量只經過一層交換器

5.3 兩條技術路線:InfiniBand vs. Spectrum-X 乙太網路

這是目前 AI 網路界最重要的「路線之爭」,NVIDIA 兩邊都押注:

路線一:InfiniBand,為 HPC 而生的純種賽車

InfiniBand 是專為超級電腦設計的網路,原生就是 RDMA、天生無損(lossless,靠 credit 機制保證不丟包):

  • Quantum-2(NDR):400Gb/s,GB200 世代的主力。
  • Quantum-X800(XDR):800Gb/s,144 個 port,搭配 GB300 與 ConnectX-8,是新一代 AI 工廠的旗艦。
  • SHARP 網內計算(In-Network Computing):InfiniBand 的殺手鐧。交換器本身能執行加總、平均等「歸約運算」。原本 AllReduce 要 GPU 之間把資料傳來傳去好幾輪,現在交換器在資料經過時順手就把加法做完了(Quantum-X800 的 SHARP v4 提供 14.4 TFLOPS 網內算力)。12這就像高速公路收費站直接在你經過時完成報稅,不用再跑一趟國稅局。
  • 延遲低於 1 微秒,搭配 NCCL/MPI 幾乎不用改程式就能受益。

代價是:InfiniBand 雖是開放標準(IBTA),但高階交換器與網卡實質上只有 NVIDIA 一家供應、需要專門的維運技能、成本較高。

路線二:Spectrum-X,把國道升級成賽道的乙太網路

乙太網路便宜、開放、全世界的網管都會用,但傳統乙太網路跑 RDMA(透過 RoCEv2,RDMA over Converged Ethernet)在大規模 AI 場景會遇到嚴重問題:AI 流量是少數幾條超大流(elephant flows),傳統的 ECMP 路由會讓它們撞在同一條路徑上大塞車,依 NVIDIA 公布的測試,有效吞吐量常常只剩約 60%13

NVIDIA 的解法是 Spectrum-X 平台(Spectrum-4/SN5600 交換器 + BlueField-3 或 ConnectX SuperNIC 端到端搭配),核心技術有三:

  1. 自適應路由+封包噴灑(Adaptive Routing / Packet Spraying):交換器根據即時壅塞狀況,逐封包選擇最空的路徑,把大流打散到所有可用道路上。
  2. 接收端重排序(Direct Data Placement):封包走不同路徑會亂序到達,由目的端 SuperNIC 硬體負責把資料按正確順序直接放進記憶體,應用程式完全無感。
  3. 硬體級壅塞控制:交換器透過帶內遙測(in-band telemetry)即時回報網路狀態,網卡以次微秒級的回饋迴路調節流速,避免任何一條路真的塞死,同時保證多租戶之間的效能隔離。

結果:依 NVIDIA 公布的數據,Spectrum-X 能把乙太網路的有效吞吐量拉到約 95%,同時保留乙太網路的開放生態與成本優勢。13

兩條 RDMA 路線:InfiniBand 原生無損+SHARP 網內計算;Spectrum-X 用自適應路由+封包噴灑+接收端重排,把乙太網路有效吞吐拉到約 95%

兩條 RDMA 路線:InfiniBand 原生無損+SHARP 網內計算;Spectrum-X 用自適應路由+封包噴灑+接收端重排,把乙太網路有效吞吐拉到約 95%

該選哪條路?

面向 InfiniBand(Quantum) Spectrum-X 乙太網路
效能 最高、延遲最低、有 SHARP 網內計算 有效吞吐可達約 95%(NVIDIA 數據),無 SHARP 網內計算
生態 開放標準,但供應集中於 NVIDIA、需專門人才 開放乙太網路標準、網管人才充足
成本 較高 較低,可沿用既有維運體系
典型用戶 頂級研究實驗室、追求極致的訓練叢集 雲端服務商、多租戶 AI 雲、企業

業界現況是「雙軌並行」:例如 CoreWeave 的 GB300 執行個體同時提供 Quantum-X800 InfiniBand 版和 Spectrum-X RoCE 版;Oracle OCI 的 GB200/GB300 也同時支援兩種 RDMA 網路。14 15

六、GB200 → GB300:網路到底升級了什麼?

項目 GB200 NVL72 GB300 NVL72
GPU Blackwell(192GB HBM3e) Blackwell Ultra(288GB HBM3e)
每 GPU 網卡 ConnectX-7,400Gb/s ConnectX-8,800Gb/s(頻寬翻倍)
網卡介面 PCIe Gen5 PCIe Gen6 x48,內建 PCIe 交換器
對應交換器 Quantum-2(NDR 400G)/Spectrum-4 Quantum-X800(XDR 800G)/Spectrum-X 800G
NVLink NVLink 5,1.8TB/s/GPU、130TB/s/櫃 同為 NVLink 5 世代

有個有趣的產業內幕:GB200 首發時,因為新一代 224G SerDes 網路晶片還沒就緒,初期出貨沿用了 H100 世代的 ConnectX-7 與 Quantum-2;真正的端到端 800G 世代要到 GB300 才算完整到位10 11這也說明了一件事:在 AI 基礎設施的世界,網路的世代交替與 GPU 同樣關鍵,甚至常常是出貨時程的決定因素。

七、真實世界的案例

xAI Colossus:10 萬顆 GPU 的乙太網路豪賭

馬斯克的 xAI 在孟菲斯建造的 Colossus 超級電腦,用 Spectrum-X 乙太網路串連 10 萬顆 NVIDIA Hopper GPU(後續擴至 20 萬顆),從動工到開始訓練只花了 122 天。NVIDIA 公布的數據:全叢集維持 95% 的資料吞吐率、零因流量碰撞造成的丟包,證明了乙太網路路線在超大規模下的可行性,也是「AI 工廠」概念最具代表性的實例。16

雲端大廠的選擇

  • Oracle OCI:為 GB200/GB300 NVL72 開發了專屬 API,把整個機櫃當成「一台超級電腦」來配置,NVLink + InfiniBand 或 Spectrum-X RoCE 全自動優化。15
  • CoreWeave:GB300 提供 InfiniBand 與 Spectrum-X 雙版本,每 GPU 800Gbps。14
  • Meta 與 Oracle 已宣布在其 AI 資料中心網路採用 Spectrum-X 交換器;微軟、CoreWeave、OCI 也已陸續部署 GB300 NVL72。13
  • Google Cloud:沒買 Spectrum-X,而是把 NVIDIA 網卡接進自家體系。從 A3 Ultra(H200)起改用 Titanium ML 網卡+標準 RoCE(取代早期魔改 TCP 的 GPUDirect-TCPX)17 18;A4X(GB200 NVL72)每櫃 28.8 Tbps、A4X Max(GB300)再翻倍到每 GPU 800Gbps,外層由自研 Jupiter fabric 串成數萬顆 GPU 的無阻塞叢集,傳輸層還自研 Falcon 並開源給 OCP。TPU 更是平行宇宙:pod 內不用乙太網路也不用 InfiniBand,而是自研 ICI + OCS 光路交換(Ironwood 單一 superpod 直連 9,216 顆晶片),TPU v4 論文原話是比 InfiniBand「更便宜、更省電、更快」。19 20 21 22 23
  • AWS:連網卡與傳輸協定都自研,EFA(Nitro 晶片)+ SRD 逐封包噴灑到最多 64 條路徑、容忍亂序到達、微秒級重傳(與 Spectrum-X「自適應路由+接收端重排」同款思路,但 2019 年就上線),對外則是自研 10p10u fabric(數十 Pb/s 吞吐、往返延遲低於 10 微秒)。24 25 26P6e-GB200 UltraServers 櫃內仍是 NVL72、櫃間跑 EFAv4(每櫃 28.8 Tbps + GPUDirect RDMA);連 NVIDIA 自家的 Project Ceiba(20,736 顆 B200)與為 Anthropic 打造的 Project Rainier(近 50 萬顆 Trainium2、櫃內 NeuronLink)走的都是 EFA 而非 InfiniBand。27 28 29

把 GCP、AWS 與前面的 InfiniBand/Spectrum-X 對照,會發現一個驚人的收斂:無論誰來做,答案都是「多路徑封包噴灑+亂序容忍+硬體卸載的壅塞控制」。RDMA 語意是共同的終點,差別只在於:這條高速公路,是向 NVIDIA 買,還是自己修。

八、下一步:當一棟資料中心也不夠用

AI 叢集的擴張已經撞到新的天花板:單一建築的供電上限。NVIDIA 的答案是在 scale-up(機櫃內)、scale-out(機櫃間)之後的第三個維度:scale-across(跨資料中心)

  • Spectrum-XGS Ethernet(2025 年發表):用「距離自適應」的壅塞控制演算法,把分散在不同地點的多座資料中心連成一座「Giga 級 AI 超級工廠」,跨資料中心的 NCCL 集體通訊效能提升約 1.9 倍。CoreWeave 是首批部署者。30
  • 矽光子(Silicon Photonics/CPO):把光學元件直接封裝進交換器晶片,Quantum-X InfiniBand Photonics 與 Spectrum-X Photonics(最高 409.6 Tb/s)將大幅降低超大規模網路的功耗,2026 年起陸續登場,目標是百萬 GPU 等級的叢集。
  • 下一代已在路上:ConnectX-9 SuperNIC(1.6 Tb/s/GPU)與 NVLink 6(3.6 TB/s/GPU、NVL72 全櫃 260 TB/s)將伴隨 Rubin 平台推出,頻寬大約每代翻倍的節奏仍在繼續。9

九、總結

回顧全文:AI 的競賽早已不只是晶片競賽,更是網路競賽。當模型大到單一 GPU、單一機櫃、甚至單一資料中心都裝不下,「讓上萬顆 GPU 高效協作」的網路能力,就直接決定了訓練的成本與速度。而支撐這一切的基石正是 RDMA:繞過作業系統、零複製、讓網卡直接讀寫遠端 GPU 記憶體,把延遲壓到微秒級、把 CPU 負擔壓到趨近於零,讓十萬顆 GPU 能像一台電腦一樣工作。

落實到 GB200/GB300,這套能力具體展開成三層網路架構:機櫃內用 NVLink 把 72 顆 GPU 焊成一顆巨型 GPU;機櫃間用 InfiniBand 或 Spectrum-X 乙太網路(兩者都跑 RDMA)把數十、數百個機櫃串成一座 AI 工廠;未來再由 Spectrum-XGS 把多座工廠連成跨資料中心的超級工廠。下次看到 AI 超級電腦的新聞時,除了 GPU 的算力數字,也別忘了那條看不見的高速公路。它才是決定這座 AI 工廠能跑多快的隱形地基。

附錄

名詞 白話解釋
RDMA 遠端直接記憶體存取。網卡直接讀寫遠端記憶體,不經過 CPU 與作業系統。
GPUDirect RDMA 網卡直接讀寫 GPU 顯示記憶體,連 CPU 系統記憶體都跳過。
RoCE 在乙太網路上跑 RDMA 的協定(RDMA over Converged Ethernet)。
NVLink / NVSwitch 機櫃內 GPU 之間的超高速互連(scale-up)。
InfiniBand 專為超算設計、原生 RDMA 的網路(Quantum 系列交換器)。
Spectrum-X NVIDIA 為 AI 優化的乙太網路平台(交換器+SuperNIC 端到端搭配)。
SHARP 讓交換器在資料經過時順便做加總運算的「網內計算」技術。
EFA/SRD AWS 自研的高速網卡與傳輸協定(實作於 Nitro 晶片),以多路徑噴灑+亂序容忍在乙太網路上實現 RDMA 式傳輸。
Falcon Google 自研並開源給 OCP 的硬體傳輸層,可在一般乙太網路上承載 RDMA。
ICI/OCS Google TPU 的晶片間互連與光路交換技術,在 pod 內取代乙太網路與 InfiniBand。
AllReduce 分散式訓練中「大家交換並彙總梯度」的集體通訊操作。
Scale-up / Scale-out / Scale-across 機櫃內擴展/跨機櫃擴展/跨資料中心擴展。

參考資料

  1. MLSysBook:Collective Communication 

  2. FS.com:RDMA vs. TCP/IP 差異速覽  2

  3. NVIDIA GPUDirect 官方頁面 

  4. NVIDIA GB200 NVL72 技術部落格:Trillion-Parameter LLM Training  2

  5. NVIDIA GB200 NVL72 官方頁面與規格  2

  6. NVIDIA GB300 NVL72 官方頁面 

  7. NVIDIA NVL72 AI Factory 企業參考架構:網路邏輯架構  2

  8. NVIDIA DGX GB200 使用手冊:Networking 

  9. SemiAnalysis:GB200 Hardware Architecture  2

  10. ServeTheHome:ConnectX-8 SuperNIC PCIe Gen6 800G 解析  2

  11. NVIDIA Quantum-X800 InfiniBand 平台 

  12. NVIDIA Spectrum-X 平台與白皮書  2 3

  13. CoreWeave:GB200 / GB300 NVL72 執行個體文件  2

  14. Oracle:GB200 NVL72 專屬 API 幕後  2

  15. NVIDIA Newsroom:Spectrum-X 加速 xAI Colossus 

  16. Google Cloud 文件:GPU 機型網路頻寬與 GPUDirect 技術對照 

  17. Google Cloud:A3 Ultra(H200)GA 與 Titanium ML 網卡 

  18. Google Cloud:A4X(GB200 NVL72)VM 發表 

  19. Google Cloud:A4X Max(GB300 NVL72)出貨公告 

  20. Google Cloud:Falcon 硬體傳輸層(開源給 OCP) 

  21. Google Cloud:Ironwood TPU 發表 

  22. TPU v4 論文:An Optically Reconfigurable Supercomputer for ML 

  23. AWS:Elastic Fabric Adapter 官方文件 

  24. AWS SRD 論文:A Cloud-Optimized Transport Protocol for Elastic and Scalable HPC 

  25. AWS:10p10u/UltraCluster 2.0 網路 

  26. AWS:P6e-GB200 UltraServers 發表 

  27. DCD:Project Ceiba 升級為 20,736 顆 Blackwell、採第四代 EFA 

  28. AWS:Project Rainier(近 50 萬顆 Trainium2 叢集) 

  29. NVIDIA Newsroom:Spectrum-XGS 跨資料中心擴展 

Eason Cao
Eason Cao Eason is an engineer working at FANNG and living in Europe. He was accredited as AWS Professional Solution Architect, AWS Professional DevOps Engineer and CNCF Certified Kubernetes Administrator. He started his Kubernetes journey in 2017 and enjoys solving real-world business problems.
comments powered by Disqus