CPU、GPU、TPU 到底差在哪?新手也能看懂的晶片指南

CPU、GPU、TPU 到底差在哪?新手也能看懂的晶片指南

一句話總結:CPU 是什麼都會的「萬能主廚」、GPU 是同時做上千道菜的「大型廚房軍團」、TPU 則是專門做一道菜、但做得又快又省電的「自動化中央廚房」。

打開新聞,NVIDIA 市值屢創新高、Google 發表新一代 TPU、AI 資料中心蓋滿全世界。這些話題的核心,其實都圍繞著三種晶片:CPU、GPU、TPU。

這篇文章不需要任何電腦科學背景也能讀懂。我們會從生活比喻開始,一步步深入到晶片架構的設計哲學,最後告訴你:什麼情境該用哪種晶片。

先從一個比喻開始:三種廚房

想像你要開一家餐廳,有三種廚房方案:

  1. 萬能主廚(CPU):一位十項全能的主廚,煎煮炒炸樣樣精通,還能接電話、管帳、處理客訴。但他一次只能做一兩件事,客人一多就忙不過來。
  2. 廚房軍團(GPU):幾千名只會切菜的學徒。單獨一位的手藝遠不如主廚,但如果今天的任務是「把一萬顆馬鈴薯切丁」,幾千人同時動手,速度輾壓任何主廚。
  3. 自動化中央廚房(TPU):一條專門生產「同一道菜」的自動化產線。它不會做別的菜,甚至連切菜都不會,但生產這道菜的速度與省電程度,前兩者都望塵莫及。

萬能主廚(CPU)、廚房軍團(GPU)、自動化中央廚房(TPU)

萬能主廚(CPU)、廚房軍團(GPU)、自動化中央廚房(TPU)

AI 運算的本質,恰好就是那道「同一道菜」:大量重複的矩陣乘法。這就是為什麼晶片的分工會這樣演化。

第一層:三種晶片是什麼?

CPU:電腦的大腦

CPU(Central Processing Unit,中央處理器)誕生於 1950 年代末,是電腦的「總指揮」。你的手機、筆電、伺服器裡都有它。它負責執行作業系統、跑瀏覽器、算 Excel、協調所有硬體資源,幾乎任何軟體都能在 CPU 上執行。

CPU 的設計特點:

  • 核心數少、單核很強:一般 CPU 只有幾個到幾十個核心,但每個核心都很聰明,擅長複雜邏輯與判斷。
  • 一步一步來:擅長「循序處理」,把一件事的步驟依序做完,特別適合有前後相依性的任務。
  • 最大優點是彈性:從文書處理、銀行交易到控制火箭引擎,什麼都能算。

但這種彈性有代價:CPU 每做一次計算,都要把數值從記憶體讀出來、算完再存回去。記憶體的存取速度遠比計算慢,成為效能天花板,這就是著名的「馮紐曼瓶頸(Von Neumann bottleneck)」。

GPU:從畫遊戲畫面到訓練 AI

GPU(Graphics Processing Unit,圖形處理器)在 1990 年代末登場,最初是為了電玩遊戲:螢幕上有數百萬個像素,每個像素的顏色計算方式都差不多,與其讓 CPU 一個一個算,不如讓「幾千個小核心」同時算。

  • 核心數以千計:一顆現代 GPU 有數千個 ALU(算術邏輯單元),可以同時執行上千個乘法與加法。
  • SIMD 平行架構:「同一個指令、同時套用到大量資料」,正是切一萬顆馬鈴薯的邏輯。
  • 意外的 AI 天賦:研究人員後來發現,神經網路的計算(大量矩陣運算)跟繪圖的數學型態幾乎一樣。在典型的深度學習訓練上,GPU 的吞吐量可以比 CPU 高一個數量級。

如今 NVIDIA 的 GPU 甚至內建了專為 AI 設計的 Tensor Core,專門加速「矩陣乘加運算」的硬體單元,支援混合精度計算,是現代 GPU AI 效能的主要來源。也就是說,GPU 本身也在往「更專用」的方向演化。

TPU:為 AI 而生的專用晶片

TPU(Tensor Processing Unit,張量處理器)是 Google 自行設計的 ASIC(Application-Specific Integrated Circuit,特殊應用積體電路),也就是為單一目的打造的晶片。

它的誕生故事很有趣:2013 年左右,Google 發現語音辨識品質大幅提升後,如果每位使用者每天對 Google「講話」三分鐘,資料中心的數量就得翻倍。用通用晶片硬撐不是辦法,於是決定打造專用晶片,第一代 TPU 在 2015 年投入使用,支撐了搜尋、翻譯、相簿等服務。

TPU 的個性非常極端:

  • 不會做別的事:它不能跑文書軟體、不能處理銀行交易,只會一件事:超大規模的矩陣運算。
  • 但這件事做到極致:第一代 TPU 對比同時期的 CPU/GPU,推論效能高 15–30 倍,每瓦效能(能源效率)更高出 30–80 倍。
  • 買不到,只能租:TPU 不對外販售,只存在於 Google 資料中心,透過 Google Cloud 租用。

第二層:架構上到底差在哪?

看懂這一段,你就超越九成的科技新聞讀者了。

同樣的晶片面積:CPU 放少數強大的核心;GPU 塞進數千個小核心;TPU 把數萬個乘加器直接相連成陣列

同樣的晶片面積:CPU 放少數強大的核心;GPU 塞進數千個小核心;TPU 把數萬個乘加器直接相連成陣列

為什麼 AI 就是「矩陣乘法」?

神經網路做預測時,每個神經元做的事情就是:把輸入乘上權重(表示訊號強度)、再全部加總。當幾百萬個神經元同時做這件事,整體就等於一場超大型的矩陣乘法。Google 曾統計自家生產環境的神經網路,單一模型的權重數量從 500 萬到 1 億個不等,每一次預測都要把輸入資料與這些權重反覆相乘、相加。

所以晶片的 AI 效能,幾乎就取決於一個問題:你一個時脈週期內,能做幾次「乘加運算」?

晶片 每週期運算量 運算單位
CPU 幾個 純量(scalar):一次算一個數字
CPU(向量擴充如 AVX) 數十個 向量(vector):一次算一排數字
GPU 數萬個 向量:數千核心同時算
TPU 數十萬個(最高 128K) 張量(tensor):一次算一整塊矩陣

同一個時脈週期內,三種晶片能完成的乘加運算量級

同一個時脈週期內,三種晶片能完成的乘加運算量級

TPU 的心臟:脈動陣列(Systolic Array)

TPU 之所以能一個週期做數十萬次運算,靠的是一種叫 脈動陣列 的特殊架構:

  • CPU 和 GPU 每做一次計算,都需要存取暫存器或共享記憶體來讀取運算元、存放中間結果,而這些存取都要耗電、耗時間。
  • TPU 則把成千上萬個「乘加器」直接實體相連成一個巨大的矩陣。資料像水流(或心臟泵血,systolic 一詞的由來)一樣流過晶片:每個單元算完就把結果直接傳給隔壁,整場矩陣乘法過程中完全不需要存取記憶體
  • 第一代 TPU 的矩陣乘法單元(MXU)就塞了 256 × 256 = 65,536 個乘加器;現代 TPU 每個 MXU 每週期可做 16K 次乘加運算。

CPU/GPU 每做一次計算都要往返記憶體(× N);TPU 讓資料直接流過乘加器陣列,進出記憶體各只需一次(× 1)

CPU/GPU 每做一次計算都要往返記憶體(× N);TPU 讓資料直接流過乘加器陣列,進出記憶體各只需一次(× 1)

這是一個很划算的交易:犧牲彈性(只能做固定模式的乘法與加法),換取極高的運算密度與省電。導線只連接相鄰的單元,又短又省電;不需要複雜的控制邏輯,晶片面積幾乎都拿來做計算。

另一個武器:降低精度

AI 預測其實不需要非常精確的小數。TPU 大量使用量化(quantization)與低精度格式(如 8-bit 整數、bfloat16):同樣的晶片面積,8-bit 乘法器可以塞進比 32-bit 浮點乘法器多 25 倍以上的數量,記憶體用量也大幅下降。GPU 的 Tensor Core 同樣採用了混合精度策略,這是整個 AI 晶片產業的共同方向。

三種晶片的記憶體哲學

面向 CPU GPU TPU
記憶體管理 多層快取(L1/L2/L3),硬體自動管理 各 SM 有 L1/共享記憶體,L2 共享 專用緩衝區,軟體明確管理
設計目標 讓「任何程式」都跑得不錯 讓「平行程式」跑得很快 讓「矩陣乘法」跑到極限
通用性 最高 中等(仍是通用處理器) 最低(神經網路專用)

關鍵洞察:GPU 雖然平行度高,但它仍然是通用處理器,必須支援各式各樣的應用,所以每次計算仍要付出記憶體存取的成本。TPU 徹底放棄通用性,才換到那個量級的效率。

第三層:效能與能源效率的真實數字

  • 第一代 TPU(2015):推論效能為同期 CPU/GPU 的 15–30 倍,每瓦效能為 CPU 的 83 倍、GPU 的 29 倍。
  • 第六代 TPU Trillium(2024):單晶片峰值效能為前一代(v5e)的 4.7 倍,能源效率提升 67%。
  • 規模化:TPU 以「Pod」為單位部署,數千顆晶片透過高速互連網路直接相連,專為超大型模型的分散式訓練設計。

值得注意的是,這不代表「TPU 全面勝過 GPU」。GPU 擁有更成熟的軟體生態系(CUDA、PyTorch 原生支援)、可以自由購買部署、應用範圍也廣得多,這正是 NVIDIA GPU 仍是 AI 市場主流的原因。TPU 的優勢在 Google Cloud 生態系內、以及超大規模且高度優化的工作負載上最為明顯。

那我該用哪一個?情境對照表

你的情境 建議 原因
日常文書、上網、寫程式 CPU 任務多元且循序,通用性最重要
玩遊戲、剪影片、3D 建模 CPU + GPU 圖形渲染正是 GPU 的本行
學習 AI、訓練小模型 GPU 生態系最成熟,資源與教學最多
大規模訓練/推論(PyTorch 為主) GPU 叢集 CUDA 生態系與框架支援最完整
超大規模訓練/推論(JAX/TensorFlow,Google Cloud) TPU 效能密度與能源效率極高,Pod 架構天生為此設計
手機、筆電上的即時 AI 功能 NPU 見下方延伸閱讀

延伸:家族還有其他成員

  • NPU(Neural Processing Unit):如果說 TPU 是資料中心裡的 AI 專用晶片,NPU 就是塞進你手機和筆電裡的迷你版。Apple 的 Neural Engine、Qualcomm 的 Hexagon、以及 Windows Copilot+ PC 的 NPU 都屬此類,負責在裝置上低功耗地執行語音辨識、照片處理等 AI 任務。
  • 更多 ASIC:TPU 的成功啟發了整個產業:Amazon 的 Trainium/Inferentia、Tesla 的 Dojo、各家新創的 AI 晶片,本質上都在走同一條路:為特定運算犧牲通用性,換取效率。

結語:沒有最強的晶片,只有最合適的分工

回到餐廳的比喻:一家成功的餐廳,需要主廚(CPU)統籌全場、學徒軍團(GPU)處理大量備料、中央廚房(TPU/NPU)量產招牌菜。現代的 AI 資料中心正是如此:CPU 負責調度與邏輯、GPU/TPU 負責運算重活,各司其職。

理解「工作負載與架構的匹配」,就是理解現代運算的第一課:用 CPU 跑神經網路,就像開跑車去搬家:能動,但完全用錯了工具。

📚 想更深入?如果你已經消化了這篇,歡迎挑戰進階篇:TPU 的 4x4x4 到底在乘什麼?一篇看懂 TPU Slice 與 GPU 設計哲學,深入 TPU 的拓撲網路與 GPU 的設計哲學差異。

Eason Cao
Eason Cao Eason is an engineer working at FANNG and living in Europe. He was accredited as AWS Professional Solution Architect, AWS Professional DevOps Engineer and CNCF Certified Kubernetes Administrator. He started his Kubernetes journey in 2017 and enjoys solving real-world business problems.
comments powered by Disqus