CPU、GPU、TPU 到底差在哪?新手也能看懂的晶片指南
一句話總結:CPU 是什麼都會的「萬能主廚」、GPU 是同時做上千道菜的「大型廚房軍團」、TPU 則是專門做一道菜、但做得又快又省電的「自動化中央廚房」。
打開新聞,NVIDIA 市值屢創新高、Google 發表新一代 TPU、AI 資料中心蓋滿全世界。這些話題的核心,其實都圍繞著三種晶片:CPU、GPU、TPU。
這篇文章不需要任何電腦科學背景也能讀懂。我們會從生活比喻開始,一步步深入到晶片架構的設計哲學,最後告訴你:什麼情境該用哪種晶片。
先從一個比喻開始:三種廚房
想像你要開一家餐廳,有三種廚房方案:
- 萬能主廚(CPU):一位十項全能的主廚,煎煮炒炸樣樣精通,還能接電話、管帳、處理客訴。但他一次只能做一兩件事,客人一多就忙不過來。
- 廚房軍團(GPU):幾千名只會切菜的學徒。單獨一位的手藝遠不如主廚,但如果今天的任務是「把一萬顆馬鈴薯切丁」,幾千人同時動手,速度輾壓任何主廚。
- 自動化中央廚房(TPU):一條專門生產「同一道菜」的自動化產線。它不會做別的菜,甚至連切菜都不會,但生產這道菜的速度與省電程度,前兩者都望塵莫及。

萬能主廚(CPU)、廚房軍團(GPU)、自動化中央廚房(TPU)
AI 運算的本質,恰好就是那道「同一道菜」:大量重複的矩陣乘法。這就是為什麼晶片的分工會這樣演化。
第一層:三種晶片是什麼?
CPU:電腦的大腦
CPU(Central Processing Unit,中央處理器)誕生於 1950 年代末,是電腦的「總指揮」。你的手機、筆電、伺服器裡都有它。它負責執行作業系統、跑瀏覽器、算 Excel、協調所有硬體資源,幾乎任何軟體都能在 CPU 上執行。
CPU 的設計特點:
- 核心數少、單核很強:一般 CPU 只有幾個到幾十個核心,但每個核心都很聰明,擅長複雜邏輯與判斷。
- 一步一步來:擅長「循序處理」,把一件事的步驟依序做完,特別適合有前後相依性的任務。
- 最大優點是彈性:從文書處理、銀行交易到控制火箭引擎,什麼都能算。
但這種彈性有代價:CPU 每做一次計算,都要把數值從記憶體讀出來、算完再存回去。記憶體的存取速度遠比計算慢,成為效能天花板,這就是著名的「馮紐曼瓶頸(Von Neumann bottleneck)」。
GPU:從畫遊戲畫面到訓練 AI
GPU(Graphics Processing Unit,圖形處理器)在 1990 年代末登場,最初是為了電玩遊戲:螢幕上有數百萬個像素,每個像素的顏色計算方式都差不多,與其讓 CPU 一個一個算,不如讓「幾千個小核心」同時算。
- 核心數以千計:一顆現代 GPU 有數千個 ALU(算術邏輯單元),可以同時執行上千個乘法與加法。
- SIMD 平行架構:「同一個指令、同時套用到大量資料」,正是切一萬顆馬鈴薯的邏輯。
- 意外的 AI 天賦:研究人員後來發現,神經網路的計算(大量矩陣運算)跟繪圖的數學型態幾乎一樣。在典型的深度學習訓練上,GPU 的吞吐量可以比 CPU 高一個數量級。
如今 NVIDIA 的 GPU 甚至內建了專為 AI 設計的 Tensor Core,專門加速「矩陣乘加運算」的硬體單元,支援混合精度計算,是現代 GPU AI 效能的主要來源。也就是說,GPU 本身也在往「更專用」的方向演化。
TPU:為 AI 而生的專用晶片
TPU(Tensor Processing Unit,張量處理器)是 Google 自行設計的 ASIC(Application-Specific Integrated Circuit,特殊應用積體電路),也就是為單一目的打造的晶片。
它的誕生故事很有趣:2013 年左右,Google 發現語音辨識品質大幅提升後,如果每位使用者每天對 Google「講話」三分鐘,資料中心的數量就得翻倍。用通用晶片硬撐不是辦法,於是決定打造專用晶片,第一代 TPU 在 2015 年投入使用,支撐了搜尋、翻譯、相簿等服務。
TPU 的個性非常極端:
- 不會做別的事:它不能跑文書軟體、不能處理銀行交易,只會一件事:超大規模的矩陣運算。
- 但這件事做到極致:第一代 TPU 對比同時期的 CPU/GPU,推論效能高 15–30 倍,每瓦效能(能源效率)更高出 30–80 倍。
- 買不到,只能租:TPU 不對外販售,只存在於 Google 資料中心,透過 Google Cloud 租用。
第二層:架構上到底差在哪?
看懂這一段,你就超越九成的科技新聞讀者了。

同樣的晶片面積:CPU 放少數強大的核心;GPU 塞進數千個小核心;TPU 把數萬個乘加器直接相連成陣列
為什麼 AI 就是「矩陣乘法」?
神經網路做預測時,每個神經元做的事情就是:把輸入乘上權重(表示訊號強度)、再全部加總。當幾百萬個神經元同時做這件事,整體就等於一場超大型的矩陣乘法。Google 曾統計自家生產環境的神經網路,單一模型的權重數量從 500 萬到 1 億個不等,每一次預測都要把輸入資料與這些權重反覆相乘、相加。
所以晶片的 AI 效能,幾乎就取決於一個問題:你一個時脈週期內,能做幾次「乘加運算」?
| 晶片 | 每週期運算量 | 運算單位 |
|---|---|---|
| CPU | 幾個 | 純量(scalar):一次算一個數字 |
| CPU(向量擴充如 AVX) | 數十個 | 向量(vector):一次算一排數字 |
| GPU | 數萬個 | 向量:數千核心同時算 |
| TPU | 數十萬個(最高 128K) | 張量(tensor):一次算一整塊矩陣 |

同一個時脈週期內,三種晶片能完成的乘加運算量級
TPU 的心臟:脈動陣列(Systolic Array)
TPU 之所以能一個週期做數十萬次運算,靠的是一種叫 脈動陣列 的特殊架構:
- CPU 和 GPU 每做一次計算,都需要存取暫存器或共享記憶體來讀取運算元、存放中間結果,而這些存取都要耗電、耗時間。
- TPU 則把成千上萬個「乘加器」直接實體相連成一個巨大的矩陣。資料像水流(或心臟泵血,systolic 一詞的由來)一樣流過晶片:每個單元算完就把結果直接傳給隔壁,整場矩陣乘法過程中完全不需要存取記憶體。
- 第一代 TPU 的矩陣乘法單元(MXU)就塞了 256 × 256 = 65,536 個乘加器;現代 TPU 每個 MXU 每週期可做 16K 次乘加運算。

CPU/GPU 每做一次計算都要往返記憶體(× N);TPU 讓資料直接流過乘加器陣列,進出記憶體各只需一次(× 1)
這是一個很划算的交易:犧牲彈性(只能做固定模式的乘法與加法),換取極高的運算密度與省電。導線只連接相鄰的單元,又短又省電;不需要複雜的控制邏輯,晶片面積幾乎都拿來做計算。
另一個武器:降低精度
AI 預測其實不需要非常精確的小數。TPU 大量使用量化(quantization)與低精度格式(如 8-bit 整數、bfloat16):同樣的晶片面積,8-bit 乘法器可以塞進比 32-bit 浮點乘法器多 25 倍以上的數量,記憶體用量也大幅下降。GPU 的 Tensor Core 同樣採用了混合精度策略,這是整個 AI 晶片產業的共同方向。
三種晶片的記憶體哲學
| 面向 | CPU | GPU | TPU |
|---|---|---|---|
| 記憶體管理 | 多層快取(L1/L2/L3),硬體自動管理 | 各 SM 有 L1/共享記憶體,L2 共享 | 專用緩衝區,軟體明確管理 |
| 設計目標 | 讓「任何程式」都跑得不錯 | 讓「平行程式」跑得很快 | 讓「矩陣乘法」跑到極限 |
| 通用性 | 最高 | 中等(仍是通用處理器) | 最低(神經網路專用) |
關鍵洞察:GPU 雖然平行度高,但它仍然是通用處理器,必須支援各式各樣的應用,所以每次計算仍要付出記憶體存取的成本。TPU 徹底放棄通用性,才換到那個量級的效率。
第三層:效能與能源效率的真實數字
- 第一代 TPU(2015):推論效能為同期 CPU/GPU 的 15–30 倍,每瓦效能為 CPU 的 83 倍、GPU 的 29 倍。
- 第六代 TPU Trillium(2024):單晶片峰值效能為前一代(v5e)的 4.7 倍,能源效率提升 67%。
- 規模化:TPU 以「Pod」為單位部署,數千顆晶片透過高速互連網路直接相連,專為超大型模型的分散式訓練設計。
值得注意的是,這不代表「TPU 全面勝過 GPU」。GPU 擁有更成熟的軟體生態系(CUDA、PyTorch 原生支援)、可以自由購買部署、應用範圍也廣得多,這正是 NVIDIA GPU 仍是 AI 市場主流的原因。TPU 的優勢在 Google Cloud 生態系內、以及超大規模且高度優化的工作負載上最為明顯。
那我該用哪一個?情境對照表
| 你的情境 | 建議 | 原因 |
|---|---|---|
| 日常文書、上網、寫程式 | CPU | 任務多元且循序,通用性最重要 |
| 玩遊戲、剪影片、3D 建模 | CPU + GPU | 圖形渲染正是 GPU 的本行 |
| 學習 AI、訓練小模型 | GPU | 生態系最成熟,資源與教學最多 |
| 大規模訓練/推論(PyTorch 為主) | GPU 叢集 | CUDA 生態系與框架支援最完整 |
| 超大規模訓練/推論(JAX/TensorFlow,Google Cloud) | TPU | 效能密度與能源效率極高,Pod 架構天生為此設計 |
| 手機、筆電上的即時 AI 功能 | NPU | 見下方延伸閱讀 |
延伸:家族還有其他成員
- NPU(Neural Processing Unit):如果說 TPU 是資料中心裡的 AI 專用晶片,NPU 就是塞進你手機和筆電裡的迷你版。Apple 的 Neural Engine、Qualcomm 的 Hexagon、以及 Windows Copilot+ PC 的 NPU 都屬此類,負責在裝置上低功耗地執行語音辨識、照片處理等 AI 任務。
- 更多 ASIC:TPU 的成功啟發了整個產業:Amazon 的 Trainium/Inferentia、Tesla 的 Dojo、各家新創的 AI 晶片,本質上都在走同一條路:為特定運算犧牲通用性,換取效率。
結語:沒有最強的晶片,只有最合適的分工
回到餐廳的比喻:一家成功的餐廳,需要主廚(CPU)統籌全場、學徒軍團(GPU)處理大量備料、中央廚房(TPU/NPU)量產招牌菜。現代的 AI 資料中心正是如此:CPU 負責調度與邏輯、GPU/TPU 負責運算重活,各司其職。
理解「工作負載與架構的匹配」,就是理解現代運算的第一課:用 CPU 跑神經網路,就像開跑車去搬家:能動,但完全用錯了工具。
📚 想更深入?如果你已經消化了這篇,歡迎挑戰進階篇:TPU 的 4x4x4 到底在乘什麼?一篇看懂 TPU Slice 與 GPU 設計哲學,深入 TPU 的拓撲網路與 GPU 的設計哲學差異。