看懂統一記憶體與記憶體頻寬
判斷 Apple silicon Mac 能不能執行一個模型時,通常要先看統一記憶體容量,再看記憶體頻寬可能如何影響速度。
統一記憶體容量
Section titled “統一記憶體容量”Apple silicon 具備統一記憶體架構(UMA,Unified Memory Architecture),也就是讓 CPU、GPU 共享同一個主要記憶體池。用在 AI 模型推論時,這能減少 CPU 與 GPU 之間複製資料的需要與開銷。統一記憶體不是 Apple 獨有的概念,卻是 Apple silicon Mac 的一大特色。
Local AI 常見的第一道限制,是模型與執行時需要的資料能不能一起放進記憶體。配備獨立顯示卡的 PC 通常有分開的系統 RAM 與視訊記憶體(VRAM);模型主要由 GPU 執行時,VRAM 往往會先形成容量限制。部分 Runtime 雖然能讓 CPU 與 GPU 分工,把放不進 VRAM 的一部分模型留在系統 RAM,但大量使用這種做法時,CPU 運算與資料搬移經常會讓速度降到不堪日常使用。它比較像是「技術上載入得了」的備援方式,不能把系統 RAM 當成等效的 VRAM。
因此,要先分清楚「能不能載入」與「載入後跑多快」。工作所需容量若連 GPU 與系統可用記憶體加起來都不夠,模型就無法以該設定載入;能載入之後,才有意義比較 GPU 運算能力、記憶體頻寬與 Runtime 的效率。
相較之下,Apple silicon Mac 的記憶體容量在購買時就已經決定,而且沒有另外劃出固定大小的 VRAM。系統、應用程式與 GPU 會共享這個記憶體池,因此 GPU 實際可用的容量不等於規格標示的總容量;但選配更多統一記憶體,會直接擴大 CPU 與 GPU 可以共同使用的容量。更多記憶體不會自動讓同一個模型變快,卻可能讓原本放不下的較大模型或較高精度版本有機會載入。
大容量統一記憶體的發展時間線
Section titled “大容量統一記憶體的發展時間線”Apple silicon 統一記憶體架構的一項早期優勢,是 Apple 很早就把大容量、GPU 可直接存取的記憶體放進個人電腦。從 2021 年的 M1 Max 開始,Mac 可選配的統一記憶體逐步提高,也較早跨過單張獨立顯示卡 VRAM 容量所形成的門檻:
| 推出年份 | 晶片或系統 | 最高統一或共享記憶體 | 對 Local AI 的意義 |
|---|---|---|---|
| 2021 | M1 Max MacBook Pro | 64 GB | 大容量、GPU 可直接使用的記憶體首次出現在 Apple silicon 筆電。 |
| 2022 | M1 Ultra Mac Studio | 128 GB | 桌上型 Mac 的單一記憶體池提高到 128 GB。 |
| 2024 | M4 Max MacBook Pro | 128 GB | 不必使用桌上型工作站,MacBook Pro 就能載入適當量化的大型模型。 |
| 2025 | M3 Ultra Mac Studio | 512 GB | 單機統一記憶體提高到半 TB,進一步擴大可載入模型的範圍。 |
| 2025 | AMD Ryzen AI Max+ 395(Strix Halo) | 128 GB | Windows 或 Linux 系統也能採用大容量統一記憶體,其中最多 96 GB 可配置為圖形記憶體。 |
| 2025 | NVIDIA DGX Spark | 128 GB | NVIDIA 把 128 GB CPU-GPU 一致性記憶體帶到桌上型 AI 系統。 |
| 2026 | M5 Max MacBook Pro | 128 GB | 新一代 MacBook Pro 延續可在筆電上執行大型模型的容量條件。 |
| 2026 | M5 Ultra Mac Studio | 512 GB(選項預計 2026 年 10 月底推出) | 容量上限延續 M3 Ultra,記憶體頻寬則提高到 1.2 TB/s。 |
對 Local AI 使用者而言,M4 Max 與 M5 Max MacBook Pro 能選配 128 GB 的重點,在於 GPU 能直接使用這個大容量記憶體池。 在模型格式、量化與 Runtime 都相容的前提下,原本受限於一般消費級顯示卡 VRAM 的大型模型,便有機會直接在 MacBook Pro 上載入。
M5 Ultra 延續 M3 Ultra 的 512 GB 上限,因此沒有提高單機的統一記憶體容量上限;不過,Apple 表示 M5 Ultra 的 512 GB 選項要到 2026 年 10 月底才會推出。它的主要變化是把記憶體頻寬從 M3 Ultra 的 819 GB/s 提高到 1.2 TB/s;對能完整載入的模型來說,這可能改善生成階段(Decode)反覆讀取權重的速度,但實際幅度仍取決於模型、Runtime 與執行設定。
這不代表 Apple GPU 的推論速度一定勝過 NVIDIA 或 AMD;模型載入後,仍要比較運算能力、記憶體頻寬、Runtime 與軟體最佳化。不過,Apple 確實比 2025 年出現的 AMD Strix Halo 與 NVIDIA DGX Spark 更早把大容量統一記憶體帶進個人電腦。後兩者的出現,也反映本地執行大型模型時,單張獨立顯示卡 VRAM 容量不足是一項真實限制,而不是 Apple 產品才會談的特殊需求。
除了模型權重,Context Window 設定所需要的 KV Cache、運算暫存與應用程式本身也會占用空間。因此,不能只看模型檔案小於記憶體容量,就斷言一定能順利執行。
以 gpt-oss-20b 的 16 GB 門檻為例
Section titled “以 gpt-oss-20b 的 16 GB 門檻為例”OpenAI 在 2025 年推出的 gpt-oss-20b,是一個總參數約 209 億、每次產生 Token 時只啟用其中一部分參數的開放權重推理模型。它原生採用 MXFP4 量化,目的之一就是讓消費級硬體也有機會執行。
OpenAI 在 Hugging Face 上的 gpt-oss-20b 官方模型卡中標示,模型可以在 16 GB 記憶體內執行。對採用獨立顯示卡的 PC 來說,如果希望模型主要由 GPU 執行,實際上就是需要一張約有 16 GB VRAM 的顯示卡;對 Apple silicon Mac 來說,GPU 則能直接使用統一記憶體池,不必另外尋找一張具備 16 GB VRAM 的顯示卡。這正是統一記憶體架構在 Local AI 上的重要差異。
在 M4 世代,Mac mini、iMac、MacBook Air 與 MacBook Pro 的入門配置都從 16 GB 統一記憶體起跳。以發表時的美國定價為例,完整的 M4 Mac mini 從 US$599 起;2026 年推出的 M6 Mac mini 同樣從 16 GB 起跳,最高可選配 32 GB,官方美國起價則提高到 US$899。NVIDIA 的消費級 GeForce 顯示卡仍要核對完整型號與版本,才能知道是否具備至少 16 GB VRAM。
下表列出 NVIDIA 近年規格上達到 gpt-oss-20b 之 16 GB 門檻的桌上型 GeForce 顯示卡:
| 推出年份 | GeForce 顯示卡 | VRAM | 發表時美國 MSRP |
|---|---|---|---|
| 2020 | RTX 3090 | 24 GB | US$1,499 |
| 2022 | RTX 3090 Ti | 24 GB | US$1,999 |
| 2022 | RTX 4080 | 16 GB | US$1,199 |
| 2022 | RTX 4090 | 24 GB | US$1,599 |
| 2023 | RTX 4060 Ti(16 GB 版本) | 16 GB | US$499 |
| 2024 | RTX 4070 Ti SUPER | 16 GB | US$799 |
| 2024 | RTX 4080 SUPER | 16 GB | US$999 |
| 2025 | RTX 5060 Ti(16 GB 版本) | 16 GB | US$429 |
| 2025 | RTX 5070 Ti | 16 GB | US$749 |
| 2025 | RTX 5080 | 16 GB | US$999 |
| 2025 | RTX 5090 | 32 GB | US$1,999 |
這張表的 16 GB 代表規格上跨過容量門檻,不是保證任何 Runtime 與設定都能順利執行。它也不是把 24 GB 定義成 Local AI 的「大容量」:從能不能完整載入模型的角度來看,24 GB 只是比 16 GB 更寬裕,和 64 GB、128 GB 甚至 512 GB 仍是不同等級。
這裡最值得注意的是入場成本。按照 OpenAI 標示的 16 GB 設計目標,入門 M4 與 M6 Mac mini 都正好跨到 gpt-oss-20b 的容量門檻;在 Runtime 相容且系統仍有足夠可用記憶體的條件下,它們可以執行這個模型,但空間相當緊。M4 Mac mini 的 US$599 是 2024 年發表價,目前新款 M6 Mac mini 則從 US$899 起。如果從 NVIDIA 顯示卡著手,表中發表價最低的是 US$429 的 RTX 5060 Ti 16 GB,其次是 US$499 的 RTX 4060 Ti 16 GB,但兩者都只有顯示卡,還需要 CPU、系統 RAM、主機板、儲存裝置、電源供應器與其他零件。
VRAM 容量本身會形成一道購買門檻:即使某張顯示卡的運算能力不差,只要 VRAM 少於模型需要的容量,就無法讓模型完整留在 GPU 上執行。對於只是想跨過 gpt-oss-20b 容量門檻的人,完整電腦與單張顯示卡的價格因此會被放在一起討論;推論速度則要另外實測。
記憶體頻寬(Memory Bandwidth)通常以 GB/s 標示,描述記憶體子系統每秒理論上能傳輸多少資料。LLM 生成文字時需要反覆讀取大量模型權重,因此記憶體頻寬可能成為影響生成速度的瓶頸之一。
圖:Apple MacBook Pro 技術規格頁中的部分晶片選項;紅框標出各選項的記憶體頻寬。查看目前完整規格。
同一個 M 世代的基本款、Pro、Max 與 Ultra 可能有不同記憶體頻寬;因此,不能只看「M5」就推定頻寬,仍要核對完整晶片與 GPU 規格。
2026 年的 Mac mini 與 Mac Studio 同時採用 M6、M5 Pro、M5 Max 與 M5 Ultra,正好顯示晶片名稱相近,容量與頻寬仍可能相差很大:
| 晶片與產品 | 最高統一記憶體 | 理論記憶體頻寬 | 規格差異 |
|---|---|---|---|
| M6 Mac mini | 32 GB | 153 或 170 GB/s | 頻寬依記憶體配置而異。 |
| M5 Pro Mac mini | 64 GB | 307 GB/s | 容量與頻寬都高於 M6。 |
| M5 Max Mac Studio | 128 GB | 460 或 614 GB/s | 頻寬依 GPU 配置而異。 |
| M5 Ultra Mac Studio | 512 GB(選項預計 2026 年 10 月底推出) | 1.2 TB/s | 容量延續 M3 Ultra,頻寬提高約 50%。 |
這組規格也說明,較新的世代不一定比前一代的高階版本擁有更多記憶體或更高頻寬。M6 比 M5 新,M5 Pro、M5 Max 與 M5 Ultra 仍分別提供更高的容量上限。
以 LLM 的 Prefill 與生成為例
Section titled “以 LLM 的 Prefill 與生成為例”記憶體頻寬不會同等影響每一種工作;即使只看 LLM 推論,不同階段的瓶頸也不一樣。
預輸入(Prefill)階段會先處理整段輸入,並建立後續生成所需的 KV Cache。這個階段可以同時處理許多輸入 Token,通常較容易受 GPU 運算能力與軟體最佳化影響;記憶體頻寬則會影響資料能否及時供應給運算單元。
接下來的生成階段(Decode) 則是一個 Token 接著一個 Token 產生。在單人互動、一次處理一個請求的情境下,模型需要反覆讀取權重,速度往往更容易受到記憶體頻寬影響。因此,頻寬適合用來判斷文字生成速度可能受什麼限制,卻不能單獨代表完整的 LLM 推論效能。
如果要分開判讀 Prompt Processing Token/s、Generation Token/s、TTFT 與兩個階段的其他影響因素,可以繼續閱讀〈LLM 的 Prompt 處理速度與文字生成速度都是看 GPU 有多快嗎?〉。
與 GeForce RTX 50 系列比較
Section titled “與 GeForce RTX 50 系列比較”Apple 與 NVIDIA 都會公布理論記憶體頻寬。若以目前兩邊的頂規產品相比,M5 Ultra 為 1.2 TB/s,GeForce RTX 5090 則為 1,792 GB/s,後者約為前者的 1.5 倍。以下也保留上一代 M3 Ultra,將 M5 Ultra、M3 Ultra、M5 Max 與 RTX 50 系列桌上型顯示卡依理論頻寬由高到低排列:
| 晶片或顯示卡 | 記憶體規格 | 理論記憶體頻寬 |
|---|---|---|
| GeForce RTX 5090 | 32 GB GDDR7 VRAM | 1,792 GB/s |
| M5 Ultra(80 核心 GPU) | 最高 512 GB 統一記憶體(選項預計 2026 年 10 月底推出) | 1.2 TB/s |
| GeForce RTX 5080 | 16 GB GDDR7 VRAM | 960 GB/s |
| GeForce RTX 5070 Ti | 16 GB GDDR7 VRAM | 896 GB/s |
| M3 Ultra(80 核心 GPU) | 最高 512 GB 統一記憶體 | 819 GB/s |
| GeForce RTX 5070 | 12 GB GDDR7 VRAM | 672 GB/s |
| M5 Max(40 核心 GPU) | 最高 128 GB 統一記憶體 | 614 GB/s |
| GeForce RTX 5060 Ti | 8 GB 或 16 GB GDDR7 VRAM | 448 GB/s |
| GeForce RTX 5060 | 8 GB GDDR7 VRAM | 448 GB/s |
| GeForce RTX 5050 | 8 GB GDDR6 VRAM | 320 GB/s |
如果只看這項規格,RTX 5090 高於 M5 Ultra,M5 Ultra 則高於 RTX 5080;M3 Ultra 的 819 GB/s 介於 RTX 5070 Ti 與 RTX 5070 之間,M5 Max 的 614 GB/s 則介於 RTX 5060 Ti 與 RTX 5070 之間。不過,這張表不能直接用來判定哪台電腦執行 LLM 比較快。
工作站級 RTX 與 Mac Studio 的價格比較
Section titled “工作站級 RTX 與 Mac Studio 的價格比較”如果需求超過消費級 GeForce 所能提供的 32 GB VRAM,NVIDIA 還有工作站級顯示卡。RTX 6000 Ada Generation 配備 48 GB VRAM,RTX PRO 6000 Blackwell Workstation Edition 則配備 96 GB VRAM。這兩張卡經常被拿來和大記憶體 Mac Studio 比較,主要問題是取得相近記憶體容量需要多少預算。
以下採用 2026 年 8 月 25 日查得的官方美國商城標價與起價;價格會隨時間、地區與配置改變:
| 產品 | 記憶體規格 | 官方美國價格 | 價格包含什麼? |
|---|---|---|---|
| NVIDIA RTX 6000 Ada Generation | 48 GB GDDR6 ECC VRAM | US$6,800 | 只有顯示卡 |
| NVIDIA RTX PRO 6000 Blackwell Workstation Edition | 96 GB GDDR7 ECC VRAM | US$16,000 | 只有顯示卡 |
| Mac Studio(M5 Max) | 36 GB 起、最高 128 GB 統一記憶體 | US$2,499 起 | 完整電腦 |
| Mac Studio(M5 Ultra) | 96 GB 起、最高 512 GB 統一記憶體(選項預計 2026 年 10 月底推出) | US$5,499 起 | 完整電腦 |
最直接的例子是 96 GB:M5 Ultra Mac Studio 的入門配置就有 96 GB 統一記憶體,完整電腦從 US$5,499 起;同樣標示 96 GB 的 RTX PRO 6000 Blackwell,目前官方商城的單卡標價則是 US$16,000。這個價差能解釋為什麼需要在本地載入大型模型的人,會把 Mac Studio 視為工作站級 RTX 方案的比較對象。
閱讀後自我確認
Section titled “閱讀後自我確認”試著回答以下問題,來確認是否已學會。不確定答案的話,再回到對應段落複習。打勾狀態是方便你在這個頁面一一確認用,不會被儲存。
- WWDC20: 探索 Apple silicon Mac 的系統架構
- OpenAI:Introducing gpt-oss
- OpenAI:
gpt-oss-20b官方模型卡 - Apple:搭載 16 GB 統一記憶體的 M4 Mac mini
- Apple:搭載 M4 的 iMac
- Apple:搭載 M4 的 MacBook Pro
- Apple:搭載 M4 的 MacBook Air
- Apple:M1 Max 最高支援 64 GB 統一記憶體
- Apple:M1 Ultra 最高支援 128 GB 統一記憶體
- Apple:M5 Max 最高支援 128 GB 統一記憶體
- Apple:M3 Ultra 最高支援 512 GB 統一記憶體
- Apple:M6 與 M5 Ultra
- Apple:搭載 M5 Max 與 M5 Ultra 的 Mac Studio
- NVIDIA:GeForce RTX 40 與 50 系列規格比較
- NVIDIA:GeForce RTX 3090 於 2020 年推出並配備 24 GB VRAM
- NVIDIA:GeForce RTX 3090 Ti 於 2022 年推出,配備 24 GB VRAM
- NVIDIA:GeForce RTX 4080 與 RTX 4090 於 2022 年推出
- NVIDIA:GeForce RTX 4060 Ti 8 GB 與 16 GB
- NVIDIA:GeForce RTX 40 SUPER 系列於 2024 年推出
- NVIDIA:GeForce RTX 50 系列於 2025 年推出
- NVIDIA:GeForce RTX 5060 Ti 8 GB 與 16 GB
- NVIDIA:RTX 6000 Ada Generation 技術規格
- NVIDIA Marketplace:RTX 6000 Ada Generation 官方標價
- NVIDIA:RTX PRO 6000 Blackwell Workstation Edition 技術規格
- NVIDIA Marketplace:RTX PRO 6000 Blackwell Workstation Edition 官方標價
- AMD:Ryzen AI Max+ 395 與 128 GB 統一記憶體
- NVIDIA:DGX Spark 於 2025 年出貨
- NVIDIA:DGX Spark 硬體規格
- Apple:MacBook Pro 技術規格
- Apple:Mac mini 技術規格
- Apple Store:Mac mini 官方美國起價
- Apple:Mac Studio 技術規格
- Apple Store:Mac Studio 官方美國起價
- llama.cpp:CPU+GPU 混合推論與支援後端
- llama.cpp:分別測量 Prompt processing 與 Text generation
- NVIDIA:LLM 推論的 Prefill 與 Decode 階段