跳到內容

看懂統一記憶體與記憶體頻寬

判斷 Apple silicon Mac 能不能執行一個模型時,通常要先看統一記憶體容量,再看記憶體頻寬可能如何影響速度。

Apple silicon 具備統一記憶體架構(UMA,Unified Memory Architecture),也就是讓 CPU、GPU 共享同一個主要記憶體池。用在 AI 模型推論時,這能減少 CPU 與 GPU 之間複製資料的需要與開銷。統一記憶體不是 Apple 獨有的概念,卻是 Apple silicon Mac 的一大特色。

Local AI 常見的第一道限制,是模型與執行時需要的資料能不能一起放進記憶體。配備獨立顯示卡的 PC 通常有分開的系統 RAM 與視訊記憶體(VRAM);模型主要由 GPU 執行時,VRAM 往往會先形成容量限制。部分 Runtime 雖然能讓 CPU 與 GPU 分工,把放不進 VRAM 的一部分模型留在系統 RAM,但大量使用這種做法時,CPU 運算與資料搬移經常會讓速度降到不堪日常使用。它比較像是「技術上載入得了」的備援方式,不能把系統 RAM 當成等效的 VRAM。

因此,要先分清楚「能不能載入」與「載入後跑多快」。工作所需容量若連 GPU 與系統可用記憶體加起來都不夠,模型就無法以該設定載入;能載入之後,才有意義比較 GPU 運算能力、記憶體頻寬與 Runtime 的效率。

相較之下,Apple silicon Mac 的記憶體容量在購買時就已經決定,而且沒有另外劃出固定大小的 VRAM。系統、應用程式與 GPU 會共享這個記憶體池,因此 GPU 實際可用的容量不等於規格標示的總容量;但選配更多統一記憶體,會直接擴大 CPU 與 GPU 可以共同使用的容量。更多記憶體不會自動讓同一個模型變快,卻可能讓原本放不下的較大模型或較高精度版本有機會載入。

大容量統一記憶體的發展時間線

Section titled “大容量統一記憶體的發展時間線”

Apple silicon 統一記憶體架構的一項早期優勢,是 Apple 很早就把大容量、GPU 可直接存取的記憶體放進個人電腦。從 2021 年的 M1 Max 開始,Mac 可選配的統一記憶體逐步提高,也較早跨過單張獨立顯示卡 VRAM 容量所形成的門檻:

推出年份 晶片或系統 最高統一或共享記憶體 對 Local AI 的意義
2021 M1 Max MacBook Pro 64 GB 大容量、GPU 可直接使用的記憶體首次出現在 Apple silicon 筆電。
2022 M1 Ultra Mac Studio 128 GB 桌上型 Mac 的單一記憶體池提高到 128 GB。
2024 M4 Max MacBook Pro 128 GB 不必使用桌上型工作站,MacBook Pro 就能載入適當量化的大型模型。
2025 M3 Ultra Mac Studio 512 GB 單機統一記憶體提高到半 TB,進一步擴大可載入模型的範圍。
2025 AMD Ryzen AI Max+ 395(Strix Halo) 128 GB Windows 或 Linux 系統也能採用大容量統一記憶體,其中最多 96 GB 可配置為圖形記憶體。
2025 NVIDIA DGX Spark 128 GB NVIDIA 把 128 GB CPU-GPU 一致性記憶體帶到桌上型 AI 系統。
2026 M5 Max MacBook Pro 128 GB 新一代 MacBook Pro 延續可在筆電上執行大型模型的容量條件。
2026 M5 Ultra Mac Studio 512 GB(選項預計 2026 年 10 月底推出) 容量上限延續 M3 Ultra,記憶體頻寬則提高到 1.2 TB/s。

對 Local AI 使用者而言,M4 Max 與 M5 Max MacBook Pro 能選配 128 GB 的重點,在於 GPU 能直接使用這個大容量記憶體池。 在模型格式、量化與 Runtime 都相容的前提下,原本受限於一般消費級顯示卡 VRAM 的大型模型,便有機會直接在 MacBook Pro 上載入。

M5 Ultra 延續 M3 Ultra 的 512 GB 上限,因此沒有提高單機的統一記憶體容量上限;不過,Apple 表示 M5 Ultra 的 512 GB 選項要到 2026 年 10 月底才會推出。它的主要變化是把記憶體頻寬從 M3 Ultra 的 819 GB/s 提高到 1.2 TB/s;對能完整載入的模型來說,這可能改善生成階段(Decode)反覆讀取權重的速度,但實際幅度仍取決於模型、Runtime 與執行設定。

這不代表 Apple GPU 的推論速度一定勝過 NVIDIA 或 AMD;模型載入後,仍要比較運算能力、記憶體頻寬、Runtime 與軟體最佳化。不過,Apple 確實比 2025 年出現的 AMD Strix Halo 與 NVIDIA DGX Spark 更早把大容量統一記憶體帶進個人電腦。後兩者的出現,也反映本地執行大型模型時,單張獨立顯示卡 VRAM 容量不足是一項真實限制,而不是 Apple 產品才會談的特殊需求。

除了模型權重,Context Window 設定所需要的 KV Cache、運算暫存與應用程式本身也會占用空間。因此,不能只看模型檔案小於記憶體容量,就斷言一定能順利執行。

OpenAI 在 2025 年推出的 gpt-oss-20b,是一個總參數約 209 億、每次產生 Token 時只啟用其中一部分參數的開放權重推理模型。它原生採用 MXFP4 量化,目的之一就是讓消費級硬體也有機會執行。

OpenAI 在 Hugging Face 上的 gpt-oss-20b 官方模型卡中標示,模型可以在 16 GB 記憶體內執行。對採用獨立顯示卡的 PC 來說,如果希望模型主要由 GPU 執行,實際上就是需要一張約有 16 GB VRAM 的顯示卡;對 Apple silicon Mac 來說,GPU 則能直接使用統一記憶體池,不必另外尋找一張具備 16 GB VRAM 的顯示卡。這正是統一記憶體架構在 Local AI 上的重要差異。

在 M4 世代,Mac mini、iMac、MacBook Air 與 MacBook Pro 的入門配置都從 16 GB 統一記憶體起跳。以發表時的美國定價為例,完整的 M4 Mac mini 從 US$599 起;2026 年推出的 M6 Mac mini 同樣從 16 GB 起跳,最高可選配 32 GB,官方美國起價則提高到 US$899。NVIDIA 的消費級 GeForce 顯示卡仍要核對完整型號與版本,才能知道是否具備至少 16 GB VRAM。

下表列出 NVIDIA 近年規格上達到 gpt-oss-20b 之 16 GB 門檻的桌上型 GeForce 顯示卡:

推出年份 GeForce 顯示卡 VRAM 發表時美國 MSRP
2020 RTX 3090 24 GB US$1,499
2022 RTX 3090 Ti 24 GB US$1,999
2022 RTX 4080 16 GB US$1,199
2022 RTX 4090 24 GB US$1,599
2023 RTX 4060 Ti(16 GB 版本) 16 GB US$499
2024 RTX 4070 Ti SUPER 16 GB US$799
2024 RTX 4080 SUPER 16 GB US$999
2025 RTX 5060 Ti(16 GB 版本) 16 GB US$429
2025 RTX 5070 Ti 16 GB US$749
2025 RTX 5080 16 GB US$999
2025 RTX 5090 32 GB US$1,999

這張表的 16 GB 代表規格上跨過容量門檻,不是保證任何 Runtime 與設定都能順利執行。它也不是把 24 GB 定義成 Local AI 的「大容量」:從能不能完整載入模型的角度來看,24 GB 只是比 16 GB 更寬裕,和 64 GB、128 GB 甚至 512 GB 仍是不同等級。

這裡最值得注意的是入場成本。按照 OpenAI 標示的 16 GB 設計目標,入門 M4 與 M6 Mac mini 都正好跨到 gpt-oss-20b 的容量門檻;在 Runtime 相容且系統仍有足夠可用記憶體的條件下,它們可以執行這個模型,但空間相當緊。M4 Mac mini 的 US$599 是 2024 年發表價,目前新款 M6 Mac mini 則從 US$899 起。如果從 NVIDIA 顯示卡著手,表中發表價最低的是 US$429 的 RTX 5060 Ti 16 GB,其次是 US$499 的 RTX 4060 Ti 16 GB,但兩者都只有顯示卡,還需要 CPU、系統 RAM、主機板、儲存裝置、電源供應器與其他零件。

VRAM 容量本身會形成一道購買門檻:即使某張顯示卡的運算能力不差,只要 VRAM 少於模型需要的容量,就無法讓模型完整留在 GPU 上執行。對於只是想跨過 gpt-oss-20b 容量門檻的人,完整電腦與單張顯示卡的價格因此會被放在一起討論;推論速度則要另外實測。

記憶體頻寬(Memory Bandwidth)通常以 GB/s 標示,描述記憶體子系統每秒理論上能傳輸多少資料。LLM 生成文字時需要反覆讀取大量模型權重,因此記憶體頻寬可能成為影響生成速度的瓶頸之一。

Apple MacBook Pro 部分 M5、M5 Pro 與 M5 Max 晶片規格比較,其中記憶體頻寬分別為 153、307 與 460 GB/s

圖:Apple MacBook Pro 技術規格頁中的部分晶片選項;紅框標出各選項的記憶體頻寬。查看目前完整規格

同一個 M 世代的基本款、Pro、Max 與 Ultra 可能有不同記憶體頻寬;因此,不能只看「M5」就推定頻寬,仍要核對完整晶片與 GPU 規格

2026 年的 Mac mini 與 Mac Studio 同時採用 M6、M5 Pro、M5 Max 與 M5 Ultra,正好顯示晶片名稱相近,容量與頻寬仍可能相差很大:

晶片與產品 最高統一記憶體 理論記憶體頻寬 規格差異
M6 Mac mini 32 GB 153 或 170 GB/s 頻寬依記憶體配置而異。
M5 Pro Mac mini 64 GB 307 GB/s 容量與頻寬都高於 M6。
M5 Max Mac Studio 128 GB 460 或 614 GB/s 頻寬依 GPU 配置而異。
M5 Ultra Mac Studio 512 GB(選項預計 2026 年 10 月底推出) 1.2 TB/s 容量延續 M3 Ultra,頻寬提高約 50%。

這組規格也說明,較新的世代不一定比前一代的高階版本擁有更多記憶體或更高頻寬。M6 比 M5 新,M5 Pro、M5 Max 與 M5 Ultra 仍分別提供更高的容量上限。

記憶體頻寬不會同等影響每一種工作;即使只看 LLM 推論,不同階段的瓶頸也不一樣。

預輸入(Prefill)階段會先處理整段輸入,並建立後續生成所需的 KV Cache。這個階段可以同時處理許多輸入 Token,通常較容易受 GPU 運算能力與軟體最佳化影響;記憶體頻寬則會影響資料能否及時供應給運算單元。

接下來的生成階段(Decode) 則是一個 Token 接著一個 Token 產生。在單人互動、一次處理一個請求的情境下,模型需要反覆讀取權重,速度往往更容易受到記憶體頻寬影響。因此,頻寬適合用來判斷文字生成速度可能受什麼限制,卻不能單獨代表完整的 LLM 推論效能。

如果要分開判讀 Prompt Processing Token/s、Generation Token/s、TTFT 與兩個階段的其他影響因素,可以繼續閱讀〈LLM 的 Prompt 處理速度與文字生成速度都是看 GPU 有多快嗎?〉

Apple 與 NVIDIA 都會公布理論記憶體頻寬。若以目前兩邊的頂規產品相比,M5 Ultra 為 1.2 TB/s,GeForce RTX 5090 則為 1,792 GB/s,後者約為前者的 1.5 倍。以下也保留上一代 M3 Ultra,將 M5 Ultra、M3 Ultra、M5 Max 與 RTX 50 系列桌上型顯示卡依理論頻寬由高到低排列:

晶片或顯示卡 記憶體規格 理論記憶體頻寬
GeForce RTX 5090 32 GB GDDR7 VRAM 1,792 GB/s
M5 Ultra(80 核心 GPU) 最高 512 GB 統一記憶體(選項預計 2026 年 10 月底推出) 1.2 TB/s
GeForce RTX 5080 16 GB GDDR7 VRAM 960 GB/s
GeForce RTX 5070 Ti 16 GB GDDR7 VRAM 896 GB/s
M3 Ultra(80 核心 GPU) 最高 512 GB 統一記憶體 819 GB/s
GeForce RTX 5070 12 GB GDDR7 VRAM 672 GB/s
M5 Max(40 核心 GPU) 最高 128 GB 統一記憶體 614 GB/s
GeForce RTX 5060 Ti 8 GB 或 16 GB GDDR7 VRAM 448 GB/s
GeForce RTX 5060 8 GB GDDR7 VRAM 448 GB/s
GeForce RTX 5050 8 GB GDDR6 VRAM 320 GB/s

如果只看這項規格,RTX 5090 高於 M5 Ultra,M5 Ultra 則高於 RTX 5080;M3 Ultra 的 819 GB/s 介於 RTX 5070 Ti 與 RTX 5070 之間,M5 Max 的 614 GB/s 則介於 RTX 5060 Ti 與 RTX 5070 之間。不過,這張表不能直接用來判定哪台電腦執行 LLM 比較快。

工作站級 RTX 與 Mac Studio 的價格比較

Section titled “工作站級 RTX 與 Mac Studio 的價格比較”

如果需求超過消費級 GeForce 所能提供的 32 GB VRAM,NVIDIA 還有工作站級顯示卡。RTX 6000 Ada Generation 配備 48 GB VRAM,RTX PRO 6000 Blackwell Workstation Edition 則配備 96 GB VRAM。這兩張卡經常被拿來和大記憶體 Mac Studio 比較,主要問題是取得相近記憶體容量需要多少預算。

以下採用 2026 年 8 月 25 日查得的官方美國商城標價與起價;價格會隨時間、地區與配置改變:

產品 記憶體規格 官方美國價格 價格包含什麼?
NVIDIA RTX 6000 Ada Generation 48 GB GDDR6 ECC VRAM US$6,800 只有顯示卡
NVIDIA RTX PRO 6000 Blackwell Workstation Edition 96 GB GDDR7 ECC VRAM US$16,000 只有顯示卡
Mac Studio(M5 Max) 36 GB 起、最高 128 GB 統一記憶體 US$2,499 起 完整電腦
Mac Studio(M5 Ultra) 96 GB 起、最高 512 GB 統一記憶體(選項預計 2026 年 10 月底推出) US$5,499 起 完整電腦

最直接的例子是 96 GB:M5 Ultra Mac Studio 的入門配置就有 96 GB 統一記憶體,完整電腦從 US$5,499 起;同樣標示 96 GB 的 RTX PRO 6000 Blackwell,目前官方商城的單卡標價則是 US$16,000。這個價差能解釋為什麼需要在本地載入大型模型的人,會把 Mac Studio 視為工作站級 RTX 方案的比較對象。

試著回答以下問題,來確認是否已學會。不確定答案的話,再回到對應段落複習。打勾狀態是方便你在這個頁面一一確認用,不會被儲存。

閱讀後自我確認