跳到內容

先用 Hugging Face 預估模型跑不跑得動

知道完整模型 ID 之後,下一個實際問題通常是:這麼多可下載版本,哪一個有機會放進我的電腦?

第一步:先確認自己的記憶體容量

Section titled “第一步:先確認自己的記憶體容量”

如果還沒有記下 Mac 規格,先回到〈找到你的 Mac 規格〉,確認完整晶片名稱與統一記憶體容量。

對配備獨立顯示卡的電腦,這一步通常要記錄顯示卡的 VRAM;對 Apple silicon Mac,GPU 使用的是和 CPU、macOS 及應用程式共享的統一記憶體。VRAM、統一記憶體與記憶體頻寬的差別,可以先參考〈看懂統一記憶體與記憶體頻寬〉

這兩種容量都能回答「模型是否可能放得下」,但不能直接互相當成完全相同的硬體規格。

登入 Hugging Face 後,前往 Hardware settings

  1. 選擇要加入 GPU、CPU 或 Apple silicon。
  2. 選擇廠商與硬體型號。
  3. 核對 VRAM、RAM 或統一記憶體容量。
  4. 如果有多張相同顯示卡或多台相同設備,再調整數量。
  5. 用星號指定主要硬體,方便模型頁優先顯示。
Hugging Face Hardware 設定頁,列出多台 Apple silicon Mac 與 NVIDIA GPU 的記憶體容量

範例帳號加入了多組硬體;實際使用時只需要登記自己要拿來執行模型的設備。畫面擷取於 2026 年 8 月 24 日。

Hugging Face 預設會把硬體顯示在公開個人檔案。若不想讓其他人看到,可以關閉 Publicly Visible;這不影響你登入後在模型頁查看自己的 Hardware compatibility。

第三步:打開提供 GGUF 或 MLX 的模型頁

Section titled “第三步:打開提供 GGUF 或 MLX 的模型頁”

Hugging Face 官方說明,Hardware compatibility 會出現在提供 GGUF 或 MLX 檔案的模型頁。

Google 原始的 google/gemma-4-E4B-it 提供 BF16 Safetensors,因此這裡改用 unsloth/gemma-4-E4B-it-GGUF 示範。

Unsloth 是開發開放模型訓練、微調與本地執行工具的團隊與專案,也在 Hugging Face 發布許多轉換及量化版本。這個 repo 的來源關係是:

google/gemma-4-E4B
↓ instruction tuning
google/gemma-4-E4B-it
↓ 轉換、量化並發布成 GGUF
unsloth/gemma-4-E4B-it-GGUF

Google 先以 instruction tuning 產生 -it checkpoint,Unsloth 再從這組權重轉換並量化成多個 GGUF 檔案。發布者與製作步驟都能從 repo 的 Model tree 和模型卡繼續核對。

第四步:查看右側的 Hardware compatibility

Section titled “第四步:查看右側的 Hardware compatibility”

模型頁右側會依照量化位元數分組,列出每個可下載版本的完整名稱、檔案大小與相容性圖示。

Hugging Face 模型頁右側的 Hardware compatibility,以 8 GB MacBook Neo 顯示不同 GGUF 量化版本的綠色、黃色與紅色估算

這裡故意選擇只有 8 GB 統一記憶體的 MacBook Neo,讓容量邊界更容易看出來。畫面擷取於 2026 年 8 月 24 日。

第一次閱讀只需要看三件事:

  1. 上方選到的是哪一台硬體,以及容量是多少。
  2. 每個版本右側標示的實際檔案大小。
  3. 圖示是綠色、黃色還是紅色。

以這張圖為例:

版本 檔案大小 8 GB MacBook Neo 的估算
Q4_K_M 4.98 GB 綠色,容量餘裕較多
Q5_K_M 5.48 GB 綠色,容量餘裕較多
UD-Q5_K_XL 6.66 GB 黃色,接近容量邊界
Q6_K 7.07 GB 黃色,接近容量邊界
UD-Q6_K_XL 7.46 GB 紅色,估計過大
Q8_0 8.19 GB 紅色,估計過大
BF16 15.1 GB 紅色,估計過大

你現在不需要先背下 Q4_K_MUD-XL 的意思。先記住:完整版本名稱用來辨認檔案,GB 數字與顏色則幫你做第一輪容量篩選。

Hugging Face 會比較你登記的記憶體容量與模型檔案大小,並替系統與執行資料預留一部分空間。看到顏色後,可以直接採取以下動作:

  • 綠色:列入候選,接著實際載入。
  • 黃色:接近容量邊界;先關閉其他程式,並準備改選較小版本。
  • 紅色:先換成較小的量化版本,或改用記憶體更大的硬體。

對 Apple silicon 而言,8 GB 是統一記憶體總容量。macOS、其他程式、Runtime、運算暫存、KV Cache 與較長輸入都會使用同一份記憶體,因此綠色仍需通過實際載入。

顏色只回答容量。模型每秒能生成多少 Token、輸出品質如何,以及 Runtime 是否支援圖片、音訊與 Chat template,都留到下一輪實測。先選出放得下的版本,再比較速度與效果。

1. 確認完整模型 ID 與用途
2. 選擇 Runtime 支援的格式
3. 用 Hardware compatibility 排除明顯過大的版本
4. 確認磁碟仍有足夠空間
5. 實際載入並用自己的任務測試

如果你想知道 -it、GGUF、Q4_K_M、BF16 與其他名稱分別是哪一個製作步驟造成的,接著讀〈為什麼同一個模型有這麼多版本?〉。

已經選好完整檔名的話,可以繼續讀〈從 Hugging Face 下載模型〉,用指令預覽並取得這個 GGUF 檔案。

試著回答以下問題,來確認是否已學會。不確定答案的話,再回到對應段落複習。打勾狀態是方便你在這個頁面一一確認用,不會被儲存。

閱讀後自我確認