豬走路觀摩 - Qwen 27B 本地運行實戰
| | | 1 | |
手邊沒設備沒機會實地玩 Qwen 3.8 27B 這類地端開源模型,沒吃過豬肉也要看過豬走路,無意滑到這支 YouTube 影片 - 不用 5090,Mac 也能实现 Token 自由!Qwen3.8 27B 本地实测,創作者新人首發,簡報動畫應為 AI 製作但樸素不花俏、解說口白慢到讓人心焦加上不斷吃螺絲,但我看了很是喜歡 😄 我愛這種真人實戰心得整理勝過 AI 吞一堆資料吐出精美卻沒靈魂的生成品。影片介紹在 Mac 64G 等級硬體跑 Qwen 3.8 27B 模型的一些實戰技巧,涵蓋不少地端跑模型必學術語,寫篇筆記整理一下。
- Qwen 3.8 27B 模型量化版只有十幾 GB,能用 24GB Mac 跑嗎?乍看可以,但可能會遇到載入失敗、生成時記憶體不足、生成速度低於 10 Token,開了 MTP (一次預測多個 Token) 沒加速反而更慢,影片內容可幫助解答這些疑惑。
- 影片展示在 Mac 完整部署 Qwen 3.8 27B,計算所需記憶體,決定採用的量化版本,使用 Hugging Face 平行下載工具先跑基礎版,再安裝 DFlash 2 加速。
- Qwen 3.8 27B 代表 270 億個參數,而 Qwen 3.8 屬於稠密模型(Dense Model),每生成一個 Token 都要用到這 270 億個參數。 註:另一種類型是 MoE 混合專家模型(或稱 Sparse Model 稀疏模型),處理每個 Token 時會透過門控網路 (Router/Gating Network) 只挑選少數幾個「專家層 (Experts)」參與運算,代表:Mixtral 8x7B、DeepSeek-V2/V3、Grok-1。
- MoE 35B-A3B 則為 MoE,35B-A3B 代表總共有 350 億個參數,但每次只選擇性激活 (Activate) 50 億個,計算量較小,記憶體需求較低速度較快。
- 稠密模型的優點是所有能力都集中在同一套參數,在輸出穩定性、複雜任務和知識調用表現較好。
- 本地模型規模簡單分類:3B ~ 8B 輕量模型,速度很快但無法勝任複雜任務;14B ~ 30B 能力較能處理複雜程式開發、文章生成和工具調用,以及 Agent 任務,是最實用的大小;70B+ 表現更好能力更強,但所需記憶體大小及頻寬一般個人電腦扛不住。
- Qwen 3.8 27B 在部分任務(如寫程式、調用工具)的表現已接近閉源模型,但無法完全取代閉源旗艦模型(尤其在開放推理、知識廣庿、長任務方面)。
- 27B 使用 BF16 光原始權重就要 54GB,這還不包含 Cache、推理過程耗用的記憶體,64G Mac 只能放下權重,幾乎無法實際運行。
- 以支援視覺版 Qwen 3.5 27B 模型 FP8 量化版為例,運行耗用記憶體包含:
- 模型權限 (29GB)
- KV Cache (上下文狀態) 與上下文長度相關,32K = 2GB、64K = 4GB ... 256K = 16GB,這裡還沒算進線性注意力狀態
- 計算過程的緩衝區,隨輸入長度和併發變化,第一次讀取大段 Pormpt 時會急速上升
- 視覺編碼器 (只做純文字可省)
- DFlash2 草稿模型,啟用時再加 2B Drafter 總耗用量 = 權重 + Cache + Buffer + 系統 + Drafter FP8 版本至少 48G,建議 64G;若 UMA 只有 24G 或 32G,跑 FP4 已很拼(模型本身已 16G)。
- 有 GGUF + llama.cpp 跟 MLX 兩種版本,Mac 建議用 MLX 有針對 Apple 晶片優化
- 先跑基礎版,取得 Baseline 基準數據,再安裝 DFlash2 加速 (2B 草稿模型一次預測一組 Token,27B 主模型驗證,接受答案可省五六次模型)
- Baseline 數據:Load Time、Prompt tok/s、TTFT (第一個 Token 回應時間)、Decode tok/s
- 草稿模式在 Mac 的主要實作叫 mlx-dspark 支援 DSpark/DFlash/DFlash2,用
mlx-dspark benchmark --model Qwen3.8-27B-4bit --trials 3測試找出最佳參數,不同 CPU (M1/M3/M4/M5 不同)最佳參數不同。 - 草稿接受率低時,主模型不斷拒絕和重新生成,反而更慢
Comments
# by Jackson2847
台灣最近有個 GPU 租用網站 (GPUtw.ai) ,感覺生意做的不錯。主要是租用費率便宜,台幣付款。 另一個是叫 cloud.vast.ai 該怎麼說呢?很像GPU界裡面的 Airbnb:有空的房子,就拿來出租。 要驗證模型合不合用 GPU的資源庫吧。