巨頭不是為 SMB 而設計,卻意外改變了 SMB 的 AI 部署門檻

工程師思路系列・事出必有因 | Mr. τ/風雲網通系統

如果把近兩年大型模型(Google、Meta、DeepSeek、阿里、Moonshot 等)的演進整理起來,可以發現一件有趣的事:

幾乎沒有任何一項技術,是專門為 SMB 本地部署而設計。

各家模型公司真正追求的,始終是資料中心的吞吐量(Throughput)、降低雲端服務成本、增加併發(Concurrency),以及降低每百萬 Token 的推論成本。

然而,這些為龐大雲端設施打造的底層技術,透過開源與社群的轉譯,最後卻讓只有雙卡 RTX 3060 12GB、甚至 Mac Studio 的 SMB 使用者,意外成了最大的受益者。

要理解這股紅利如何傳導到地端,不能只看單一名詞,而必須用系統工程的三層架構來拆解。更重要的是,這三層並非平行存在,而是嚴格的依賴與傳導鏈

模型架構(決定天花板) 推論框架(決定能不能跑) 部署技術(決定有沒有資格入場)

例如:MLA 再強,如果推論引擎沒有支援,SMB 一樣享受不到;反過來,GGUF 量化格式再成熟,如果模型本身缺乏 GQA 或高效設計,VRAM 還是會被 KV Cache 瞬間撐爆。唯有三者同步成熟,地端的性價比甜蜜點才會出現。

第一層:模型架構層(決定天花板)

MLA(Multi-head Latent Attention)— 以 93.3% 壓縮率突破 KV Cache 瓶頸

代表模型 DeepSeek V2 / V3 / V4

工程意義:根據 DeepSeek 官方技術論文《DeepSeek-V2》,相較於前代 67B 模型,MLA 架構將 KV Cache 縮減了 93.3%,同時將最大生成吞吐量提升至 5.76 倍。若以單層 Token 的 Cache 元素數量計算,壓縮率更接近 98.2%(從 32,768 個元素降至 576 個)。這不是邊際改善,而是從根本上改變了同等硬體能跑多長 Context 和多大 Batch 的物理限制。

SMB 受益:同樣的 VRAM,能跑更長的對話而不 OOM,或者騰出 VRAM 空間給更多 Expert 留在 GPU 上。

MoE(Mixture of Experts)— 算力解方與資料搬移的雙面刃

代表模型 DeepSeek 系列、Qwen3 MoE、Kimi K2

工程意義:模型雖然總參數龐大,但每次推論只啟用少數活躍參數(Active Parameters)。

現實限制(PCIe 瓶頸):MoE 解決的是「算力需求」,但沒有解決「資料搬移成本」。當模型無法完整駐留於 GPU VRAM 時,分散的 Expert 需要透過 PCIe 頻寬在系統記憶體與 GPU 間頻繁來回搬移。此時的瓶頸往往不是 GPU FLOPS,而是 PCIe 頻寬

GPU  ⟵ PCIe ⟶  RAM

每個 Token 都需要搬運,搬多少決定速度

目前的 MoE 更接近「用有限 VRAM 跑更大的模型」,而非「用有限 VRAM 跑得更快」。

工程抉擇:如果模型能全數塞進 VRAM,就不要輕易做 offload;只有在硬體限制下,MoE 才有資格用來換取「把大模型跑起來」的門票,而不是用來追求極致速度。

GQA(Grouped Query Attention)— 新世代開源模型的基線標配

代表模型 Llama 3 / Mistral / Qwen 全系

工程意義:大幅降低傳統 Multi-Head Attention 的 KV Cache 規模,讓長 Context 運作更省 VRAM,現已成為幾乎所有新世代開源模型的共同基礎。

第二層:推論引擎層(決定能不能跑順)

MTP(Multi-Token Prediction)— 零額外 VRAM 的推測解碼

代表模型 DeepSeek、Gemma 4、Qwen3

工程意義:傳統 Speculative Decoding 需要額外載入第二個 Draft Model,佔用寶貴 VRAM。MTP 讓主模型內建多 Token 預測能力,不增加額外 VRAM 開銷即能提升 Token Throughput。

※ MTP heads 屬於模型 weights 的一部分,技術分類上源自架構層,但因其核心價值在於不增加 VRAM 負擔即提升推論效率,故歸入本層討論。

推論引擎最佳化(PagedAttention 與混合配置)

代表框架 vLLM、SGLang、llama.cpp

工程意義:推論框架已開始支援更細緻的 Expert Placement 與 CPU/GPU 混合配置。透過對記憶體配置與硬體分配(如 -ot exps=CPU 等參數)的最佳化,讓有限的 GPU 資源能發揮更高的實測吞吐量。這一層是 MoE offload 從理論變成實測 tok/s 數字的關鍵橋樑,沒有它,上層架構對 SMB 只是論文而非工具。

第三層:部署與量化層(決定有沒有資格入場)

量化生態與跨設備池化(GGUF / AWQ / EXO)

工程意義:值得注意的是,GGUF、AWQ、EXO 等並非大型模型公司提出的架構創新,而是開源社群為了讓前述技術真正能在消費級硬體落地所建立的部署生態。透過 GGUF 量化與異質硬體 VRAM 池化,才真正讓 24GB~35GB VRAM 的消費級機器,具備運行 30B / 70B 級別模型的資格。沒有這一層,上面兩層對 SMB 都是空的。

對 SMB 本地部署的重要性排序

排名 技術 對 SMB 的主要價值
MLA 大幅降低 KV Cache,節省 VRAM,長 Context 不 OOM。
量化技術(GGUF / AWQ) 讓消費級 GPU 有資格跑 30B/70B 模型,是入場門票。
GQA 降低 KV Cache,改善長 Context 效率,已成新模型基線。
MoE 以少量活躍參數提供大模型能力,但受限 PCIe 頻寬。
MTP 提升生成速度,不需第二個 Draft Model 佔 VRAM。
PagedAttention / 推論引擎 提升推論效率,是架構創新落地的關鍵橋樑。

結語:SMB 的新瓶頸與技術傳導鏈的限期

三年前,企業在問:「本地到底能不能跑 AI?」

現在,問題已經變成:「到底要怎麼配置才划算?」

瓶頸已經不再是「模型夠不夠聰明」,而是轉向了系統整合效率的工程細節。這些問題沒有通用答案,必須依硬體組態逐一實測:

哪些 Layer 必須留在 GPU?
哪些 Expert 必須放 CPU?
Context 要開多少才不會撞牆?
Tok/s 是否符合實際互動需求?
PCIe 頻寬是否已經吃滿?

對 SMB 而言,真正值得觀察的,不是哪一家模型今天在排行榜拿第一,而是巨頭的模型架構創新,是否能透過推論框架與開源社群快速傳導到消費級硬體

目前這扇紅利視窗之所以是開的,本質上是全球 AI 競局下的必然產物——各大廠為了爭奪生態市佔與雲端優勢,主動將模型開源、架構公開,並任由 GGUF 等生態在社群茁壯。這不是慈善,而是高度競爭下的外溢效果。

當這條技術傳導鏈持續存在,本地 AI 的部署門檻就會不斷下降;但一旦巨頭的競爭格局改變,或是未來重心全面轉向高度專有化、特化硬體的架構,SMB 所享有的技術紅利也可能隨之放緩。

在窗口期內掌握系統整合的自主權,才是企業在地端落地 AI 最關鍵的護城河。

#地端AI #SMB #MoE #MLA #llama.cpp #工程師思路系列 Mr. τ/風雲網通系統
Last modified: 2026-07-24

Author

Comments

Write a Reply or Comment

Your email address will not be published.