跳至主要內容
2026年9月24日星期四Today's Edition即時更新
KOH NEWS
科技 深度報導

從 MoE 到推測解碼:一批新開源模型讓架構術語再度被翻出來

GLM 5.3 Flash、Qwen 3.8 Flash 與 Hy4 Preview 相繼發布後,技術術語整理文章流傳,本臺綜合公開資料整理 MoE、GQA、MLA 等常見大模型架構術語的含義與脈絡。

KOH NEWS 採訪中心 閱讀約 7 分鐘

2026年8月30日,掘金平臺上出現一篇題為「看懂大模型架構術語」的長文,作者以近期接連發布的 GLM 5.3 Flash、Qwen 3.8 Flash 與 Hy4 Preview 為切入點,逐一拆解這些模型技術文件中出現的架構術語。文章發布後在開發者社羣間流傳,成為理解當前開源大模型技術文件的入門材料之一。本臺依據該文內容與各模型公開的技術資料,整理這些術語的實際含義、作用,以及它們在具體模型中的應用方式。

為何此時談架構術語

這一波討論的直接背景,是多個開源模型在短時間內密集發布。GLM 5.3 Flash、Qwen 3.8 Flash、Hy4 Preview 等模型的技術說明中,出現了 MoE、Top-8、共享專家、GQA、MLA、DSA、Indexer、IndexCache、殘差連接、iHC、MTP、推測解碼等大量術語。對多數非研究背景的開發者而言,這些詞彙的密度已經構成閱讀門檻。

原作者的處理方式是跳過數學推導,用最小必要的概念框架說明每個術語「是什麼」與「有什麼用」。這種做法有其取捨:犧牲了嚴謹性,換取可讀性。以下整理沿用同樣的原則,並在數字上與原文核對。

參數與啟用參數:模型規模的兩種量法

最基礎的一組術語涉及模型大小的描述方式。

Parameter(參數)指模型訓練過程中學到的數值,可以粗略理解為模型儲存知識與計算規則的載體。參數總量越大,模型的潛在容量通常越大,但對應的顯存佔用、通信開銷與部署成本也越高。以 Hy4 為例,其總參數量標示為 770B,即約 7700 億個參數。

Activated Parameters(啟用參數)則是處理單一 Token 時真正參與計算的參數量。這個指標的存在與 MoE 架構直接相關:模型可以保留巨大的總容量,同時避免每個 Token 都跑完整個模型。Hy4 的標示是 770B 總參數、每個 Token 約啟用 49B。

權重大小直接決定部署門檻。以 770B 為例,若以 BF16 精度儲存,僅權重就需要約 1.54 TB 空間(770B 乘以每參數 2 Byte);若使用 FP8 則接近 770 GB。這個估算尚未計入 MTP 模組、KV Cache 與運行時緩衝區的額外開銷。

MoE 與專家路由:把 FFN 拆開來用

MoE(Mixture of Experts,混合專家)是這幾代開源模型最常見的架構選擇。其核心做法是把 Transformer 中的 FFN(前饋網路)層拆成許多並行的「專家」,每個 Token 只調用其中一部分,從而在增加模型總容量的同時,控制單一 Token 的計算量。

圍繞 MoE 有幾個配套術語。

Router(路由器)是一個很小的網路,負責給所有專家打分,決定當前 Token 送給哪些專家。Top-8 的意思是從全部路由專家中選得分最高的 8 個。以 Hy4 為例,每個 MoE 層有 256 個路由專家,每個 Token 在每一層只選出其中 8 個參與計算,加上 1 個共享專家,構成其 Top-8+1 的結構。

Shared Expert(共享專家)是每個 Token 都必須經過的專家,用來承載各類輸入都需要的通用能力,例如基礎語法與語言理解,減少路由專家重複學習這些基礎功能的負擔。

與 MoE 相對的是 Dense FFN(稠密前饋網路):所有 Token 都經過同一套完整的 FFN 參數。這種方式計算行為穩定,沒有專家路由的不確定性,但參數越大、每個 Token 的計算成本就越高。Hy4 的做法是混合使用:第一層採用 Dense FFN,其後 77 層使用 MoE,全模型共 78 層。

原文特別提醒一點常見誤讀:「專家」只是結構名稱,不能直接理解為「代碼專家」或「金融專家」。訓練結束後各專家可能出現一定程度的分工,但通常無法為這 256 個專家貼上人類可讀的職能標籤。

層、隱藏維度與上下文長度

第二組術語描述模型的形狀。

Layer(層)是模型連續進行一次注意力計算與 FFN 處理的基本單元,層數體現處理深度。Hy4 有 78 層,一個 Token 的內部狀態要連續經過 78 次更新。

Hidden Size(隱藏維度)指每個 Token 在模型內部用多長的向量表示。Hy4 的一個 Token 由 6144 個數值表示。向量越寬,可同時編碼的特徵越多,計算與顯存開銷也越高。

Context Length(上下文長度)是一次請求最多能放入多少 Token,決定模型能同時處理的程式碼、文件與對話歷史的規模。達到 1M(百萬 Token)量級的上下文,可以容納大型程式碼庫、日誌與多輪工具呼叫的結果。

注意力與 KV Cache:GQA、MLA 與 DSA

理解注意力相關術語,需要先回到最基本的注意力機制。模型生成當前 Token 時,要拿當前 Token 的 Query 去與歷史 Token 的 Key 比對,再取回相應的 Value。可以概括為:Query 是「我現在想找什麼」,Key 是歷史信息的索引,Value 是歷史信息實際攜帶的內容。KV Cache 則是已經算好的歷史 Key 與 Value,避免重複計算。

GQA(Grouped Query Attention,分組查詢注意力)讓多個 Query 頭共享同一組 Key 與 Value。假設模型有 64 個 Query 頭,傳統多頭注意力需要儲存 64 組 K/V;GQA 可以讓每 8 個 Query 頭共享一組,只需儲存 8 組。其主要作用是降低 KV Cache 體積與記憶體帶寬消耗,較適合長上下文推理場景。

MLA 與 DSA 是另外兩種對 KV Cache 做壓縮或改造的注意力變體,涉及更具體的矩陣分解與稀疏化設計。原文以 Hy3、Hy4 的具體配置為例說明其差異,共同方向都是在超長上下文下控制 KV Cache 的增長速度。與之配套的 Indexer 與 IndexCache,則是在超長上下文中先檢索相關歷史段落、再送入注意力的機制,用以進一步削減計算量。

生成速度:MTP 與推測解碼

最後一組術語與推理速度有關。MTP(Multi-Token Prediction)讓模型在一次前向計算中預測多個 Token,而非傳統的一次一個。推測解碼(Speculative Decoding)則是用一個較小的草稿模型快速生成候選序列,再由大模型一次性驗證,驗證通過的部分等於變相加速了生成。這兩類技術在近期的開源模型中經常同時出現,目標一致:在不改變輸出品質的前提下提高單位時間的 Token 產出量。

術語背後的共同方向

把這些術語放在一起看,可以歸納出當前開源大模型架構設計的幾條主線。其一,以 MoE 控制「容量大但單次計算量可控」的平衡,770B 總參數對應 49B 啟用參數是典型配置。其二,以 GQA、MLA、DSA 等注意力變體壓縮 KV Cache,讓百萬級上下文在工程上可行。其三,以 MTP 與推測解碼提升生成吞吐。三者解決的問題不同,但都指向同一個現實約束:模型能力持續變大,推理成本必須同步被壓下來。

對照各家的公開資料,GLM 5.3 Flash、Qwen 3.8 Flash 與 Hy4 Preview 在術語使用上高度重疊,差異主要體現在專家數量、啟用比例、注意力方案的具體選型與上下文長度上限。此類技術整理文章的價值,在於提供一張對照表,讓讀者在面對下一批模型發布時,能夠直接定位新配置落在哪些已知的設計軸線上。至於各家宣稱的效能數字與實際部署表現之間的落差,仍需等待更多第三方實測數據累積後方能比較。

#大模型架構#開源模型#人工智慧