螞蟻百靈開源 Ling-3.0 tiny / flash Base 模型 連訓練中途的 6 個 checkpoints 一併放出
螞蟻百靈開源Ling-3.0-tiny與flash Base模型,同步釋出預訓練與中期訓練共計6個checkpoints,並公開WSM合併技術細節。
8 月 20 日,螞蟻集團百靈團隊宣布將 Ling-3.0-tiny-base 與 Ling-3.0-flash-base 正式開源。這次釋出的內容除最終 Base checkpoint 外,還包括兩個模型在預訓練與中期訓練階段的權重檔案,合計 6 個 checkpoints,已同步上架 Hugging Face 與 ModelScope 兩大平臺。此前的 8 月內,該團隊已陸續開源 Ling-3.0-tiny 與 Ling-3.0-flash 兩個模型,本次則進一步把訓練過程中的關鍵節點對外開放。
三類 checkpoint,對應訓練流程的三個切面
依官方說明,6 個 checkpoints 分屬三種狀態。預訓練 checkpoint 指已完成大規模預訓練、但尚未進行中期訓練、WSM 合併與後訓練的版本;中期訓練 checkpoint 在前者基礎上完成了中期訓練,同樣未經 WSM 合併與後訓練;WSM 合併 checkpoint 則已基於中期訓練結果完成合併,僅剩後訓練未執行。
所謂 Base 模型,一般指未經特定任務微調的基礎預訓練模型,訓練時以平衡性能與資源消耗為目標。官方列出這些 checkpoint 的適用場景,包括持續預訓練、領域監督微調、偏好優化、強化學習後訓練、蒸餾,以及長上下文與混合專家(MoE)系統研究。
團隊同時提出明確的使用邊界。Base Model 並非已完成指令對齊的聊天模型,官方不建議在未經後訓練的情況下,直接將其部署為面向終端用戶的聊天服務,也不建議在未經額外對齊與評估前用於安全關鍵型應用。任何生產環境使用,都應先完成針對具體任務的後訓練、評估與驗證。
WSM:以權重合併取代學習率衰減
這次開源在技術層面最受注意的環節,是中期訓練結束後的處理方式。傳統做法是在訓練後段讓學習率逐步衰減,使模型收斂;百靈團隊改採 checkpoints 加權合併,即 WSM(Warmup-Stable and Merge)機制。
官方稱,由於不再依賴學習率衰減,這個 Base Model 更適合持續預訓練與動態擴展資料,並支援在訓練完成後離線探索不同的學習率「衰減曲線」。換言之,研究者可以在不重跑訓練的前提下,嘗試多種收斂策略再比較結果,這也是團隊願意把中途權重一併開放的原因之一。
兩個模型的參數規模與官方評測說法
參數規模方面,Ling-3.0-tiny-base 總參數為 7.9B,啟用參數 1.3B。官方稱其以約為前代 50% 的總參數量,在多數評測中取得更高分,與同規模模型對比時,程式碼能力更具競爭力。
Ling-3.0-flash-base 總參數 124B,啟用參數 5.1B,採稀疏啟用設計。官方將其定位為可供研究與開發團隊繼續訓練、擴展並適配真實場景的開放底座。
官方公布的評測說法稱,模型在程式碼、複雜推理與長上下文方向表現突出,與總參數量約為其 2 至 3 倍的其他 base model 相比,整體表現仍具優勢。上述數據均為官方口徑,獨立第三方的復現結果尚未大量出現,後續可對照社羣評測再行檢視。
開源連結與取得管道
模型以 inclusionAI 名義上架。Hugging Face 與 ModelScope 兩個平臺上,Ling-3.0-tiny 與 Ling-3.0-flash 各有三個版本,分別對應最終 base、30T 預訓練 checkpoint 與 midtrain 中期訓練 checkpoint。使用者可依自身訓練階段需求選擇對應權重。
背景:中國大模型開源競賽的下一階段
螞蟻百靋的 Ling 系列並非孤立事件。過去一年多以來,中國多家機構接連開源基礎模型,開放範圍從最終權重逐步延伸到訓練資料、技術報告與訓練細節。把中途 checkpoint 釋出,在業界仍屬少見做法,其訴求對象主要是需要研究訓練動力學的學術團隊與需要持續預訓練的企業用戶。
與此同時,開發者社羣對國產開源模型的使用熱度持續存在,例如先前 DeepSeek 相關工具教學在嗶哩嗶哩的傳播,與本次 DeepSeek 工具教學影片湧現嗶哩嗶哩的現象同屬一波更大的開源模型應用潮流。Ling-3.0 系列 base 權重的開放幅度,能否帶動更多基於其上的微調與研究專案,仍需觀察後續社羣採用情況。
截至發稿,螞蟻集團未公布這些權重的具體授權條款細節與後續 instruct 版本的釋出時間表。依官方使用建議,一般用戶若需要可直接對話的模型,仍應等待完成後訓練與對齊的版本,而非直接部署此次開源的 base 權重。
主題