Kimi K3 被質疑「吹得厲害」:V2EX 討論串記錄訂閱用戶的體感落差與訊源對照
V2EX 出現「Kimi K3 是不是吹得厲害」討論串,本臺整理發文者與回文者對跑分、體感、額度與降智說法的輪廓與可核實邊界。
2026年9月22日中午,程式設計師社羣 V2EX 出現一篇標題為「kimi K3 是不是吹的厲害」的討論串。發文者自述為月付 699 元人民幣的訂閱用戶,質疑月之暗面旗下 Kimi K3 模型的實際表現與官方宣傳存在落差。截至本臺彙整時,該討論串累積約 3,179 次瀏覽、34 則回覆。本臺整理討論串內容、各方說法的出入,以及可核實資訊的邊界。
發文者的三項質疑
發文者帳號為 1zh3n,透過 Android 裝置發文。其質疑集中在三個層面。
第一是額度調整。發文者指出,Kimi 官網先前曾標示「kimi code 多少倍額度」的資訊,後來被悄悄移除。此一說法屬於單一用戶的觀察,本臺尚未在月之暗面官方管道找到對應公告或說明。
第二是跑分與體感的落差。發文者表示,K3「說是跑分比肩 fable」,但實際使用體感「沒覺得比 DeepSeek 4.1 flash 高到哪裡去」。在後續補充中,發文者進一步自問「我們各自的參照物是什麼」,認為若以 Opus 4.8/5 或 GPT 5.6/6 為對照,K3 仍「很勉強」。
第三是測評方法的質疑。發文者稱,網路上的各項測評「測來測去」,但未見有人以中大型實際專案來檢驗模型能力。
回文者的分歧:第一梯隊與性價比疑慮並存
34 則回覆中,用戶評價明顯分歧,並非一面倒的批評。
用戶 shakaraka 認為 Kimi K3「可以生產使用,也是國模第一梯隊」,但受限於算力,即使付費 699 元,配合 Claude Code 的 teamagent 與 workflow 功能,「實際用量非常少」。該用戶估算,個人體感上至少需要 4 個 699 元帳號,才能與 GPT 20x 套餐搭配 5.6 sol xhigh|max 的使用體驗相當。
用戶 106npo 給出更具體的配置方案:3 個 699 元帳號都不夠用,目前改用 2 個 699 元帳號加 1 個 GLM Pro 才勉強夠用。該用戶對兩款模型的分工有明確描述:Kimi 的快取便宜,但輸入輸出額度少,適合用來執行方案;GLM 適合用來產出方案。同一用戶也直言,「如果你能用 GPT/anthropic 那就別猶豫直接用,國產模型不管價格還是效果都沒有能打的」。
用戶 Alwaysonline 的立場則偏向肯定。該用戶自述「天天黑 Kimi,也就黑它的量」,但認為模型品質「真可以」,前端生成能力強,製作簡報「輸出即可用」。
「降智」說法與基準測試爭議
討論串中多名用戶提及 K3「降智」。用戶 kindjeff 表示,Kimi 早期即以前端 one shot 生成效果走紅,近期「K3 降智也很嚴重」,並認為涉及嚴肅邏輯的任務表現不如 GLM-5.3。用戶 chihiro2014 與 jjx 亦有類似表述,後者稱在 Cursor 中長期使用 K3 max,程式碼審查產生多個誤報,原因研判為「對專案了解不深入」,對比 GLM 5.3「幹活實在、很少出錯」。
用戶 defa21312 提出一項具體對照數據:在 Terminal Bench v4 測試中,K3 未能跑贏參數量小 4 倍的 GLM,且 v4 是在 K3 發布一個多月後才出題,「不存在刷題可能」。此說法源自回文者的轉述,本臺未能在討論串內找到對應排行榜的原始連結,具體名次與版本細節無法獨立核實。
版本差異與商業合作背景
部分回文者指出,討論中的體感差異可能與模型版本有關。用戶 mmdsun 詢問原發文者使用的是否為 K3 max,稱「max 思考版本才是排名前幾名的版本」,並自述以 K3 max 搭配 Claude Code 的體驗「還可以」。發文者回覆稱自己使用的是 high 或 max 版本。
商業合作方面,用戶 413420 提到「AWS 已經和它合作」。用戶 imnotlxy 則持相對正面看法,稱 GLM 5.3 等模型在跑分上與 K3 非常接近,但 K3 參數量大很多,「這可能也是用起來更舒服的原因」。
可核實資訊的邊界
綜合討論串,可歸納的輪廓如下:K3 的爭議點集中於額度供給、長時間自主運行的可靠度、嚴肅邏輯任務表現與性價比四個面向;支持者肯定其前端生成與意圖理解能力;批評者的對照組多為 GPT、Claude、GLM 5.3 與 DeepSeek 4.1 flash。
須說明的是,該討論串屬於匿名社羣的個人使用經驗彙集,涉及跑分名次、額度計算與「降智」判斷的說法,均未附可查證的原始數據。官網額度資訊移除一事,亦僅見於發文者單方陳述。月之暗面方面截至彙整時未對相關說法公開回應。
同類討論並非首見。本站先前曾整理 GPT-6 是否「降智」的 V2EX 討論串,該事件中 Pro 訂閱用戶同樣以體感描述模型品質下滑並提出多種歸因猜測。兩案對照顯示,付費重度用戶對模型品質波動的感知與表述,已成為各家模型上線後週期性出現的社羣話題類型,其可核實邊界也高度相似:用戶體感陳述量大,但缺乏可複驗的基準數據,官方說明通常缺席。Kimi K3 的後續版本更新與額度政策是否調整,本臺將視官方公布資訊再行彙整。
主題