跳至主要內容
2026年9月24日星期四Today's Edition即時更新
KOH NEWS
科技 即時報導

GPT-6 是否「降智」再成討論:V2EX 帖子記錄 Pro 用戶的使用體感與歸因猜測

V2EX 出現「GPT-6 是不是最近又降智了」討論串,多位 Pro 訂閱用戶反映模型回應品質下滑,本臺整理帖子內容、用戶歸因猜測與可核實資訊的邊界。

KOH NEWS 採訪中心 閱讀約 5 分鐘

一則標題為「GPT-6 是不是最近又降智了」的討論帖於 2026 年 9 月 14 日前後出現在程式設計師社羣 V2EX,發起者以親身使用經歷描述 GPT-6 Astra High 在指令遵循上的異常表現,至 9 月 15 日下午該帖累計瀏覽約 2180 次、回覆 12 則。這並非 GPT-6 相關品質質疑首次在技術社羣出現,但此帖以具體的操作過程記錄了異常樣態,多位同為 OpenAI Pro 訂閱層級的用戶在回覆中表示有類似體感。需要說明的是,OpenAI 官方並未發布任何承認或否認模型品質變動的公告,以下整理僅代表帖子內的用戶敘述與猜測。

發帖者記錄的完整過程:一份番茄炒蛋食譜演變成一盤東坡肉

發帖用戶 w568w 自述使用官方 Pro 訂閱(帖內稱 20x Pro 帳號)、ChatGPT Desktop 客戶端,模型選項為 GPT-6 Astra High。按其敘述,最初對話體驗良好,模型能給出一份品質不錯的番茄炒蛋食譜;但在後續的模擬烹飪互動中,模型的行為開始偏離指令。

其描述的時間軸如下:使用者要求模型「按照這份食譜做」,模型在過程中加入了不該使用的劣質油品;使用者指出問題後,模型道歉,隨後將原有食材全部丟棄,轉而搜尋另一道菜的食譜並中途停止,要求使用者確認後再繼續;使用者催促繼續,模型再次道歉,最終交付的成品與最初指令完全不符。發帖者以「像注意力渙散症似的」形容這種表現,並表示已將主力模型轉向 DeepSeek V4.1 Flash,理由是後者「起碼說做東坡肉就做東坡肉」。

值得注意的是,回覆中有用戶針對這段敘述提出質疑,指出家用電腦環境中不存在其所稱的油品,發帖者隨後補充說明,稱整段敘述帶有比喻性質,用以形容模型對語義的機械式誤讀,而非字面上的實境操作。這一來一回也顯示,此類使用者敘事的細節未必能逐字核實,但多名回覆者表示對「體感下滑」本身有共鳴。

多位 Pro 用戶回報類似體感:與 GPT-5.6 時期的對照

回覆中有兩名用戶提供了與發帖者相近的使用紀錄。用戶 layxy 表示,各項測試顯示模型沒有降智,但實際使用的體感確實下滑,「沒有剛出的時候驚艷」。用戶 Gyyyy 則稱自己持有兩個同級訂閱帳號,並提出一個對照觀察:無論是此前的 GPT-5.6 Sol 還是現在的 GPT-6,都在發布後約三天內表現最佳,之後開始下滑;該用戶進一步認為,GPT-6 下滑後的可用度低於 GPT-5.6 下滑後的水準,「已經到了完全不能用的地步」,並表示已轉用 Claude 作為過渡。

這類「發布初期最好、之後變差」的說法在歷代模型上均有用戶提出,屬於 AI 社羣長期流傳的主觀印象之一。截至目前,沒有公開的基準測試數據或第三方評測能對特定時間段的模型表現變化做出系統性驗證,相關說法僅能視為使用者樣本的自我報告。用戶 takemefly 則在回覆中給出相反體感,稱「我的沒什麼問題」,顯示同一時期不同用戶的體感存在明顯差異。

用戶歸因的三種猜測:路由、IP 品質與容量錯誤

帖子中多數討論集中在「為什麼會這樣」的猜測上,大致可分為幾類。

其一是指向模型路由機制。有用戶猜測 OpenAI 在後端加入了分流邏輯,若判定請求屬於低複雜度問題、或帳號被標記,就會悄悄路由到較低等級的模型。這一猜測未有任何人提出直接證據,屬於社羣長期流傳的假說,OpenAI 也從未證實存在此類未告知的靜默降級。

其二是指向網路出口品質。用戶 kerwin1874 提供了較完整的自查過程:其先前透過共用節點連線時,即便在客戶端明確選擇高階模型與高思考等級,回應仍呈現「秒出」的低品質特徵;改用雲端主機自建固定美國 IP 出口後,客戶端對話恢復正常,容量錯誤也不再出現。這一說法將問題歸因於出口 IP 的信譽分級,而非模型本身,且發帖者回覆稱願意嘗試,但補充自己走的是公司採購的美國家寬 IP 出口。兩種網路條件下的體感差異,目前僅有個案敘述。

其三是容量錯誤訊息。用戶 particlec 回報近期頻繁收到「Selected model is at capacity」錯誤,kerwin1874 也稱在使用高階模型時偶發同類訊息。此類錯誤屬於可客觀觀察的現象,但錯誤訊息本身無法證明與模型推理品質的變化存在因果關係。

可核實與不可核實的邊界

綜合帖子內容,可以核實的事實包括:該討論串存在、瀏覽與回覆規模約略如此、部分 Pro 用戶在同一時期回報了體感下滑與容量錯誤。無法核實的部分則佔多數:模型是否存在未被告知的靜默路由、OpenAI 是否在特定時間調整過推理配置、使用者體感的下滑是否源於模型本身,這些均缺乏官方資料或可複現的測試支持。

作為對照,GPT-6 Astra 的公開案例此前曾在技術社羣帶動一波工具鏈相關的關注,例如本臺先前整理的GPT-6 Astra 操作 Blender 的案例與搜尋量變化,當時的討論重點在模型能力的上限展示;而此次 V2EX 帖子反映的則是穩定性與指令遵循的日常使用層面,兩者共同構成這一代模型在公眾視野中的完整圖像。

OpenAI 至今未對外說明其生產環境中模型配置的調整機制,也未承認存在依帳號或請求特徵的差別對待。在官方保持沉默的情況下,此類討論串的價值在於留存在線服務品質波動的第一手使用者紀錄;至於「降智」一說能否成立,仍需等待可複現的測試方法或官方說明問世,目前各界說法均停留在體感與假說層次。

#gpt-6降智#openai#v2ex