不生成一個字的模型Jev:TypeSafe AI新架構三天登頂HN,官方數據與「零幻覺」宣稱的訊源對照
TypeSafe AI於2026年9月15日發布不生成文字的模型Jev,三天登上Hacker News榜首,本臺綜合官方文件、HN討論與第三方實測整理其技術輪廓與爭議。
2026年9月15日,一家名為TypeSafe AI的新創公司在Hacker News發布部落格文章,介紹一款名為Jev的模型。文章上線一天累積1863分、491則留言,登上該站榜首。Jev的核心賣點與主流大型語言模型截然不同:它不生成任何文字,只輸出「選項加置信度」。本臺綜合掘金一篇於9月18日發布的調研長文、官方文件、HN討論串與第三方實測,整理這款模型的技術輪廓、數據宣稱與各方出入。
模型定位:不是加了限制的LLM
依據掘金作者的整理,Jev的名稱有兩層來源。其概念取自《思考,快與慢》一書的框架:大型語言模型屬於System 2,慢而深、逐token推理;Jev則想做System 1,快速、直覺、直接給出判斷。「Jev」一詞本身取自經濟學家Jevons,對應Jevons悖論,即智慧越便宜、用例越可能爆發。
創辦人Diogo Almeida本人現身HN討論串(ID為CompleteSkeptic)逐一回覆提問。針對「這是不是加了輸出限制的LLM」這一最常見質疑,他的原話是:它就是一個模型,還沒有harness;它是一個結構化資料模型,技術上並非語言模型,因為它不生成語言。
兩者的調用鏈差異可以概括如下。LLM的路徑是prompt經自回歸逐token生成JSON字串,再經解析、校驗與失敗重試,最終得到決策。Jev的路徑是輸入state,一次前向傳播並行處理所有問題,直接輸出帶類型的答案與機率分布。
| 項目 | LLM | Jev |
|---|---|---|
| 訓練方法 | RLHF/RLVR | RLCD(校準決策強化學習) |
| 輸出 | 自由文字,需解析驗證 | Choice/Score/Boolean,結構先於生成存在 |
| 採樣方式 | 逐token自回歸 | 所有答案一次並行算出 |
| 端到端延遲 | 3至329秒 | 70至500毫秒 |
| 置信度 | 常見過度自信 | 每個答案附校準置信度 |
定價與速度宣稱:官方自報數據為主
價格方面,Jev的輸出token免費,輸入定價為每百萬token 0.042美元。延遲官方宣稱為70至500毫秒,比LLM快最多193.6倍、便宜444.6倍。
掘金作者特別註明:以上性能數字基本來自官方自報,處於早期訪問階段,第三方獨立驗證尚未完整覆蓋。該文作者對此的結論是,方向大概率是真的,數據有水分。
值得注意的是模型9月15日才發布,可查證的實測樣本有限。與先前V2EX上關於GPT-6回應品質下滑的討論相比,兩者面臨同樣的訊源困境:多數體感與效能說法來自用戶自述,缺乏可複現的基準測試。
三種原語:Boolean、Choice、Score
官方文件顯示,整個模型只支援三種問題類型,官方稱為primitives。
第一種是boolean(官方名稱Noul),回答是或否,回傳P(true)介於0到1之間的數值。第二種是choice,回答選哪個選項,回傳選項、完整分布與置信度。第三種是score,回答打幾分,分數可落在兩級之間,附帶分布與置信度。
以客服工單分診為例,一次請求的state欄位包含工單主旨(例如「重複扣款」)、訊息內容、訂單資料(編號A-104、兩筆各49美元的扣款)與退款政策文字。questions欄位則並行提出多個問題:department屬於choice類型,在billing與technical兩個準則之間選擇;is_urgent屬於noul類型,判斷訊息是否傳達急迫性;frustration則評估使用者沮喪程度。
這種設計把結構化的判斷從文字生成流程中剝離,等於把模型當成「帶機率的智慧if語句」使用。掘金作者的評估是:當作這種用途是劃算的,想把它當成小號GPT使用則會出問題。
「零幻覺」爭議:文字遊戲的質疑
官方宣稱Jev為「零幻覺」,理由是類型錯誤在數學上不可能發生。這也是HN討論串中被質疑最多的部分。
質疑者的邏輯是:Jev確實不會產生類型之外的值,choice只能回傳定義過的選項,boolean只能回傳機率。但「不產生類型外的值」與「答案正確」是兩回事。Jev仍可能選錯選項、給出錯誤的判斷,只是錯誤會以結構化、附帶置信度的形式呈現。
掘金作者直接將「零幻覺」定性為文字遊戲。這一判斷與官方說法之間的落差,是評估該產品時需要留意的核心出入。
社羣反應與生態進展
HN社羣對創辦人ID「CompleteSkeptic」的討論也佔了一定篇幅,有網友指出這個名字與Dario Amodei形成某種對仗,成為討論串中的插曲。
更實質的進展來自第三方。Browser Use團隊在模型發布三天內完成了官方整合。獨立復現項目也陸續出現,顯示社羣對「非生成式決策模型」這一方向存在實際嘗試,而非停留於圍觀。
這與近期另一個現象形成對照:當AI工具的輸出品質被反覆檢驗時,開發者傾向親自拆解原始碼與文件再下判斷,例如掘金上AI給出八個正確卻無用的最佳化方案一文所記錄的工程判斷難題。Jev的調研文屬於同一脈絡:結論建立在原始碼閱讀、官方文件比對與第三方實測交叉驗證之上。
早期階段的訊源邊界
目前可確認的事實如下:Jev於9月15日由TypeSafe AI發布,三天內登上HN榜首,積分與留言數據來自該站。模型的訓練方法、三種原語設計、定價與延遲宣稱均來自官方文件與創辦人在HN的回覆。
尚未能獨立確認的部分包括:193.6倍速度與444.6倍成本差距的測試條件與對照基準、RLCD訓練方法的技術細節、以及長期使用下的置信度校準品質。掘金作者在文首聲明所有數據截至2026年9月18日,並坦承已盡量標註來源與水分。
一款不生成文字、只輸出判斷與機率的模型,能否在以文字生成為主流的AI市場中站穩,取決於後續獨立基準測試與生態整合的實際表現。截至本文整理時,該模型仍處於早期訪問階段。
主題