ChatGPT 共同創造者的新 Jev 模型捨棄文字,讓 AI 決策快上 200 倍

新聞摘要
一家由 ChatGPT 背後研究人員之一創立的初創公司,推出了一款完全跳過自然語言、改為回傳結構化機率式決策而非文字的人工智慧模型——早期測試者表示,在它鎖定的任務上,它比主流大型語言模型快得多、也便宜得多。這款名為 Jev 的模型來自 TypeSafe AI,由前 OpenAI 研究員 Diogo Almeida 創辦;他被認為是「基於人類回饋的強化學習」(RLHF)的共同發明人,而這項訓練技術普遍被歸功於讓 ChatGPT 及其後續產品得以大規模實用化。
TypeSafe AI 宣布了什麼
TypeSafe AI 在 2026 年 9 月 16 日(美東時間)星期二結束兩年的隱密研發,揭曉其所稱的「第一系統模型」。Jev 不像 GPT 風格的大型語言模型那樣一次一個詞元地生成對話文字,而是設計成直接由其他軟體取用:它接收結構化輸入,回傳具型別標註、附機率分數的輸出——例如將請求分類、為紀錄評分,或標記政策違規——完全不產出任何散文式文字。該公司表示已募得 4,000 萬美元資金,以追求 Almeida 所描述的「一條人工智慧研究的替代路徑,聚焦於機器原生的人工智慧」。
Jev 與傳統 LLM 有何不同
Jev 使用 TypeSafe 稱為「校準決策強化學習」(RLCD)的技術訓練,該公司將其定位為 RLHF 與 RLVR(基於可驗證獎勵的強化學習)的後繼者,而這兩種方法支撐了目前大多數以聊天為導向的模型。Jev 不是依序、逐詞元地預測輸出,而是在單一查詢中平行取樣所有可能的輸出。由於開發者事先定義固定的輸出結構描述,TypeSafe 表示該模型在數學上受到約束,無法產出格式錯誤或「幻覺」的結果——它只能回傳符合所給結構描述的值。
Almeida 將這次發布定調為回應他所看見的產業缺口:「模型多年來在聊天方面已超越人類,那麼自動化究竟在哪裡?」其賣點在於,大多數軟體在處理請求路由、內容排序,或篩檢輸出是否為越獄嘗試等決策時,仍依賴脆弱的手寫規則或緩慢、昂貴的 LLM 呼叫——TypeSafe 主張,這些任務更適合由專門打造的決策引擎來處理,而非通用型聊天機器人。
效能與定價主張
TypeSafe 公布了基準比較,顯示 Jev 約在 70 至 500 毫秒內回應,該公司稱這在可比的結構化決策任務上,比前沿聊天模型快 40 至 200 倍。在一項展示中,該公司讓 Jev 遊玩經典電子遊戲《毀滅戰士》,方式是餵給它結構化的遊戲狀態資料而非影像;TypeSafe 表示 Jev 約在 0.114 秒內回應,而在相同測試設定下,定位相近的 OpenAI 模型約需 8.566 秒。
在定價方面,TypeSafe 將輸入詞元定為每百萬詞元 0.042 美元,輸出詞元則免費提供;該公司將這種結構與對話式 LLM 典型的輸入與輸出分別計價模式作對比。TypeSafe 引用內部工作流程評估,聲稱在某些生產級自動化工作流程上,Jev 比可比的大型語言模型方法快約 193.6 倍、便宜約 444.6 倍,不過這些數字來自該公司自家的基準測試,而非獨立的第三方測試。
開發者的反應
早期採用者的反應明顯相當熱烈。Vercel 的工程師回報,在部分基礎設施中以 Jev 取代 OpenAI 的對話模型後,結果快了 5 至 18 倍,同時維持或提升了準確度。Bryo AI 的工程師表示,他們發現 Jev 比 Google Gemini 系列的可比產品便宜約 10 至 20 倍,同時還提供真正經過校準的機率分數,讓他們更容易建立可靠的工作流程自動化邏輯,而不必從自由文字回應中解析訊號。
發布後的需求強勁到 TypeSafe 表示其 API 一度無法跟上湧入的流量;該公司將這次中斷直接歸因於開發者關注的熱度,而非任何預先規劃的容量限制。
為何這個框架很重要
TypeSafe 為 Jev 取的名字,向 19 世紀經濟學家 William Stanley Jevons 致意;他的悖論主張,當使用某項資源的成本下降時,該資源的總消耗量往往會上升而非下降。Almeida 引用這個概念來描述他對人工智慧決策走向的願景:不是由少數幾個非常大型、通用型的聊天模型處理每一項任務,而是由數量多得多的小型、快速、廉價決策模型嵌入整個軟體基礎設施之中。Almeida 說:「我們認為,智慧軟體將會以一種湧現且分散的方式,遍布各處。」他將第一系統模型描述為大型語言模型的補充,而非替代——後者驅動了對話式人工智慧產品。
接下來會如何
TypeSafe 主要將 Jev 定位於後端與基礎設施用途:模型路由、內容審核與安全篩檢、工作流程自動化,以及大規模資料分類,而非面向消費者的聊天應用。由於該模型的輸出受結構描述約束,而非開放式文字,它並不打算直接與聊天機器人或寫作助理競爭。獨立研究人員與競爭實驗室尚未發表第三方基準,證實 TypeSafe 的效能主張;而第一系統這個類別在更廣泛的真實世界生產工作負載中——超出 TypeSafe 自身強調的用途之外——表現如何,仍有待更多開發者將該模型投入生產後才能見分曉。