首頁 / 資訊 / AWS 開源 Strands Decider 2B:一款在 JevBench 上達 72.3% 分數且無文字輸出的 2B 智慧體模型
AWS

AWS 開源 Strands Decider 2B:一款在 JevBench 上達 72.3% 分數且無文字輸出的 2B 智慧體模型

2026年10月5日5 分鐘閱讀
AWS 開源 Strands Decider 2B:一款在 JevBench 上達 72.3% 分數且無文字輸出的 2B 智慧體模型

新聞摘要

Amazon Web Services 於美東時間 2026 年 10 月 1 日(星期四)宣布了 Strands Decider 2B,這是一款連一個字都寫不出來的開源決策模型。這款約 20 億參數的模型透過 Strands Labs 計畫發布,專為處理 AI 智慧體不斷面臨的小型日常選擇而設計,例如挑選工具、路由請求或分類政策問題,同時將較大型的語言模型保留給更困難的推理任務。其權重、訓練資料來源與腳本皆依 Apache 2.0 授權公開。

Strands Decider 2B 是什麼

Strands Decider 2B 是一款專門的「決策模型」,而非聊天機器人。它不會生成文字,而是從開發者提供的選項清單中進行挑選、指派分數,或回傳信心估計值。AWS 將其描述為一款小型、快速的模型,針對 Agentic AI 中的快速實驗與本機開發進行了最佳化。此次發布被納入 strands-labs,即 Strands Agents 生態系的實驗部門。相關報導將其形容為「系統一」元件:一種存在於智慧體控制迴圈內、快速且直覺的判斷機制。

Strands Agents SDK 本身大約在此公告前 16 個月發布,此後該專案已擴展至涵蓋智慧體所需的大部分功能,包括 2026 年 9 月發布的一個執行框架。Decider 2B 則為該技術堆疊增添了一個小型的本機組件。

運作原理

根據 Tech Times 與 The Letter Two 的報導,AWS 是以阿里巴巴的開放式 Qwen3.5-2B 基礎模型(約 19 億參數)為起點。團隊使用 LoRA 對其進行微調,這是一種輕量級技術,僅訓練一個小型附加層,而非重寫整個網路。接著,他們移除了通常讓模型能夠產生文字的語言建模頭,並以一個約 100 萬參數的「指標頭」取而代之。

指標頭會利用點積,將模型對輸入內容的內部表示與每個候選選項進行比較,然後套用遮罩 softmax 來產生機率分布。由於這樣的設計,輸出完全受限於所提供的選項。該模型支援三種問題類型:是/否、N 個候選選項中的選擇,以及在有序評分標準上的分數配置。LoRA 以秩 16 進行套用,而指標頭則以 fp32 精度執行。

基準測試與延遲

在公開的 JevBench v1 評估中,Decider 2B 正確回答了 231 項任務中的 167 項,準確率為 0.723。回報的校準數據包括 Brier 分數 0.342 與預期校準誤差 0.052。效能因難度而異:在簡單任務上近乎完美,標準任務約 87.5%,困難任務則約 50.5%。

各家媒體的排名略有不同。Tech Times 報導其在 2B 級別的 33 款模型中名列第三,若排除較大型模型,則在 30 款模型中排名第一。The Letter Two 則描述其在規模相近的公開模型中排名第二,而在公布完整訓練流程的模型中排名第一。讀者應注意,確切排名取決於排行榜的篩選方式。

在速度方面,AWS 表示決策可在數十毫秒內完成,在普遍可用的硬體上低於 100 毫秒。Tech Times 提供的獨立數據則較為保守:在 Nvidia RTX 3090 上,中位數為 115 毫秒(第 95 百分位數為 299 毫秒);在 Apple M3 Pro 上處理少於 300 個 token 的輸入時,預熱後的中位數為 153 毫秒。針對同一輸入提出兩個問題約需耗費 230 毫秒。這些社群數據未經 AWS 驗證。

訓練與可重現性

此次發布的一大特色在於開放性。AWS 公布了訓練資料來源與授權、訓練腳本以及評估工具。Tech Times 報導指出,在單張配備 24 GB 記憶體的 RTX 3090 上,訓練約需 11 小時;若使用八張 H100 GPU,則約需 1 小時 10 分鐘。該專案還會在每次訓練執行前記錄預測結果與失敗條件,這種類似預註冊的做法在模型發布中並不常見。

可用性與應用情境

該模型可在 Hugging Face 上取得(StrandsAgents/strands-decider-2B-hobson-v19),程式碼則存放於 GitHub 的 strands-labs/strands-decider 下。安裝方式為 pip install strands-decider,並內建命令列工具與本機 HTTP 伺服器。該伺服器預設在 localhost 上監聽且不設驗證,因此團隊在對外公開前應自行加入存取控制。它可在 CPU、消費級 GPU 或 Apple Silicon 上執行,並且能在離線狀態下運作,無需依賴 API。

建議用途包括模型路由、工具選擇、記憶體與上下文管理、政策分類、防護機制、評估與輸出驗證。在混合式設計中,大型模型負責處理複雜推理,而 Decider 2B 則以低成本在本機處理大量的日常決策。

競爭態勢

此次發布正值一波小型決策模型專案浪潮。TypeSafe AI 的 Jev 模型,以及 LocalJev 與 OpenJev,皆出現在公開的 jevbench.dev 排行榜上,而 Cloudflare 也在同一週發布了其 Clef 與 Clef-flash 模型。部分評論人士認為 AWS 此舉是在削弱商業產品,但 AWS 自身則將該專案定位為一項實驗,旨在驗證專用模型是否能處理智慧體的日常工作。

對學習者的意義

對學生與開發者而言,該專案清楚示範了一項更廣泛的工程理念:AI 系統中的每個步驟並非都需要大型生成式模型。將模型的輸出限制在一組固定選項內,能使其更快、更容易測試,也更容易推論。由於程式碼、資料來源與腳本皆為開放,它也成為 LoRA 微調與校準測量的一個實用且可重現的案例研究。

注意事項

困難任務約 50% 的準確率顯示,該模型無法取代更深層的推理。延遲數據會因硬體與來源而異,且部分基準測試數字來自社群測試而非 AWS。所查閱的來源並未提供公告的確切時間戳記;上述日期皆依報導中的美東時間為準。

AWSAI 智慧體