首页 / 资讯 / AWS 开源 Strands Decider 2B:一款在 JevBench 上得分 72.3%、不输出文本的 2B 智能体模型
AWS

AWS 开源 Strands Decider 2B:一款在 JevBench 上得分 72.3%、不输出文本的 2B 智能体模型

2026年10月5日5 分钟阅读
AWS 开源 Strands Decider 2B:一款在 JevBench 上得分 72.3%、不输出文本的 2B 智能体模型

新闻摘要

亚马逊云科技(AWS)于美国东部时间 2026 年 10 月 1 日星期四宣布了 Strands Decider 2B,这是一款连一个字都无法生成的开源决策模型。该模型通过 Strands Labs 项目发布,参数量约为 20 亿,专为处理 AI 智能体不断面临的小型常规选择而设计,例如挑选工具、路由请求或对策略问题进行分类,从而将更复杂的推理任务留给更大的语言模型。其权重、训练数据来源和脚本均依据 Apache 2.0 许可证公开。

Strands Decider 2B 是什么

Strands Decider 2B 是一款专用的“决策模型”,而非聊天机器人。它不会生成文本,而是从开发者提供的选项列表中做出选择、分配分数或返回置信度估计值。AWS 将其描述为一款小巧快速的模型,针对智能 AI 领域的快速实验和本地开发进行了优化。此次发布被纳入 strands-labs,即 Strands Agents 生态系统的实验分支。相关报道将其称为“系统一”组件:一种位于智能体控制循环内部的快速直觉判断机制。

Strands Agents SDK 本身在此次宣布前约 16 个月发布,此后该项目已扩展至涵盖智能体所需的大部分功能,包括 2026 年 9 月发布的一个运行框架。Decider 2B 为该工具栈增添了一个可在本地运行的小型组件。

工作原理

据 Tech Times 和 The Letter Two 报道,AWS 以阿里巴巴开源的 Qwen3.5-2B 基础模型(约 19 亿参数)为起点。团队使用 LoRA 对其进行了微调,这是一种轻量级技术,只训练一个小型附加层,而不重写整个网络。随后,他们移除了通常用于让模型生成文本的语言建模头,并将其替换为一个约 100 万参数的“指针头”。

指针头通过点积运算,将模型对输入的内部表示与每个候选选项进行比较,然后应用掩码 softmax 生成概率分布。由于这种设计,模型的输出完全局限于所提供的选项。该模型支持三种问题类型:是/否、N 个候选项中的选择,以及在有序评分标准上的打分。LoRA 的秩设为 16,指针头以 fp32 精度运行。

基准测试与延迟

在公开的 JevBench v1 评测中,Decider 2B 在 231 项任务中正确回答了 167 项,准确率为 0.723。报告的校准指标包括 Brier 分数 0.342 和预期校准误差 0.052。性能因难度而异:在简单任务上近乎完美,在标准任务上约为 87.5%,在困难任务上约为 50.5%。

不同媒体的排名略有差异。Tech Times 报道称,它在 2B 级别的 33 个模型中排名第三;若排除更大规模的模型,则在 30 个模型中排名第一。The Letter Two 则称,它在同等规模的公开模型中排名第二,在公布了完整训练方案的模型中排名第一。读者应注意,具体排名取决于排行榜的筛选方式。

在速度方面,AWS 表示决策过程仅需数十毫秒,在广泛可用的硬件上低于 100 毫秒。Tech Times 给出的独立数据更为保守:在 Nvidia RTX 3090 上,中位数为 115 毫秒(第 95 百分位数为 299 毫秒);在 Apple M3 Pro 上处理少于 300 个 token 的输入时,预热后的中位数为 153 毫秒。对同一输入提出两个问题大约需要 230 毫秒。这些社区数据未经 AWS 验证。

训练与可复现性

此次发布的一个显著特点是开放性。AWS 公开了训练数据来源及许可证、训练脚本和评测工具。Tech Times 报道称,在单张 24 GB 显存的 RTX 3090 上训练大约需要 11 小时,而在八张 H100 GPU 上大约只需 1 小时 10 分钟。该项目还在每次训练运行前记录了预测结果和失败条件,这种预注册式的做法在模型发布中并不常见。

可用性与应用场景

该模型已在 Hugging Face 上线(StrandsAgents/strands-decider-2B-hobson-v19),代码托管在 GitHub 的 strands-labs/strands-decider 仓库下。可通过 pip install strands-decider 安装,并附带命令行工具和本地 HTTP 服务器。默认情况下,服务器监听 localhost 且无需身份验证,因此团队在对外暴露前应自行添加访问控制。它可以在 CPU、消费级 GPU 或 Apple 芯片上运行,并且能够离线工作,无需依赖 API。

建议的应用场景包括模型路由、工具选择、记忆与上下文管理、策略分类、安全防护栏、评测以及输出验证。在混合架构设计中,大模型负责复杂推理,而 Decider 2B 则以低成本在本地处理高并发的常规决策。

竞争背景

此次发布正值一批决策模型项目涌现之际。TypeSafe AI 的 Jev 模型以及 LocalJev 和 OpenJev 均出现在公开的 jevbench.dev 排行榜上,Cloudflare 也在同一周发布了其 Clef 和 Clef-flash 模型。一些评论人士认为 AWS 此举是在打压商业产品,而 AWS 自身则将该项目定位为一项实验,旨在探索专用模型能否胜任智能体的常规工作。

对学习者的意义

对于学生和开发者而言,该项目清晰地体现了一个更广泛的工程理念:AI 系统中的并非每一步都需要大型生成式模型。将模型的输出限制在一组固定选项中,可以使其运行更快、更易于测试,也更便于理解。由于代码、数据来源和脚本均已开源,它也是一个实用且可复现的案例研究,适用于学习 LoRA 微调和校准测量。

注意事项

困难任务上约 50% 的准确率表明,该模型无法替代更深层次的推理。延迟数据因硬件和信息来源而异,部分基准测试数据来自社区测试而非 AWS。所查阅的资料未给出公告的确切时间戳;上述日期均以报道中的美国东部时间为准。

AWSAI 智能体