ホーム / ニュース / AWSがStrands Decider 2Bをオープンソース化、テキスト出力なしでJevBench 72.3%を達成した2Bエージェントモデル
AWS

AWSがStrands Decider 2Bをオープンソース化、テキスト出力なしでJevBench 72.3%を達成した2Bエージェントモデル

2026年10月5日5 分で読了
AWSがStrands Decider 2Bをオープンソース化、テキスト出力なしでJevBench 72.3%を達成した2Bエージェントモデル

ニュース概要

Amazon Web Servicesは、米国東部時間2026年10月1日(木曜日)にStrands Decider 2Bを発表しました。これはテキストを一言も生成できないオープンソースの意思決定モデルです。Strands Labsプログラムを通じてリリースされた約20億パラメータのこのモデルは、ツールの選択、リクエストのルーティング、ポリシーに関する質問の分類など、AIエージェントが常に直面する小規模で日常的な判断を行うために構築されており、より高度な推論には大規模な言語モデルを温存できるようにしています。重み、学習データの出所、スクリプトはApache 2.0ライセンスの下で公開されています。

Strands Decider 2Bとは何か

Strands Decider 2Bはチャットボットではなく、専門特化した「意思決定モデル」です。テキストを生成する代わりに、開発者が提供した選択肢のリストから一つを選び、スコアを割り当てるか、信頼度の推定値を返します。AWSはこれを、エージェント型AIにおける迅速な実験とローカル開発に最適化された、小型で高速なモデルであると説明しています。今回のリリースは、Strands Agentsエコシステムの実験部門であるstrands-labsに追加されました。報道では、これを「システム1」の構成要素、すなわちエージェントの制御ループ内に存在する高速で直感的な判断機構として位置づけています。

Strands Agents SDK自体はこの発表の約16カ月前にリリースされており、その後プロジェクトは2026年9月にリリースされたハーネスを含め、エージェントが必要とする機能の多くをカバーするまでに成長しました。Decider 2Bは、そのスタックに小規模でローカルな部品を追加するものです。

仕組み

Tech TimesおよびThe Letter Twoの報道によると、AWSはAlibabaのオープンなベースモデルQwen3.5-2B(約19億パラメータ)を出発点としました。チームはLoRAを用いてファインチューニングを行いました。これはネットワーク全体を書き換えるのではなく、小さな追加レイヤーを学習させる軽量な手法です。その後、通常はモデルがテキストを生成できるようにする言語モデリングヘッドを削除し、約100万パラメータの「ポインターヘッド」に置き換えました。

ポインターヘッドは、入力に対するモデルの内部表現と各候補オプションを内積を用いて比較し、マスク付きソフトマックスを適用して確率分布を生成します。この設計により、出力は提供された選択肢の範囲に完全に限定されます。モデルは3種類の質問形式に対応しています。はい/いいえ、N個の候補からの選択、順序付けられた評価基準上でのスコア配置です。LoRAはランク16で適用され、ポインターヘッドはfp32精度で動作します。

ベンチマークとレイテンシ

公開されているJevBench v1の評価において、Decider 2Bは231タスク中167タスクに正解し、精度0.723を記録しました。報告されている較正指標には、ブライアスコア0.342、期待較正誤差0.052が含まれます。性能は難易度によって異なり、簡単なタスクではほぼ完璧、標準的なタスクで約87.5%、難しいタスクで約50.5%でした。

順位はメディアによってわずかに異なります。Tech Timesは、2Bクラス33モデル中3位、より大きなモデルを除いた場合は30モデル中1位と報じています。The Letter Twoは、同程度のサイズの公開モデルの中で2位、完全な学習手順を公開しているモデルの中では1位であると説明しています。読者は、正確な順位がリーダーボードのフィルタリング方法に依存することを念頭に置くべきです。

速度について、AWSは意思決定が数十ミリ秒で実行され、広く利用可能なハードウェアでは100ミリ秒未満であると述べています。Tech Timesによる第三者の数値はより保守的で、Nvidia RTX 3090での中央値115ミリ秒(95パーセンタイル299ミリ秒)、Apple M3 Proで300トークン未満の入力に対するウォーム状態での中央値153ミリ秒となっています。同じ入力に対して2つの質問を行う場合、約230ミリ秒かかります。これらのコミュニティによる数値は、AWSによって検証されたものではありません。

学習と再現性

今回のリリースの特徴的な点は、その公開性です。AWSは学習データの出所とライセンス、学習スクリプト、評価ツールを公開しました。Tech Timesの報道によれば、学習にはメモリ24GBのRTX 3090単体で約11時間、あるいは8基のH100 GPUで約1時間10分かかります。また本プロジェクトは、各学習実行の前に予測と失敗条件を文書化しており、これはモデルリリースにおいては珍しい事前登録型の慣行です。

利用可能性とユースケース

モデルはHugging Face(StrandsAgents/strands-decider-2B-hobson-v19)で利用可能であり、コードはGitHub上のstrands-labs/strands-deciderに存在します。pip install strands-deciderでインストールでき、コマンドラインツールとローカルHTTPサーバーが含まれています。サーバーはデフォルトで認証なしにlocalhostをリッスンするため、チームは公開前に独自のアクセス制御を追加する必要があります。CPU、コンシューマー向けGPU、Appleシリコン上で動作し、APIへの依存なくオフラインで利用できます。

推奨される用途には、モデルのルーティング、ツールの選択、メモリとコンテキストの管理、ポリシーの分類、ガードレール、評価、出力の検証が含まれます。ハイブリッド設計では、大規模モデルが複雑な推論を処理し、Decider 2Bが大量の日常的な判断を低コストかつローカルで処理します。

競合環境

今回のリリースは、意思決定モデルプロジェクトの小規模な波の中で登場しました。TypeSafe AIのJevモデルやLocalJev、OpenJevが公開リーダーボードjevbench.devに掲載されており、Cloudflareも同じ週にClefおよびClef-flashモデルをリリースしました。一部の評論家はAWSの動きを商用製品を切り崩すものだと捉えましたが、AWS自身は本プロジェクトを、専門特化したモデルがエージェントの日常的な作業を処理できるかどうかの実験として位置づけています。

学習者にとっての意義

学生や開発者にとって、本プロジェクトはより広範なエンジニアリングの概念を示す明確な例です。すなわち、AIシステムのすべてのステップに大規模な生成モデルが必要なわけではないということです。モデルの出力を固定された選択肢の集合に制限することで、より高速になり、テストしやすくなり、推論も容易になります。コード、データの出所、スクリプトが公開されているため、LoRAによるファインチューニングと較正測定に関する実用的で再現可能なケーススタディにもなっています。

注意点

難しいタスクでの精度が約50%であることは、このモデルがより深い推論の代替にはならないことを示しています。レイテンシに関する主張はハードウェアや情報源によって異なり、一部のベンチマーク数値はAWSではなくコミュニティのテストによるものです。レビューした情報源には発表の正確なタイムスタンプが記載されていなかったため、上記の日付は報道に基づく米国東部時間に従っています。

AWSAIエージェント