OmniParser

純粋な視覚GUIエージェント向けのシンプルな画面解析ツール

Jupyter NotebookCC-BY-4.0Agent
⭐ GitHubhttps://github.com/microsoft/OmniParser
25,193
スター数
+279
スター増加率
Jul 20, 2026
最終更新
1,791
クリック数

OmniParser プロジェクト詳細紹介

プロジェクト概要

OmniParserは、ユーザーインターフェースのスクリーンショットを構造化され、理解しやすい要素に解析するための包括的な手法です。これにより、GPT-4Vがインターフェースの対応する領域を正確に特定できる操作を生成する能力が大幅に向上します。

プロジェクトアドレス: https://github.com/microsoft/OmniParser

コア機能

1. 画面解析能力

  • インタラクティブアイコン検出: ユーザーインターフェース内のインタラクティブなアイコンを確実に識別できます。
  • セマンティック理解: スクリーンショット内のさまざまな要素のセマンティクスを理解し、予想されるアクションを画面上の対応する領域に正確に関連付けます。
  • 構造化された出力: UIスクリーンショットを構造化された形式に変換し、LLMベースのUIエージェントを改善します。

2. 技術アーキテクチャ

OmniParserには、主に2つのコンポーネントが含まれています。

  • インタラクティブアイコン検出データセット: 人気のあるWebページからキュレーションされ、自動的にアノテーションが付けられ、クリック可能で操作可能な領域を強調表示します。
  • アイコン記述データセット: 各UI要素を対応する機能に関連付けます。

主な特徴

OmniTool

OmniTool:OmniParser + 選択したビジュアルモデルを使用してWindows 11仮想マシンを制御します。

サポート機能:

  • マルチエージェントオーケストレーション
  • 軌跡ローカルロギング
  • ドメインのトレーニングデータパイプラインの構築
  • 改善されたユーザーインターフェースエクスペリエンス

サポートされているモデル

  • OpenAI GPT-4o/o1/o3-mini
  • DeepSeek R1
  • Qwen 2.5VL
  • Anthropic Computer Use

インストールと使用

環境設定

cd OmniParser
conda create -n "omni" python==3.12
conda activate omni
pip install -r requirements.txt

モデルウェイトのダウンロード

for f in icon_detect/{train_args.yaml,model.pt,model.yaml} icon_caption/{config.json,generation_config.json,model.safetensors}; do huggingface-cli download microsoft/OmniParser-v2.0 "$f" --local-dir weights; done
mv weights/icon_caption weights/icon_caption_florence

デモの実行

python gradio_demo.py

性能表現

  • Windows Agent Arenaで最高のパフォーマンスを達成
  • Screen Spot Pro GUIロケーションベンチマークで39.5%の最新の最高の結果を達成
  • GUI操作タスクにおけるGPT-4Vの精度を大幅に向上

アプリケーションシナリオ

  1. GUI自動化テスト: ユーザーインターフェース要素を自動的に識別して操作します。
  2. インテリジェントアシスタント開発: グラフィカルインターフェースを理解して操作できるAIアシスタントを構築します。
  3. アクセシビリティ技術: 視覚障害のあるユーザーが画面の内容を理解するのを支援します。
  4. プロセス自動化: 繰り返しのGUI操作タスクを自動化します。
  5. ユーザーエクスペリエンス調査: ユーザーインターフェースの使いやすさとインタラクティブ性を分析します。

技術的優位性

  1. 純粋な視覚的方法: 基盤となるUIコードまたはAPIに依存せず、視覚情報のみで動作します。
  2. 高精度な位置特定: インタラクティブな要素の位置と機能を正確に識別できます。
  3. クロスプラットフォーム互換性: さまざまなオペレーティングシステムとアプリケーションをサポートします。
  4. 拡張性: さまざまな大規模言語モデルとの統合をサポートします。

データセットとモデル

検出モデル

  • YOLOアーキテクチャに基づく
  • AGPLライセンスを使用
  • UI要素の検出専用にトレーニング

記述モデル

  • BLIP2およびFlorenceアーキテクチャに基づく
  • UI要素の機能記述の生成専用

関連リンク