COMPUTER USE / 所有者用ラボ
Computer Use Lab
画面上のどの操作で、モデルがつまずくのか。Canvas、ブラウザー、アルバム編集の課題を選び、操作中の状態とイベントを保存します。細いハンドルのドラッグや、非同期の画面で待つ判断など、具体的な失敗を調べるためのラボです。
画面を操作するAIを評価し、同じ課題で設定や挙動の違いを確かめたい人向け。
本体とガイドはCloudflare Accessによる所有者限定です。この紹介ページから、保存済みの実行やスナップショットは閲覧できません。
課題を選び、操作を記録し、結果を確かめる
- 課題一覧から単問、複数問、または全問を選びます。比較する実行では、問題セット、版、seed、viewport、操作言語をそろえます。
- モデルに課題の画面を操作させます。保存されたイベントとスナップショットから、どこで状態が変わったかを追います。
- 選んだ全問の終了後、モデル名、推論設定、申告トークン数を入力して確定します。アプリの評価器がまとめて採点します。
モデル名・設定・トークン数は実行者の申告です。小さな操作課題の結果だけで、実務全体の能力は判断できません。外部採点は接続設定が必要で、設定不足や失敗を採点済みとは扱いません。
確かめたい操作に合う評価環境を選ぶ
| 環境・版 | 評価対象と確認する条件 |
|---|---|
| Computer Use Lab | このラボ内の個別GUI操作。共通の課題、初期状態、版、seed、viewportをそろえて、操作記録と評価器の結果を確認します。 |
| OSWorld v1 / OSWorld- | 実OS上のWeb・デスクトップアプリや複数アプリをまたぐ課題。Verifiedはタスクと評価基盤を改良したv1系の更新です。実行した版、セットアップ、評価条件を明示します。 |
| WebArena (原版) | 自己ホストできるWebサイト上の作業を、完了状態の正しさで評価。サイトの初期状態、観測方法、タスクごとの評価条件を確認します。 |
| OSWorld 2.0 | 現在の後継版は、長い実務フローや動的な環境を対象にしています。v1 / Verifiedとは別の課題・評価として扱います。 |
公式資料の確認日:。原論文:OSWorld · WebArena · OSWorld 2.0