Tencentが「画面を見て操作する」オープンウェイトAIエージェントを公開──OSWorld-Verifiedで77.0点、手元で動かせるcomputer useの選択肢
Tencent HY Frontierは2026年8月14日、スクリーンショットと自然言語の指示だけからマウス・キーボード操作を出力するGUIエージェント「UI-Mate」をApache-2.0でHugging Faceに公開した。27B/9Bの2サイズとデモ誘導版があり、OSWorld-Verifiedで平均77.0点、WindowsAgentArenaで66.2点を自己申告。ClaudeのComputer Use APIとは別に、重みを自分で動かせる選択肢が中国発で登場した。

目次
「AIにパソコンの画面を見せて操作させる」――いわゆるcomputer use機能は、AnthropicがClaude APIで正式版に格上げしたばかりだ(関連記事)。同じタイミングで、Tencentの研究チーム「HY Frontier」が、重みを自分の環境で動かせるオープンウェイト版のGUIエージェント「UI-Mate」を公開した。
3行まとめ
- Tencent HY Frontierは2026年8月14日、GUIエージェント「UI-Mate」をApache-2.0でHugging Faceに公開した。27B/9Bの2サイズがあり、27B版はOSWorld-Verified 77.0点・WindowsAgentArena 66.2点を自己申告(同社arXiv論文、submitted 2026年8月16日)
- 独自ベンチマーク「OSWorkerBench」(41アプリにまたがる100の長時間タスク)では、ベースモデルのQwen3.6-27Bに対しstrict successで+17.7ポイント、progressで+24.5ポイントの上乗せを報告している
- 「デモを1回見せる」in-context demonstration機能により、OSWorkerBenchの自己デモ設定でstrict successが17.2%→35.4%、progressが67.9%→81.1%に伸びたという結果も同論文に記載されている
モデルの仕組み
Hugging Face上のREADME(一次ソース、curlで確認済み)によれば、UI-Mateは次のように動く。
- ベースモデルはQwen3.6-27B
- 入力:タスクの自然言語指示、スクリーンショット、操作履歴
- 出力:推論内容、簡潔な操作の説明、構造化されたcomputer use用のツール呼び出し
- 操作範囲:マウス・キーボード・スクロール・待機・ユーザーへの問い合わせ・タスク完了
pyautogui互換の構造化アクションを出力し、OpenAI互換のサービング・クライアントインターフェースを持つ- 学習は教師ありファインチューニングの後、実行可能なGUI環境でのオンライン強化学習
- 公式プロジェクトページによれば、この学習パイプラインは「タスク・環境構築 → ロールアウトのフィルタリング → 能力ツリーの再バランス → SFT → オンラインRL」という閉ループのデータフライホイールとして回されている
3つのチェックポイントが公開されている。
| チェックポイント | 想定用途 |
|---|---|
| UI-Mate-27B | 汎用のcomputer use(27B) |
| UI-Mate-9B | 汎用のcomputer use(9B・軽量版) |
| UI-Mate-democua-27B | デモンストレーション誘導型のcomputer use |
「デモンストレーション誘導型」は、arXiv論文のタイトル("Advancing Open-Weight Foundation GUI Agents with In-Context Demonstrations")が示す通り、作業の手順を一度示せば、それを別のタスクに適応させて実行する能力に力点を置いたバージョンとみられる。
ベンチマーク(Tencent自己申告、27B/9Bの両モデルカードで確認)
27B・9Bそれぞれのモデルカード掲載の評価表を並べると次の通り。9BはQwen3.5-9Bをベースにしている(27BはQwen3.6-27Bベース)。
| ベンチマーク | UI-Mate-27B | UI-Mate-9B |
|---|---|---|
| OSWorld-Verified(平均) | 77.0 | 66.2 |
| WindowsAgentArena(平均) | 66.2 | 61.7 |
| OSWorkerBench(strict success) | 41.00 | 34.00 |
| OSWorkerBench(progress) | 76.86 | 66.55 |
いずれもTencent自身の測定によるもので、第三者による再現検証は本記事の調査範囲では確認していない。
独自ベンチマーク「OSWorkerBench」の中身
arXiv論文の要旨(curlで確認)によると、OSWorkerBenchは41のアプリケーションにまたがる100件の「長時間かかるオフィスタスク」で構成される、Tencent自身が今回新設したベンチマークだ。指示のみで解かせる評価に加えて、デモンストレーション付きの評価にも対応しており、デモ用のタスクは2種類に分かれている。
- self-demoセット(33タスク):同じ目標タスクを、性能の高いエージェント自身が過去に成功させた実行記録から作成
- variant-demoセット(45タスク):関連はするが同一ではない別タスクを、人間が操作した記録から作成
論文はUI-Mate-27Bが、ベースにしたQwen3.6-27B(デモ無しの素のモデル)と比べて、OSWorkerBenchのstrict successで+17.7ポイント、progressで+24.5ポイント上回ったと報告している。さらにself-demoセット(33タスク)では、デモを1回見せるだけでstrict successが17.2%から35.4%へ、progressが67.9%から81.1%へ伸びたとしている。この論文の著者リストには29名が名を連ねている(arXivの著者一覧をcurlで確認)。
「デモを1回見せる」仕組み
UI-Mateの公式プロジェクトページ(curlで確認)は、デモンストレーションの取り込み方を具体的なステップで説明している。まず操作をネイティブレコーダーで記録し(掲載サンプルでは82秒・71イベント)、各操作の前後のスクリーンショットとクリック・キー入力・テキストをペアにする。次に視覚言語モデル(VLM)が各ステップに「観察・意図・アクション・検証」のキャプションを付け、71件のイベントを6つのサブタスクへとグルーピングし、人間がレビュー・保存することで再利用可能なデモとしてライブラリ化するという。実行時は、ライブスクリーンショットが常に優先され、記録したデモは「台本」ではなく「ガイド」として扱われる、と公式は説明している。
Hugging Face上の実測(2026年8月29日確認)
27B・9BともにcreatedAtは2026年8月14日で、lastModifiedは2026年8月20日。ダウンロード数・likesは次の通り(Hugging Face API、curlで直接取得)。
| モデル | ダウンロード数 | likes |
|---|---|---|
| UI-Mate-27B | 544 | 85 |
| UI-Mate-9B | 665 | 21 |
前回確認(2026年8月27日時点)の27Bダウンロード数は483件だったため、2日間で60件強増えている計算になる。
なぜ意味があるか
Claude・OpenAIのcomputer use機能は、いずれもクラウドAPI経由の利用が前提になる。UI-Mateはオープンウェイト(Apache-2.0)で公開されているため、自分の環境でモデルを動かして画面操作エージェントを組むという選択肢が生まれる。日本語圏では「AIがコンピュータを操作する」という話題自体がAnthropic・OpenAI側の話に偏りがちで、こうした手元で動かせるオープンウェイトのGUIエージェントという切り口はまだあまり扱われていない。
なお、公式は「UI-Mateはスタンドアロンの視覚対話モデルではなく、エージェントのチェックポイント」だとし、UI-Mateリポジトリの公式プロンプト・レスポンスパーサー・実行ハーネスの利用を推奨している。単純にモデルを読み込んで使えるわけではなく、専用の実行環境が必要になる点は留意したい。
ベンチマークの数字はすべてTencent自身の発表であること
本記事の仕様・ベンチマーク数値はHugging Faceのモデルカード(27B・9Bの両方)とarXiv論文(Submitted 16 Aug 2026)から直接確認したもので、いずれもTencent自身の発表内容。OSWorld-Verified・WindowsAgentArenaという既存の第三者ベンチマークでの77.0点・66.2点という数字も、外部機関による再測定ではなく、Tencentが自社で実行した結果を自己申告したものである点は変わらない。OSWorkerBenchに至っては、評価用のベンチマーク自体をUI-Mateの開発チームが新設したものであり、比較対象の選び方・タスクの難易度設計もTencent側の裁量に委ねられている。
実際にUI-Mateを動かした場合の使い勝手、日本語UIでの動作精度は本記事では検証していない。デモ機構(82秒・71イベントの記録例)についても、公式プロジェクトページに掲載されたサンプル1件を紹介したに過ぎず、記録時間・イベント数がどの程度典型的なのか、記録に失敗しやすいケースがあるかどうかは確認できていない。また、UI-Mateはスタンドアロンでは動かず専用ハーネスが必要なため、本記事で紹介した性能が、そのハーネスへの依存を含んだ数字である点にも留意してほしい。
出典・参照資料
AIニュースの解説を動画でも
YouTubeでは注目ニュースの背景を解説し、Xでは新着記事をお知らせしています。
コメント
まだコメントはありません。最初のコメントを書いてみませんか?
AIについて聞きたいことはありますか?
質問箱で無料で受け付けています。回答は公開され、他の方の参考にもなります。
質問箱を見る →新しい記事をメールで受け取る
AIの新しい発表を、出典付きで整理して届けます。