AI時短ラボ
モデル· 約10

Tencentが「画面を見て操作する」オープンウェイトAIエージェントを公開──OSWorld-Verifiedで77.0点、手元で動かせるcomputer useの選択肢

Tencent HY Frontierは2026年8月14日、スクリーンショットと自然言語の指示だけからマウス・キーボード操作を出力するGUIエージェント「UI-Mate」をApache-2.0でHugging Faceに公開した。27B/9Bの2サイズとデモ誘導版があり、OSWorld-Verifiedで平均77.0点、WindowsAgentArenaで66.2点を自己申告。ClaudeのComputer Use APIとは別に、重みを自分で動かせる選択肢が中国発で登場した。

Tencentが「画面を見て操作する」オープンウェイトAIエージェントを公開──OSWorld-Verifiedで77.0点、手元で動かせるcomputer useの選択肢
執筆・編集:
目次

「AIにパソコンの画面を見せて操作させる」――いわゆるcomputer use機能は、AnthropicがClaude APIで正式版に格上げしたばかりだ(関連記事)。同じタイミングで、Tencentの研究チーム「HY Frontier」が、重みを自分の環境で動かせるオープンウェイト版のGUIエージェント「UI-Mate」を公開した。

3行まとめ

  1. Tencent HY Frontierは2026年8月14日、GUIエージェント「UI-Mate」をApache-2.0でHugging Faceに公開した。27B/9Bの2サイズがあり、27B版はOSWorld-Verified 77.0点・WindowsAgentArena 66.2点を自己申告(同社arXiv論文、submitted 2026年8月16日)
  2. 独自ベンチマーク「OSWorkerBench」(41アプリにまたがる100の長時間タスク)では、ベースモデルのQwen3.6-27Bに対しstrict successで+17.7ポイント、progressで+24.5ポイントの上乗せを報告している
  3. 「デモを1回見せる」in-context demonstration機能により、OSWorkerBenchの自己デモ設定でstrict successが17.2%→35.4%、progressが67.9%→81.1%に伸びたという結果も同論文に記載されている

モデルの仕組み

Hugging Face上のREADME(一次ソース、curlで確認済み)によれば、UI-Mateは次のように動く。

  • ベースモデルはQwen3.6-27B
  • 入力:タスクの自然言語指示、スクリーンショット、操作履歴
  • 出力:推論内容、簡潔な操作の説明、構造化されたcomputer use用のツール呼び出し
  • 操作範囲:マウス・キーボード・スクロール・待機・ユーザーへの問い合わせ・タスク完了
  • pyautogui互換の構造化アクションを出力し、OpenAI互換のサービング・クライアントインターフェースを持つ
  • 学習は教師ありファインチューニングの後、実行可能なGUI環境でのオンライン強化学習
  • 公式プロジェクトページによれば、この学習パイプラインは「タスク・環境構築 → ロールアウトのフィルタリング → 能力ツリーの再バランス → SFT → オンラインRL」という閉ループのデータフライホイールとして回されている

3つのチェックポイントが公開されている。

チェックポイント 想定用途
UI-Mate-27B 汎用のcomputer use(27B)
UI-Mate-9B 汎用のcomputer use(9B・軽量版)
UI-Mate-democua-27B デモンストレーション誘導型のcomputer use

「デモンストレーション誘導型」は、arXiv論文のタイトル("Advancing Open-Weight Foundation GUI Agents with In-Context Demonstrations")が示す通り、作業の手順を一度示せば、それを別のタスクに適応させて実行する能力に力点を置いたバージョンとみられる。

ベンチマーク(Tencent自己申告、27B/9Bの両モデルカードで確認)

27B・9Bそれぞれのモデルカード掲載の評価表を並べると次の通り。9BはQwen3.5-9Bをベースにしている(27BはQwen3.6-27Bベース)。

ベンチマーク UI-Mate-27B UI-Mate-9B
OSWorld-Verified(平均) 77.0 66.2
WindowsAgentArena(平均) 66.2 61.7
OSWorkerBench(strict success) 41.00 34.00
OSWorkerBench(progress) 76.86 66.55

いずれもTencent自身の測定によるもので、第三者による再現検証は本記事の調査範囲では確認していない。

独自ベンチマーク「OSWorkerBench」の中身

arXiv論文の要旨(curlで確認)によると、OSWorkerBenchは41のアプリケーションにまたがる100件の「長時間かかるオフィスタスク」で構成される、Tencent自身が今回新設したベンチマークだ。指示のみで解かせる評価に加えて、デモンストレーション付きの評価にも対応しており、デモ用のタスクは2種類に分かれている。

  • self-demoセット(33タスク):同じ目標タスクを、性能の高いエージェント自身が過去に成功させた実行記録から作成
  • variant-demoセット(45タスク):関連はするが同一ではない別タスクを、人間が操作した記録から作成

論文はUI-Mate-27Bが、ベースにしたQwen3.6-27B(デモ無しの素のモデル)と比べて、OSWorkerBenchのstrict successで+17.7ポイント、progressで+24.5ポイント上回ったと報告している。さらにself-demoセット(33タスク)では、デモを1回見せるだけでstrict successが17.2%から35.4%へ、progressが67.9%から81.1%へ伸びたとしている。この論文の著者リストには29名が名を連ねている(arXivの著者一覧をcurlで確認)。

「デモを1回見せる」仕組み

UI-Mateの公式プロジェクトページ(curlで確認)は、デモンストレーションの取り込み方を具体的なステップで説明している。まず操作をネイティブレコーダーで記録し(掲載サンプルでは82秒・71イベント)、各操作の前後のスクリーンショットとクリック・キー入力・テキストをペアにする。次に視覚言語モデル(VLM)が各ステップに「観察・意図・アクション・検証」のキャプションを付け、71件のイベントを6つのサブタスクへとグルーピングし、人間がレビュー・保存することで再利用可能なデモとしてライブラリ化するという。実行時は、ライブスクリーンショットが常に優先され、記録したデモは「台本」ではなく「ガイド」として扱われる、と公式は説明している。

Hugging Face上の実測(2026年8月29日確認)

27B・9BともにcreatedAtは2026年8月14日で、lastModifiedは2026年8月20日。ダウンロード数・likesは次の通り(Hugging Face API、curlで直接取得)。

モデル ダウンロード数 likes
UI-Mate-27B 544 85
UI-Mate-9B 665 21

前回確認(2026年8月27日時点)の27Bダウンロード数は483件だったため、2日間で60件強増えている計算になる。

なぜ意味があるか

Claude・OpenAIのcomputer use機能は、いずれもクラウドAPI経由の利用が前提になる。UI-Mateはオープンウェイト(Apache-2.0)で公開されているため、自分の環境でモデルを動かして画面操作エージェントを組むという選択肢が生まれる。日本語圏では「AIがコンピュータを操作する」という話題自体がAnthropic・OpenAI側の話に偏りがちで、こうした手元で動かせるオープンウェイトのGUIエージェントという切り口はまだあまり扱われていない。

なお、公式は「UI-Mateはスタンドアロンの視覚対話モデルではなく、エージェントのチェックポイント」だとし、UI-Mateリポジトリの公式プロンプト・レスポンスパーサー・実行ハーネスの利用を推奨している。単純にモデルを読み込んで使えるわけではなく、専用の実行環境が必要になる点は留意したい。

ベンチマークの数字はすべてTencent自身の発表であること

本記事の仕様・ベンチマーク数値はHugging Faceのモデルカード(27B・9Bの両方)とarXiv論文(Submitted 16 Aug 2026)から直接確認したもので、いずれもTencent自身の発表内容。OSWorld-Verified・WindowsAgentArenaという既存の第三者ベンチマークでの77.0点・66.2点という数字も、外部機関による再測定ではなく、Tencentが自社で実行した結果を自己申告したものである点は変わらない。OSWorkerBenchに至っては、評価用のベンチマーク自体をUI-Mateの開発チームが新設したものであり、比較対象の選び方・タスクの難易度設計もTencent側の裁量に委ねられている。

実際にUI-Mateを動かした場合の使い勝手、日本語UIでの動作精度は本記事では検証していない。デモ機構(82秒・71イベントの記録例)についても、公式プロジェクトページに掲載されたサンプル1件を紹介したに過ぎず、記録時間・イベント数がどの程度典型的なのか、記録に失敗しやすいケースがあるかどうかは確認できていない。また、UI-Mateはスタンドアロンでは動かず専用ハーネスが必要なため、本記事で紹介した性能が、そのハーネスへの依存を含んだ数字である点にも留意してほしい。

シェア: ポスト はてブ

出典・参照資料

AIニュースの解説を動画でも

YouTubeでは注目ニュースの背景を解説し、Xでは新着記事をお知らせしています。

コメント

まだコメントはありません。最初のコメントを書いてみませんか?

AIについて聞きたいことはありますか?

質問箱で無料で受け付けています。回答は公開され、他の方の参考にもなります。

質問箱を見る →

新しい記事をメールで受け取る

AIの新しい発表を、出典付きで整理して届けます。

関連記事

Qwen3.8-27Bが公開──1枚のGPUに収まる密モデルで動画も読める、ダウンロード330万回・likes 1.3万で中国勢8月最多の記事画像
モデル09.07読了14

Qwen3.8-27Bが公開──1枚のGPUに収まる密モデルで動画も読める、ダウンロード330万回・likes 1.3万で中国勢8月最多

出典 ─ Hugging Face
Qwen3.8-Maxの重みは「Apache 2.0ではない」──売上5,000万ドル超のAIサービス事業者だけに求められる別途契約を条文で読むの記事画像
モデル09.06読了10

Qwen3.8-Maxの重みは「Apache 2.0ではない」──売上5,000万ドル超のAIサービス事業者だけに求められる別途契約を条文で読む

出典 ─ Hugging Face
派手な発表の裏で静かに公開された中国勢3モデル──文書検索・マルチモーダル埋め込み・動画編集パイプライン【2026年8月】の記事画像
モデル09.05読了12

派手な発表の裏で静かに公開された中国勢3モデル──文書検索・マルチモーダル埋め込み・動画編集パイプライン【2026年8月】

出典 ─ Hugging Face API: Byte
748Bのモデルなのに動くのは1B──MindLabのMacaron-V1-Ventiが採るMixture-of-LoRA構成を、公開モデルカードで読むの記事画像
モデル09.03読了13

748Bのモデルなのに動くのは1B──MindLabのMacaron-V1-Ventiが採るMixture-of-LoRA構成を、公開モデルカードで読む

出典 ─ mindlab-research/Macar
DeepSeek-V4.1-Flash公開──出力100万トークン0.6ドル、KVキャッシュは1トークン890バイトの記事画像
モデル09.10読了15

DeepSeek-V4.1-Flash公開──出力100万トークン0.6ドル、KVキャッシュは1トークン890バイト

出典 ─ DeepSeek公式 Change Log(
ベースモデルを凍結し、LoRAをターンごとに切り替える──Macaron-V1が選んだ「継続学習」への回り道の記事画像
モデル09.02読了15

ベースモデルを凍結し、LoRAをターンごとに切り替える──Macaron-V1が選んだ「継続学習」への回り道

出典 ─ Macaron-V1: Towards Op
テンセントのHy4 previewはClaude Haikuより安い──公開ベンチ46行を数えたらKimi K3と23勝22敗だったの記事画像
モデル08.28読了16

テンセントのHy4 previewはClaude Haikuより安い──公開ベンチ46行を数えたらKimi K3と23勝22敗だった

出典 ─ Tencent「Introducing Hy
AlibabaがQwen4の仕組みを先行公開──Qwen3.8-Flash-Next、動くのは6Bで最上位級の性能の記事画像
モデル08.26読了7

AlibabaがQwen4の仕組みを先行公開──Qwen3.8-Flash-Next、動くのは6Bで最上位級の性能

出典 ─ Qwen公式ブログ: Qwen3.8-Fla