AI時短ラボ
モデル· 約16

テンセントのHy4 previewはClaude Haikuより安い──公開ベンチ46行を数えたらKimi K3と23勝22敗だった

Tencentが2026年8月28日に公開した「Hy4 preview」は、出力が100万トークンあたり2.501ドルでClaude Haiku 4.5の5ドルを下回る。発表ページの付録ベンチマーク表46行を1行ずつ数えたところ、Kimi K3とは23勝22敗のほぼ互角。ただし相手をGPT 5.6 Solに変えると11勝35敗で、検索・STEM・推論は1行も勝てていない。

テンセントのHy4 previewはClaude Haikuより安い──公開ベンチ46行を数えたらKimi K3と23勝22敗だった
執筆・編集:
目次

Tencentは2026年8月28日、大規模言語モデル「Hy4 preview」を公開した。同社の発表によると総パラメータ770B・アクティブ49B・コンテキスト100万トークンで、重みはGitHub・Hugging Face・ModelScope・AtomGitに置かれている。

目を引いたのは料金だった。出力が100万トークンあたり2.501ドル。Anthropicのラインナップで最も小さく安いClaude Haiku 4.5が5.000ドルなので、その半額を下回る。文脈長はHaikuの20万トークンに対し100万トークンで、5倍以上入る。

同社の発表ページには総合スコアが載っていない。そこで付録のベンチマーク表46行を書き起こして1行ずつ数えたところ、Kimi K3とは23勝22敗だった。ただし同じ表で相手をGPT 5.6 Solに変えると11勝35敗になる。以下、数え方も含めて全部書く。

動画版でも同じ内容を扱っている(11分29秒): 【速報】Hy4 preview登場 Kimi K3と同等性能でClaude Haikuより安い

3行まとめ

  • Tencent「Hy4 preview」は入力0.834ドル/出力2.501ドル(100万トークンあたり)で、Claude Haiku 4.5の1.000ドル/5.000ドルより安い。コンテキストは100万トークン
  • 発表ページの付録表46行を当方で数えた結果、Kimi K3とは23勝22敗。K3の出力単価は15.000ドルで、Hy4の6.0倍
  • ただしGPT 5.6 Solとは11勝35敗。検索5件・STEM 2件・推論8件は1行も勝てていない

料金は2つのソースで一致した

Hy4 previewの料金は、Tencentの発表ページに記載された数字と、OpenRouterのModels APIが返す数字が一致した。自社発表だけに乗った数字ではない。

モデル 入力 $/1M 出力 $/1M 文脈長
Hy4 preview 0.834 2.501 100万
Claude Haiku 4.5 1.000 5.000 20万
GLM 5.3 1.400 4.400 100万
Claude Sonnet 5 2.000 10.000 100万
GPT 5.6 Sol 2.000 10.000 105万
Kimi K3 3.000 15.000 100万
Claude Opus 5 5.000 25.000 100万

(OpenRouter Models API・2026年8月28日取得。すべて通常料金)

Claude Opus 5と比べると出力で10.0倍、GPT 5.6 Solと比べると4.0倍安い。入力の差(Opus 5比6.0倍)より出力の差のほうが大きく開いている。コード生成や長文変換のように出力トークンが多い用途ほど、請求額の差が広がる形になる。

安く出せる理由は構造にあると見られる。同社の発表によると770Bのうち1回の応答で動くのは49Bで、残りは使われない。推論時の計算量は49B級ということになる。

前世代からの間隔は51日だった

Tencentは同じ発表ページの付録で、前世代Hy3との比較も出している。

ベンチマーク Hy3 Hy4 preview
DeepSWE 28.0 64.3
SWE-Marathon 5.0 31.9
MathArena Apex 2025 38.7 74.2
SWE Atlas - Codebase Q&A 30.8 64.0
GDPval-AA V2 (Elo) 1213 1678

Hy3の公開は2026年7月8日、Hy4 previewは8月28日。間は51日しかない。SWE-Marathonの5.0から31.9のような動き方は、改善というより作り直しに近い。

なお同社は注記で、Hy3の一部スコアがハーネス・judgeモデル・アンチハッキング機構の更新により過去公表値と異なると書いている。上の表のHy3側は、その更新後の値である。

総合スコアは公式には存在しない。だから数えた

Tencentは発表ページ本文で、社内エキスパート163人が203件のエンジニアリングタスクでブラインド評価した結果を出している。Kimi K3に対して平均2.99対2.94(勝51.2%/分7.9%/負40.9%)、GLM 5.3に対して2.99対2.92(勝46.8%/分12.8%/負40.4%)。どちらもHy4がわずかに上だが、社内の人が社内のタスクで自社実施した評価であり、第三者評価ではない。

一方、付録のベンチマーク表には総合スコアが載っていない。そこで当方で表を全部書き起こし、Hy4 previewのほうが高い行を「勝ち」として数えた。以下はTencentの主張ではなく当方の集計である。

対 Kimi K3(45行)

分野 Hy4の勝
コーディング 7 8
検索 3 2
業務エージェント 9 6
STEM 1 1
推論 3 5
合計 23 22

表は46行あるが、Kimi K3の欄が空の1行(Harbor-Index)を除いた45行で数えた。表には数字が2つ併記されているセルがあり、2つ目を採ると24勝21敗、Tencentの社内ベンチ(名前が Hy- で始まるもの)を除くと20勝18敗になる。どう数えても差は1行から3行で、勝ったとは言えない。互角という言い方のほうが正確だと考える。

分野別に見ると偏りがある。業務エージェントは9勝6敗で勝ち越しているが、コーディングは7勝8敗で負け越している。得意そうに見える分野で勝てていない。

対 GPT 5.6 Sol(46行)

同じ表のまま相手を変えると、景色が変わる。

分野 Hy4の勝
コーディング 6 10
業務エージェント 5 10
検索 0 5
STEM 0 2
推論 0 8
合計 11 35

検索・STEM・推論の15行は1行も取れていない。併記セルの1つ目を採っても2つ目を採っても11勝35敗で変わらなかった。

勝った11行の中身も偏っている。SWE-bench MultilingualとSWE-bench Pro、SWE Atlasの3種、NL2Repo-Bench、OfficeQA Pro、MCP-Atlas、Toolathlon-Verified、SkillsBench、JobBench。リポジトリを触る仕事と、ツールを呼ぶ仕事に集まっている。

個別の数字で言うと、Terminal-Bench 2.1はHy4が85.4で、GPT 5.6 Solの88.8、Kimi K3の88.3、GLM 5.3の88.2に届いていない。CritPtは16.9で、GPT 5.6 Solの32.3のおよそ半分である。

自社ベンチで負けた行を載せている

自社発表の表は、都合のいい種目だけを並べれば作れる。そこを確かめる手がかりが表の中にあった。

Tencentは自分で作った社内ベンチを表に載せているが、そのうち3つでHy4はKimi K3に負けている

社内ベンチ Hy4 preview Kimi K3
Hy-Backend 2.0 35.2 37.9
Hy-SWE Max Verified 64.2 65.6
Hy-CompanyBench V2 62.4 63.3

自分の作った試験で負けた結果を、隠せる場所で隠していない。

注記も細かい。推論系8ベンチのうちClaude Opus 5の5件はhigh設定で実行しており、その設定での打ち切り率がHLE 2.32%、ArXivMath 15.17%、HorizonMath 28.76%、MathArena Apex 2025 5.86%、BrokenArXiv 17.17%だったと書いてある。つまりOpus 5の推論スコアは本来より低く出ている可能性があると、Tencent自身が申告している。

もうひとつ目に付いたのは評価ハーネスだ。Terminal Bench 2.1、SkillsBench、SWE-Atlas、NL2Repo、ProgramBench、BioMystery、OfficeQA Proなどで、Claude Codeを測定の道具として使っている(GPT系のみCodex CLIに差し替え)。他社の道具で自社モデルを測り、その条件を公開している。

「Haikuより安い」に付く3つの条件

冒頭の比較には但し書きが要る。3つとも都合の悪い方向の話だが、全部書く。

1. Haikuにはバッチ料金がある。 Claude Haiku 4.5のバッチ料金は入力0.500ドル/出力2.500ドル。入力はHaikuのほうが安く、出力は2.500ドル対2.501ドルでほぼ同額になる。すぐ結果が要らない用途では差が消える。

2. Hy4は最安ではない。 DeepSeek V4 Pro(無印)は入力0.870ドル/出力1.740ドルで、出力はHy4より約3割安い。Flash系まで含めればGLM 5.3-Flashが0.075ドル/0.250ドル、DeepSeek V4 Flashが0.089ドル/0.177ドルと桁が違う。

3. OpenAIのGPT 5.6 Lunaのほうが安い。 入力0.200ドル/出力1.200ドル、文脈長105万トークン。3軸すべてでHy4を下回る。ただしLunaはTencentの付録表に列が無いため、Hy4との性能比較データは存在しない。強いか弱いかは、この記事の材料では判断できない。

正確に言えば「Hy4はフラッグシップ帯としては安い」であって、「最安」ではない。

実際に触ってみて分かったこと

この記事を書くにあたって発表ページを取得しようとしたが、curl はTencent Cloud EdgeOneのWAFに拒否された(HTTP 567 / Restricted Access)。ブラウザで開き直して本文と付録表を読んでいる。プログラムから機械的に読ませない設定になっている発表ページは、それほど多くない。

もうひとつ。発表ページのコメント欄は、当方が確認した時点で0件だった。日本語圏でDeepSeek・Qwen・Kimi・GLMの名前は記事で見かけるが、Tencentの言語モデルはほとんど話題にならない。検索ボリュームを測ったわけではないので数字では示せないが、コメント0件は画面上の事実として書いておく。

この記事で確かめられなかったこと

  • ベンチマーク表の値は大半がTencentの自社テストである(表内の * 印)。第三者による再現ではない。
  • 勝敗の集計は当方が表を書き起こして数えたもので、公式の指標ではない。数え方(併記セルの扱い、除外行)は本文に書いたとおり。
  • 表には Hy- で始まる社内ベンチが複数含まれており、外部から再現できない。
  • GPT 5.6 Lunaとの性能比較は、比較データが公開されていないため不明のまま残る。
  • 実際にモデルを走らせての検証はしていない。この記事は公開資料の突き合わせに限定している。
  • 価格・スペックは2026年8月28日時点。preview版のため、正式版で変わる可能性がある。実際、前世代Hy3は0.132ドル/0.528ドルだったので、Hy4では入力6.3倍・出力4.7倍の値上げになっている。

Hy4を選ぶ基準を3つ置く

材料から言えることを3つ。

出力トークンを大量に吐かせる用途では単価差がそのまま請求額に出る。Hy4の2.501ドルはGPT 5.6 Solの10.000ドルの4分の1で、重みが公開されているので自前で動かす道も残る。

推論・検索・科学が要る用途では、GPT 5.6 Sol相手に0勝の領域である。少なくとも現時点の公開データからは、ここで乗り換える根拠はない。

料金を比べるときは入力と出力を分ける。Hy4とHaiku 4.5は入力では1.2倍差だが、出力では2.0倍差になる。どちらのトークンが多く出る仕事かで、選ぶモデルが変わる。

安いモデルを高いモデルの下位互換として並べると、この形は見えない。得意な領域が違う別の刃として持つほうが、今の状況には合っている。


関連記事

出典

数え直したい方のために条件を残しておく。比較列はHy4 preview / Kimi K3 / GPT 5.6 Sol、併記セルは1つ目を採用(2つ目でも結論は同じ)、対K3はKimi K3の欄が空の1行を除いた45行、対GPT 5.6 Solは46行全部。ここと違う結果になった場合は指摘してほしい。訂正が必要なら記事冒頭に注記を出す。

関連記事

シェア: ポスト はてブ

出典・参照資料

YouTubeで見る ↗

AIニュースの解説を動画でも

YouTubeでは注目ニュースの背景を解説し、Xでは新着記事をお知らせしています。

コメント

まだコメントはありません。最初のコメントを書いてみませんか?

AIについて聞きたいことはありますか?

質問箱で無料で受け付けています。回答は公開され、他の方の参考にもなります。

質問箱を見る →

新しい記事をメールで受け取る

AIの新しい発表を、出典付きで整理して届けます。

関連記事

DeepSeek-V4.1-Flash公開──出力100万トークン0.6ドル、KVキャッシュは1トークン890バイトの記事画像
モデル09.10読了15

DeepSeek-V4.1-Flash公開──出力100万トークン0.6ドル、KVキャッシュは1トークン890バイト

出典 ─ DeepSeek公式 Change Log(
XiaomiがMiMo-V2.6を公開──1.02兆パラメータのオープンウェイト、公式掲載のArtificial Analysis指数46、価格はV2.5据え置きの記事画像
モデル09.21読了22

XiaomiがMiMo-V2.6を公開──1.02兆パラメータのオープンウェイト、公式掲載のArtificial Analysis指数46、価格はV2.5据え置き

出典 ─ Xiaomi MiMo 公式ブログ: Int
ベースモデルを凍結し、LoRAをターンごとに切り替える──Macaron-V1が選んだ「継続学習」への回り道の記事画像
モデル09.02読了15

ベースモデルを凍結し、LoRAをターンごとに切り替える──Macaron-V1が選んだ「継続学習」への回り道

出典 ─ Macaron-V1: Towards Op
748Bのモデルなのに動くのは1B──MindLabのMacaron-V1-Ventiが採るMixture-of-LoRA構成を、公開モデルカードで読むの記事画像
モデル09.03読了13

748Bのモデルなのに動くのは1B──MindLabのMacaron-V1-Ventiが採るMixture-of-LoRA構成を、公開モデルカードで読む

出典 ─ mindlab-research/Macar
Alibaba、Qwen3.8-Omni-Flashを発表──音声1時間の入力が1セント未満、会議の文字起こしはDER 88.1→3.4、Gemini 3.8 Flashに音声で上・動画推論で下、重みは非公開の記事画像
モデル09.18読了20

Alibaba、Qwen3.8-Omni-Flashを発表──音声1時間の入力が1セント未満、会議の文字起こしはDER 88.1→3.4、Gemini 3.8 Flashに音声で上・動画推論で下、重みは非公開

出典 ─ Qwen公式ブログ「Qwen3.8-Omni
エージェントのプロンプト・ツール・スキルを「失敗トレースから」自動改善するcap-evolve──held-out評価で+58.3%の実測値の記事画像
検証09.01読了15

エージェントのプロンプト・ツール・スキルを「失敗トレースから」自動改善するcap-evolve──held-out評価で+58.3%の実測値

出典 ─ skillberry-ai/cap-evol
月額9.99ドルでオープンウェイトモデル使い放題──Cline「ClinePass」の中身と、8月26日にtasksツールへ入った変更の記事画像
検証09.01読了21

月額9.99ドルでオープンウェイトモデル使い放題──Cline「ClinePass」の中身と、8月26日にtasksツールへ入った変更

出典 ─ Cline公式ブログ: ClinePass,
プロンプトではなく「プログラムの構造」自体を最適化する──DSPyの実験的機能`dspy.Flex`の記事画像
検証09.02読了14

プロンプトではなく「プログラムの構造」自体を最適化する──DSPyの実験的機能`dspy.Flex`

出典 ─ stanfordnlp/dspy 3.3.0