テンセントのHy4 previewはClaude Haikuより安い──公開ベンチ46行を数えたらKimi K3と23勝22敗だった
Tencentが2026年8月28日に公開した「Hy4 preview」は、出力が100万トークンあたり2.501ドルでClaude Haiku 4.5の5ドルを下回る。発表ページの付録ベンチマーク表46行を1行ずつ数えたところ、Kimi K3とは23勝22敗のほぼ互角。ただし相手をGPT 5.6 Solに変えると11勝35敗で、検索・STEM・推論は1行も勝てていない。

目次
Tencentは2026年8月28日、大規模言語モデル「Hy4 preview」を公開した。同社の発表によると総パラメータ770B・アクティブ49B・コンテキスト100万トークンで、重みはGitHub・Hugging Face・ModelScope・AtomGitに置かれている。
目を引いたのは料金だった。出力が100万トークンあたり2.501ドル。Anthropicのラインナップで最も小さく安いClaude Haiku 4.5が5.000ドルなので、その半額を下回る。文脈長はHaikuの20万トークンに対し100万トークンで、5倍以上入る。
同社の発表ページには総合スコアが載っていない。そこで付録のベンチマーク表46行を書き起こして1行ずつ数えたところ、Kimi K3とは23勝22敗だった。ただし同じ表で相手をGPT 5.6 Solに変えると11勝35敗になる。以下、数え方も含めて全部書く。
動画版でも同じ内容を扱っている(11分29秒): 【速報】Hy4 preview登場 Kimi K3と同等性能でClaude Haikuより安い
3行まとめ
- Tencent「Hy4 preview」は入力0.834ドル/出力2.501ドル(100万トークンあたり)で、Claude Haiku 4.5の1.000ドル/5.000ドルより安い。コンテキストは100万トークン
- 発表ページの付録表46行を当方で数えた結果、Kimi K3とは23勝22敗。K3の出力単価は15.000ドルで、Hy4の6.0倍
- ただしGPT 5.6 Solとは11勝35敗。検索5件・STEM 2件・推論8件は1行も勝てていない
料金は2つのソースで一致した
Hy4 previewの料金は、Tencentの発表ページに記載された数字と、OpenRouterのModels APIが返す数字が一致した。自社発表だけに乗った数字ではない。
| モデル | 入力 $/1M | 出力 $/1M | 文脈長 |
|---|---|---|---|
| Hy4 preview | 0.834 | 2.501 | 100万 |
| Claude Haiku 4.5 | 1.000 | 5.000 | 20万 |
| GLM 5.3 | 1.400 | 4.400 | 100万 |
| Claude Sonnet 5 | 2.000 | 10.000 | 100万 |
| GPT 5.6 Sol | 2.000 | 10.000 | 105万 |
| Kimi K3 | 3.000 | 15.000 | 100万 |
| Claude Opus 5 | 5.000 | 25.000 | 100万 |
(OpenRouter Models API・2026年8月28日取得。すべて通常料金)
Claude Opus 5と比べると出力で10.0倍、GPT 5.6 Solと比べると4.0倍安い。入力の差(Opus 5比6.0倍)より出力の差のほうが大きく開いている。コード生成や長文変換のように出力トークンが多い用途ほど、請求額の差が広がる形になる。
安く出せる理由は構造にあると見られる。同社の発表によると770Bのうち1回の応答で動くのは49Bで、残りは使われない。推論時の計算量は49B級ということになる。
前世代からの間隔は51日だった
Tencentは同じ発表ページの付録で、前世代Hy3との比較も出している。
| ベンチマーク | Hy3 | Hy4 preview |
|---|---|---|
| DeepSWE | 28.0 | 64.3 |
| SWE-Marathon | 5.0 | 31.9 |
| MathArena Apex 2025 | 38.7 | 74.2 |
| SWE Atlas - Codebase Q&A | 30.8 | 64.0 |
| GDPval-AA V2 (Elo) | 1213 | 1678 |
Hy3の公開は2026年7月8日、Hy4 previewは8月28日。間は51日しかない。SWE-Marathonの5.0から31.9のような動き方は、改善というより作り直しに近い。
なお同社は注記で、Hy3の一部スコアがハーネス・judgeモデル・アンチハッキング機構の更新により過去公表値と異なると書いている。上の表のHy3側は、その更新後の値である。
総合スコアは公式には存在しない。だから数えた
Tencentは発表ページ本文で、社内エキスパート163人が203件のエンジニアリングタスクでブラインド評価した結果を出している。Kimi K3に対して平均2.99対2.94(勝51.2%/分7.9%/負40.9%)、GLM 5.3に対して2.99対2.92(勝46.8%/分12.8%/負40.4%)。どちらもHy4がわずかに上だが、社内の人が社内のタスクで自社実施した評価であり、第三者評価ではない。
一方、付録のベンチマーク表には総合スコアが載っていない。そこで当方で表を全部書き起こし、Hy4 previewのほうが高い行を「勝ち」として数えた。以下はTencentの主張ではなく当方の集計である。
対 Kimi K3(45行)
| 分野 | Hy4の勝 | 負 |
|---|---|---|
| コーディング | 7 | 8 |
| 検索 | 3 | 2 |
| 業務エージェント | 9 | 6 |
| STEM | 1 | 1 |
| 推論 | 3 | 5 |
| 合計 | 23 | 22 |
表は46行あるが、Kimi K3の欄が空の1行(Harbor-Index)を除いた45行で数えた。表には数字が2つ併記されているセルがあり、2つ目を採ると24勝21敗、Tencentの社内ベンチ(名前が Hy- で始まるもの)を除くと20勝18敗になる。どう数えても差は1行から3行で、勝ったとは言えない。互角という言い方のほうが正確だと考える。
分野別に見ると偏りがある。業務エージェントは9勝6敗で勝ち越しているが、コーディングは7勝8敗で負け越している。得意そうに見える分野で勝てていない。
対 GPT 5.6 Sol(46行)
同じ表のまま相手を変えると、景色が変わる。
| 分野 | Hy4の勝 | 負 |
|---|---|---|
| コーディング | 6 | 10 |
| 業務エージェント | 5 | 10 |
| 検索 | 0 | 5 |
| STEM | 0 | 2 |
| 推論 | 0 | 8 |
| 合計 | 11 | 35 |
検索・STEM・推論の15行は1行も取れていない。併記セルの1つ目を採っても2つ目を採っても11勝35敗で変わらなかった。
勝った11行の中身も偏っている。SWE-bench MultilingualとSWE-bench Pro、SWE Atlasの3種、NL2Repo-Bench、OfficeQA Pro、MCP-Atlas、Toolathlon-Verified、SkillsBench、JobBench。リポジトリを触る仕事と、ツールを呼ぶ仕事に集まっている。
個別の数字で言うと、Terminal-Bench 2.1はHy4が85.4で、GPT 5.6 Solの88.8、Kimi K3の88.3、GLM 5.3の88.2に届いていない。CritPtは16.9で、GPT 5.6 Solの32.3のおよそ半分である。
自社ベンチで負けた行を載せている
自社発表の表は、都合のいい種目だけを並べれば作れる。そこを確かめる手がかりが表の中にあった。
Tencentは自分で作った社内ベンチを表に載せているが、そのうち3つでHy4はKimi K3に負けている。
| 社内ベンチ | Hy4 preview | Kimi K3 |
|---|---|---|
| Hy-Backend 2.0 | 35.2 | 37.9 |
| Hy-SWE Max Verified | 64.2 | 65.6 |
| Hy-CompanyBench V2 | 62.4 | 63.3 |
自分の作った試験で負けた結果を、隠せる場所で隠していない。
注記も細かい。推論系8ベンチのうちClaude Opus 5の5件はhigh設定で実行しており、その設定での打ち切り率がHLE 2.32%、ArXivMath 15.17%、HorizonMath 28.76%、MathArena Apex 2025 5.86%、BrokenArXiv 17.17%だったと書いてある。つまりOpus 5の推論スコアは本来より低く出ている可能性があると、Tencent自身が申告している。
もうひとつ目に付いたのは評価ハーネスだ。Terminal Bench 2.1、SkillsBench、SWE-Atlas、NL2Repo、ProgramBench、BioMystery、OfficeQA Proなどで、Claude Codeを測定の道具として使っている(GPT系のみCodex CLIに差し替え)。他社の道具で自社モデルを測り、その条件を公開している。
「Haikuより安い」に付く3つの条件
冒頭の比較には但し書きが要る。3つとも都合の悪い方向の話だが、全部書く。
1. Haikuにはバッチ料金がある。 Claude Haiku 4.5のバッチ料金は入力0.500ドル/出力2.500ドル。入力はHaikuのほうが安く、出力は2.500ドル対2.501ドルでほぼ同額になる。すぐ結果が要らない用途では差が消える。
2. Hy4は最安ではない。 DeepSeek V4 Pro(無印)は入力0.870ドル/出力1.740ドルで、出力はHy4より約3割安い。Flash系まで含めればGLM 5.3-Flashが0.075ドル/0.250ドル、DeepSeek V4 Flashが0.089ドル/0.177ドルと桁が違う。
3. OpenAIのGPT 5.6 Lunaのほうが安い。 入力0.200ドル/出力1.200ドル、文脈長105万トークン。3軸すべてでHy4を下回る。ただしLunaはTencentの付録表に列が無いため、Hy4との性能比較データは存在しない。強いか弱いかは、この記事の材料では判断できない。
正確に言えば「Hy4はフラッグシップ帯としては安い」であって、「最安」ではない。
実際に触ってみて分かったこと
この記事を書くにあたって発表ページを取得しようとしたが、curl はTencent Cloud EdgeOneのWAFに拒否された(HTTP 567 / Restricted Access)。ブラウザで開き直して本文と付録表を読んでいる。プログラムから機械的に読ませない設定になっている発表ページは、それほど多くない。
もうひとつ。発表ページのコメント欄は、当方が確認した時点で0件だった。日本語圏でDeepSeek・Qwen・Kimi・GLMの名前は記事で見かけるが、Tencentの言語モデルはほとんど話題にならない。検索ボリュームを測ったわけではないので数字では示せないが、コメント0件は画面上の事実として書いておく。
この記事で確かめられなかったこと
- ベンチマーク表の値は大半がTencentの自社テストである(表内の
*印)。第三者による再現ではない。 - 勝敗の集計は当方が表を書き起こして数えたもので、公式の指標ではない。数え方(併記セルの扱い、除外行)は本文に書いたとおり。
- 表には
Hy-で始まる社内ベンチが複数含まれており、外部から再現できない。 - GPT 5.6 Lunaとの性能比較は、比較データが公開されていないため不明のまま残る。
- 実際にモデルを走らせての検証はしていない。この記事は公開資料の突き合わせに限定している。
- 価格・スペックは2026年8月28日時点。preview版のため、正式版で変わる可能性がある。実際、前世代Hy3は0.132ドル/0.528ドルだったので、Hy4では入力6.3倍・出力4.7倍の値上げになっている。
Hy4を選ぶ基準を3つ置く
材料から言えることを3つ。
出力トークンを大量に吐かせる用途では単価差がそのまま請求額に出る。Hy4の2.501ドルはGPT 5.6 Solの10.000ドルの4分の1で、重みが公開されているので自前で動かす道も残る。
推論・検索・科学が要る用途では、GPT 5.6 Sol相手に0勝の領域である。少なくとも現時点の公開データからは、ここで乗り換える根拠はない。
料金を比べるときは入力と出力を分ける。Hy4とHaiku 4.5は入力では1.2倍差だが、出力では2.0倍差になる。どちらのトークンが多く出る仕事かで、選ぶモデルが変わる。
安いモデルを高いモデルの下位互換として並べると、この形は見えない。得意な領域が違う別の刃として持つほうが、今の状況には合っている。
関連記事
- Z.aiがGLM-5.3-Flashを公開──Opus級に迫って価格は10分の1
- AlibabaがQwen4の仕組みを先行公開──Qwen3.8-Flash-Next、動くのは6Bで最上位級の性能
- 安いモデルから強いモデルに交代させても、ギャップの半分も埋まらない──Handoff Tax
- 中国勢・オープンウェイト2026年上半期
出典
- Tencent「Introducing Hy4 preview」 https://hy.tencent.ai/research/hy4-preview (2026年8月28日)
- OpenRouter Models API https://openrouter.ai/api/v1/models (2026年8月28日取得)
- Tencent-Hunyuan/Hy4-preview https://huggingface.co/tencent/Hy4-preview
数え直したい方のために条件を残しておく。比較列はHy4 preview / Kimi K3 / GPT 5.6 Sol、併記セルは1つ目を採用(2つ目でも結論は同じ)、対K3はKimi K3の欄が空の1行を除いた45行、対GPT 5.6 Solは46行全部。ここと違う結果になった場合は指摘してほしい。訂正が必要なら記事冒頭に注記を出す。
関連記事
出典・参照資料
この記事の解説動画
YouTubeで見る ↗AIニュースの解説を動画でも
YouTubeでは注目ニュースの背景を解説し、Xでは新着記事をお知らせしています。
コメント
まだコメントはありません。最初のコメントを書いてみませんか?
AIについて聞きたいことはありますか?
質問箱で無料で受け付けています。回答は公開され、他の方の参考にもなります。
質問箱を見る →新しい記事をメールで受け取る
AIの新しい発表を、出典付きで整理して届けます。