AI時短ラボ
研究· 約13

Humanity's Last Exam、Nature誌に掲載──2,500問の「人類最後の試験」を作った理由と、まだ超えられていない壁

Center for AI SafetyとScale AIが共同で作った試験「Humanity's Last Exam」が2026年1月28日、学術誌Natureに掲載された。50カ国・500以上の機関に所属する約1,000人の専門家が持ち寄った2,500問は、当初のリーダーボードでトップのGemini 3 Proでも正答率38.3%にとどまる。

Humanity's Last Exam、Nature誌に掲載──2,500問の「人類最後の試験」を作った理由と、まだ超えられていない壁
執筆・編集:
目次

「人類最後の試験(Humanity's Last Exam、HLE)」という名前の学術ベンチマークが、2026年1月28日、査読付き学術誌Natureに掲載された(Nature 649号、1139〜1146ページ)。AI安全性の研究団体Center for AI Safetyと、データラベリング企業Scale AIが共同で立ち上げたこのベンチマークは、既存の多くの試験がAIによって「飽和」(ほぼ満点を取られてしまう状態)してしまったことへの対応として作られた。公式サイトとNature掲載論文本体で確認できる内容を整理する。

3行まとめ

  1. Humanity's Last Exam(HLE)は2,500問からなる学術ベンチマークで、50カ国・500以上の機関に所属する約1,000人の専門家提供者が持ち寄った問題を収録し、2026年1月28日にNature誌に掲載された
  2. 2025年4月3日時点のリーダーボードでは、トップのGemini 3 Proでも正答率38.3%、GPT-4oは2.7%にとどまり、既存ベンチマークが軒並み「飽和」する中でHLEはまだAIが苦戦する難易度を保っている
  3. Nature論文の著者欄は「Center for AI Safety, Scale AI & HLE Contributors Consortium」という大規模コンソーシアム名義で、投稿は2025年5月7日、査読受理は同年11月25日と、公開までに約9ヶ月弱を要している

HLEの基本データ

公式サイトの記述を確認した。

項目 内容
Nature掲載日 2026年1月28日(Nature 649, 1139–1146)
問題数 2,500問(2025年4月3日に最終確定。バグ報奨金プログラムで指摘された問題や、検索で答えが見つかる問題は差し替え済み)
対象分野 100以上の学問分野にまたがる
問題の出所 約1,000人の専門家提供者(主に教授・研究者・大学院修了者)から。50カ国・500以上の機関に所属
データセット構成 公開する2,500問に加え、モデルの過学習を検証するための非公開の保留セットも維持
評価対象の性質 クローズドエンド(答えが一意に定まる)の学術的な問題。開放的な研究課題や創造的な問題解決能力を測るものではない、と公式サイトが明記

なぜ「最後の試験」なのか

公式サイトは、この名前の理由を「既存のベンチマークの飽和と比較して、Humanity's Last Examの正答率は複数のフロンティアモデルにわたって低いままで、高度な学術的能力を測る有効性を示している」と説明している。つまり、他の多くの試験がAIにとって簡単になりすぎて意味をなさなくなる中、HLEはまだAIが苦戦する難易度を保っている、という位置づけだ。

リーダーボードのスコア(データセット更新時点)

公式サイトに掲載されている評価結果(判定モデル:o3-mini、データセット更新日:2025年4月3日時点)は次の通り。

モデル 正答率 キャリブレーション誤差
Gemini 3 Pro 38.3% 57.2%
GPT-5 25.3% 50.0%
Grok 4 24.5% 56.4%
Gemini 2.5 Pro 21.6% 72.0%
GPT-5-mini 19.4% 65.0%
Claude 4.5 Sonnet 13.7% 65.0%
Gemini 2.5 Flash 12.1% 80.0%
DeepSeek-R1(テキストのみで評価) 8.5% 73.0%
o1 8.0% 83.0%
GPT-4o 2.7% 89.0%

このリーダーボードは2025年4月3日のデータセット更新時点のものであり、2026年8月時点の最新モデル(Claude Opus 5・Sonnet 5、Gemini 3.6など)のスコアは、公式サイトのこのセクションでは確認できなかった。公式サイトには継続更新版として「HLE-Rolling」というフォーク版が2025年10月8日にリリースされているとの記載があり、最新のスコアはそちらで追跡されている可能性がある。

「50%を超えるかもしれない」という2025年時点の見通し

公式サイトの考察部分は、当時の見通しとしてこう書いている。「現在のLLMはHumanity's Last Examで非常に低い正答率にとどまっているが、近年の傾向は、ベンチマークがほぼゼロからほぼ満点へと短期間で劇的に進歩することを示している。AI開発の急速なペースを踏まえると、モデルが2025年末までにHLEで50%の正答率を超えることはありうる」。同時に「HLEでの高い正答率は、クローズドエンドで検証可能な問題・最先端の科学知識における専門家レベルの性能を示すが、それだけで自律的な研究能力や『汎用人工知能』を示唆するものではない」とも明記している。HLEは構造化された学術的問題を試すものであり、開放的な研究や創造的な問題解決能力を試すものではないため、「技術的知識と推論力に焦点を絞った指標」だと位置づけている。

出発点は2024年9月、賞金50万ドルの公募だった

Nature掲載(2026年1月28日)や問題セットの最終確定(2025年4月3日)よりずっと前、HLEというプロジェクト自体は2024年9月16日、Scale AI公式ブログでの発表から始まっている。ブログ記事「Submit Your Toughest Questions for Humanity's Last Exam」(The Scale Team名義、2026年6月3日に更新済みの状態を確認)によれば、Scale AIとCAISは「AIがAIを上回る専門家レベルの水準にどれだけ近づいているかを測定するプロジェクト」として、世界で最も難しい公開AIベンチマークを作るために、あらゆる分野の専門家から問題を募る形で立ち上げた。採用された問題の投稿者は、データセットの論文の共著者として招待され、合計50万ドルの賞金プールから、採用上位50問には1問あたり5,000ドル、続く上位500問には1問あたり500ドルが支払われるという設計だった。ブログはこの取り組みの背景として、CAIS自身が開発した「MMLU」というベンチマークが、かつてはAIがランダムよりましな程度の性能しか出せなかったのに、わずか数年でOpenAIの当時の最新モデルが天井近い性能に達してしまったことを挙げ、既存のベンチマークが次々と「飽和」していく状況こそがHLE立ち上げの動機だったと説明している。発表時点で、MIT・UCバークレー・スタンフォードの研究者からすでに問題が集まっていたとも書かれている。

なお、Scale AI側の窓口はブログによれば「Safety, Evaluations, and Alignment Lab(SEAL)」という同社内のチームで、フロンティアモデルの堅牢な評価手法を研究し、専門家主導の非公開評価に基づくリーダーボードを定期的に公開する役割を担うという。共同運営のCenter for AI Safety(CAIS)は、サンフランシスコを拠点とする研究・分野構築系の非営利団体で、公式サイトによれば「AIに関連する社会規模のリスクを、安全性研究の実施・AI安全性研究者コミュニティの育成・安全基準の提唱を通じて低減すること」を使命に掲げている。2024年9月の公募開始から、2025年4月のデータセット最終確定、2026年1月のNature掲載まで、単発の発表ではなく1年4カ月にわたる継続的なプロジェクトだったことが、これらの一次資料を突き合わせることで確認できる。

Nature論文本体で確認できた投稿の経緯

公式サイトのリンクからNature論文本体(DOI: 10.1038/s41586-025-09962-4)をcurlで直接取得すると、公式サイトのトップページには無い、査読・公開の経緯が確認できた。

項目 内容
投稿受理(Received) 2025年5月7日
査読受理(Accepted) 2025年11月25日
掲載(Published/Version of record) 2026年1月28日
巻号 Nature volume 649, pages 1139–1146
著者名義 Center for AI Safety, Scale AI & HLE Contributors Consortium
責任著者(Correspondence) Long Phan、Dan Hendrycks
利益相反の申告 著者は利益相反なしと申告("The authors declare no competing interests")

(表はNature論文の書誌情報ページの記載をそのまま表にしたもの。)

投稿(2025年5月7日)から査読受理(同年11月25日)まで約6ヶ月半、そこから実際の掲載(2026年1月28日)までさらに約2ヶ月というスケジュールで、合計すると投稿から掲載まで8ヶ月半以上を要している。論文のアブストラクトは、公式サイトの説明とほぼ同じ内容(既存ベンチマークの飽和、2,500問・複数分野にまたがる構成、専門家によるグローバルな作問体制)を述べており、公式サイトの記載とNature論文本体の間で、この記事が確認した範囲では矛盾する記述は見当たらなかった。

キャリブレーション誤差という2つ目の指標

正答率と並んで公式サイトが重視しているのが「キャリブレーション誤差」だ。モデルに答えと同時に0〜100%の確信度を申告させ、その確信度がどれだけ実際の正答率とズレているかを測る。表を見ると、正答率が最も高いGemini 3 Proでもキャリブレーション誤差は57.2%と高く、いずれのモデルも「自信満々に間違える」傾向を抱えていることが読み取れる。

リーダーボードの数字は2025年4月時点で止まっている

  • 本記事はHLE公式サイト(lastexam.ai)とNature掲載論文の書誌情報・アブストラクトを確認して書いたもので、論文本文の詳細な方法論(Methods節、統計的な検証手法)やarXiv版プレプリントとの異同までは読み込んでいない。
  • リーダーボードのスコアは2025年4月3日時点のデータセット更新時のものであり、2026年8月27日時点の最新モデルのスコアは確認できていない。「2025年末までに50%を超えるかもしれない」という見通しが実際にどうなったかも、本記事の範囲では検証していない。継続更新版「HLE-Rolling」の変更履歴ファイル(hle-rolling-changes.txt)をcurlで確認したところ、2026年2月時点まで問題の追加・差し替えが続いていることは確認できたが、これは問題セットの更新記録であり、モデルのスコア推移そのものではない。
  • 「50カ国・500以上の機関」「約1,000人の専門家」という数字はHLE公式サイトの記述をそのまま採用しており、これらの数字自体の算出方法(重複カウントの扱いなど)までは確認していない。

AGIの定義そのものはAGI(汎用人工知能)とは何か、同種の推論力ベンチマークとしてAnthropicが8月に発表した指標はAIの「嘘発見器」は訓練しても未知のケースに汎化しなかったを参照。

この記事は2026年8月27日時点でHumanity's Last Exam公式サイトを確認して書いたものです。

シェア: ポスト はてブ

出典・参照資料

AIニュースの解説を動画でも

YouTubeでは注目ニュースの背景を解説し、Xでは新着記事をお知らせしています。

コメント

まだコメントはありません。最初のコメントを書いてみませんか?

AIについて聞きたいことはありますか?

質問箱で無料で受け付けています。回答は公開され、他の方の参考にもなります。

質問箱を見る →

新しい記事をメールで受け取る

AIの新しい発表を、出典付きで整理して届けます。

関連記事

GDPvalは本当に「線形に伸びている」のか──2026年5月から8月まで、モデル発表8件分のスコアで検証したの記事画像
研究09.07読了17

GDPvalは本当に「線形に伸びている」のか──2026年5月から8月まで、モデル発表8件分のスコアで検証した

出典 ─ OpenAI, GDPval論文(arXiv
AIの事実誤りは「知らない」のではなく「思い出せない」──Google Researchのrecall仮説を読むの記事画像
研究09.07読了14

AIの事実誤りは「知らない」のではなく「思い出せない」──Google Researchのrecall仮説を読む

出典 ─ Google Research Blog
AIが天気予報を変える──Google DeepMindのWeatherNext 2とはの記事画像
研究09.07読了17

AIが天気予報を変える──Google DeepMindのWeatherNext 2とは

出典 ─ Introducing WeatherNex
暗号化されたままAI推論する──Googleのオープンソースコンパイラ「HEIR」を公式ブログから読むの記事画像
研究09.06読了11

暗号化されたままAI推論する──Googleのオープンソースコンパイラ「HEIR」を公式ブログから読む

出典 ─ How Google is Making Private AI Practical with Homomorphic Encryption
GPT-4.5は73%の確率で「人間」と判定された──チューリングテスト論文を原文で読み、AGIの証拠になるか考えるの記事画像
研究09.06読了10

GPT-4.5は73%の確率で「人間」と判定された──チューリングテスト論文を原文で読み、AGIの証拠になるか考える

出典 ─ Cameron R. Jones, Benj
Isomorphic Labsとは──AlphaFoldの先にある創薬AI企業を一次情報で整理するの記事画像
研究09.05読了11

Isomorphic Labsとは──AlphaFoldの先にある創薬AI企業を一次情報で整理する

出典 ─ Isomorphic Labs(公式サイト
OpenAIが「AIがナビエ・ストークスを解いた」と発表──同じ日に数学者が公にした「パクられた疑惑」、何が証明され、どこまで検証されたかの記事画像
研究09.09読了32

OpenAIが「AIがナビエ・ストークスを解いた」と発表──同じ日に数学者が公にした「パクられた疑惑」、何が証明され、どこまで検証されたか

出典 ─ OpenAI公式ブログ(2026-09-08)
AI医療対話モデル「AMIE」がビデオ診察に対応──歩き方や表情から診断する仕組みの記事画像
研究09.04読了12

AI医療対話モデル「AMIE」がビデオ診察に対応──歩き方や表情から診断する仕組み

出典 ─ Google Research Blog