Humanity's Last Exam、Nature誌に掲載──2,500問の「人類最後の試験」を作った理由と、まだ超えられていない壁
Center for AI SafetyとScale AIが共同で作った試験「Humanity's Last Exam」が2026年1月28日、学術誌Natureに掲載された。50カ国・500以上の機関に所属する約1,000人の専門家が持ち寄った2,500問は、当初のリーダーボードでトップのGemini 3 Proでも正答率38.3%にとどまる。

目次
「人類最後の試験(Humanity's Last Exam、HLE)」という名前の学術ベンチマークが、2026年1月28日、査読付き学術誌Natureに掲載された(Nature 649号、1139〜1146ページ)。AI安全性の研究団体Center for AI Safetyと、データラベリング企業Scale AIが共同で立ち上げたこのベンチマークは、既存の多くの試験がAIによって「飽和」(ほぼ満点を取られてしまう状態)してしまったことへの対応として作られた。公式サイトとNature掲載論文本体で確認できる内容を整理する。
3行まとめ
- Humanity's Last Exam(HLE)は2,500問からなる学術ベンチマークで、50カ国・500以上の機関に所属する約1,000人の専門家提供者が持ち寄った問題を収録し、2026年1月28日にNature誌に掲載された
- 2025年4月3日時点のリーダーボードでは、トップのGemini 3 Proでも正答率38.3%、GPT-4oは2.7%にとどまり、既存ベンチマークが軒並み「飽和」する中でHLEはまだAIが苦戦する難易度を保っている
- Nature論文の著者欄は「Center for AI Safety, Scale AI & HLE Contributors Consortium」という大規模コンソーシアム名義で、投稿は2025年5月7日、査読受理は同年11月25日と、公開までに約9ヶ月弱を要している
HLEの基本データ
公式サイトの記述を確認した。
| 項目 | 内容 |
|---|---|
| Nature掲載日 | 2026年1月28日(Nature 649, 1139–1146) |
| 問題数 | 2,500問(2025年4月3日に最終確定。バグ報奨金プログラムで指摘された問題や、検索で答えが見つかる問題は差し替え済み) |
| 対象分野 | 100以上の学問分野にまたがる |
| 問題の出所 | 約1,000人の専門家提供者(主に教授・研究者・大学院修了者)から。50カ国・500以上の機関に所属 |
| データセット構成 | 公開する2,500問に加え、モデルの過学習を検証するための非公開の保留セットも維持 |
| 評価対象の性質 | クローズドエンド(答えが一意に定まる)の学術的な問題。開放的な研究課題や創造的な問題解決能力を測るものではない、と公式サイトが明記 |
なぜ「最後の試験」なのか
公式サイトは、この名前の理由を「既存のベンチマークの飽和と比較して、Humanity's Last Examの正答率は複数のフロンティアモデルにわたって低いままで、高度な学術的能力を測る有効性を示している」と説明している。つまり、他の多くの試験がAIにとって簡単になりすぎて意味をなさなくなる中、HLEはまだAIが苦戦する難易度を保っている、という位置づけだ。
リーダーボードのスコア(データセット更新時点)
公式サイトに掲載されている評価結果(判定モデル:o3-mini、データセット更新日:2025年4月3日時点)は次の通り。
| モデル | 正答率 | キャリブレーション誤差 |
|---|---|---|
| Gemini 3 Pro | 38.3% | 57.2% |
| GPT-5 | 25.3% | 50.0% |
| Grok 4 | 24.5% | 56.4% |
| Gemini 2.5 Pro | 21.6% | 72.0% |
| GPT-5-mini | 19.4% | 65.0% |
| Claude 4.5 Sonnet | 13.7% | 65.0% |
| Gemini 2.5 Flash | 12.1% | 80.0% |
| DeepSeek-R1(テキストのみで評価) | 8.5% | 73.0% |
| o1 | 8.0% | 83.0% |
| GPT-4o | 2.7% | 89.0% |
このリーダーボードは2025年4月3日のデータセット更新時点のものであり、2026年8月時点の最新モデル(Claude Opus 5・Sonnet 5、Gemini 3.6など)のスコアは、公式サイトのこのセクションでは確認できなかった。公式サイトには継続更新版として「HLE-Rolling」というフォーク版が2025年10月8日にリリースされているとの記載があり、最新のスコアはそちらで追跡されている可能性がある。
「50%を超えるかもしれない」という2025年時点の見通し
公式サイトの考察部分は、当時の見通しとしてこう書いている。「現在のLLMはHumanity's Last Examで非常に低い正答率にとどまっているが、近年の傾向は、ベンチマークがほぼゼロからほぼ満点へと短期間で劇的に進歩することを示している。AI開発の急速なペースを踏まえると、モデルが2025年末までにHLEで50%の正答率を超えることはありうる」。同時に「HLEでの高い正答率は、クローズドエンドで検証可能な問題・最先端の科学知識における専門家レベルの性能を示すが、それだけで自律的な研究能力や『汎用人工知能』を示唆するものではない」とも明記している。HLEは構造化された学術的問題を試すものであり、開放的な研究や創造的な問題解決能力を試すものではないため、「技術的知識と推論力に焦点を絞った指標」だと位置づけている。
出発点は2024年9月、賞金50万ドルの公募だった
Nature掲載(2026年1月28日)や問題セットの最終確定(2025年4月3日)よりずっと前、HLEというプロジェクト自体は2024年9月16日、Scale AI公式ブログでの発表から始まっている。ブログ記事「Submit Your Toughest Questions for Humanity's Last Exam」(The Scale Team名義、2026年6月3日に更新済みの状態を確認)によれば、Scale AIとCAISは「AIがAIを上回る専門家レベルの水準にどれだけ近づいているかを測定するプロジェクト」として、世界で最も難しい公開AIベンチマークを作るために、あらゆる分野の専門家から問題を募る形で立ち上げた。採用された問題の投稿者は、データセットの論文の共著者として招待され、合計50万ドルの賞金プールから、採用上位50問には1問あたり5,000ドル、続く上位500問には1問あたり500ドルが支払われるという設計だった。ブログはこの取り組みの背景として、CAIS自身が開発した「MMLU」というベンチマークが、かつてはAIがランダムよりましな程度の性能しか出せなかったのに、わずか数年でOpenAIの当時の最新モデルが天井近い性能に達してしまったことを挙げ、既存のベンチマークが次々と「飽和」していく状況こそがHLE立ち上げの動機だったと説明している。発表時点で、MIT・UCバークレー・スタンフォードの研究者からすでに問題が集まっていたとも書かれている。
なお、Scale AI側の窓口はブログによれば「Safety, Evaluations, and Alignment Lab(SEAL)」という同社内のチームで、フロンティアモデルの堅牢な評価手法を研究し、専門家主導の非公開評価に基づくリーダーボードを定期的に公開する役割を担うという。共同運営のCenter for AI Safety(CAIS)は、サンフランシスコを拠点とする研究・分野構築系の非営利団体で、公式サイトによれば「AIに関連する社会規模のリスクを、安全性研究の実施・AI安全性研究者コミュニティの育成・安全基準の提唱を通じて低減すること」を使命に掲げている。2024年9月の公募開始から、2025年4月のデータセット最終確定、2026年1月のNature掲載まで、単発の発表ではなく1年4カ月にわたる継続的なプロジェクトだったことが、これらの一次資料を突き合わせることで確認できる。
Nature論文本体で確認できた投稿の経緯
公式サイトのリンクからNature論文本体(DOI: 10.1038/s41586-025-09962-4)をcurlで直接取得すると、公式サイトのトップページには無い、査読・公開の経緯が確認できた。
| 項目 | 内容 |
|---|---|
| 投稿受理(Received) | 2025年5月7日 |
| 査読受理(Accepted) | 2025年11月25日 |
| 掲載(Published/Version of record) | 2026年1月28日 |
| 巻号 | Nature volume 649, pages 1139–1146 |
| 著者名義 | Center for AI Safety, Scale AI & HLE Contributors Consortium |
| 責任著者(Correspondence) | Long Phan、Dan Hendrycks |
| 利益相反の申告 | 著者は利益相反なしと申告("The authors declare no competing interests") |
(表はNature論文の書誌情報ページの記載をそのまま表にしたもの。)
投稿(2025年5月7日)から査読受理(同年11月25日)まで約6ヶ月半、そこから実際の掲載(2026年1月28日)までさらに約2ヶ月というスケジュールで、合計すると投稿から掲載まで8ヶ月半以上を要している。論文のアブストラクトは、公式サイトの説明とほぼ同じ内容(既存ベンチマークの飽和、2,500問・複数分野にまたがる構成、専門家によるグローバルな作問体制)を述べており、公式サイトの記載とNature論文本体の間で、この記事が確認した範囲では矛盾する記述は見当たらなかった。
キャリブレーション誤差という2つ目の指標
正答率と並んで公式サイトが重視しているのが「キャリブレーション誤差」だ。モデルに答えと同時に0〜100%の確信度を申告させ、その確信度がどれだけ実際の正答率とズレているかを測る。表を見ると、正答率が最も高いGemini 3 Proでもキャリブレーション誤差は57.2%と高く、いずれのモデルも「自信満々に間違える」傾向を抱えていることが読み取れる。
リーダーボードの数字は2025年4月時点で止まっている
- 本記事はHLE公式サイト(lastexam.ai)とNature掲載論文の書誌情報・アブストラクトを確認して書いたもので、論文本文の詳細な方法論(Methods節、統計的な検証手法)やarXiv版プレプリントとの異同までは読み込んでいない。
- リーダーボードのスコアは2025年4月3日時点のデータセット更新時のものであり、2026年8月27日時点の最新モデルのスコアは確認できていない。「2025年末までに50%を超えるかもしれない」という見通しが実際にどうなったかも、本記事の範囲では検証していない。継続更新版「HLE-Rolling」の変更履歴ファイル(
hle-rolling-changes.txt)をcurlで確認したところ、2026年2月時点まで問題の追加・差し替えが続いていることは確認できたが、これは問題セットの更新記録であり、モデルのスコア推移そのものではない。 - 「50カ国・500以上の機関」「約1,000人の専門家」という数字はHLE公式サイトの記述をそのまま採用しており、これらの数字自体の算出方法(重複カウントの扱いなど)までは確認していない。
AGIの定義そのものはAGI(汎用人工知能)とは何か、同種の推論力ベンチマークとしてAnthropicが8月に発表した指標はAIの「嘘発見器」は訓練しても未知のケースに汎化しなかったを参照。
この記事は2026年8月27日時点でHumanity's Last Exam公式サイトを確認して書いたものです。
出典・参照資料
- 二次資料Humanity's Last Exam 公式サイト(lastexam.ai) ↗
- 一次資料A benchmark of expert-level academic questions to assess AI capabilities — Nature(Center for AI Safety, Scale AI & HLE Contributors Consortium、2026年1月28日) ↗
- 二次資料Submit Your Toughest Questions for Humanity's Last Exam — Scale AI公式ブログ(2024年9月16日公開・2026年6月3日更新) ↗
- 二次資料Center for AI Safety(CAIS)公式サイト ↗
AIニュースの解説を動画でも
YouTubeでは注目ニュースの背景を解説し、Xでは新着記事をお知らせしています。
コメント
まだコメントはありません。最初のコメントを書いてみませんか?
AIについて聞きたいことはありますか?
質問箱で無料で受け付けています。回答は公開され、他の方の参考にもなります。
質問箱を見る →新しい記事をメールで受け取る
AIの新しい発表を、出典付きで整理して届けます。