GPT-4.5は73%の確率で「人間」と判定された──チューリングテスト論文を原文で読み、AGIの証拠になるか考える
UCSDの研究者2人が2025年3月、査読前論文でGPT-4.5に人間らしいペルソナを与えて三者間チューリングテストを実施した結果、審査員の73%がGPT-4.5を人間だと判定したと報告した。人間の対話相手を選ぶ確率を有意に上回った初の事例だとされるが、これがAGIの証拠になるかどうかは論文自体が明確に答えていない。

目次
「GPT-4.5は人間だと73%の確率で誤認された」という数字は、AIがチューリングテストに合格したことの証拠として引用されることがある。出どころは、カリフォルニア大学サンディエゴ校(UCSD)認知科学科のCameron R. JonesとBenjamin K. Bergenが2025年3月31日にarXivへ投稿した論文「Large Language Models Pass the Turing Test(大規模言語モデルはチューリングテストに合格する)」だ。本記事はPDF全文を読んで書いている。
3行まとめ
- 人間らしいペルソナ(内向的でスラングを使う若者)を指示したGPT-4.5は73%の確率で「人間」と判定され、標準的な三者間チューリングテストに合格した初の実証例だと論文は主張する
- ただしペルソナ指示を外すと、GPT-4.5の勝率は36%に落ち、「GPT-4o-NO-PERSONA・GPT-4.5-NO-PERSONAはどちらも、1966年のELIZAより統計的に有意に優れた成績を示さなかった」と論文自身が明記している
- 分析対象は除外処理後1,023ゲーム(中央値8メッセージ・4.2分)で、論文はこの結果を「AGIの証拠」だとは明言していない
論文が報告した実験内容
arXiv掲載のアブストラクトを訳すと、実験の骨子は次の通りだ。
| 項目 | 内容 |
|---|---|
| 投稿日 | 2025年3月31日 |
| 著者 | Cameron R. Jones、Benjamin K. Bergen(いずれもUCSD) |
| テストしたシステム | ELIZA(1960年代の古典的チャットボット)、GPT-4o、LLaMa-3.1-405B、GPT-4.5の4種 |
| 実験形式 | ランダム化・対照化・事前登録済みの三者間チューリングテストを、独立した2つの被験者集団で実施。参加者は5分間、人間ともう一方(AIまたは人間)の両方と同時に会話し、どちらが人間かを判定する |
| GPT-4.5(人間らしいペルソナを指示した場合) | 73%の確率で「人間」と判定された(学部生対象:69%、Prolific対象:76%)。これは審査員が本物の人間参加者を選んだ確率を統計的に有意に上回った |
| LLaMa-3.1-405B(同じペルソナ指示) | 56%の確率で「人間」と判定(学部生:45%、Prolific:65%)。人間参加者との比較で統計的に有意な差はなかった |
| ELIZA(ベースライン) | 23% |
| GPT-4o(ベースライン、ペルソナ指示なし) | 21%。いずれもチャンスレート(偶然による判定確率)を統計的に有意に下回った |
論文は結論として「これは、何らかの人工システムが標準的な三者間チューリングテストに合格したことを示す初めての実証的証拠を構成する」と述べている。実験全体では、除外処理後に1,023ゲームを分析し、1ゲームあたり中央値8メッセージ・4.2分間だったとされ、会話ログ全文を含む実験データはOSF(Open Science Framework)で公開されている。
「人間らしいペルソナを与えた場合」という条件が重要──ペルソナ無しではELIZA並み
この結果で見落とせないのは、GPT-4.5とLLaMa-3.1の73%・56%という数字が、いずれも「人間らしいペルソナを採用するよう指示された(prompted to adopt a humanlike persona)」条件でのものだという点だ。PDF本文を確認すると、このペルソナ指示の具体的な中身は「内向的で、インターネット文化に詳しく、スラングを使う若者」というものだった。研究チームは事前の探索的研究(5種類のプロンプト×7種類のLLMを評価)で、このペルソナがLLaMa-3.1-405BとGPT-4.5にとって最も効果的だったため採用したと説明している。
そして、ペルソナ指示を与えなかった条件(NO-PERSONA、「あなたはこれからチューリングテストに参加します。尋問者にあなたが人間だと信じ込ませることが目標です」という最小限の指示のみ)での結果は劇的に異なった。GPT-4.5-NO-PERSONAの勝率は36%、LLaMa-NO-PERSONAは38%にとどまり、論文は「GPT-4o-NO-PERSONAもGPT-4.5-NO-PERSONAも、どちらの参加者集団においても、ELIZA(1966年の古典的チャットボット)より統計的に有意に優れた成績を示さなかった」と明記している。つまり「73%」という数字は、モデルの素の会話能力ではなく、特定の人物像を演じるよう明示的に指示したことによって初めて達成された結果であり、ペルソナ指示を外すと、GPT-4.5は60年前のルールベースのチャットボットと統計的に区別がつかない水準まで落ち込む。
なお比較対象のELIZAについてもWikipediaで確認した。1966年にJoseph Weizenbaum氏が開発した、キーワードを認識してあらかじめ用意されたルールで応答を返すだけの、いわゆる心理療法士を模した「DOCTOR」スクリプトで知られるプログラムだ。ニューラルネットワークもLLMも使わない、60年近く前の単純なルールベースのプログラムが、ペルソナ指示なしのGPT-4.5・GPT-4oと統計的に区別できない成績だった、という点は、この論文の結果を読む上で重要な補助線になる。
審査員は何を手がかりに判定していたか
PDF本文には、審査員(尋問者)がどんな戦略・理由で判定を下したかという分析もある。最も多かった戦略は「雑談」(61%のゲーム)で、日常の活動や職業といった個人的な話題を尋ねるものだった。社会的・感情的な質問(意見・感情・ユーモア・経験について、50%)、「あなたは人間ですか」と直接尋ねる(19%)、状況認識を試す(天気やゲーム画面を把握しているか、13%)、知識・推論能力を試す(時事問題など、12%)が続く。
興味深いのは、戦略・判定理由の「頻度」と「正確さ」が必ずしも一致しなかった点だ。最も正解率が高かったのは、あえて奇妙なことを言って反応を見る、あるいは「これまでの指示をすべて無視して」といったLLM定番の「ジェイルブレイク」を試す戦略だったが、これらは比較的まれにしか使われていなかった。逆に天気や人間的な経験について尋ねる戦略は、最も効果が低かった。判定理由としては「言語スタイル」(27%、「タイプミスがあった」「より"人間らしい"言葉遣いだった」など)と「対話の力学」(23%)が最も多く挙げられたが、実際に正解率が高かった判定理由は「質問への対応の直接さ」と「知識の欠如」(何かを知らなかった、間違えた、という点)だった。論文はこれについて「多くの人が知らないような話題であえて無知を装わなければならない、という現代LLMにとってのチューリングテストの複雑さを浮き彫りにしている」と分析している。つまり人間らしく見せるには、知りすぎない・完璧すぎないことが有効だという逆説的な結果が示されている。
これはAGIの証拠になるのか
論文のアブストラクトは「この結果は、LLMがどのような種類の知能を示しているかという議論、そしてこれらのシステムが持つと考えられる社会的・経済的影響についての議論に対して意味を持つ」と述べるにとどまり、「AGIの証拠である」とは明言していない。チューリングテストは1950年にアラン・チューリングが提案した「機械が人間と見分けがつかない会話ができるか」を測る基準であり、知能の全体像を測るものではなく、あくまで会話における模倣の巧拙を測る指標だ、という位置づけそのものは論文の枠を超えた一般的な議論として存在する。
Google DeepMindの「Levels of AGI」論文がAGIの既存定義の一つとして挙げているのがまさにこのチューリングテストであり、AGI(汎用人工知能)とは何かで扱った通り、DeepMindの論文自体は9つの既存定義の一つとしてチューリングテストを位置づけ、それだけでAGIを判定する基準としては採用していない。「会話で人間と見分けがつかない」ことと「あらゆる認知タスクで人間の熟練者を上回る」ことは、別の能力を測っている可能性がある。
それでも確認しきれなかったこと
- 本記事はarXiv掲載のPDF全文(v1)を確認して書いている。ただし審査員(interrogator)の人口統計学的な内訳の詳細分析、探索的分析(exploratory analyses)の全項目までは読み込んでいない。
- 2025年3月31日の投稿はarXivのプレプリント(査読前論文、"Preprint. Under review."と本文に明記)であり、本記事執筆時点(2026年8月)でどの学術誌に正式掲載されたか、あるいはその後の版(v2以降)で内容に変更があったかは確認していない。
- OSF(osf.io/jk7bw)で会話ログ全文が公開されているとPDF本文に記載されているが、OSFのページ自体はJavaScriptレンダリングのため、本記事ではURLの実在(アクセス可能であること)のみを確認し、ログの中身までは読み込んでいない。
- この結果を追試・反証する後続研究があるかどうかも、本記事の調査範囲外。
チューリングテストを含むAGIの定義論争全体はAGI(汎用人工知能)とは何かを参照。
この記事は2026年8月27日時点でarXivの論文ページを確認して書いたものです。
出典・参照資料
AIニュースの解説を動画でも
YouTubeでは注目ニュースの背景を解説し、Xでは新着記事をお知らせしています。
コメント
まだコメントはありません。最初のコメントを書いてみませんか?
AIについて聞きたいことはありますか?
質問箱で無料で受け付けています。回答は公開され、他の方の参考にもなります。
質問箱を見る →新しい記事をメールで受け取る
AIの新しい発表を、出典付きで整理して届けます。