OpenAI、全二重の音声モデル「GPT-Live-1」をAPIで提供──1分$0.05(秒単位課金)の会話層に、推論とツールはGPT-6 Astraなど後ろのモデルへ委任。Full Duplex BenchでGPT-Realtime-2.1より30ポイント上、電話(SIP)対応、声は12種類
OpenAIは2026年9月10日、ChatGPT Voiceで7月に導入した全二重(聞きながら話す)音声モデルGPT-Live-1をAPIで公開した。会話はGPT-Live-1が担い、推論とツール呼び出しはGPT-6 AstraやLuna、または他社モデルや自前のエージェントに委任する構成。料金は音声セッションが1分$0.05で秒単位課金(分に切り上げない)、後ろのモデルとツールは別課金。OpenAIの評価ではFull Duplex BenchがGPT-Realtime-2.1より30ポイント上で、Astra(medium)と組むとTau3で1位。WebRTC・WebSocket・電話(SIP)に対応し、声はQuartzからCinderまで12種類。Yelpは電話予約で処理率が改善、Speakは学習者の割り込みを約80%減、ある医療系企業はコードを80%減らして2万3,000行を削除したと語る(いずれもOpenAIの掲載)。Artificial Analysisの表ではGPT-Live-1(Astra設定)が81.5で音声対話指数の2位。

目次
2026年9月17日・日本時間時点の情報です。 OpenAIが9月10日、全二重(フルデュプレックス=聞きながら話す)の音声モデルGPT-Live-1をAPIで提供開始した。7月にChatGPT Voiceへ入ったモデル(当サイトの記事)で、当時「API提供も予定」とされていたものが1週間前に出ている。当サイトは同じ週に出たGoogleのGemini 3.8 Liveを先に扱ったので、OpenAI側もそろえる。公式ブログ、モデルページ、ガイド、料金ページから、構成・料金・評価・接続方法を整理する。
3行まとめ
- 構成は「会話層+後ろの頭脳」。 GPT-Live-1は聞く・話す・割り込みへの応答を担い、推論とツール呼び出しは後ろのモデル(GPT-6 Astra、Luna、他社モデル、自前のエージェントハーネス)に委任する。従来のSTT→LLM→TTSの連結で起きる遅延と受け渡しの脆さを1つのモデルで避ける、というのがOpenAIの説明。
- 料金は1分$0.05・秒単位。 音声セッションは分に切り上げず秒で課金し、後ろのモデルとツールは別課金(Responses委任なら通常の単価)。エンドポイントは
v1/live/sessionsのみで、Chat Completions・Responses・Realtimeでは使えない。知識カットオフは2025年7月31日。- 評価と接続。 OpenAIの評価ではFull Duplex BenchがGPT-Realtime-2.1より30ポイント上、Astra(medium)と組むとTau3で1位。WebRTC(ブラウザ)・WebSocket(サーバー)・サーバー側制御・電話(SIP)に対応し、声は12種類(Quartz・Ripple・Vesper・Willow・Stone・Gleam・Meridian・Bossa・Tempo・Beacon・Delta・Cinder)。Artificial Analysisの表(9月17日)ではGPT-Live-1(Astra設定)が音声対話指数81.5で2位(1位はGemini 3.8 Live Extended Thinking 82.6)。
何が出たのか
公式ブログの冒頭を引く。
We're launching GPT‑Live‑1 in the API, giving developers a powerful, natural voice model for building voice-enabled apps and business workflows. First introduced in ChatGPT, GPT‑Live‑1 is capable of listening and speaking at the same time, and, as seen with Codex and ChatGPT Work, can delegate deeper reasoning and actions to the models and tools it is paired with.
(GPT-Live-1をAPIで公開する。音声対応のアプリや業務ワークフローを作るための、自然な音声モデルである。最初にChatGPTで導入されたGPT-Live-1は、聞くことと話すことを同時に行え、CodexやChatGPT Workで見られるように、より深い推論と行動を、組み合わせたモデルやツールに委任できる)
APIで焦点を当てた「強み」として、ブログは6つを挙げる。
| 強み | 内容 |
|---|---|
| 割り込みの扱い | 入ってくる音声と出ていく音声を1つのモデルで一緒に推論する。STT–LLM–TTSの連結の遅延と受け渡しの脆さを避ける |
| 推論とツール呼び出しの委任 | 後ろのテキストモデル(GPT-6 Astraなど)や他社モデルに委任 |
| 口調・速さ・スタイル | システムプロンプトで調整 |
| 無音と背景雑音 | 会話を止めたり、すべての手順を声に出したりせずに処理 |
| 長いセッション | 文脈の保持と会話の質を改善 |
| 電話 | 全二重の音声エージェントを電話に載せる(レストラン予約から顧客サポートまで) |
ASRの文字起こしと応答テキストをネイティブに返し、英数字の聞き取りとキーワードのバイアスに対応し、ターン制のモデルではないがターン検出はネイティブに持つ、ともある。
構成──会話層と後ろのモデルを分ける
ガイドの説明では、GPT-Liveが「聞く・話す・いつ後ろに助けを求めるか」を決め、後ろが委任されたタスクをこなす。委任の方式は2つ。Responses委任(OpenAIの対応モデルを後ろに置く。通常の単価で課金)と、クライアント委任(自分のアプリが動かす任意のモデル・エージェントハーネス・サービスに接続)。ブログの例は「予定の変更や注文の更新のような大量の定型タスクはLuna、推論が要る複雑な顧客対応はAstra」で、深さ・速さ・費用をタスクごとに合わせる。
注意点としてガイドは、権限・確認・関数の実行・タスクの状態はアプリ側が持つこと、発話を割り込んでも後ろの作業は自動では止まらないこと、を書いている。ブログにはCodexに委任するコードの抜粋もあり、会話の文脈をCodexに渡して2文の返答をもらい、session.commentary.appendでGPT-Live-1に戻す形が示されている。
料金と使える経路
| 項目 | 記載 |
|---|---|
| 音声セッション | $0.05/分、秒単位課金(分に切り上げない) |
| 後ろのモデル・ツール | 別課金(Responses委任は通常の単価) |
| モデルID | gpt-live-1 |
| 入出力 | 音声・テキスト(画像・動画は非対応) |
| 知識カットオフ | 2025年7月31日 |
| エンドポイント | v1/live/sessionsのみ |
| 接続 | WebRTC(ブラウザ)/WebSocket(サーバー)/サーバー側制御(既存セッションへの帯域外接続)/電話・SIP |
| 参考(同じ料金ページ) | ライブ翻訳 gpt-realtime-translate $0.034/分、ライブ文字起こし gpt-live-transcribe $0.017/分 |
カスタム音声は営業窓口経由で要件と申請の手続きがある。企業向けには、GPT-Live-1を使った「OpenAI Presence」(質問に答え、社内システムを使い、承認済みの行動を取り、必要なら人に引き継ぐエージェント)も案内されている。
評価──OpenAIの数字と独立指標
OpenAIの記述は「Full Duplex BenchでGPT-Realtime-2.1より30ポイント改善、ターン交代の遅延と対話的な振る舞いで大きく向上」「Astra(medium)と組むとTau3で1位」。ページ上の評価図の説明には、航空・小売・通信の音声カスタマーサービス(Pass@1)、97件の銀行業務(Pass@1)、間の取り方・割り込み・相づち、背景の話し声への反応、返答開始までの速さ、ためらいを含む発話からのツール呼び出し(後ろはTerra low)が並ぶが、本文に数値表は載っていない。
当サイトが9月17日にArtificial Analysisのspeech-to-speechの表を取得すると、Speech to Speech IndexでGPT-Live-1(Astra, medium)は81.5で2位、GPT-Live-1(Sol, low)は80.1で4位。列ごとでは、GPT-Live-1(Sol)の「会話の自然さ」97.3%はStepAudio 3 Realtime(98.9%)とQwen Audio 3.0 Realtime Plus(98.4%)に次ぐ値で、「音声推論」は89〜90%でGemini 3.8 Live Extended Thinking(98%)より低い。Full Duplex Benchの上位は同サイトのFAQによればStepAudio 3 Realtime 98.9%、Qwen Audio 3.0 Realtime Plus 98.4%、GPT-Live-1(Sol, low)97.3%。
導入企業の声
ブログに載ったのは、Yelp(Yelp HostとHatchで、電話の予約や注文の処理率が改善し、発話がより自然な長い文になった)、Speak(語学の学習者が考える時間を取れるようになり、ターン制の旧システムより割り込みが約80%減)、医療系企業のCTO(連結型と比べてコードベースを80%簡素化し、2万3,000行を削除)、Cognition、Fin、Picsart、HeyGen。いずれもOpenAIの掲載で、当サイトが検証したものではない。
Gemini 3.8 Liveとの位置関係
同じ週に出たGoogleのGemini 3.8 Live/3.8 Live Extended Thinkingは、1つのモデルが裏で考えながら話す設計(Extended Thinkingは推論と発話を同時に行う)で、価格は音声入力$0.005/分・出力$0.018/分の換算値。GPT-Live-1は会話層を$0.05/分で切り出し、頭脳は別のモデルに委任する設計で、後ろの単価は別に乗る。どちらが安いかは、後ろに何を置くかと会話時間の比で変わり、単純には比べられない。独立指標では、Extended Thinking(82.6)とGPT-Live-1 Astra設定(81.5)の差は1.1である。
筆者が確かめたこと・確かめていないこと
- 筆者はGPT-Live-1をAPIから呼んでいない。ChatGPT側の音声会話は音声モードの記事で扱っており、本記事の数字はすべてOpenAIとArtificial Analysisによる
- ブログの評価図の数値は本文に無く、当サイトは図の説明文だけを写した
- 日本語での対話品質、電話(SIP)の日本の通信事業者での対応、カスタム音声の条件は、公開資料に無く確認していない
- 7月の記事で「GPT-Live-1 mini(Free向け)」に触れたが、miniのAPI提供の有無は本記事の時点で料金ページに行が無い(「GPT-Live sessions」の表にあるのは
gpt-live-1のみ)
OpenAIの発表・モデルページ・料金表と、独立指標
- 発表内容・引用・導入企業の声は、OpenAI公式ブログ「Build more natural voice experiences with GPT-Live-1 in the API」(2026年9月10日)。当サイトが9月17日にブラウザで取得
- 料金・エンドポイント・知識カットオフはモデルページ、委任の仕組みと接続方法はガイド「GPT-Live」、料金の行はAPI料金ページ(いずれも9月17日にcurlで取得)
- 独立指標はArtificial Analysisのspeech-to-speechページ(9月17日取得)
- 本記事は続報があれば更新する。評価の数値表、miniのAPI提供、日本語対応の情報が出たら追記する
出典・参照資料
- 一次資料Build more natural voice experiences with GPT-Live-1 in the API — OpenAI公式(2026-09-10) ↗
- 一次資料GPT-Live 1 — OpenAI API モデルページ(料金・エンドポイント・知識カットオフ) ↗
- 一次資料GPT-Live — OpenAI Developers(委任の仕組み・接続方法) ↗
- 一次資料Pricing — OpenAI API(GPT-Live sessions の行) ↗
- 二次資料Artificial Analysis: Speech to Speech モデル比較(2026-09-17取得) ↗
AIニュースの解説を動画でも
YouTubeでは注目ニュースの背景を解説し、Xでは新着記事をお知らせしています。
コメント
まだコメントはありません。最初のコメントを書いてみませんか?
AIについて聞きたいことはありますか?
質問箱で無料で受け付けています。回答は公開され、他の方の参考にもなります。
質問箱を見る →新しい記事をメールで受け取る
AIの新しい発表を、出典付きで整理して届けます。