AI時短ラボ
モデル· 約10

grok-voice-latestが裏側でThink Fast 2.0に切り替わった日──8月5日、気づかれずに起きたルーティング変更

xAIは2026年7月、音声対話モデル「grok-voice-think-fast-2.0」を公開し、既定のエイリアス「grok-voice-latest」を2026年8月5日からこのモデルにルーティングすると公式ドキュメントで予告していました。8月5日は本記事の確認時点(8月27日)から見て既に経過しており、grok-voice-latestを固定名で呼び出しているだけの実装は、意識しないままモデルが切り替わっていた可能性があります。

grok-voice-latestが裏側でThink Fast 2.0に切り替わった日──8月5日、気づかれずに起きたルーティング変更
執筆・編集:
目次

2026年8月27日、xAI公式ドキュメント(docs.x.ai)を実際に開いて確認した内容です。 release notesの「July」セクションに、次の記載があります(原文と訳)。

"grok-voice-think-fast-2.0 is now available with Speech to Speech. grok-voice-latest will route to this model starting August 5, 2026."

(訳:grok-voice-think-fast-2.0がSpeech to Speechで利用可能になった。grok-voice-latestは2026年8月5日からこのモデルにルーティングされる)

本記事の確認時点(2026年8月27日)は、この切り替え予定日から22日が経過しています。エイリアス名(grok-voice-latest)でモデルを固定的に呼び出す実装では、この切り替わりに気づかないまま動き続けている可能性があります。

3行まとめ

  • grok-voice-think-fast-2.0はSpeech to Speech(音声対話)モデル。2026年7月にリリースされ、grok-voice-latestという「常に最新版を指すエイリアス」が2026年8月5日からこのモデルにルーティングされる予定だった
  • 前世代のgrok-voice-think-fast-1.0も同じrelease notesページに記載があり、Speech to Speech APIとして利用可能だった
  • grok-voice-latestのような「latest」系エイリアスは、モデル名を固定しても中身が自動更新される設計であるため、動作の変化に気づきにくい

他社にも共通する「latest」エイリアスの罠

余談だが、筆者は別の記事(Claude CodeのANTHROPIC_DEFAULT_MODELANTHROPIC_MODELの違いを扱った記事)でも、似た構造の設計に触れたことがある。「latest」や「default」という名前のエイリアスが、指し先のモデルを実装側の裁量で切り替えられる設計は、xAI・Anthropicに限らず複数のAPIプロバイダーに共通する。固定した名前を呼び続けているつもりでも、裏側のモデルが変わっている可能性は、API連携を組む際に一度は疑ってみる価値がある。

Think Fastシリーズとは何か

xAIのrelease notesを遡ると、Speech to Speech(音声対話、テキストを介さず音声入力から音声出力を直接生成する方式)向けのモデルとして、「Grok Voice Think Fast」というシリーズがあることが分かります。

"You can now use grok-voice-think-fast-1.0 with the Speech to Speech API."

(訳:grok-voice-think-fast-1.0をSpeech to Speech APIで利用できるようになった)

という1.0の記載が別の日付エントリにあり、その後継として2.0が今回のエントリで追加された、という順序です。

1.0から2.0で何が変わったか:公式発表ページのベンチマーク

release notesの1文だけでは中身が分からなかったため、リンク先の公式発表ページ(x.ai/news/grok-voice-think-fast-2)を直接開いて確認した。Artificial Analysis社のベンチマークとして、次の数値が掲載されている。

ベンチマーク Think Fast 2.0 Think Fast 1.0 GPT-Realtime-2.1(High) Gemini 3.1 Flash(High)
AA Speech-to-Speech Quality Index(総合) 82.9% 75.7% 79.1% 69.5%
Big Bench Audio(音声推論) 97.2% 97.1% 96.0% 96.6%
Full Duplex Bench(会話の自然さ) 95.1% 77.8% 95.7% 74.3%
τ-voice Bench(エージェント性能) 56.5% 52.1% 45.7% 37.7%
Time to First Audio(応答速度) 0.70秒 1.25秒 記載なし 2.98秒

総合指標では他社モデルを上回る一方、Full Duplex Benchでは僅差でGPT-Realtime-2.1(High)に次ぐ2位となっている点は、xAI自身の発表ページでも数値がそのまま示されている。

文字起こし精度については「Deepgram Nova 3・ElevenLabs Scribe v2に対して1.5〜2.0倍、Think Fast 1.0に対して1.4倍の改善」、ノイズの多い環境では「専用の音声認識モデルとの差が約10倍に広がる」と説明されている。また「Think Fastモデルは発話しながら推論する」という設計上の特徴があり、2.0は1.0と比べて応答あたりの推論トークン消費が0.4倍(P50中央値)に効率化されたという。料金は音声1分あたり$0.08と明記されている。

実際の導入事例として、Starlinkのサポート窓口(+1 888 GO STARLINK)でのA/Bテストで「販売コンバージョン率とサポート完結率が有意に向上した」とされているが、具体的な向上幅(パーセンテージ)は発表ページに記載がなかった。

さらに、docs.x.ai上のモデルページ(.mdで生Markdown取得)を直接確認すると、grok-voice-think-fast-2.0のエイリアスとしてgrok-voice-latestが明記されており、release notesの記載を公式モデルカード側からも裏取りできた。同ページには利用可能リージョンとしてus-east-1eu-west-1us-saltlake-2の3つが記載されている(料金・レート制限の欄はページ上で空欄になっており、本記事執筆時点では数値の記載を確認できなかった)。

grok-voice-latestという設計

今回の記載でもう1つ注目すべきなのが、「latest」エイリアスの存在です。grok-voice-latestという名前自体は特定のモデルバージョンを固定的に指すのではなく、xAI側の判断で指し先が更新される仕組みだと、この記載から読み取れます。8月5日を境に、grok-voice-latestを呼び出しているアプリケーションは、明示的な変更を加えなくても実際に動いているモデルがgrok-voice-think-fast-2.0に切り替わった、ということになります。

このような「latest」系のエイリアス設計は、常に最新モデルを使いたい開発者にとっては便利な一方で、本番環境で厳密な再現性・挙動の一貫性が必要な用途では、意図しないタイミングでモデルの挙動が変わるリスクにもなります。この点についてxAIの公式ドキュメントがどのような注意喚起をしているかは、release notesの該当エントリの範囲では確認できませんでした。

同時期に強化されていた音声機能

同じJulyセクションには、Speech to Textのvad_thresholdパラメータ(音声区間検出のしきい値を調整するパラメータ。値を下げると狭帯域の電話音声のような、より小さく・ノイズの多い音声も文字起こし対象にできる。0を指定するとゲート自体を無効化できる)の追加も記載されており、xAIが2026年7月に音声関連の機能をまとめて拡張していたことがうかがえます。

ベンチマーク数値は発表元の自己申告、独立検証はしていない

上記のベンチマーク表は「Artificial Analysis社の計測」としてxAI自身の発表ページに掲載されている数値であり、Artificial Analysis側の公開ベンチマークページを本記事のために別途curlして突き合わせる作業は行っていない。文字起こし精度の「1.5〜2.0倍」「約10倍」という比較も、xAIが選んだ比較条件(24言語・数千の短いフレーズ)の範囲での結果であり、第三者による再現検証は確認できていない。Starlinkでの導入事例も「有意に向上した」という定性的な記述のみで、具体的な改善幅の数字はxAI自身が公開していない。

また、8月5日の切り替えが実際に予定通り行われたのか、遅延や変更があったのかについては、今回確認したドキュメント・発表ページの範囲では追跡できなかった。本記事の確認時点(2026年8月27日)で発表ページの内容と整合していることは確認できたが、実際にgrok-voice-latestを呼び出して応答モデルを確認する検証は行っていない。

関連記事

シェア: ポスト はてブ

出典・参照資料

AIニュースの解説を動画でも

YouTubeでは注目ニュースの背景を解説し、Xでは新着記事をお知らせしています。

コメント

まだコメントはありません。最初のコメントを書いてみませんか?

AIについて聞きたいことはありますか?

質問箱で無料で受け付けています。回答は公開され、他の方の参考にもなります。

質問箱を見る →

新しい記事をメールで受け取る

AIの新しい発表を、出典付きで整理して届けます。

関連記事