AI時短ラボ

音声AI・文字起こしの記事

「音声AI・文字起こし」に関連するAIニュースと解説を、出典付きで24本まとめています。

解除

音声AI・文字起こし の記事:24

Googleが「300言語超・70億人・世界人口の86%」と数字を出した言語AIの現在地──Gemini 3.5 Live Translateは70言語・2,000超の言語ペア、目標は「話者数上位1,000言語」、端末内翻訳TranslateGemmaは55言語、フィーチャーフォンでもGeminiの記事画像
研究09.21読了8

Googleが「300言語超・70億人・世界人口の86%」と数字を出した言語AIの現在地──Gemini 3.5 Live Translateは70言語・2,000超の言語ペア、目標は「話者数上位1,000言語」、端末内翻訳TranslateGemmaは55言語、フィーチャーフォンでもGemini

出典 ─ Google公式ブログ(James Manyika・2026年9月15日・9月18日取得)
Introducing GPT-Live-1 in the API(OpenAI公式の画像)
プロダクト09.20読了12

OpenAI、全二重の音声モデル「GPT-Live-1」をAPIで提供──1分$0.05(秒単位課金)の会話層に、推論とツールはGPT-6 Astraなど後ろのモデルへ委任。Full Duplex BenchでGPT-Realtime-2.1より30ポイント上、電話(SIP)対応、声は12種類

出典 ─ OpenAI公式(2026-09-10)
Alibaba、Qwen3.8-Omni-Flashを発表──音声1時間の入力が1セント未満、会議の文字起こしはDER 88.1→3.4、Gemini 3.8 Flashに音声で上・動画推論で下、重みは非公開の記事画像
モデル09.18読了20

Alibaba、Qwen3.8-Omni-Flashを発表──音声1時間の入力が1セント未満、会議の文字起こしはDER 88.1→3.4、Gemini 3.8 Flashに音声で上・動画推論で下、重みは非公開

出典 ─ Qwen公式ブログ「Qwen3.8-Omni
Introducing Gemini 3.8 Live and 3.8 Live Extended Thinking(Google公式ブログの画像)
モデル09.18読了19

Gemini 3.8 Liveと3.8 Live Extended Thinking公開──話しながら裏で考えて道具を動かす音声モデル、Artificial Analysisの音声対話指数で首位、音声は1分あたり入力$0.005・出力$0.018

出典 ─ Google公式ブログ(2026-09-15)
ByteDanceが「見ながら聞きながら話す」全二重AIを実運用投入──音声だけのGPT系リアルタイムAIとの違いはどこにあるかの記事画像
モデル09.07読了17

ByteDanceが「見ながら聞きながら話す」全二重AIを実運用投入──音声だけのGPT系リアルタイムAIとの違いはどこにあるか

出典 ─ ByteDance Seed公式ブログ
RedNoteのdots3-noteをllama.cppがサポート──280Bのマルチモーダル、動くのは16B、Apache 2.0の記事画像
モデル09.07読了11

RedNoteのdots3-noteをllama.cppがサポート──280Bのマルチモーダル、動くのは16B、Apache 2.0

出典 ─ ggml-org/llama.cpp v0.
5分のフル楽曲を生成するMiniMax Music 3、重みが公開──8B+0.6Bの2段構えLLMとFlow Matchingで歌詞から曲を作るの記事画像
モデル09.07読了11

5分のフル楽曲を生成するMiniMax Music 3、重みが公開──8B+0.6Bの2段構えLLMとFlow Matchingで歌詞から曲を作る

出典 ─ Hugging Face
grok-voice-latestが裏側でThink Fast 2.0に切り替わった日──8月5日、気づかれずに起きたルーティング変更の記事画像
モデル09.06読了10

grok-voice-latestが裏側でThink Fast 2.0に切り替わった日──8月5日、気づかれずに起きたルーティング変更

出典 ─ xAI公式ドキュメント
OpenAIが「4o」を外した文字起こしモデルを投入──GPT Transcribe・GPT Live Transcribeの料金と対応範囲の記事画像
プロダクト09.06読了11

OpenAIが「4o」を外した文字起こしモデルを投入──GPT Transcribe・GPT Live Transcribeの料金と対応範囲

出典 ─ OpenAI API Changelog(2
Sunoが9月3日からダウンロード数に上限──旧モデル全廃も予告、公式ブログ4本で確認する変更点の記事画像
プロダクト09.06読了11

Sunoが9月3日からダウンロード数に上限──旧モデル全廃も予告、公式ブログ4本で確認する変更点

出典 ─ Suno Blog
diffusersの「Modular Diffusers」が実験段階を卒業──新モデルは既に旧来パイプラインを持たずModular専用で配布されるの記事画像
検証09.05読了11

diffusersの「Modular Diffusers」が実験段階を卒業──新モデルは既に旧来パイプラインを持たずModular専用で配布される

出典 ─ huggingface/diffusers
Gemini 3.5 Transcribeが正式提供──85言語以上を自動判定・話者最大8人分離を料金表で確認するの記事画像
プロダクト09.05読了11

Gemini 3.5 Transcribeが正式提供──85言語以上を自動判定・話者最大8人分離を料金表で確認する

出典 ─ Gemini API Changelog(2
IBMの音声認識モデル「Granite Speech 5.0 TurboCTC」──470Mでデコーダなし、1フォワードパスで文字起こしの記事画像
モデル09.05読了11

IBMの音声認識モデル「Granite Speech 5.0 TurboCTC」──470Mでデコーダなし、1フォワードパスで文字起こし

出典 ─ huggingface/transforme
ElevenLabsが画像・動画生成APIに進出、ローカルMCPは廃止──changelogで確認する8月の3つの変更の記事画像
プロダクト09.04読了12

ElevenLabsが画像・動画生成APIに進出、ローカルMCPは廃止──changelogで確認する8月の3つの変更

出典 ─ ElevenLabs Changelog 2
音声やYouTubeリンクをピアノ譜に変換するpianoify──『Muscriptor』公開インスタンスの中身の記事画像
検証09.04読了12

音声やYouTubeリンクをピアノ譜に変換するpianoify──『Muscriptor』公開インスタンスの中身

出典 ─ pianoify公式サイト(メタデータ)
動画のPikaが音声4モデルを一挙公開──「ElevenLabsの9倍安い」という自己申告の中身の記事画像
プロダクト09.04読了12

動画のPikaが音声4モデルを一挙公開──「ElevenLabsの9倍安い」という自己申告の中身

出典 ─ Pika Blog
話し言葉を整った文章に変換するGoogleの新AI「Eloquent」──サブスクなし・オフライン動作の音声入力アプリの記事画像
プロダクト09.03読了13

話し言葉を整った文章に変換するGoogleの新AI「Eloquent」──サブスクなし・オフライン動作の音声入力アプリ

出典 ─ Google quietly launche
Suno対GEMA、独ミュンヘン地裁がGEMA勝訴──AI音楽著作権訴訟でヨーロッパ初の判断の記事画像
業界09.02読了15

Suno対GEMA、独ミュンヘン地裁がGEMA勝訴──AI音楽著作権訴訟でヨーロッパ初の判断

出典 ─ Gericht entscheidet pr
OfflineでもParakeet TDT V3が使えるLinuxネイティブ音声入力ツール「hyprwhspr」の記事画像
検証09.01読了16

OfflineでもParakeet TDT V3が使えるLinuxネイティブ音声入力ツール「hyprwhspr」

出典 ─ GitHub: goodroot/hyprw
Sesameの「インテリジェント・アイウェア」──Oculus共同創業者が2027年に投入するAIメガネで、今わかっていることの記事画像
プロダクト09.01読了15

Sesameの「インテリジェント・アイウェア」──Oculus共同創業者が2027年に投入するAIメガネで、今わかっていること

出典 ─ Sesame 公式サイト(トップページ)
Microsoft、Build 2026で自社初の推論モデル「MAI-Thinking-1」を発表の記事画像
モデル08.24読了12

Microsoft、Build 2026で自社初の推論モデル「MAI-Thinking-1」を発表

出典 ─ Thurrott
AI業界が72時間で"声"に集中投下──Anthropic・OpenAI・Googleが動いた3日間を一次資料で確認したの記事画像
業界07.24読了11

AI業界が72時間で"声"に集中投下──Anthropic・OpenAI・Googleが動いた3日間を一次資料で確認した

出典 ─ Anthropic公式ブログ「Think t
OpenAI、全二重音声モデル『GPT-Live』を発表──聞きながら喋り、裏でGPT-5.5に委任する新設計の記事画像
プロダクト07.08読了6

OpenAI、全二重音声モデル『GPT-Live』を発表──聞きながら喋り、裏でGPT-5.5に委任する新設計

出典 ─ OpenAI公式
声のクローンは日本の法律で止められるのか──津田健次郎さんの提訴を一次資料で確認したの記事画像
業界07.06読了9

声のクローンは日本の法律で止められるのか──津田健次郎さんの提訴を一次資料で確認した

出典 ─ 共同通信(Yahoo!ニュース配信)

新しい記事をメールで受け取る

AIの新しい発表を、公式資料にあたって数字を確認したうえで届けます。盛らない・出典を明記する・確認できていないことは書かない、を守ります。