動画編集AIのデメリット──自動カット・自動字幕を使って直す羽目になった場面
Adobe公式ヘルプが明記する「シーン編集の検出はリンクされたオーディオも自動的に切る」という仕様と、自分のVOICEVOX×ffmpeg制作で実際に手直しした2つの自動処理の不具合を、数字つきで並べた。

目次
3行まとめ
- Adobe公式ヘルプは「シーン編集の検出はリンクされたオーディオにも自動的にカットを追加する」と明記しており、音声を分離せずに使うと意図しない場所で音が切れる
- 自分のVOICEVOX×ffmpeg制作では、疑問形の文だけ自動生成した口パクのタイミングが実測で最大111.19ms(当初の補正前は23.97ms)ズレる不具合が起きた。全て自動処理の出力をそのまま信じたことが原因
- ffmpegのsilencedetectを既定値のまま動かすと無音区間が1件も検出できない一方、閾値を下げると文中の息継ぎまで拾う。どちらの方向にもハズレがある
この記事で書くこと
「動画編集AI デメリット」で検索する人は、導入する前にリスクを知りたいのだと思う。ここでは抽象的な注意喚起ではなく、公式ドキュメントに明記されている仕様上の注意点と、自分(AI時短ラボ)が実際の制作で自動処理の出力をそのまま使えず直した具体的な場面を、数字つきで並べる。
なお前提として、自分は普段CapCutではなくVOICEVOX(テキスト読み上げ)とffmpeg、Remotionを組み合わせた自作パイプラインで動画を作っている。そのためCapCut固有の不具合は語れない。ここに書くのは、①ベンダー自身が公式ドキュメントで認めているリスク、②自分の制作環境で実際に踏んだ不具合、の2種類だ。
ベンダー公式が明記している注意点──「シーン編集の検出」の場合
Adobe Premiere Proには「シーン編集の検出」という機能があり、フッテージ(撮影素材)を解析してシーンの変わり目を自動検出し、カットポイントを追加してくれる。Adobe公式のヘルプページ(2026年2月18日時点のアーカイブで確認)には、次の一文がある。
「Premiere Pro では、リンクされたオーディオにも自動的にカットが追加されます。それが必要ない場合は、シーン編集を適用する前に、ビデオからオーディオを分離してください。」
これは裏を返すと、「何も準備せずにこの機能を使うと、映像の切れ目と一緒に音声も強制的に切られる」ということだ。ナレーションや会話の途中で映像側のシーンが変わるタイミングがあれば、音声もそこで分断される。ベンダー自身が「それが必要ない場合は事前にオーディオを分離してください」と手順を示しているということは、何もしなければその事故が起きる前提で機能が設計されている、と読むのが自然だ。
これは「AIが間違えた」という話ではなく、「自動化の対象範囲を人間側が把握していないと事故る」という、自動カット機能全般に共通するリスクの一次情報としてここに置いておく。
自分が実際に手直しした場面(1)──疑問形の文だけ、口パクのタイミングが自動処理で壊れた
VOICEVOXは音声合成の前に/audio_queryというAPIを叩くと、各モーラ(拍)の発音時間が秒単位で返ってくる。この情報を使えば、音声認識をせずに「今どの文字を発音しているか」を計算だけで復元できる。この計算結果をもとに口パク(キャラクターの口の開閉アニメーション)を自動生成する仕組みを、自分のパイプラインで運用している。
ところがVOICEVOX ENGINE 0.25.1で実測したところ、文末に「?」が付く疑問形の文だけ、/audio_queryが返すmoras[]の中身は平叙文とまったく同じなのに、実際に生成されるwavファイルだけが0.128秒長くなる不具合が見つかった。エンジンが合成の直前に「疑問形用の継続長0.15秒のモーラ」を勝手に追加しているためで、その情報はAPIレスポンスのどこにも現れない。
最初に組んだ「計算した総尺と実際のwav尺の比(ratio)で全体を引き伸ばして補正する」というロジックは、平叙文には効いたが、疑問形の文にはむしろ逆効果だった。手元の4,864クリップ(実音声8時間14分)で「計算した尺」と「実際に合成されたwavの尺」の比を測った結果は次の通り。
| 文の種類 | 件数 | 比(計算尺/実尺)の中央値 | 誤差5%超の件数 |
|---|---|---|---|
| 疑問符なし | 4,384件 | 0.997506(ほぼ一致) | ― |
| 疑問符あり | 480件 | 1.044455(4.4%のズレ) | 207件(43.1%) |
疑問符なしのクリップは中央値がほぼ1.0で安定していたのに対し、疑問符ありのクリップだけ比がずれ、そのうち43.1%が誤差5%を超えていた。「自動で口パクを作れる」という機能は確かに動いていたが、出力をそのまま信じて配信していたら、疑問文のたびに口の動きと声がズレたキャラクターが映っていたことになる(詳しい実測データと修正方法は別記事にまとめた)。
この不具合を確認した後、実際に使っているエンジンのバージョン(VOICEVOX ENGINE 0.25.1)について、GitHub APIでリリース情報をcurlで取得し直した。このバージョンのリリース日時は2026年1月5日で、公式の変更履歴には「キャラクター『あんこもん』を追加」という1行しか書かれておらず、疑問形の継続長を自動追加するこの挙動についての記載は見当たらなかった。つまりこの挙動は、少なくとも今回確認した公式リリースノートには明文化されていない。
これは自動処理そのものが悪いという話ではなく、「自動生成された数値を検証せずに使うと、特定の条件(この場合は疑問形)でだけ静かに壊れる」という、AIを使った処理全般に言えるリスクの実例として書いている。
自分が実際に手直しした場面(2)──読み間違いは毎回起きる前提で運用している
VOICEVOXでナレーションを生成する際、固有名詞や英数字混じりの語(AIモデル名や企業名など、このサイトの記事では頻出する)で読み間違いが起きる。これは偶発的な不具合ではなく、テキスト読み上げという処理の性質上、常に一定確率で起きるものとして扱っている。対処は公式のユーザー辞書への単語登録か、読み仮名を先にテキスト置換しておくかの2択で、どちらも「後から人間が気づいて直す」工程が必須になる(手順はVOICEVOXの読み間違いを直す2つの方法に書いた)。
「テキスト読み上げAIが使える」という機能名の裏には、読み間違いチェックという地味な手直し工程が常に張り付いている、というのが実感だ。
自動カットの誤検出──閾値を上げても下げても外れる
音声の無音区間を検出してカットする処理の基礎になるffmpegのsilencedetectフィルタを、自分の制作で使っているVOICEVOX生成音声(4クリップ・計15.47秒)に対して実際にかけてみた。ffmpeg公式ドキュメントを今回curlで取得し直すと、silencedetectのデフォルト値は「noise(無音判定の閾値)は-60dBまたは振幅比0.001、duration(最低継続時間)は2秒」と明記されている。この公式デフォルトのまま実行すると、無音区間が1件も検出されなかった。自然な話し言葉の間(ま)は2秒よりずっと短いため、デフォルトのままでは「無音カット」という機能そのものが空振りする。
閾値を変えながら検出件数を数えると、次のようになった。
| 閾値設定 | 検出件数 | 傾向 |
|---|---|---|
| デフォルト(-60dB・2秒) | 0件 | 何も検出できない(空振り) |
| -50dB・0.1秒 | 9件 | ちょうど良さそうな範囲 |
| -30dB・0.05秒 | 30件超 | 文中の息継ぎ・破裂音直後まで拾いすぎる |
後者(-30dB・0.05秒)では文中の小さな息継ぎや破裂音の直後の一瞬の静けさまで「無音」として拾ってしまい、そのまま自動カットに使うと文の途中で不自然に音が途切れる箇所が増える。逆に厳しすぎれば何も検出できず、緩めすぎれば誤検出だらけになる。この閾値のちょうど良いところを探る作業自体が、結局は人間の判断を必要とする(検出結果の詳細な数値は別記事に書いた)。
なお、同じffmpeg公式ドキュメントにはsilencedetectと対になるsilenceremoveという別フィルタも存在し、検出だけでなく実際に無音区間を除去する処理までを1つのフィルタで行える。またsilencedetectにはmonoというオプションもあり、有効にするとステレオ音声の左右チャンネルを別々に無音判定できる。この記事の検証ではmonoオプションは使っていない。
「自動カットができる」という機能は存在するが、パラメータを一つ決め打ちにして安心して使える性質のものではない、というのがここでの結論になる。
今回のデメリットに含まれないもの
この記事に書いたのは、公式ドキュメントに明記された仕様上の注意点1件と、自分の制作環境で実際に発生した不具合2件、合わせて3件だけだ。著作権・利用規約まわりのリスクや、CapCut・DaVinci Resolveなど自分が普段使っていないツール固有の不具合については、この記事では扱っていない。「動画編集AIは万能ではない」という一般論ではなく、確認できた具体例だけを書くという方針でこの記事を書いている。
また、GitHub APIで確認したのはVOICEVOX ENGINE 0.25.1という1バージョン分のリリースノートのみで、この挙動がいつから存在するのか(それより前のバージョンから同じ挙動だったのか、どこかのバージョンで追加されたのか)を追う変更履歴の突き合わせは行っていない。同様に、ffmpegのsilencedetectの検証も自分が持っている短いクリップ(4本・計15.47秒)に対する結果であり、異なる話者・異なる収録条件の音声で同じ傾向になるかは確認していない。
出典・参照資料
AIニュースの解説を動画でも
YouTubeでは注目ニュースの背景を解説し、Xでは新着記事をお知らせしています。
コメント
まだコメントはありません。最初のコメントを書いてみませんか?
AIについて聞きたいことはありますか?
質問箱で無料で受け付けています。回答は公開され、他の方の参考にもなります。
質問箱を見る →新しい記事をメールで受け取る
AIの新しい発表を、出典付きで整理して届けます。