AI時短ラボ
活用· 約11

動画編集の仕事はAIでなくなるのか──自動化できたタスクとできなかったタスクの線引き

CapCut公式が「スクリプトからビデオを生成」と説明する自動化の範囲と、自分のVOICEVOX×ffmpeg×Remotion制作で実際に自動化した工程・人力に残した工程を突き合わせ、どこに線があるかを整理した。

動画編集の仕事はAIでなくなるのか──自動化できたタスクとできなかったタスクの線引き
執筆・編集:
目次

3行まとめ

  1. CapCut公式ページは「トピックを入力→AIが台本生成→AIアバターが読み上げ→字幕が自動同期→BGMを選ぶだけ」という手順を、動画編集の標準フローとして案内している
  2. 自分の制作でも、ナレーション音声の生成・音量ミックスの計算・口パクのタイミング算出はすでに自動化しているが、台本の中身の判断と、自動処理が出した数値の検証は毎回人間(自分)がやっている
  3. 「なくなるか」で二択にするより、どのタスクが機械的なルールに落とせて、どのタスクが検証・判断を要求するかで線を引いたほうが、自分の制作実感には合っている

「なくなる/なくならない」の前に、何が自動化できているかを見る

「動画編集の仕事はAIでなくなるのか」という検索は、おそらく職業としての先行きへの不安から来ている。ここでは抽象的な未来予測はせず、①動画編集ツールのベンダーが「自動化できる」と公式に説明している範囲、②自分(AI時短ラボ)が実際の動画制作で自動化している範囲、の2つを並べて、「置き換わりやすいタスク」と「人力が残っているタスク」の線がどこにあるかを書く。

自分の制作環境は、VOICEVOX(テキスト読み上げ)でナレーションを音声合成し、ffmpegで音声処理、Remotion(HTMLベースの動画合成ツール)で映像を組む自作パイプラインで、CapCutなどの市販AI動画編集ツールは使っていない。そのため、ベンダー側の説明は「業界がどこまで自動化を謳っているか」の一次情報として引用し、自分の経験は別の実装での実感として区別して書く。

ベンダーが「自動化できる」と説明している範囲

CapCutの「AIビデオエディター」ページ(2026年8月27日確認)には、動画を作る手順がHowTo形式で載っている。要約すると次の4ステップだ。

  1. 「新しいプロジェクト」を作り、トピックやアイデアを入力する(自分で台本を書いても、「AIで作成」機能にAIへ台本を書かせてもよい)
  2. AIアバター(仮想プレゼンター)を選び、AIボイスオーバー生成機能でナレーションを読ませる
  3. キャプション(字幕)テンプレートを追加すると、ナレーションと自動的に同期する
  4. 動画の雰囲気に合うBGMを選んでタイムラインに配置する

さらに公式のFAQには、「CapCutの人工知能ビデオ編集は、高度なアルゴリズムを使用して編集過程を自動化および強化」し、「スクリプトからビデオへの変換、テキストから音声への変換、安定化、フィラーワードの削除、自動キャプション」などの機能を提供する、という説明もある。

これを読む限り、ベンダー側が謳っている自動化の範囲は、「台本を書く」「読み上げる」「字幕を同期する」「不要な言い淀み(フィラーワード)を削る」「手ブレを直す」「BGMを乗せる」という、動画制作の工程のかなりの部分に及んでいる。少なくとも建前上は、企画から書き出しまでを一気通貫でAIに任せられる、という設計思想がうかがえる。

ただし個別の機能ページを深掘りすると、ベンダー自身も「完全自動」とは言い切っていない箇所がある。CapCutの字幕生成機能の個別ページ(capcut.com/ja-jp/tools/ai-caption-generator)を今回curlで取得すると、「正確かつ精密な字幕」という見出しの説明文に「AIキャプション生成ツールは高精度を目指して設計されており、手動での修正の必要性を軽減します」と書かれている。「なくす(eliminate)」ではなく「軽減する(reduce)」という言葉が使われている点は、公式サイド自身が手動修正の可能性を前提にしていることを示している。同じページには、自分のSRT字幕ファイルをアップロードして「字幕のタイミングと文言を完全にコントロールする」機能も案内されており、自動生成の結果を丸ごと差し替えられる手段が公式に用意されていることも確認できた。

同様に、台本生成機能の個別ページ(capcut.com/ja-jp/tools/ai-dialogue-generator)にも「生成されたダイアログは複数の編集をサポート」という項目があり、「スクリプトが作成されると...完全な柔軟性でスクリプトを改良できます。テキストを磨いたり、広告用に短くしたり...」と説明されている。AIが生成した台本をそのまま使う前提ではなく、その後の推敲(磨く)を組み込んだ機能設計になっている。

自分の制作で実際に自動化している工程

自分のパイプラインで、すでに「機械的なルールに落とし込めていて、人間が毎回手を動かしていない」工程は次の3つだ。

ナレーション音声の生成。 台本のテキストをVOICEVOXに渡せば、音声ファイルは自動で出てくる。人間の声優やナレーターを都度手配する必要はない。

音量ミックスの計算。 ナレーションとBGMを混ぜる処理は、声だけにラウドネス正規化をかけ、BGMは固定音量にし、最後にリミッターで音割れを防ぐ、という決まった処理順序に落とし込んである(詳しい手順)。この順序さえ守れば、素材が変わっても毎回同じ品質のミックスが機械的に出てくる。

口パクのタイミング算出。 VOICEVOXが音声合成の前に返す/audio_queryのレスポンスから、各モーラの発音時間を計算し、キャラクターの口の開閉タイミングを自動生成している(実装の詳細)。これも音声を人間が聞いて手作業でタイミングを取る必要がない。

この3つに共通するのは、「入力が決まれば、出力の計算方法が一意に決まる」という性質だ。ルール化できるタスクは、実際に機械に渡してしまえる。

人力に残っている工程

一方で、次の3つは今のところ毎回自分(人間)が確認・判断している。

台本の中身を決めること。 何を書くか、どの事実を取り上げるか、どの順番で説明するかは、AIに丸投げしていない。CapCutのFAQは「AIで作成」機能でAIに台本を書かせることもできると案内しているが、自分の制作では「何が読者にとって重要な情報か」の判断そのものを自動化対象にしていない。

読み間違いのチェック。 VOICEVOXでの音声生成は自動化されているが、固有名詞や英数字混じりの語で読み間違いが起きるのは避けられず、公式辞書への登録や読み仮名の置換で人間が直している(詳しい手順)。「音声が出る」ところまでは自動化できても、「正しく読めているか」の検証は残る。

自動カットの結果を鵜呑みにしないこと。 ffmpegのsilencedetectで無音区間を自動検出する処理を試したところ、デフォルト設定では何も検出されず、閾値を緩めると今度は文中の息継ぎまで誤検出するという結果になった(実測データ)。この閾値をどこに設定するか、検出結果のどこを実際に採用するかは、結局は人間が最後に見て決めている。

見えてきた線引き

この3対3を並べて気づくのは、自動化できているのは「入力から出力までの計算方法が決まっているタスク」で、人力に残っているのは「正しさを検証する必要があるタスク」と「何が重要かを判断するタスク」だということだ。

工程 自分の制作での状態 CapCut公式ページの説明との関係
ナレーション音声生成 自動化済み 公式も「テキストから音声への変換」を自動化機能として案内
音量ミックスの計算 自動化済み(決まった処理順序) 対応する公式機能の詳細な文言は確認していない
口パクのタイミング算出 自動化済み(モーラ単位の計算) 公式もリップシンク機能を提供するが、「表情や唇の動きを正確にマッチング」という説明のみで、算出方式の詳細は非公開
台本の中身の判断 人力 公式も生成後に「スクリプトを改良できます」と、推敲工程を前提にした設計
読み間違いのチェック 人力 公式は「手動での修正の必要性を軽減」と明記(ゼロにするとは言っていない)
自動カット結果の採否 人力 ffmpeg公式ドキュメントのsilencedetect既定値でも無検出が起きることを別記事で実測済み

CapCutの説明にある「フィラーワードの削除」や「安定化」も、恐らく同じ構造だと推測できる。検出のアルゴリズムは自動化できても、「本当にこの言い淀みは削っていい場所か」「この手ブレ補正で不自然にならないか」の最終判断がどこまで人間の手を離れているかは、自分では検証していないため書けない。今回、この2機能について公式サイト内に個別の機能紹介ページ(字幕生成・対話生成にあったような専用ページ)がないかをcurlで探したが、見当たらなかった。少なくとも公式が単独ページを用意して詳しく説明する扱いにはなっていない、という点までは確認できた。

「動画編集の仕事はAIでなくなるか」という問いに一言で答えるなら、少なくとも自分の制作実感では「機械的なルールに落とせる作業は自分の手からすでに離れており、正しさの検証と何を伝えるかの判断は残っている」という状態になる。これが動画編集という職業全体に当てはまるかどうかは別の問いで、AIと雇用全般についてのより広いデータは別記事にまとめている。

「AIで作成」機能そのものは試していない

CapCutをはじめとする市販AI動画編集ツールで、実際に「AIで作成」機能を使って台本から動画までを一気通貫で作った場合に、どの程度の手直しが必要になるかは、自分では試していないため書けない。今回書けたのは、公式が案内している自動化の範囲と、自分が別の実装で実際に体験している自動化・非自動化の範囲の2つを並べたところまでだ。

シェア: ポスト はてブ

出典・参照資料

AIニュースの解説を動画でも

YouTubeでは注目ニュースの背景を解説し、Xでは新着記事をお知らせしています。

コメント

まだコメントはありません。最初のコメントを書いてみませんか?

AIについて聞きたいことはありますか?

質問箱で無料で受け付けています。回答は公開され、他の方の参考にもなります。

質問箱を見る →

新しい記事をメールで受け取る

AIの新しい発表を、出典付きで整理して届けます。

関連記事