AI時短ラボ
検証· 約11

Runway Act-Twoで演技をAIキャラクターに転写する方法──APIリファレンスで確認したパラメータと料金

RunwayのAct-Two(モデルID act_two)は、3〜30秒の演技参照動画を、静止画または動画のキャラクターに転写するモーションキャプチャ型モデル。表情の強さは1〜5段階、身体の動きまで転写するbodyControlはオン・オフ可能。開発者向けAPI料金は1秒あたり5クレジット(1クレジット=$0.01、つまり$0.05/秒)。

Runway Act-Twoで演技をAIキャラクターに転写する方法──APIリファレンスで確認したパラメータと料金
執筆・編集:
目次

「このキャラクターに、この演技をさせたい」――Runwayの「Act-Two」は、それをAPI 1本で実現するモーションキャプチャ型のモデルである。Runway Academyは「私たちにとって最も高度なモーションキャプチャ」と位置づけている。本稿はdocs.dev.runwayml.comのAPIリファレンスとOpenAPI仕様を一次で確認し、実際に何が指定でき、いくらかかるのかを整理する。

3行まとめ

  1. Act-Two(モデルID act_two)は、静止画または動画のキャラクターに、別の人物が演じた参照動画(3〜30秒)の表情・動きを転写するAPI。エンドポイントは/v1/character_performance
  2. 表情の強さ(expressionIntensity)は1〜5の整数で指定でき、デフォルトは3。bodyControlをtrueにすると、表情だけでなく身体のジェスチャーも転写対象になる
  3. Runway Dev(開発者向けAPI)の料金は1秒あたり5クレジット。クレジットは1個$0.01で購入するため、1秒あたり$0.05に相当する(税金は地域による)

Act-Twoは何をするモデルか

APIリファレンスの説明を訳すと、Act-Twoのエンドポイント(/v1/character_performance)は「参照動画を使ってキャラクターの表情と身体の動きを制御する新しいタスクを開始する」ものだ。入力は2つに分かれる。

  • character(キャラクター): 動かしたい対象。APIリファレンスのフィールド説明文には「動画または画像のどちらかを指定できる(You can either provide a video or an image)」とあり、docs.dev.runwayml.com/openapi.jsonのスキーマ定義を直接確認したところ、実際にCharacterImage(type: image)とCharacterVideo(type: video)の2種類がoneOfで定義されていることを確認できた。「視覚的に認識できる顔が映っており、フレーム内に収まっている」ことが両方に共通する条件として明記されている。この2つでは出力の性質が異なり、画像を渡した場合は「キャラクターは参照動画の演技を、元の静止した環境の中で行う」、動画を渡した場合は「キャラクターは参照動画の演技を、元のアニメーションされた環境の中で、キャラクター自身の動きの一部も保ったまま行う」とスキーマの説明文に明記されている
  • reference(参照): 手本にしたい演技が映った動画。「あなたのキャラクターに演じさせたいように演技している人物の動画」で、長さは3秒から30秒という制約がAPIリファレンスに明記されている

つまり「顔がはっきり映ったキャラクター(静止画または動画)」と「演技のお手本動画」の組み合わせで、キャラクターの表情・動きを演技側に同期させる仕組みだ。

指定できるパラメータ

OpenAPI仕様から確認できる主なパラメータは次の通り。

パラメータ 内容
character.type image(静止画・元の環境を保ったまま演技を適用)またはvideo(動画・元のアニメーション環境とキャラクター自身の動きの一部を保ったまま演技を適用)の2択
reference 手本となる演技動画。typevideo固定で、3〜30秒という長さ制約が明記されている
bodyControl 真偽値。trueにすると表情だけでなく非顔面の動き・ジェスチャーもキャラクターに適用される
expressionIntensity 1〜5の整数(デフォルト3)。数値が大きいほど表情の強度が増す
ratio 出力解像度。1280:720720:1280960:9601104:832832:11041584:672のいずれかから選択
contentModeration.publicFigureThreshold auto(既定)またはlowlowにすると、認識可能な公人が映る生成に対するコンテンツモデレーションが緩くなる
seed 0〜4294967295の整数。同じシードと他パラメータの組み合わせで、似た結果を再現できる

「公人(public figure)」に関するモデレーション設定が明示的に用意されている点は、実在の人物の演技を別のキャラクターに転写するというAct-Twoの性質上、当然の設計と言える。ファイルサイズの上限も仕様に明記されており、画像も動画もbase64データURIで5MBまでとなっている(openapi.jsonのスキーマはいずれも maxLength 5242880 で、説明文も「up to 5MB」)。

料金──1秒5クレジット、それが具体的に何ドルか

docs.dev.runwayml.com/guides/pricingによると、Runway Devのクレジットは開発者ポータルで1クレジット$0.01で購入する(地域により消費税が上乗せされる場合がある)。Act-Twoの料金は次の通り明記されている。

act_two — 5 credits per second

つまり出力1秒あたり5クレジット=$0.05/秒。10秒の動画を1本生成すると50クレジット=$0.50という計算になる。これは開発者向けAPI(Runway Dev)の料金であり、Runwayの一般的なWebアプリ(サブスクリプションプランでのクレジット消費)とは別建てである点に注意したい。

参考までに、同じページで確認できた近い性質のモデルの料金は、Gen-4 Turboが5クレジット/秒、Gen-4.5が12クレジット/秒、動画編集系のAleph 2.0が28クレジット/秒(56クレジットの最低課金あり)となっており、Act-Twoは相対的に低コストな部類に位置づけられる。

Runway Academyが案内する使い方

Runway Academyの「Act-Two」カテゴリには、本記事確認時点で3本のコースが用意されている。

  • Character Animation with Act-Two(2モジュール、レベル:中級、無料受講可): 「表情・身体のジェスチャーの捉え方、キャラクターの声の変更まで含む、Act-Twoを使った説得力のあるキャラクター演技の作り方を学ぶ」と説明されている
  • 声の置き換え: 「Act-Twoでキャラクターの声を置き換える方法を学ぶ」動画コース
  • より高度な表現力のあるキャラクター演技の作り方: 「Act-Two――当社史上最も高度なモーションキャプチャ――で説得力のあるキャラクター演技を作る方法を学ぶ」動画コース

いずれも「Act-Two」という同じ製品カテゴリの下に置かれているが、「声の置き換え」がAPIの/v1/character_performanceエンドポイント単体の機能なのか、音声系の別モデルと組み合わせたワークフローなのかは、コース概要の文言だけでは判別できない。

Aleph 2.0のvideo_to_videoとの違い

本メディアで別に扱ったAleph 2.0(エンドポイント/v1/video_to_video)と混同しないよう整理しておく。Aleph 2.0は「既存の動画そのものを編集する」モデルで、対象・スタイル・照明などを変更する用途に向く。一方Act-Twoは「静止画または動画のキャラクターに、別人が演じた参照動画の表情・動きを転写する」モデルで、character(対象)とreference(演技の手本)という2つの入力を組み合わせる点が構造的に異なる。料金面では、Act-Twoが1秒5クレジット($0.05)なのに対し、Aleph 2.0は1秒28クレジット($0.28、最低56クレジット)と、Aleph 2.0の方が約5.6倍高い。

訂正:以前は「画像のみ」としていたが、OpenAPI仕様を直接確認すると動画も指定できた

  • 本稿のパラメータ情報は開発者向けAPI(docs.dev.runwayml.com)のリファレンスとOpenAPI仕様(openapi.json)が根拠であり、Runwayの一般Webアプリ(runwayml.com)のUI上でのAct-Two利用体験(クレジット消費・操作画面)は別途確認していない
  • characterフィールドについて、本記事作成時にopenapi.jsonのスキーマ定義を直接確認したところ、CharacterImage(type: image)とCharacterVideo(type: video)の2種類がoneOfで定義されており、画像・動画のどちらも指定できることが分かった。本記事は当初「スキーマ上は画像のみが許可値」としていたが、これは誤りだったため訂正する
  • Runway Academyのコース内容は概要説明のみを確認しており、実際の受講は行っていない
  • 「音声(声)を置き換える」機能がAct-Two本体のAPIパラメータに含まれるのか、それとも別モデル・別機能との組み合わせなのかは、今回確認したOpenAPI仕様の範囲では判別できなかった。少なくとも/v1/character_performanceのリクエストスキーマには、音声・声に関するパラメータは見当たらなかった

関連記事

シェア: ポスト はてブ

出典・参照資料

更新・訂正履歴

  • ファイルサイズ上限を訂正。「画像は5MBまで、動画は同16MBまで」と書いていたが、docs.dev.runwayml.com/openapi.json の /v1/character_performance を全走査すると、character(CharacterVideo)・reference(CharacterReferenceVideo)いずれのuriスキーマも maxLength 5242880 で、説明文も up to 5MB。16MBに当たる値はAct-Two関連スキーマのどこにも無かった。動画も5MBに直した。

AIニュースの解説を動画でも

YouTubeでは注目ニュースの背景を解説し、Xでは新着記事をお知らせしています。

コメント

まだコメントはありません。最初のコメントを書いてみませんか?

AIについて聞きたいことはありますか?

質問箱で無料で受け付けています。回答は公開され、他の方の参考にもなります。

質問箱を見る →

新しい記事をメールで受け取る

AIの新しい発表を、出典付きで整理して届けます。

関連記事