Runway Act-Twoで演技をAIキャラクターに転写する方法──APIリファレンスで確認したパラメータと料金
RunwayのAct-Two(モデルID act_two)は、3〜30秒の演技参照動画を、静止画または動画のキャラクターに転写するモーションキャプチャ型モデル。表情の強さは1〜5段階、身体の動きまで転写するbodyControlはオン・オフ可能。開発者向けAPI料金は1秒あたり5クレジット(1クレジット=$0.01、つまり$0.05/秒)。

目次
「このキャラクターに、この演技をさせたい」――Runwayの「Act-Two」は、それをAPI 1本で実現するモーションキャプチャ型のモデルである。Runway Academyは「私たちにとって最も高度なモーションキャプチャ」と位置づけている。本稿はdocs.dev.runwayml.comのAPIリファレンスとOpenAPI仕様を一次で確認し、実際に何が指定でき、いくらかかるのかを整理する。
3行まとめ
- Act-Two(モデルID
act_two)は、静止画または動画のキャラクターに、別の人物が演じた参照動画(3〜30秒)の表情・動きを転写するAPI。エンドポイントは/v1/character_performance- 表情の強さ(
expressionIntensity)は1〜5の整数で指定でき、デフォルトは3。bodyControlをtrueにすると、表情だけでなく身体のジェスチャーも転写対象になる- Runway Dev(開発者向けAPI)の料金は1秒あたり5クレジット。クレジットは1個$0.01で購入するため、1秒あたり$0.05に相当する(税金は地域による)
Act-Twoは何をするモデルか
APIリファレンスの説明を訳すと、Act-Twoのエンドポイント(/v1/character_performance)は「参照動画を使ってキャラクターの表情と身体の動きを制御する新しいタスクを開始する」ものだ。入力は2つに分かれる。
- character(キャラクター): 動かしたい対象。APIリファレンスのフィールド説明文には「動画または画像のどちらかを指定できる(You can either provide a video or an image)」とあり、
docs.dev.runwayml.com/openapi.jsonのスキーマ定義を直接確認したところ、実際にCharacterImage(type: image)とCharacterVideo(type: video)の2種類がoneOfで定義されていることを確認できた。「視覚的に認識できる顔が映っており、フレーム内に収まっている」ことが両方に共通する条件として明記されている。この2つでは出力の性質が異なり、画像を渡した場合は「キャラクターは参照動画の演技を、元の静止した環境の中で行う」、動画を渡した場合は「キャラクターは参照動画の演技を、元のアニメーションされた環境の中で、キャラクター自身の動きの一部も保ったまま行う」とスキーマの説明文に明記されている - reference(参照): 手本にしたい演技が映った動画。「あなたのキャラクターに演じさせたいように演技している人物の動画」で、長さは3秒から30秒という制約がAPIリファレンスに明記されている
つまり「顔がはっきり映ったキャラクター(静止画または動画)」と「演技のお手本動画」の組み合わせで、キャラクターの表情・動きを演技側に同期させる仕組みだ。
指定できるパラメータ
OpenAPI仕様から確認できる主なパラメータは次の通り。
| パラメータ | 内容 |
|---|---|
character.type |
image(静止画・元の環境を保ったまま演技を適用)またはvideo(動画・元のアニメーション環境とキャラクター自身の動きの一部を保ったまま演技を適用)の2択 |
reference |
手本となる演技動画。typeはvideo固定で、3〜30秒という長さ制約が明記されている |
bodyControl |
真偽値。trueにすると表情だけでなく非顔面の動き・ジェスチャーもキャラクターに適用される |
expressionIntensity |
1〜5の整数(デフォルト3)。数値が大きいほど表情の強度が増す |
ratio |
出力解像度。1280:720・720:1280・960:960・1104:832・832:1104・1584:672のいずれかから選択 |
contentModeration.publicFigureThreshold |
auto(既定)またはlow。lowにすると、認識可能な公人が映る生成に対するコンテンツモデレーションが緩くなる |
seed |
0〜4294967295の整数。同じシードと他パラメータの組み合わせで、似た結果を再現できる |
「公人(public figure)」に関するモデレーション設定が明示的に用意されている点は、実在の人物の演技を別のキャラクターに転写するというAct-Twoの性質上、当然の設計と言える。ファイルサイズの上限も仕様に明記されており、画像も動画もbase64データURIで5MBまでとなっている(openapi.jsonのスキーマはいずれも maxLength 5242880 で、説明文も「up to 5MB」)。
料金──1秒5クレジット、それが具体的に何ドルか
docs.dev.runwayml.com/guides/pricingによると、Runway Devのクレジットは開発者ポータルで1クレジット$0.01で購入する(地域により消費税が上乗せされる場合がある)。Act-Twoの料金は次の通り明記されている。
act_two— 5 credits per second
つまり出力1秒あたり5クレジット=$0.05/秒。10秒の動画を1本生成すると50クレジット=$0.50という計算になる。これは開発者向けAPI(Runway Dev)の料金であり、Runwayの一般的なWebアプリ(サブスクリプションプランでのクレジット消費)とは別建てである点に注意したい。
参考までに、同じページで確認できた近い性質のモデルの料金は、Gen-4 Turboが5クレジット/秒、Gen-4.5が12クレジット/秒、動画編集系のAleph 2.0が28クレジット/秒(56クレジットの最低課金あり)となっており、Act-Twoは相対的に低コストな部類に位置づけられる。
Runway Academyが案内する使い方
Runway Academyの「Act-Two」カテゴリには、本記事確認時点で3本のコースが用意されている。
- Character Animation with Act-Two(2モジュール、レベル:中級、無料受講可): 「表情・身体のジェスチャーの捉え方、キャラクターの声の変更まで含む、Act-Twoを使った説得力のあるキャラクター演技の作り方を学ぶ」と説明されている
- 声の置き換え: 「Act-Twoでキャラクターの声を置き換える方法を学ぶ」動画コース
- より高度な表現力のあるキャラクター演技の作り方: 「Act-Two――当社史上最も高度なモーションキャプチャ――で説得力のあるキャラクター演技を作る方法を学ぶ」動画コース
いずれも「Act-Two」という同じ製品カテゴリの下に置かれているが、「声の置き換え」がAPIの/v1/character_performanceエンドポイント単体の機能なのか、音声系の別モデルと組み合わせたワークフローなのかは、コース概要の文言だけでは判別できない。
Aleph 2.0のvideo_to_videoとの違い
本メディアで別に扱ったAleph 2.0(エンドポイント/v1/video_to_video)と混同しないよう整理しておく。Aleph 2.0は「既存の動画そのものを編集する」モデルで、対象・スタイル・照明などを変更する用途に向く。一方Act-Twoは「静止画または動画のキャラクターに、別人が演じた参照動画の表情・動きを転写する」モデルで、character(対象)とreference(演技の手本)という2つの入力を組み合わせる点が構造的に異なる。料金面では、Act-Twoが1秒5クレジット($0.05)なのに対し、Aleph 2.0は1秒28クレジット($0.28、最低56クレジット)と、Aleph 2.0の方が約5.6倍高い。
訂正:以前は「画像のみ」としていたが、OpenAPI仕様を直接確認すると動画も指定できた
- 本稿のパラメータ情報は開発者向けAPI(
docs.dev.runwayml.com)のリファレンスとOpenAPI仕様(openapi.json)が根拠であり、Runwayの一般Webアプリ(runwayml.com)のUI上でのAct-Two利用体験(クレジット消費・操作画面)は別途確認していない characterフィールドについて、本記事作成時にopenapi.jsonのスキーマ定義を直接確認したところ、CharacterImage(type: image)とCharacterVideo(type: video)の2種類がoneOfで定義されており、画像・動画のどちらも指定できることが分かった。本記事は当初「スキーマ上は画像のみが許可値」としていたが、これは誤りだったため訂正する- Runway Academyのコース内容は概要説明のみを確認しており、実際の受講は行っていない
- 「音声(声)を置き換える」機能がAct-Two本体のAPIパラメータに含まれるのか、それとも別モデル・別機能との組み合わせなのかは、今回確認したOpenAPI仕様の範囲では判別できなかった。少なくとも
/v1/character_performanceのリクエストスキーマには、音声・声に関するパラメータは見当たらなかった
関連記事
出典・参照資料
更新・訂正履歴
- ファイルサイズ上限を訂正。「画像は5MBまで、動画は同16MBまで」と書いていたが、docs.dev.runwayml.com/openapi.json の /v1/character_performance を全走査すると、character(CharacterVideo)・reference(CharacterReferenceVideo)いずれのuriスキーマも maxLength 5242880 で、説明文も up to 5MB。16MBに当たる値はAct-Two関連スキーマのどこにも無かった。動画も5MBに直した。
AIニュースの解説を動画でも
YouTubeでは注目ニュースの背景を解説し、Xでは新着記事をお知らせしています。
コメント
まだコメントはありません。最初のコメントを書いてみませんか?
AIについて聞きたいことはありますか?
質問箱で無料で受け付けています。回答は公開され、他の方の参考にもなります。
質問箱を見る →新しい記事をメールで受け取る
AIの新しい発表を、出典付きで整理して届けます。