1枚の写真からトーキング動画を作成 — OmniHuman 1.5
1枚のポートレートと音声トラックを入力するだけで、OmniHuman 1.5が映画品質のリップシンク、表現力豊かな表情モーション、自然な頭部ジェスチャーを実現します。
OmniHuman 1.5でできること
1枚画像アバター
1枚のポートレートをフルパフォーマンスのキャラクターに変換 — リギング、トレーニング、再撮影は不要です。
精密なリップシンク
口の形、顎の動き、音素タイミングが提供した音声トラックにぴったり同期します。
感情パフォーマンス
表情、マイクロムーブメント、頭部ジェスチャーがオーディオのプロソディとエネルギーに応答します。
シネマティック品質
ByteDanceのアップグレードされたジェネレーターが、クローズアップにも耐える自然な肌、髪、ライティングを生成します。
縦型、正方形、ワイドスクリーン
同じソース画像から、Shorts用の9:16、フィード用の1:1、YouTube・ウェブ用の16:9をエクスポートできます。
マスクガイドターゲティング
複数の顔がフレーム内にある場合、マスクサポートを使用してリップシンクを正しい被写体にロックします。
実際のクリエイターのために
SNSスポークスパーソン動画
創業者のヘッドショットをTikTok、Reels、Shortsの解説動画に変換 — あらゆる言語で、スタジオ時間やオンカメラタレントの予約は不要です。
広告クリエイティブ&プロダクトデモ
1枚のポートレートから数十のローカライズされたアバター広告を生成 — スクリプトとボイスを差し替えても、パフォーマンスは一貫したまま。
コース・トレーニング動画
フレンドリーなインストラクターがカメラに向かって直接話す、オンボーディング、人事、eラーニングモジュールを30秒以内で構築。
パーソナライズドアウトリーチ&セールス
メールやLinkedInのアウトリーチ用に15秒のトーキングヘッドイントロを作成 — 録画したように感じられますが、テキストのようにスケールします。
仕様
- プロバイダー
- ByteDance
- 入力タイプ
- ポートレート画像+オーディオ
- 対応画像フォーマット
- JPEG / PNG
- 対応オーディオフォーマット
- MP3 / WAV / M4A
- アスペクト比
- 9:16, 16:9, 1:1
- 解像度
- 720p, 1080p
- 最大再生時間(720p)
- 60秒
- 最大再生時間(1080p)
- 30秒
- マスクサポート
- あり(特定の顔をターゲット)
- テキストプロンプトガイダンス
- オプション
PopcraftでのOmniHuman 1.5の使い方
OmniHuman 1.5はPopcraftのキャラクタースタジオにおけるトーキング動画ワークフローを駆動します。ポートレートをアップロードし、ElevenLabs TTSまたは自身の録音から音声トラックを添付し、アスペクト比と解像度を選択すると、Popcraftがマスク選択、Batch AIゲートウェイを介した送信、SSEによるプログレスストリーミングを処理します。完成したクリップはアバタープロジェクトとアセットギャラリーに保存され、生成されたBロール、SFX、BGMと共にRemotionマルチトラックタイムライン上でAI Agentパイプラインに組み込めます。
よくあるご質問
OmniHuman 1.5はByteDanceのトーキングヘッド動画モデルで、1枚のポートレートをリアルに話すキャラクターに変換します。1枚の画像とオーディオから、表現力豊かなリップシンク、顔のパフォーマンス、微妙な頭部の動きを生成します。
ポートレートとオーディオトラックを提供します。モデルがボイスのリズム、プロソディ、音素を分析し、写真の人物がオーディオに同期して話し、マッチングする表情を行う動画を生成します。
Popcraftの無料アカウントにはOmniHuman 1.5で使えるクレジットが含まれています。長時間や高解像度のレンダリングはより多くのクレジットを消費し、有料プランやトップアップで月間予算を拡大できます。
Popcraftの有料プランではレンダリングした動画の商用利用権が付与されます。ソースポートレートに写っている実在の人物の肖像を使用するには同意が必要です — 許可なく他者のトーキングヘッドコンテンツを生成しないでください。
1080pで最大30秒、720pで最大60秒です。より長い動画はRemotionタイムラインで複数のクリップをつなぎ合わせて作成します。
縦型ショートフォーム動画用の9:16、ワイドスクリーンのYouTubeやランディングページ用の16:9、正方形のフィード投稿用の1:1に対応。Popcraftのキャラクタースタジオからすべて選択できます。
キャラクターページを開き、ポートレートをアップロードし、オーディオを添付し、アスペクト比と解像度を選択して送信します。プログレスがリアルタイムでストリーミングされ、完成したトーキングヘッド動画がギャラリーに保存されます。
さらに探索
関連モデル
PopcraftでKling Avatarを使って長尺トーキングアバター動画を生成。1枚の画像とオーディオから9:16、16:9、1:1で最大60秒の出力。
Seedance 2.5は、1回のジョブで最大30秒の動画を生成できます。最大50個のアセットを参照でき、動画編集の制御、高忠実度の時間軸拡張、0.4から2.5までの任意のアスペクト比、10以上の言語でのネイティブプロンプトに対応しています。Popcraftで公開中。
MiniMax H3は、24fpsの2K動画と同期したステレオ音源(効果音、環境音、台詞)を一度に生成。1つのプロンプトからマルチショット生成、5〜15秒、最初と最後のフレーム制御に対応。Popcraftで公開中。
Popcraft で Seedance 2.0 を使い、テキスト・画像・クリップから映画品質の 4K 動画を生成。ネイティブ同期音声、マルチショットシーケンス、最大 4K (2160p) の極めて精細なディテール。