一張照片變成說話影片 —— OmniHuman 1.5
提供一張肖像照和任意語音音軌,OmniHuman 1.5 即可生成影視級唇形同步、豐富面部表情和自然頭部動作。
OmniHuman 1.5 能做什麼
單圖數位人
將一張肖像照動畫化為完整演出的角色 —— 無需綁定、訓練或重拍。
精準唇形同步
嘴型、下顎運動和音素節奏與您提供的語音音軌緊密鎖定。
情感演出
表情、微動作和頭部姿態隨音訊的語調和情感能量變化而回應。
電影級畫質
字節跳動升級的生成器可產生自然的皮膚、頭髮和光照效果,經得起特寫鏡頭的考驗。
直式、方形、寬螢幕
從同一來源圖匯出 9:16 用於短影音、1:1 用於動態消息、16:9 用於 YouTube 或網頁。
遮罩引導定位
使用遮罩支援在多人同框時將唇形同步鎖定到正確的人物。
為真正的創作者打造
社群媒體代言人影片
將創辦人頭像變成任何語言的 TikTok、Reels 和短影音講解 —— 無需預約攝影棚或出鏡人才。
廣告創意和產品示範
從一張肖像照生成數十個在地化數位人廣告 —— 更換腳本和聲音,演出保持一致。
課程和培訓影片
製作入職、人力資源和線上課程模組,讓友善的講師直面鏡頭講解,每次不超過 30 秒。
個人化外展和銷售
建立 15 秒的說話頭像片頭用於電郵和 LinkedIn 外展 —— 看起來像錄製的,卻能像文字一樣規模化。
技術規格
- 供應商
- ByteDance
- 輸入類型
- 肖像圖片 + 音訊
- 支援的圖片格式
- JPEG / PNG
- 支援的音訊格式
- MP3 / WAV / M4A
- 寬高比
- 9:16, 16:9, 1:1
- 解析度
- 720p, 1080p
- 最長時長(720p)
- 60 秒
- 最長時長(1080p)
- 30 秒
- 遮罩支援
- 是(指定人臉)
- 文字提示引導
- 選填
Popcraft 如何使用 OmniHuman 1.5
OmniHuman 1.5 為 Popcraft 的角色工作室說話影片工作流提供動力。上傳一張肖像照,附上來自 ElevenLabs TTS 或您自己的錄音的語音音軌,選擇寬高比和解析度,Popcraft 處理遮罩選擇、透過 Batch AI 閘道提交和 SSE 進度串流。成品影片儲存到您的數位人專案和素材藝廊,可拼接到 AI Agent 流程中,與生成的 B-roll、音效和背景音樂一起放在 Remotion 多軌時間軸上。
常見問題
OmniHuman 1.5 是字節跳動推出的說話頭像影片模型,可將一張肖像照動畫化為逼真的說話角色。它從一張圖片加音訊生成富有表現力的唇形同步、面部演出和細微的頭部動作。
您提供一張肖像照和一段音訊。模型分析語音的節奏、語調和音素,然後生成影片,其中圖片中的人物與音訊同步說話並做出匹配的面部表情。
Popcraft 免費帳號包含可用於 OmniHuman 1.5 的點數。更長或更高解析度的算繪消耗更多點數,付費方案或儲值可擴展您的每月額度。
Popcraft 付費方案授予您算繪影片的商業使用權。您仍需獲得來源肖像中真實人物的肖像使用同意 —— 切勿在未經許可的情況下生成他人的說話頭像內容。
1080p 下每次算繪最長 30 秒,720p 下最長 60 秒。更長的影片可以在 Remotion 時間軸上拼接多個片段來組裝。
9:16 用於直式短影音,16:9 用於寬螢幕 YouTube 和著陸頁,1:1 用於方形動態消息貼文。Popcraft 在角色工作室中提供所有三種選項。
開啟角色頁面,上傳一張肖像照,附上音訊,選擇寬高比和解析度,提交即可。進度即時串流,成品說話影片儲存到您的藝廊。
繼續探索
相關模型
在 Popcraft 上使用 Kling Avatar 生成長時長說話數位人影片。9:16、16:9 和 1:1 輸出,單次生成最長 60 秒。
Seedance 2.5 單次任務可生成長達 30 秒的影片,支援多達 50 個參考素材、可控影片編輯、高保真時間軸延展、0.4 至 2.5 的任意長寬比,以及 10 種以上語言的原生提示詞。現已於 Popcraft 上線。
MiniMax H3 可生成 24fps 的 2K 影片並同步立體聲配樂,一次搞定特效、氛圍與對白。支援單一提示詞多鏡頭、5 至 15 秒、首末幀控制。現已在 Popcraft 上線。
在 Popcraft 上使用 Seedance 2.0,從文字、圖片或片段生成電影級 4K 影片。原生同步音訊、多鏡頭序列,以及最高 4K (2160p) 的極致清晰細節。