一张照片变成说话视频 —— OmniHuman 1.5
提供一张肖像照和任意语音音轨,OmniHuman 1.5 即可生成影视级唇形同步、丰富面部表情和自然头部动作。
OmniHuman 1.5 能做什么
单图数字人
将一张肖像照动画化为完整表演的角色 —— 无需绑定、训练或重拍。
精准唇形同步
嘴型、下颌运动和音素节奏与您提供的语音音轨紧密锁定。
情感表演
表情、微动作和头部姿态随音频的语调和情感能量变化而响应。
电影级画质
字节跳动升级的生成器可产生自然的皮肤、头发和光照效果,经得起特写镜头的考验。
竖版、方形、宽屏
从同一源图导出 9:16 用于短视频、1:1 用于信息流、16:9 用于 YouTube 或网页。
遮罩引导定位
使用遮罩支持在多人同框时将唇形同步锁定到正确的人物。
为真正的创作者打造
社交媒体代言人视频
将创始人头像变成任何语言的 TikTok、Reels 和短视频讲解 —— 无需预约摄影棚或出镜人才。
广告创意和产品演示
从一张肖像照生成数十个本地化数字人广告 —— 更换脚本和声音,表演保持一致。
课程和培训视频
制作入职、人力资源和在线课程模块,让友好的讲师直面镜头讲解,每次不超过 30 秒。
个性化外展和销售
创建 15 秒的说话头像片头用于邮件和 LinkedIn 外展 —— 看起来像录制的,却能像文字一样规模化。
技术参数
- 供应商
- ByteDance
- 输入类型
- 肖像图片 + 音频
- 支持的图片格式
- JPEG / PNG
- 支持的音频格式
- MP3 / WAV / M4A
- 宽高比
- 9:16, 16:9, 1:1
- 分辨率
- 720p, 1080p
- 最长时长(720p)
- 60 秒
- 最长时长(1080p)
- 30 秒
- 遮罩支持
- 是(指定人脸)
- 文本提示引导
- 可选
Popcraft 如何使用 OmniHuman 1.5
OmniHuman 1.5 为 Popcraft 的角色工作室说话视频工作流提供动力。上传一张肖像照,附上来自 ElevenLabs TTS 或您自己的录音的语音音轨,选择宽高比和分辨率,Popcraft 处理遮罩选择、通过 Batch AI 网关提交和 SSE 进度推流。成品视频保存到您的数字人项目和素材画廊,可拼接到 AI Agent 流程中,与生成的 B-roll、音效和背景音乐一起放在 Remotion 多轨时间线上。
常见问题
OmniHuman 1.5 是字节跳动推出的说话头像视频模型,可将一张肖像照动画化为逼真的说话角色。它从一张图片加音频生成富有表现力的唇形同步、面部表演和细微的头部动作。
您提供一张肖像照和一段音频。模型分析语音的节奏、语调和音素,然后生成视频,其中图片中的人物与音频同步说话并做出匹配的面部表情。
Popcraft 免费账户包含可用于 OmniHuman 1.5 的积分。更长或更高分辨率的渲染消耗更多积分,付费计划或充值可扩展您的月度额度。
Popcraft 付费计划授予您渲染视频的商业使用权。您仍需获得源肖像中真实人物的肖像使用同意 —— 切勿在未经许可的情况下生成他人的说话头像内容。
1080p 下每次渲染最长 30 秒,720p 下最长 60 秒。更长的视频可以在 Remotion 时间线上拼接多个片段来组装。
9:16 用于竖版短视频,16:9 用于宽屏 YouTube 和落地页,1:1 用于方形信息流帖子。Popcraft 在角色工作室中提供所有三种选项。
打开角色页面,上传一张肖像照,附上音频,选择宽高比和分辨率,提交即可。进度实时推流,成品说话视频保存到您的画廊。
继续探索
相关模型
在 Popcraft 上使用 Kling Avatar 生成长时长说话数字人视频。9:16、16:9 和 1:1 输出,单次生成最长 60 秒。
Seedance 2.5 单次任务最长可生成 30 秒视频,支持最多 50 个参考素材、可控视频编辑、高保真时序延展,宽高比支持 0.4 至 2.5,原生支持 10 种以上语言输入提示词。现已在 Popcraft 上线。
MiniMax H3 生成 24fps 的 2K 视频,并同步配有立体声声纹——音效、环境音和对话一次完成。单提示词多镜头切换,5 至 15 秒,支持首尾帧控制。Popcraft 现已上线。
在 Popcraft 上使用 Seedance 2.0,从文本、图片或片段生成电影级 4K 视频。原生同步音频、多镜头序列,以及最高 4K (2160p) 的极致清晰细节。