NEW下一个爆款 UGC 广告,一键即达。快来体验 Studio立即制作广告
PopcraftPopcraft
ByteDance · OmniHuman 1.5

一张照片变成说话视频 —— OmniHuman 1.5

提供一张肖像照和任意语音音轨,OmniHuman 1.5 即可生成影视级唇形同步、丰富面部表情和自然头部动作。

免费试用说话视频

OmniHuman 1.5 能做什么

单图数字人

将一张肖像照动画化为完整表演的角色 —— 无需绑定、训练或重拍。

精准唇形同步

嘴型、下颌运动和音素节奏与您提供的语音音轨紧密锁定。

情感表演

表情、微动作和头部姿态随音频的语调和情感能量变化而响应。

电影级画质

字节跳动升级的生成器可产生自然的皮肤、头发和光照效果,经得起特写镜头的考验。

竖版、方形、宽屏

从同一源图导出 9:16 用于短视频、1:1 用于信息流、16:9 用于 YouTube 或网页。

遮罩引导定位

使用遮罩支持在多人同框时将唇形同步锁定到正确的人物。

为真正的创作者打造

社交媒体代言人视频

将创始人头像变成任何语言的 TikTok、Reels 和短视频讲解 —— 无需预约摄影棚或出镜人才。

广告创意和产品演示

从一张肖像照生成数十个本地化数字人广告 —— 更换脚本和声音,表演保持一致。

课程和培训视频

制作入职、人力资源和在线课程模块,让友好的讲师直面镜头讲解,每次不超过 30 秒。

个性化外展和销售

创建 15 秒的说话头像片头用于邮件和 LinkedIn 外展 —— 看起来像录制的,却能像文字一样规模化。

技术参数

供应商
ByteDance
输入类型
肖像图片 + 音频
支持的图片格式
JPEG / PNG
支持的音频格式
MP3 / WAV / M4A
宽高比
9:16, 16:9, 1:1
分辨率
720p, 1080p
最长时长(720p)
60 秒
最长时长(1080p)
30 秒
遮罩支持
是(指定人脸)
文本提示引导
可选

Popcraft 如何使用 OmniHuman 1.5

OmniHuman 1.5 为 Popcraft 的角色工作室说话视频工作流提供动力。上传一张肖像照,附上来自 ElevenLabs TTS 或您自己的录音的语音音轨,选择宽高比和分辨率,Popcraft 处理遮罩选择、通过 Batch AI 网关提交和 SSE 进度推流。成品视频保存到您的数字人项目和素材画廊,可拼接到 AI Agent 流程中,与生成的 B-roll、音效和背景音乐一起放在 Remotion 多轨时间线上。

常见问题

OmniHuman 1.5 是字节跳动推出的说话头像视频模型,可将一张肖像照动画化为逼真的说话角色。它从一张图片加音频生成富有表现力的唇形同步、面部表演和细微的头部动作。

您提供一张肖像照和一段音频。模型分析语音的节奏、语调和音素,然后生成视频,其中图片中的人物与音频同步说话并做出匹配的面部表情。

Popcraft 免费账户包含可用于 OmniHuman 1.5 的积分。更长或更高分辨率的渲染消耗更多积分,付费计划或充值可扩展您的月度额度。

Popcraft 付费计划授予您渲染视频的商业使用权。您仍需获得源肖像中真实人物的肖像使用同意 —— 切勿在未经许可的情况下生成他人的说话头像内容。

1080p 下每次渲染最长 30 秒,720p 下最长 60 秒。更长的视频可以在 Remotion 时间线上拼接多个片段来组装。

9:16 用于竖版短视频,16:9 用于宽屏 YouTube 和落地页,1:1 用于方形信息流帖子。Popcraft 在角色工作室中提供所有三种选项。

打开角色页面,上传一张肖像照,附上音频,选择宽高比和分辨率,提交即可。进度实时推流,成品说话视频保存到您的画廊。

准备好试试 OmniHuman 1.5 了吗?

100 个免费积分即刻开始创作 —— 无需信用卡。

免费试用说话视频

继续探索

相关模型