形象克隆|声音克隆|全身动作生成

一张照片|一段本人录音
生成全身动作口播视频

照片用于克隆人物形象,录音用于克隆本人声音,口播文案用于驱动口型、表情、手势、全身动作、动态场景和镜头变化。

照片克隆人物形象
录音克隆本人声音
文案驱动人物表达
操作教程 · 约1分43秒
技术原理

不是让照片简单说话,而是克隆形象与声音

人物照片、本人录音和口播文案承担不同任务,三者共同决定最终数字分身视频的效果。

输入一张人物照片克隆人物形象

根据照片中的面部、发型、服装和身体轮廓生成对应人物形象。半身或全身照片能提供更完整的姿态信息。

输入一段本人录音克隆本人声音

根据清晰录音复刻本人音色和声音特征,使人物使用本人声音表达新的口播文案。

输入一篇口播文案生成全身表达

根据文案语义生成口型、表情、手势和身体动作,并协调动态场景与镜头变化。

重要区别:无需提前拍摄数分钟训练素材,也不必长期绑定一个固定数字人。每次生成均可重新提交新的授权照片和本人录音,独立克隆对应的形象与声音。

方案区别

普通照片说话、传统数字人定制与全身动作生成有什么不同?

三种方案都可能被称为数字人,但人物来源、声音来源、动作范围和付费方式并不相同。

比较项目普通照片说话传统数字人定制本页介绍的生成方式
人物形象让静态照片产生嘴部或头部运动拍摄训练素材后制作固定数字人每次通过照片克隆人物形象
人物声音平台音色或外部配音提前制作并长期使用固定声音每次通过本人录音克隆声音
动作范围嘴部、眨眼和头部为主按照固定底板或预设动作播报表情、手势和全身动作协同生成
画面表现背景和镜头通常固定模板或演播室场景支持动态场景与镜头变化
更换人物可以更换照片通常需要重新定制或训练每次生成均可更换授权照片与录音
形象费用按会员、积分或次数计费形象定制费加视频生成费无独立形象定制费,按生成时长计费
透明计费

不收形象定制费,只按最终生成时长计费

每次生成都可以独立克隆新的授权人物形象与本人声音,不需要为每个人物购买固定数字人。

15秒¥3150积分
30秒¥6300积分
60秒¥12600积分
3分钟¥361800积分
¥0.20/秒|充值¥100获得5000积分可生成500秒视频,约8分20秒
素材准备

照片、录音和文案分别有什么要求?

高质量素材不能保证每次生成完全一致,但能减少轮廓错误、口型不稳和动作僵硬等问题。

人物照片

建议

正面或轻微侧身,光线均匀,人物清晰,身体与手臂轮廓完整。

避免

多人合照、严重侧脸、低分辨率、过度美颜或身体大面积遮挡。

服装与背景

建议

服装边缘清楚,人物与背景存在色差,饰品和手持物保持简洁。

避免

衣服与背景同色、透明材质、复杂流苏或手持物遮住手指。

本人录音

建议

环境安静、语速正常、音量稳定,并使用清晰的原始录音。

避免

背景音乐、明显混响、多人说话、音量波动或重度降噪失真。

口播文案

建议

短句为主、标点明确,数字和专有名词采用便于朗读的写法。

避免

超长句、符号堆叠、生僻缩写和难以自然表达的书面句。

取景原则:头像适合面部口播,半身照更容易表现手势,全身照能呈现完整姿态。不要用头像照片强行要求完整腿部动作。

文案优化

怎样写文案,动作和口播更自然?

动作不是越多越好。好的文案会给语音和身体动作留出节奏。

一句一个重点

把过长复句拆开,观点、数字和结论单独成句,口型和强调动作更容易同步。

用标点控制停顿

逗号用于短停顿,句号用于完整收束,不要依靠大量特殊符号制造节奏。

先朗读再提交

修改拗口表达、数字读法和英文缩写。真人难以朗读的文本也难以自然呈现。

示例:“这款产品有三个特点。第一,操作简单;第二,生成速度快;第三,适合批量制作。”比一个没有停顿的长句更容易形成自然的列举动作。

制作流程

从素材检查到成片,建议按五步操作

1

确认授权

确认照片、声音、文案和其他素材具有相应使用权限。

2

上传照片

检查面部、手指、服装边缘和遮挡,用于克隆人物形象。

3

上传录音

检查噪声、爆音和混响,用于克隆本人声音。

4

提交文案

用口语化短句驱动口型、表情、手势与全身动作。

5

复核成片

发布前检查形象、声音、口型、手部、字幕和品牌信息。

问题排查

常见异常、可能原因和改进方法

不要只重复生成同一份素材。先判断问题来自照片、录音、文案还是画面设置。

手指或手臂异常手部模糊、遮挡或与服装重叠换用轮廓完整的照片,减少手持物和连续强动作
身体动作僵硬原图姿态紧张或文案动作过密选择自然姿态,拆短句子,在重点位置保留动作空间
口型声音不协调噪声、语速太快或缩写读法不明确使用清晰录音,降低语速,把数字和缩写改为明确读法
服装边缘闪动服装与背景同色或细碎材质过多提高人物与背景反差,选择边缘清楚的服装照片
人物不像原图脸部太小、过度美颜或压缩严重使用清晰原图,减少滤镜和二次压缩
发布前检查

数字人视频商用需要注意什么?

生成成功不等于可以直接公开发布。涉及人物形象、声音复刻和商业宣传时,应确认授权与平台规则。

获得人物肖像使用授权
获得录音和声音复刻所需授权
文案、音乐、字体和图片可用于当前用途
广告宣传语真实且可以证明
不冒充他人或制造误导身份的信息
按平台要求添加必要的生成内容标识
人工检查口型、字幕、手部和品牌信息
保存授权记录、素材来源和最终成片

本页提供一般性制作与风险提示,不替代针对具体业务、地区和平台规则的专业法律意见。

常见问题

关于形象克隆、声音克隆和全身动作生成

照片和录音分别用来做什么?

人物照片用于克隆人物形象,本人录音用于克隆声音,口播文案用于驱动人物说话、表情、手势、全身动作、动态场景和镜头变化。

每次生成可以更换人物和声音吗?

可以。每次生成都可以独立提交新的授权人物照片和本人录音,无需长期绑定一个固定数字人。

需要支付形象定制费吗?

不需要支付独立的形象定制费。视频按照最终生成时长计费,每秒0.20元。

头像照片可以制作全身动作数字人吗?

头像更适合面部和上半身画面。若希望身体姿态和手势完整,建议使用清晰的半身或全身照片。

为什么手部动作容易异常?

常见原因是手部遮挡、细节模糊、双手与身体重叠,或动作要求过密。应优先更换照片并降低动作密度。

录音需要多长时间?

长度以所用系统要求为准。比时长更重要的是声音清楚、环境安静、音量稳定,并拥有声音使用授权。

一次生成多长比较合适?

首次建议用短文案确认人物、声音和动作风格。长内容按自然段拆分生成,再统一检查一致性。

全身动作数字人视频可以商用吗?

取决于照片、声音、文案、音乐、字体和平台服务的授权范围。发布前应取得必要授权并遵守适用规则。

用一张照片和一段本人录音生成数字分身视频

每次均可独立克隆新的授权形象与声音,无需支付形象定制费。

查看产品介绍