NB
Studio0
上传人脸照片和音频,AI 生成口型对上的说话视频。
使用方法
正面半身肖像照效果最好。
通常 1–3 分钟 · 60 积分
上传一张人脸和一段音频,嘴部动作会被重新生成以匹配语音。适合多语种配音、不重拍就换旁白,以及把一张静态肖像变成会说话的出镜人。每次生成消耗 60 积分。
上传素材:一张肖像图片,或一段人脸清晰正面的视频。
上传你希望这张脸说出来的音频,任何语言都可以。
点击生成。口型、下颌动作和时间点会依据音频波形重建。
按正常速度检查同步效果,确认后下载成片。
同步直接来自音频本身,所以配成原说话人根本不会的语言也毫无障碍。
一张正面肖像就够了,不需要原始视频也能做出口播片段。
下颌和嘴唇跟随音素时间点运动,而不是机械的开合循环。
五官、皮肤质感和光照在整段片子里与原素材保持一致。
配合配音工具,可以一次走完写稿、生成旁白、对口型的完整流程。
真人录音、AI 生成的旁白,或用变声工具处理过的音轨都可以。