用一张人像照片和一条音轨生成 5 秒口播片段:脸匹配人像、说话匹配音频,可选字幕与情绪方向。更长的口播分段制作——每段单独运行,用上一段的尾帧接续。
-
准备内容: 清晰的人像(必填)+ 音轨(必填,MP3/WAV/M4A,单次 5 秒以内)。可选情绪方向与字幕开关。
-
你会得到: 画廊中的片段(带播放器与下载),附创作说明。生成通常需要 5-10 分钟。
-
后续用途: 代言口播、播客预告、商品配音。
输出示例
口播视频预览 结果包含 - 带播放器与下载的 5 秒对口型片段 - 人像与声音匹配 - 实际使用的提示词 - 应用的情绪与字幕 最终报告还会补充证据、判断理由和建议的下一步动作。