它针对原始表演来生成,而不是针对一段转录文本,所以语气、情绪、表达方式会跨语言保留下来,声音克隆全自动,会给原说话人建一个声音模型并应用到所有目标语言,保留身份、音高和语气,不用手动设置。 发布于 安徽