马力AI和商业思维
26-06-24 18:20 微博认证:知群 CEO 微博新知博主

给一条外语视频配上中文音,光配音引擎,你就能从近十种里挑一个用。

我说的是 pyVideoTrans 这个开源工具。它干的活儿是把一条外语视频翻成另一种语言,自动配音、配字幕,反过来把中文视频翻成外语也行。这类工具其实不止它一个,但它有个不一样的地方,让我愿意单独拿出来讲:它把「选择权」几乎全交给了你。

先说最直观的一点,它是个桌面软件,不是要你敲命令的那种。

Windows 上有打包好的版本,下载下来双击就能开,连 Python 都不用自己装。开起来是一个带界面的窗口,把视频拖进去,选好原语言和目标语言,点一下,剩下的它自己跑。这一条听着普通,但对很多想用又怕折腾的人,门槛就卡在「要不要碰命令行」这一步。pyVideoTrans 把这步省了。

真正让我觉得它好用的,是它在每一个环节都让你自己挑工具。

把视频里的话听成文字,这步它支持好几种引擎。有能在自己电脑上跑、不联网也能转的 Faster-Whisper,也有 OpenAI 的 Whisper、阿里的 Qwen 语音识别、字节的火山,还有 Azure、Google。你电脑够强就用本地的,图省事就接云端的,自己定。

翻译这步更敞开。它兼容市面上一大票大模型,DeepSeek、ChatGPT、Claude、Gemini、通义,连你在自己电脑上用 Ollama 跑的本地开源模型都能接进去,前后差不多十家。而且它是带着上下文翻,不是把字幕一句一句拆开孤立地译,读起来更连贯。

到了配音这步,可挑的就更多了,近十种。里头有微软那个免费的 Edge-TTS(TTS 就是文字转语音,把翻好的字幕念成声音),也有能克隆声音的 CosyVoice、F5-TTS、GPT-SoVITS——你想让配出来的声音是某个特定音色,甚至接近某个人的嗓音,它给你留了这个口子。

这种「每一步都能换」的设计,好处是你不会被某一家绑死。哪天觉得这家翻译不行,换一家就是,不用整个工具推倒重来。

它还真的自带了一个工具箱。

除了翻译配音这条主线,它把一堆做视频时的零碎活儿也打包进去了:把人声和背景音乐分开、把视频和字幕合并、把音频和视频对齐、把文本和语音对上。这些活儿平时你可能得专门找别的软件做,现在它顺手就给你备着了。哪天你只是想把一段视频里的人声抠出来,根本不做翻译,也能单拿这一个小工具用。

顺带说一句,整条主线也是可以拆开用的。你今天只想要字幕、不要配音,那就让它只跑「听写加翻译」这两步,配音那步不开就行。

还有个细节挺实用:多角色配音。

它能先把视频里不同的人分出来,再给不同的人配不同的音色。如果你处理的是采访、对谈、好几个人说话的视频,这一下就解决了「所有人都一个声音」的尴尬(很多翻译工具的硬伤就在这儿,几个人聊半天,配出来全是同一把嗓子,听着特别出戏)。一问一答能听出是两个人,体验差很多。

把这些拼起来,能干的活儿其实挺杂的。手头有授权的外语教程想做成中文版,就走完整条线,翻译加配音加双语字幕一次出。只是自己想看懂一条外语长视频,那就别配音了,让它只出字幕,省时间。手头有段视频背景音乐太吵,想留干净人声,那连翻译都不用碰,单点工具箱里的人声分离就完事。同一个软件,你能当全自动翻译机用,也能当一把零件齐全的小工具使,看你那天缺哪样。

它的强项是「广」和「全」,但选择权全交给你,意味着责任也跟着交到了你手里。

它给你的是一个调度台,不是一台出片机。识别准不准、译文顺不顺、配出来的声音像不像个人,本质上是你挑的那几样 ASR、大模型、TTS 在决定,pyVideoTrans 做的是把它们接上、对齐、按节拍跑完,至于每一样的水平高低,它管不着也补不了。同一个软件,配上一套强的引擎和一套弱的引擎,出来的东西能差出一截。这套选择题没有标准答案,哪家识别你的口音准、哪家翻译合你的口味、哪个音色你听着不别扭,得你自己拿几段素材试出来。

还有一笔账得算清楚,就是钱。成本上分两种情况:接云端的识别、翻译、配音服务,多数得自己去对应平台办接口、按用量付费;也有不花钱的,比如微软的 Edge-TTS 免费,本地的 Faster-Whisper、Ollama 也不要钱。但本地模型省的是云端的钱,吃的是你电脑的算力,转写、配音都想本地化,最好有块像样的显卡。

顺着这点,能搭出一条几乎不花钱的路子:语音识别用本地的 Faster-Whisper,翻译用本地的 Ollama,配音用免费的 Edge-TTS——这一套下来基本不用掏云端的钱。要注意的是,Edge-TTS 虽然免费,但它是微软的在线服务,还是得联网;你要的是「连网线都不插、整条链路全在自己电脑上离线跑」,那配音就别用 Edge-TTS,换成 CosyVoice、F5-TTS 这类能本地部署的,配上本地的识别和翻译,才是真正的全离线。免费和离线是两回事,这点先分清楚,省得到时候发现没网配音就用不了。

这工具是开源的,到现在攒了大概1.8万颗 star,作者从2023年做到现在一直在更新,最近还在动。开源协议是 GPL-3.0,自己用没问题。它是个非商业项目,你拿它处理的内容、调用第三方服务产生的版权和费用问题,得自己担着。

手头有授权视频、自己拍的素材或者想看懂的学习资料,想配中文音或出字幕,可以先挑一组模型搭一遍,对着界面把流程摸熟,再慢慢调到自己满意的那套。它给的选择多,麻烦也在这儿,可省心也在这儿。

它是开源的,在 GitHub 上叫 pyvideotrans,作者是 jianchang512。

#马力的AI知识分享#
#马力的AI开源项目分享#

发布于 北京