把外语视频变成中文字幕、中文配音,难点不是有没有一个按钮,而是每一步你能不能换工具。
pyVideoTrans 这个开源项目,我觉得最有意思的地方就是「选择权」。语音识别可以用本地 Faster-Whisper,也可以接 OpenAI Whisper、Qwen、火山、Azure、Google;翻译可以接 DeepSeek、ChatGPT、Claude、Gemini、通义,也能接本地 Ollama;配音又能选 Edge-TTS、CosyVoice、F5-TTS、GPT-SoVITS 等。
它更像一个视频翻译调度台,而不是某一家模型的壳。哪一步效果不好,就换哪一步,不用整个流程推倒重来。
对普通用户也比较友好:Windows 有桌面版,拖视频、选语言、点开始就能跑。你也可以只要字幕不要配音,或者只用工具箱里的人声分离、字幕合并、音视频对齐这些小功能。
但自由度高,也意味着结果由你选的引擎决定。识别准不准、翻译顺不顺、声音像不像人,不是 pyVideoTrans 自己能全包的。想省钱可以多用本地模型和免费服务;想全离线,就得避开在线 TTS 和云端翻译。免费、本地、离线,这三件事要分清。
#马力的AI知识分享#
#马力的AI开源项目分享#
发布于 北京
