现在想做一个能跟你聊天的 AI 数字人,多数方案都得先联网、租一台云上的 GPU(显卡),你说一句话,声音先传到云端,AI 想完再传回来,数据全程在别人服务器上转一圈。有一个开源项目偏不这么干,它让你把这套会说话、会回应的数字人,直接装进手机、平板、车机里本地跑;如果 LLM、ASR、TTS 也接本地或私有服务,对话就不用绕公共云。想做对话型数字人、又介意数据往外跑的人,能省掉一大块顾虑。
它叫 Duix-Mobile,duixcom 团队做的,GitHub 上有8000多颗 star,最近一次更新就在2026年5月,不是那种挂着没人管的库。
把两条路摆开看,差别就清楚了。
一条是云端路:算力在远端,模型在远端,你的设备只是个显示器。好处是设备可以很弱,坏处是离不开网、数据要出门,而且每多一个人用,云上的账单就往上涨一截。
另一条就是 Duix-Mobile 走的端上路:数字人渲染和交互核心在你自己设备里跑,低网络依赖。意思是,断网、弱网的地方它也能撑住;如果外接的模型和语音服务也走本地或私有部署,数据就不用离开这套环境。所以它特别点了金融、政务、法律、车载这几类场景,这些地方的共同点是,数据敏感、又经常网络不稳,恰恰是云端方案最难受的地方。
它本身是个 SDK(软件开发工具包),不是下载就能用的成品 App。你得把三样东西接上去:大模型(LLM,负责想话)、语音识别(ASR,负责听懂你说啥)、语音合成(TTS,负责把字变成声音)。自己的也行,第三方的也行。三样拼齐,一个能听你说话、当场回你的数字人就立起来了。
几个我觉得值得说的点。
一是支持流式语音,边合成边说,不用等整句生成完再开口;而且你能打断它——它正说着,你插一句,它会停下来听你的。这一下就把「人机问答」拉近到「跟人聊天」的感觉。
二是嘴型对得上(唇形同步),还能出多语言字幕。
三是形象这块,官方给了4个现成的数字人形象,下载就能用;想换成你自己的脸,按官方说法,通常给一段15秒到2分钟的视频就能克隆出来。当然这步要联系官方做,不是完全自助。
延迟它官方报得挺猛:一个说法是响应低于约1.5秒,更细的说法是在骁龙8 Gen2 芯片上实测低于120毫秒。这俩都是它自己给的数字,我没拿设备独立复测过,到底跑多快,还得你自己上手才算数。但端上跑这条路本身,确实天生比「声音绕云端一圈」要短。
有一点得据实提醒:它的开源协议是自定义的,不是 MIT、Apache 那种你随手就能商用的宽松协议。
说到底,这东西的价值不在「又一个数字人」,而在它把数字人从云上搬回了你手里的设备。想试就先用起来,接上一家大模型跑个最小的 demo。
它叫 Duix-Mobile,duixcom 团队的开源项目,GitHub 上就有。
#马力的AI知识分享#
#马力的AI开源项目分享#
