IEEE中国
26-05-29 09:15 微博认证:美国IEEE有限公司北京代表处

【毛利语语音合成模型摒弃科技巨头理念 全球多项本土人工智能模型研发项目稳步推进】新西兰以壮阔自然风光闻名,其语言文化同样独具特色。该国共有三门官方语言,其中仅有毛利语属于本土原生语言。虽然能流利使用毛利语的人口仅占总人口4.3%,但国家统计数据显示,约三成新西兰人都会基础毛利词句(http://t.cn/AX6REkgu)。

向聊天机器人程序下达毛利语写作指令,它便能以学校教学、国家电视台通用的标准毛利语流畅作答,Claude、Perplexity等人工智能产品也具备同款能力。这类出色的语言能力,依托毛利族群与学者创作的文本、语音数据训练而成。这些数据未经许可被爬取收录,在新西兰境外加工处理,最终通过大型科技企业旗下平台面向用户提供服务。这一现状,令毛利族群深感困扰。

怀卡托大学教授、人工智能研究所联合负责人Te Taka Keegan表示:“海外科技企业拥有充足资源打造性能优异的人工智能模型,但它们擅自爬取相关数据,全程未征求毛利族群意见,产出成果也不归我们所有。语言是传承本土知识最重要的载体,可新西兰本土知识的传播话语权,正不断被境外技术掌控。”

出于构建基根口中主权数字系统(sovereign digital systems)的诉求,他与当时的硕士生Kingsley Eng联手,着手研发高保真语音合成系统,适配毛利语特定方言。二人研发全程恪守一条人工智能行业普遍忽视的核心原则:合成语音及所有研发素材,所有权必须归属该方言使用者。团队希望这项成果,能为全球其他少数民族语言社群提供可借鉴的研发范本。http://t.cn/AX6REkg3

发布于 北京