1. 电商 > 电商资讯 >

亚马逊祭出10亿参数BASE TTS

王汝林(著名电子商务专家)
专注于电商行业15年,中国电子商务协会专家主任

伴随着生成式深度学习模型的飞速发展,自然语言处理(NLP)和计算机视觉(CV)已经经历了根本性的转变,从有监督训练的专门模型,转变为只需有限的明确指令就能完成各种任务的通用模型。

在语音处理和文本到语音(TTS)领域,这样的转变也正在发生,模型能够利用数千小时的数据,使合成结果越来越接近类人语音。

在最近的一项研究中,亚马逊正式推出了 BASE TTS,将 TTS 模型的参数规模提升到了前所未有的 10 亿级别。

BASE TTS 是一个多语言、多说话人的大型 TTS(LTTS)系统,在约 10 万小时的公共领域语音数据上进行了训练,比此前的训练数据量最高者 VALL-E 翻了一番。受 LLM 成功经验的启发,BASE TTS 将 TTS 视为下一个 token 预测的问题。这种方法通常与大量训练数据结合使用,以实现强大的多语言和多说话人能力。

阅读了本文内容的用户还读了:

已帮助()人

本文由腾牛网发布,不代表电商号立场,部分内容来源于网络,如有侵权请联系删除,转载联系作者并注明出处:http://www.tnzycc.com

联系我们

在线咨询:点击这里给我发消息

微信号:13527385032

电话:13527385032

工作日:9:30-19:00,全年无休