
开源语音合成领域迎来重磅新品。近日,OpenBMB团队正式发布VoxCPM2,这是一款无需Tokenizer的全新文本转语音(TTS)模型,支持多语言语音生成、创意声音设计以及逼真语音克隆,在GitHub上迅速获得大量关注。
VoxCPM2的核心创新在于抛弃了传统TTS模型对Tokenizer的依赖。传统的语音合成系统通常需要将文本先分割成音素或子词单元,再映射到语音特征,这一过程不仅增加了模型复杂度,还容易在多语言场景下产生兼容性问题。VoxCPM2通过直接对原始文本进行建模,实现了端到端的语音生成,大幅简化了处理流程。
在多语言支持方面,VoxCPM2表现出色。它能够处理中文、英文、日文等多种语言的文本输入,并生成自然流畅的语音输出。对于全球化的应用场景来说,这意味着开发者无需为每种语言单独训练模型,一个模型即可覆盖多种语言需求。
创意声音设计是VoxCPM2的另一大亮点。用户可以通过简单的文本描述来定制声音特征,例如指定音色、语速、情感色彩等参数,模型会据此生成符合要求的语音。这为有声读物、游戏配音、虚拟角色等创意场景提供了极大的便利。
在语音克隆能力上,VoxCPM2仅需极短的目标语音样本,就能复制说话人的声音特征,实现逼真的语音克隆。开源社区普遍认为,这一能力在隐私保护和伦理规范下合理使用,将极大推动个性化语音助手和无障碍辅助工具的发展。
作为完全开源的项目,VoxCPM2的发布为语音技术社区注入了新的活力。开发者可以自由使用、修改和分发模型代码,加速语音技术在各行各业的落地应用。未来,随着更多贡献者的加入,VoxCPM2有望成为开源TTS领域的新标杆。