OmniVoice 是一个大规模多语言零样本文本转语音(TTS)模型,支持 600+ 种语言,是目前同类模型中语言覆盖最广的。基于扩散语言模型式架构,生成高质量语音且推理速度极快——RTF 最低 0.025,约 40 倍于实时速度。有论文和在线 Demo,模型权重托管在 HuggingFace,可本地部署或用 Google Colab 在线跑。
三种生成模式:语音克隆给出 3-10 秒参考音频即可克隆音色(跨语言会带参考语言的口音),克隆好的音色可存成 prompt 跨会话复用;语音设计不需要参考音频,直接描述说话人属性(性别、年龄、音高、耳语风格、英语口音、普通话方言如四川话和陕西话)就能捏出一个声音;自动语音则让模型自己挑一个声音。文本里可以内嵌非语言符号(如 [laughter])增加表现力,也能用拼音或 CMU 音标纠正特定字的读音。
支持 NVIDIA GPU、Apple Silicon、Intel Arc GPU(XPU),批处理推理可跨多 GPU 分布式跑大规模合成任务,FlashInfer 加速可无损提升 2-2.9 倍。提供 web demo、单条推理和批量推理三个命令行工具。注意:模型明确禁止用于未经授权的语音克隆、冒充、诈骗等非法或不道德用途。