阿里Qwen发布Qwen-Audio-3.0-TTS,含Flash实时版与Plus高质量版,支持细粒度标签、自然语言控制、16种语言及3分钟长文本,登顶TTS排行榜
AI 摘要
阿里Qwen发布Qwen-Audio-3.0-TTS文本转语音模型,提供Flash(实时交互)和Plus(高质量生成)两个版本。新特性包括细粒度内联标签(如[whisper]、[angry]等)、自然语言风格控制、支持16种语言、可从嘈杂参考音频中干净输出,并支持最长3分钟的一次生成长文本。该模型已在Artificial Analysis TTS排行榜上位列第一。对开发者而言,该模型提供了更精细的语音控制能力和多语言支持,适用于实时语音交互和高质量内容生成场景。 核心观点: 1. 支持通过内联标签精细控制语音特征,如耳语、愤怒、呼吸和笑声。 2. 支持自然语言指令控制语速和风格,如“像睡前故事一样慢读”。 3. 在Artificial Analysis TTS排行榜上排名第一,支持16种语言和最长3分钟长文本生成。
推荐理由高信息密度,值得细读
原文
Our latest text-to-speech model, in two flavors: • Flash: real-time interaction • Plus: high-quality generation
What's new: • Fine-grained inline tags-steer [whisper], [angry], [breaths] & [laughs] • Free-style natural-language control-“read this slowly, like a bedtime story” • 16 languages • Clean output even from noisy reference audio • One-pass long-form up to 3 min
now #1 on the Artificial Analysis TTS Leaderboard.
Blog: https://funaudiollm.github.io/qwen-audio-3.0-tts/ API: https://www.alibabacloud.com/help/en/model-studio/realtime-tts-user-guide
金句
Fine-grained inline tags-steer [whisper], [angry], [breaths] & [laughs]
Free-style natural-language control-“read this slowly, like a bedtime story”
now #1 on the Artificial Analysis TTS Leaderboard.
讨论
暂无评论。