# 阿里Qwen发布Qwen-Audio-3.0-TTS，含Flash实时版与Plus高质量版，支持细粒度标签、自然语言控制、16种语言及3分钟长文本，登顶TTS排行榜

- 来源：Qwen
- 发布时间：2026-07-23 20:33
- AIWatch 分数：72
- AIWatch 标记：当日精选
- AIWatch 链接：https://aiwatch.icu/events/evt_01ky9mcvywe0xcj9afx0k8erw3
- 原文链接：https://x.com/Alibaba_Qwen/status/2080270065547809133

## 精选理由

高信息密度，值得细读

## AI 摘要

阿里Qwen发布Qwen-Audio-3.0-TTS文本转语音模型，提供Flash（实时交互）和Plus（高质量生成）两个版本。新特性包括细粒度内联标签（如[whisper]、[angry]等）、自然语言风格控制、支持16种语言、可从嘈杂参考音频中干净输出，并支持最长3分钟的一次生成长文本。该模型已在Artificial Analysis TTS排行榜上位列第一。对开发者而言，该模型提供了更精细的语音控制能力和多语言支持，适用于实时语音交互和高质量内容生成场景。
核心观点：
1. 支持通过内联标签精细控制语音特征，如耳语、愤怒、呼吸和笑声。
2. 支持自然语言指令控制语速和风格，如“像睡前故事一样慢读”。
3. 在Artificial Analysis TTS排行榜上排名第一，支持16种语言和最长3分钟长文本生成。

## 正文

Our latest text-to-speech model, in two flavors:
• Flash: real-time interaction
• Plus: high-quality generation

What's new:
• Fine-grained inline tags-steer [whisper], [angry], [breaths] & [laughs]
• Free-style natural-language control-“read this slowly, like a bedtime story”
• 16 languages
• Clean output even from noisy reference audio
• One-pass long-form up to 3 min

now #1 on the Artificial Analysis TTS Leaderboard.

Blog: https://funaudiollm.github.io/qwen-audio-3.0-tts/
API: https://www.alibabacloud.com/help/en/model-studio/realtime-tts-user-guide
