header-langage
简体中文
繁體中文
English
Tiếng Việt
한국어
日本語
ภาษาไทย
Türkçe
扫码下载APP

ElevenLabs v4登顶TTS榜,超过Gemini和Qwen

动察 Beating AI 快讯,ElevenLabs 发布新一代语音模型 Eleven v4 和实时版 Eleven v4 Turbo。v4 主打更自然的情绪和声音控制,Turbo 面向实时语音 Agent,中位推理延迟约 100ms。

在 Artificial Analysis 最新 TTS 盲测榜中,Eleven v4 目前以 1315 Elo 排第一。Cartesia Sonic 3.6 为 1275,Gemini 3.8 Flash TTS 为 1267,Qwen-Audio-3.0-TTS-Plus 为 1258。上一代 Eleven v3 目前只有 1169,排第 17。

v3 已经支持笑声、耳语等音频标签,v4 主要把这套控制做得更准。用户可以直接指定语气、节奏、情绪和音效,也可以用自然语言描述一句话该怎么说。模型还把语言覆盖从 70 多种扩到 90 多种,Instant Voice Clone 只需要约 10 秒音频,并增强了长文本和多人对话中的声音一致性。

Turbo 则专门解决实时对话的速度问题。官方文档显示,v3 Conversational 的中位推理延迟约为 280ms,v4 Turbo 降到约 100ms。

AI 解读
ElevenLabs v4以1315 Elo登顶TTS榜,v3仅1169跌出前列;语言扩至90余种、10秒克隆,Turbo面向实时Agent。近月Cartesia、Inworld先后登顶,谷歌Gemini 3.8 Flash TTS施压。

延迟是重点:v3 Conversational中位280ms,v4 Turbo约100ms,直入实时语音Agent区间。Inworld 9月初Controlled Voice以1123登顶,此次1315口径不同;竞争从音质转向情绪控制、低延迟与Agent集成。
展开
举报 纠错/举报
纠错/举报
提交
新增文库
仅自己可见
公开
保存
选择文库
新增文库
取消
完成