header-langage
简体中文
繁體中文
English
Tiếng Việt
한국어
日本語
ภาษาไทย
Türkçe
扫码下载APP

腾讯开源「音频版Nano Banana」:改词换声全包,语音编辑大幅刷榜

动察 Beating AI 快讯,腾讯混元开源 15 亿参数语音生成与编辑模型 AuK,官方直接称它为「音频版 Nano Banana」。声音克隆、改词、换情绪、去口音、调语速和音高、降噪、多人及音乐分离,都塞进了同一个模型,用自然语言就能控制。


AuK 可以直接改已有录音。说错几个字,只改那几个字就行,不用整段重录;内容不变,也能换情绪、音色或口音。改歌词、去掉笑声和咳嗽声、把正常说话改成耳语也都支持。声音克隆也不用先给参考录音配文字稿,只要一段声音和新的文本就能生成。


官方测试中,AuK 在语音生成和通用语音编辑多项评测领先。SpeechEditBench 得分 49.73,第二名 Ming-UniAudio 为 28.70。快速版 AuK-Flash 经过蒸馏后只需 4 步推理,速度约快 4.5 倍。不过论文也承认,AuK 目前还不能稳定理解所有随意输入的自然语言指令,仍要靠 Prompt Enhancer 先判断任务、整理参数和改写指令。代码和模型权重已经公开,采用 MIT 许可证。

AI 解读
腾讯混元把语音编辑补齐了。6 月其联合高校发布的 MMAE 基准显示,主流模型音频精确匹配率普遍低于 5%,复杂任务通过率归零——精准改音频是这一轮多模态里公认的硬骨头。AuK 用 15 亿参数把声音克隆、改词、换情绪、去口音、降噪、分离塞进单一模型,SpeechEditBench 49.73 对第二名 28.70,差距接近一倍。

真正值得注意的是许可证路径。混元 3.0 正式版刚从带地域限制的自定义协议换到 Apache 2.0,AuK 直接采用 MIT——比 Apache 2.0 更宽松。两个月内两次放宽,配合 Hy ASR 3.0 走云 API 变现、田永龙等研究员补强多模态,腾讯在音频栈上摆出的姿态是:底层权重全部开放,商业化留给云。

论文自承自然语言指令理解仍不稳,需 Prompt Enhancer 预处理。这意味着"用嘴剪辑音频"目前仍是演示级,不是可交付的产品级。
展开
举报 纠错/举报
纠错/举报
提交
新增文库
仅自己可见
公开
保存
选择文库
新增文库
取消
完成