腾讯开源「音频版Nano Banana」:改词换声全包,语音编辑大幅刷榜
动察 Beating AI 快讯,腾讯混元开源 15 亿参数语音生成与编辑模型 AuK,官方直接称它为「音频版 Nano Banana」。声音克隆、改词、换情绪、去口音、调语速和音高、降噪、多人及音乐分离,都塞进了同一个模型,用自然语言就能控制。 AuK 可以直接改已有录音。说错几个字,只改那几个字就行,不用整段重录;内容不变,也能换情绪、音色或口音。改歌词、去掉笑声和咳嗽声、把正常说话改成耳语也都支持。声音克隆也不用先给参考录音配文字稿,只要一段声音和新的文本就能生成。 官方测试中,AuK 在语音生成和通用语音编辑多项评测领先。SpeechEditBench 得分 49.73,第二名 Ming-UniAudio 为 28.70。快速版 AuK-Flash 经过蒸馏后只需 4 步推理,速度约快 4.5 倍。不过论文也承认,AuK 目前还不能稳定理解所有随意输入的自然语言指令,仍要靠 Prompt Enhancer 先判断任务、整理参数和改写指令。代码和模型权重已经公开,采用 MIT 许可证。
「查看原文」本内容旨在传递行业动态,不构成投资建议或承诺。