Qwen3-TTS 的一个 Bug 教会了我:声音是生物识别数据
来源:dev.to/dannwaneri — 2026-07-21 发布
📋 概述
作者因为现有语音克隆工具(ElevenLabs、XTTS)全部抹掉他的尼日利亚口音,转而使用阿里巴巴的 Qwen3-TTS(17 亿参数)加上自己的参考音频来构建口音保留的语音克隆管线。技术障碍很小但很具体:Qwen3-TTS 在 modeling_qwen3_tts.py 第 2046 行硬编码了 min_new_tokens=2,导致一半的种子产生中途截断。修复后管线稳定。但真正让作者深思的是:训练好的模型权重只有 50MB,任何人拿到这 50MB 就能在电话中完美冒充他——声音和密码不同,密码可以更换但声音不可旋转。作者拒绝将模型权重推送到 GitHub,并在 README 开头标注:声音指纹是生物识别数据,不应提交到公共仓库。
🔑 核心要点
- Qwen3-TTS 硬编码 min_new_tokens=2 导致语音中途截断,该 Issue 已存在六个月无维护者响应。
- 50MB 模型权重等于一个人:载入口音、元音压缩方式,足以在电话中冒充身份。
- 声音不可旋转——密码泄露可以更换,声音泄露是永久性的身份威胁。
- 现有西方训练数据的工具 抹除了尼日利亚口音,作者管线用 Qwen3-TTS 成功保留了本土语音特征。
- 在免费 Kaggle GPU 上运行完整管线,关注 AI 语音克隆的可及性和滥用潜力。
💡 金句
The trained voice cloning model is 50 megabytes. Anyone with those 50 megabytes can convincingly be me on a phone call.
👍 0👎 0
← 返回 Dev.to 首页