Dev.to|📄 原文链接|2026-07-22 收录

Qwen3-TTS 的一个 Bug 教会了我:声音是生物识别数据

来源:dev.to/dannwaneri — 2026-07-21 发布

📋 概述

作者因为现有语音克隆工具(ElevenLabs、XTTS)全部抹掉他的尼日利亚口音,转而使用阿里巴巴的 Qwen3-TTS(17 亿参数)加上自己的参考音频来构建口音保留的语音克隆管线。技术障碍很小但很具体:Qwen3-TTS 在 modeling_qwen3_tts.py 第 2046 行硬编码了 min_new_tokens=2,导致一半的种子产生中途截断。修复后管线稳定。但真正让作者深思的是:训练好的模型权重只有 50MB,任何人拿到这 50MB 就能在电话中完美冒充他——声音和密码不同,密码可以更换但声音不可旋转。作者拒绝将模型权重推送到 GitHub,并在 README 开头标注:声音指纹是生物识别数据,不应提交到公共仓库。

🔑 核心要点

💡 金句

The trained voice cloning model is 50 megabytes. Anyone with those 50 megabytes can convincingly be me on a phone call.
← 返回 Dev.to 首页