[P1][Feature] GPU服务器本地部署Qwen3-TTS 1.7B替代云端CosyVoice API #2075

Open
opened 2026-09-28 00:25:51 +08:00 by xiaoxia · 0 comments
Owner

背景

当前staging环境使用阿里云百炼DashScope API的cosyvoice-v3-flash模型(1元/万字符),配音效果不理想。经过TTS技术调研,阿里2026年1月开源的Qwen3-TTS 1.7B在Artificial Analysis评测中TTS赛道全球第一,Apache-2.0可商用,本地部署即可免费商用。

为什么选Qwen3-TTS而不是继续用CosyVoice

  • Qwen3-TTS 1.7B:Artificial Analysis全球TTS排名第一,3秒零样本克隆,97ms首包延迟,支持10语言,Apache-2.0
  • CosyVoice3 0.5B(本地开源版):效果好但排名低于Qwen3-TTS
  • 豆包Seed-TTS 2.0:中文效果最好但闭源,声音复刻58元/音色,合成3元/万字符
  • Qwen3-TTS同时满足:系统音色丰富+零样本声音克隆免费+中文效果顶级

需要做的事

  1. 在5060Ti GPU服务器上Docker部署Qwen3-TTS 1.7B(需8GB+显存,5060Ti 16G足够,与MuseTalk分时复用)
  2. 提供HTTP API接口(与现有CosyVoice API风格兼容),支持:
    • 系统音色合成(预置10+种音色)
    • 零样本声音克隆(上传3-10秒参考音频)
    • 流式/非流式合成
    • 语速/语调调节
  3. 后端TTS调用层做双引擎支持:
    • 默认走本地Qwen3-TTS
    • 保留云端CosyVoice/豆包作为降级备份
  4. 测试与现有视频配音流程的对接
  5. Docker化+Watchtower自动更新

显存规划

  • 5060Ti 16G:MuseTalk约占用6-8GB,Qwen3-TTS 1.7B FP16约占4GB,二者分时复用(不并行推理)足够
  • 如果后续需要并行,可考虑量化到INT8(约2GB)或用P4000分担

验收标准

  • Qwen3-TTS Docker服务在5060Ti上正常运行,健康检查通过
  • 系统音色合成质量明显优于当前cosyvoice-v3-flash
  • 零样本克隆功能可用(3-10秒参考音频),克隆效果自然
  • 与现有视频配音流水线对接成功,生成视频配音无异常
  • 合成速度满足:30秒配音<10秒生成
  • Apache-2.0可商用合规确认
## 背景 当前staging环境使用阿里云百炼DashScope API的cosyvoice-v3-flash模型(1元/万字符),配音效果不理想。经过TTS技术调研,阿里2026年1月开源的Qwen3-TTS 1.7B在Artificial Analysis评测中TTS赛道全球第一,Apache-2.0可商用,本地部署即可免费商用。 ## 为什么选Qwen3-TTS而不是继续用CosyVoice - Qwen3-TTS 1.7B:Artificial Analysis全球TTS排名第一,3秒零样本克隆,97ms首包延迟,支持10语言,Apache-2.0 - CosyVoice3 0.5B(本地开源版):效果好但排名低于Qwen3-TTS - 豆包Seed-TTS 2.0:中文效果最好但闭源,声音复刻58元/音色,合成3元/万字符 - Qwen3-TTS同时满足:系统音色丰富+零样本声音克隆免费+中文效果顶级 ## 需要做的事 1. 在5060Ti GPU服务器上Docker部署Qwen3-TTS 1.7B(需8GB+显存,5060Ti 16G足够,与MuseTalk分时复用) 2. 提供HTTP API接口(与现有CosyVoice API风格兼容),支持: - 系统音色合成(预置10+种音色) - 零样本声音克隆(上传3-10秒参考音频) - 流式/非流式合成 - 语速/语调调节 3. 后端TTS调用层做双引擎支持: - 默认走本地Qwen3-TTS - 保留云端CosyVoice/豆包作为降级备份 4. 测试与现有视频配音流程的对接 5. Docker化+Watchtower自动更新 ## 显存规划 - 5060Ti 16G:MuseTalk约占用6-8GB,Qwen3-TTS 1.7B FP16约占4GB,二者分时复用(不并行推理)足够 - 如果后续需要并行,可考虑量化到INT8(约2GB)或用P4000分担 ## 验收标准 - [ ] Qwen3-TTS Docker服务在5060Ti上正常运行,健康检查通过 - [ ] 系统音色合成质量明显优于当前cosyvoice-v3-flash - [ ] 零样本克隆功能可用(3-10秒参考音频),克隆效果自然 - [ ] 与现有视频配音流水线对接成功,生成视频配音无异常 - [ ] 合成速度满足:30秒配音<10秒生成 - [ ] Apache-2.0可商用合规确认
xiaoxia added the backenddevopsP1feature labels 2026-09-28 00:25:51 +08:00
Sign in to join this conversation.
1 Participants
Notifications
Due Date
No due date set.
Dependencies

No dependencies set.

Reference: xiaoxia/xiaoxia-saas#2075