目前用过最好的声音克隆工具,CosyVoice v3.5-plus教程

你想做短视频配音、播客、有声书,但不想用机器音。

这么多克隆声音的工具用下来,我觉得CosyVoice v3.5-plus 是目前中文场景下效果最稳的语音克隆工具,不仅声音还原度高,语速和情感也很不错——上传 30 秒到 5 分钟你的原声,AI 就能用你的声音读任何文字。

本文就一起看一下如何从注册到使用吧!

一、为什么选 CosyVoice v3.5-plus?

  • 克隆效果好,生成声音超自然,感情也更丰富
  • 支持跨多语种(中、英、德、法、俄、日、韩、葡、泰、印尼、越南)
  • 相较于开源项目,CosyVoice v3.5-plus成本不高,不需要按月付费,不需要单独为语音功能付费,用多少付多少
  • 不需要自己部署,可以结合Agent工具,实现工作流程化
  • 首包延迟低,同时提高发音准确率,改善韵律和音质

二、复刻声音

2.1 注册

打开阿里云百炼,用你的阿里账号登录(淘宝/支付宝扫码登陆都行)。

2.2 声音复刻

登录成功之后,点击左边的语音模型——语音合成——声音复刻——复刻声音,然后可以实时录音也可以上传自己以前的音频,接着就开始复刻。

CosyVoice v3.5-plus声音克隆效果展示

复刻完成之后就可以在语音合成下面的我的复刻选项里找到你复刻的声音了。

阿里云百炼控制台登录界面

找到对应复刻声音星星图标后的去合成就可以进行试听了。

CosyVoice声音复刻操作界面

试听如果觉得没问题那么就可以开始应用了。

三、应用复刻的声音

目前阿里云百炼的后台只能复刻和试听,真正长文本的使用还需要我们自己进行设置一下。

3.1 在Agent里运行

直接把下面的内容发送给Agent的对话中(我这里一Qclaw为例):

使用百炼的 Python SDK 或 API 运行一段脚本生成**

import os
from dashscope.audio.tts_v2 import SpeechSynthesizer

# 设置你的百炼 API Key
os.environ["DASHSCOPE_API_KEY"] = "你的百炼API-Key"

model = "cosyvoice-v2"  # 根据你使用的复刻模型调整
voice_id = "你在后台获取的voice_id"
text = "需要转换成语音的具体文本内容"

# 调用合成并保存为本地文件
synthesizer = SpeechSynthesizer(model=model, voice=voice_id)
audio_data = synthesizer.call(text)

with open("output.mp3", "wb") as f:
    f.write(audio_data)
print("音频生成完毕并已保存!")

然后它会让我们提供一些参数:

声音复刻完成后的我的复刻列表

百炼的API Key:回到百炼的后台,左边菜单的最下面有个API Key,点击后选右上角的创建API Key,然后把它复制到Agent窗口即可。

这个 Key 千万别上传到 GitHub 或分享给别人

百炼API Key创建界面

模型名称和Voice_id:也就是我们用哪个模型来复制这个声音的。还是回到百炼上我们前面复刻的声音,在名称后面有个ID,点击后出现的就是Voice_id,前面的cosyvoice-v3.5-plus就是模型名称。

CosyVoice v3.5-plus教程封面

先把这三个信息发给Agent,至于合成文本,可以当你真的需要生成一段语音内容的时候再把稿子给它。

3.2 调试

到这里其实这个Agent就已经可以帮你把稿子转化成语音文件了,但是也可能会出现一些小问题。

比如我的Agent最开始跑的时候总是一段文本读不到最后,这个时候只需要告诉Agent让它自己排查解决即可。然后Agent把脚本改成分句合成 + 严格校验(任何一段失败就拒绝合并),这个问题就彻底消失了。

所以你在正式使用生成长音频之前,最好用一些短内容先测试一下。

3.3 其他使用方式

除了Agent外你也可以直接用Python执行或者做成Web端,我主要是因为Agent可以顺便帮我改稿形成工作流。

四、录入文本小建议

🎯 配音稿怎么写 AI 才念得好?

  1. 中英文之间留空格:「安装 aaPanel 面板」而不是「安装aaPanel面板」
  2. 数字单独写:「八十和四十三」而不是「80 和 43」(AI 念 80/43 会卡顿)
  3. 专业词用全拼:「Nginx」写成「引擎 X」+ 括注 Nginx
  4. 长句拆短:「接着在终端里复制粘贴脚本回车,安装 aaPanel 面板」比一长串逗号好

💰 成本控制

  • CosyVoice v3.5-plus 大约 1.5元 / 万字
  • 一段 5 分钟的口播稿 ≈ 1500 字 ≈ 0.225 元
  • 每天第一条先跑 50 字测试音色,满意再跑全文

🔄 进阶玩法

  • 批量合成:把所有口播稿写进 script.txt,每行一段,循环调用脚本
  • 情感控制:v3.5-plus 支持情感标记,如 <|情感:开心|> 嵌入文本中
  • 字幕对齐:脚本生成 segments.txt 审计文件本身就是段-字对齐的,可直接当字幕时间轴用

五、常见问题

Q1:克隆别人的声音合法吗? A:仅限克隆自己的声音或已获得授权的人声。克隆明星、政客、未授权人物违反《生成式人工智能服务管理办法》,最高可追究刑事责任。

Q2:训练音色需要多久? A:30 秒素材约 3 分钟,5 分钟素材约 10 分钟。训练期间你可以做别的事,完成会有通知。

Q3:生成的音频能商用吗? A:百炼生成的音频支持商用,但你克隆的音色只能商用你自己的声音,且需在视频里标注「AI 配音」(中国法规要求)。

© 文章版权归白小菌所有,🫰欢迎转发分享。未经允许请勿抄袭转载。

订阅评论
提醒
guest
0 评论
最新
最旧 最多投票
现代响应式侧边栏
快捷菜单