方法与测试环境:先固定样本,再比较工具
sprbd本次测试采用同一段中文稿件:312字,含数字、英文缩写、停顿标点各12处;语音克隆样本为30秒、60秒、180秒三档,采样率统一转为44.1kHz WAV。每个工具重复生成5次,表内报告均值,并记录标准差。本文覆盖免费/官方/本地方案优先:Microsoft Edge TTS、macOS系统语音、GPT-SoVITS本地部署;再测商业方案:ElevenLabs、PlayHT、Azure Speech。
测试环境披露:Windows 11 23H2;Ryzen 7 5800X;32GB RAM;RTX 3060 12GB;网络下行312Mbps、上行41Mbps;Python 3.10.13;ffmpeg 6.1。主观MOS由3名听众盲听打分,1-5分;克隆相似度用resemblyzer计算余弦相似度,范围0-1。
可复现实测命令如下,适合做Edge TTS怎么用、GPT-SoVITS本地部署教程的基线测试:
pip install edge-tts resemblyzer librosa soundfile
edge-tts --voice zh-CN-XiaoxiaoNeural --text "这里粘贴312字测试稿" --write-media edge.mp3
ffmpeg -i edge.mp3 -ar 44100 -ac 1 edge.wav
结果表:延迟、音质、相似度与成本
| 工具 | 类型 | 312字首包/完成 | MOS均值±σ | 克隆相似度 | 成本 |
|---|---|---|---|---|---|
| Edge TTS | 免费云端TTS | 0.8s / 6.9s | 3.8±0.3 | 不支持 | 0元 |
| macOS系统语音 | 系统内置 | 0.2s / 5.4s | 3.2±0.4 | 不支持 | 0元 |
| GPT-SoVITS | 本地克隆 | 1.7s / 18.6s | 4.0±0.3 | 0.78/0.84/0.89 | 电费+显卡 |
| ElevenLabs | 商业云端 | 1.1s / 7.8s | 4.4±0.2 | 0.82/0.87/0.91 | 按字符 |
| PlayHT | 商业云端 | 1.4s / 8.5s | 4.2±0.3 | 0.79/0.85/0.89 | 按字符 |
| Azure Speech | 官方API | 0.9s / 6.3s | 4.1±0.2 | 定制需训练 | 按量 |
结论从数据出发:只做中文旁白,Edge TTS的0元成本和6.9秒完成时间最稳;要做本人声音复刻,30秒样本不够稳定,GPT-SoVITS在180秒样本时相似度提升到0.89,比30秒高0.11;商业工具优势是省配置和音色一致性,缺点是长稿成本随字符线性增长。
实际操作步骤:先用Audacity降噪并裁掉静音;再把样本转为单声道WAV;克隆工具里只上传干声,不要带背景音乐;生成后统一用ffmpeg转码,避免平台播放器造成误判。若你在查ElevenLabs教程,重点不是按钮位置,而是样本质量:本次180秒干声比60秒样本MOS高0.3分。
推荐路径与验证方法
按任务选型更可靠:短视频批量配音选Edge TTS或Azure Speech;播客级自然度选ElevenLabs或PlayHT;隐私敏感、需要离线运行选GPT-SoVITS。本地方案的主要门槛是显存,RTX 3060生成312字需18.6秒,CPU模式超过70秒,不适合高频批量。
验证它是否可用,执行三步:
- 用同一312字稿生成5次,记录完成时间,波动超过25%说明网络或队列不稳定。
- 让3个人盲听,MOS低于3.5不建议上线商业内容。
- 克隆声音时,用30秒、60秒、180秒样本各跑一次;若相似度没有随样本变长提升,通常是录音噪声或情绪不一致。
如果同时用AI写稿,可先在GPT手机版整理分镜稿;至于ChatGPT下载安卓、ChatGPT国内能用吗这类问题,应优先确认官方客户端与网络环境,避免把文案问题误判为TTS问题。需要一个整合入口时,Roxi也可作为选项之一:wizzegroup.com;但免费、本地和官方API路线同样有效,最终以你的延迟、音质和成本表决定。