除了 OpenAI(TTS-1 / Realtime API)之外,目前全球与国内的 AI 语音大模型领域还有很多表现优秀、且提供开放 API 接口的服务商。根据侧重点(如超低延迟、音色克隆、情感表现力或中文本地化),主要分为三大类:1. 垂直领域顶尖语音大模型 API(全球头部)这类厂商专注做“语音即代码”(Voice-first AI),在音色克隆、情绪调控和低延迟上代表了行业最高水平:ElevenLabs 特点:全球公认综合表现力最强的语音大模型 API 之一。API 优势:提供完整的 TTS、音色克隆(Voice Cloning)、自动翻译配音(Dubbing API)以及对话式 AI(Conversational AI Agent API)。适用场景:高品质播客/有声书、游戏 NPC 配音、跨国语言本地化。 Cartesia (Sonic 3 / 3.5) 特点:主打极致低延迟(首包响应时间可达 90ms 左右)。 API 优势:支持 WebSocket 流式双向传输,是实时语音 Agent(Voice Bot)开发者的首选 API 之一。支持 40+ 语言和情绪控制。 Fish Audio (Fish Speech) 特点:基于自回归架构的开放语音大模型,提供非常方便的云端 API。 API 优势:零样本(Zero-shot)音色克隆非常强,只需极短的音频样本就能生成效果出色的双语/多语配音。Hume AI (EVI - Empathic Voice Interface) 特点:主打共情与情绪感知。API 优势:不仅能生成语音,还能从用户的语音语气中实时分析情绪(如焦虑、开心、疑惑),并带入情感进行语音对答。2. 国内头部大模型厂商 API(中文及跨语言优化)如果你的业务以中文、中英混合或国内网络访问为主,国内大厂的 API 拥有极高性价比和本地化优势:MiniMax (Speech-02 / T2A API) 特点:国内第一梯队的文本转语音(T2A)大模型 API。API 优势:支持 300+ 种音色和 32+ 种语言,支持 HTTP/WebSocket 流式传输,并允许直接在 API 参数中动态调整语气和情绪(如 happy, calm 等)。阿里百炼平台 (DashScope - CosyVoice API) 特点:阿里将开源的 CosyVoice 部署为高并发云端 API。 API 优势:提供快速声音复刻(仅需几秒音频)、实时流式合成和非实时长文本生成,对接 DashScope SDK 非常方便。火山引擎 (字节跳动·豆包语音 API)特点:支撑抖音、剪映底层的语音能力。 API 优势:拥有全网最丰富、最接地气的中文音色库(含各种流行解说音、方言音色、动漫音色),接口稳定且并发能力强。科大讯飞 (星火语音 API) / 百度文心语音 API特点:传统的语音巨头大模型化升级。 API 优势:在专业领域(医疗、政务、客服)的专有名词发音准确率高,具备完善的 SSML 控制标签体系。3. 基础设施级云厂商 & 工具 APIDeepgram (Aura TTS)原本以超强的 STT(语音识别)闻名,其推出的 Aura API 专为实时对话 Agent 优化,兼具高吞吐量与低延迟。微软 Azure Neural TTS工业级标杆,支持超过 140 种语言和上百种声音,支持极精细的语气、停顿、朗读风格(如“新闻”、“客服”、“温柔”等)调控,适合大批量商业流水线。Play.ht (PlayHT 2.0 / 3.0 API)专为内容创作者和开发者设计的云端 TTS API,支持克隆与高拟真语音生成。选型建议 做实时语音通话 AI(Voice Agent):优先考虑 Cartesia (Sonic)、Deepgram Aura 或 OpenAI Realtime(注重极低延迟)。 做中文影视解说 / 广播剧 / 游戏配音:推荐 MiniMax Speech API 或 火山引擎(豆包语音),语气表现力和情绪丰富度很高。 做高质量多语言音色克隆:推荐 ElevenLabs 或 阿里百炼 CosyVoice API。

本地部署 CosyVoice 后,主要有三种方式进行 API 调用:原生 Python 代码直接调用(适合集成在自己的 Python 项目中)、搭轻量 FastAPI HTTP 服务(适合跨语言或多服务调用)以及 直接使用 WebUI 自带的 Gradio API。方式一:原生 Python 代码直接调用 (推荐在 Python 环境内使用)如果你需要在自己的 Python 项目里直接引入 CosyVoice,可以直接加载其 CLI 库进行推理。 1. 核心示例代码Pythonimport torchaudio

如果是 CosyVoice 1.0 请 import CosyVoice,2.0 导入 CosyVoice2

from cosyvoice.cli.cosyvoice import CosyVoice2
from cosyvoice.utils.file_utils import load_wav

1. 初始化模型(启动时加载一次即可)

cosyvoice = CosyVoice2('pretrained_models/CosyVoice2-0.5B')

--- 模式 A: Zero-Shot 音色克隆 (最常用) ---

需要:目标文本、参考音频文本、参考音频采样率转换为 16k 的 Tensor

prompt_speech_16k = load_wav('prompt.wav', 16000)
prompt_text = "这是参考音频里面说的原话内容。"
target_text = "你好,这是使用 CosyVoice 本地 API 合成的全新语音。"

运行推理

output = cosyvoice.inference_zero_shot(

tts_text=target_text,
prompt_text=prompt_text,
prompt_speech_16k=prompt_speech_16k,
stream=False, # 是否流式输出
speed=1.0     # 控制语速

)

保存生成的音频

for i, res in enumerate(output):

# res['tts_speech'] 结构为 torch.Tensor
torchaudio.save(f'output_zero_shot_{i}.wav', res['tts_speech'], cosyvoice.sample_rate)

--- 模式 B: 跨语言音色克隆 (Cross-Lingual) ---

用中文参考音频,输出英文/日文/韩文等其他语言

prompt_speech_16k = load_wav('chinese_prompt.wav', 16000)
english_text = "Hello, this is a cross-lingual voice cloning test."

output = cosyvoice.inference_cross_lingual(

tts_text=english_text,
prompt_speech_16k=prompt_speech_16k,
stream=False

)

for i, res in enumerate(output):

torchaudio.save(f'output_cross_{i}.wav', res['tts_speech'], cosyvoice.sample_rate)

方式二:封装 FastAPI 提供 RESTful HTTP API (跨语言/远程调用)如果你的主程序是 Java、Go、Node.js 或前端,需要通过 HTTP 接口访问,可以写一个简单的 FastAPI 服务脚本 api_server.py。1. 创建 api_server.py 脚本在 CosyVoice 项目根目录下新建 api_server.py:Pythonimport io
import torchaudio
from fastapi import FastAPI, Form, File, UploadFile
from fastapi.responses import Response
import uvicorn

from cosyvoice.cli.cosyvoice import CosyVoice2
from cosyvoice.utils.file_utils import load_wav

app = FastAPI(title="CosyVoice Local API")

全局单例加载模型

print("正在加载 CosyVoice 模型...")
cosyvoice = CosyVoice2('pretrained_models/CosyVoice2-0.5B')
print("模型加载完成!")

@app.post("/v1/tts/zero-shot")
async def zero_shot_tts(

text: str = Form(..., description="待合成的中文或外文文本"),
prompt_text: str = Form(..., description="参考音频对应的文字内容"),
prompt_wav: UploadFile = File(..., description="参考音频文件 (.wav / .mp3)")

):

# 读取上传的音频并转换为 16k 采样率的 Tensor
content = await prompt_wav.read()
prompt_speech_16k = load_wav(io.BytesIO(content), 16000)

# 推理合成
output = cosyvoice.inference_zero_shot(
    tts_text=text,
    prompt_text=prompt_text,
    prompt_speech_16k=prompt_speech_16k,
    stream=False
)

# 获取音频 Tensor 并保存到内存 Buffer 中返回
audio_tensor = next(output)['tts_speech']
buffer = io.BytesIO()
torchaudio.save(buffer, audio_tensor, cosyvoice.sample_rate, format="wav")
buffer.seek(0)

return Response(content=buffer.read(), media_type="audio/wav")

if name == "__main__":

uvicorn.run(app, host="0.0.0.0", port=8000)
  1. 启动 HTTP 服务Bashpython3 api_server.py
  2. 调用 HTTP API 测试使用 curl 命令行调用:Bashcurl -X POST "http://localhost:8000/v1/tts/zero-shot" \
    -F "text=你好,这是通过 HTTP API 合成的语音。" \
    -F "prompt_text=参考音频的原文字内容" \
    -F "prompt_wav=@/path/to/your/prompt.wav" \
    --output output_api.wav
    使用 Python requests 调用:Pythonimport requests

url = "http://localhost:8000/v1/tts/zero-shot"
payload = {

"text": "你好,这是通过 HTTP API 合成的语音。",
"prompt_text": "参考音频的原文字内容"

}
files = {

"prompt_wav": ("prompt.wav", open("/path/to/prompt.wav", "rb"), "audio/wav")

}

response = requests.post(url, data=payload, files=files)

with open("output_api.wav", "wb") as f:

f.write(response.content)

方式三:使用 Gradio Client(零代码修改的快速调用)如果在本地启动了 python webui.py(假设端口是 50000),Gradio 本身就会自动为你暴露一套 API 接口,你可以直接用 gradio_client 来调用:安装 Gradio 客户端工具: Bashpip install gradio_client
Python 代码调用 WebUI API:Pythonfrom gradio_client import Client, handle_file

连接本地运行的 WebUI 服务

client = Client("http://localhost:50000/")

调用零样本克隆函数(具体的 fn_index 或 api_name 可以在 http://localhost:50000/ 页脚点 "Use via API" 查看)

result = client.predict(

tts_text="你好,这是通过 Gradio API 调用的合成测试。",
prompt_text="参考音频原文字",
prompt_wav=handle_file('/path/to/prompt.wav'),
api_name="/generate_audio" # 替换为 WebUI 中实际的 API 名称

)

print("生成音频保存路径:", result)

本地部署阿里通义开源的 CosyVoice(或升级版的 CosyVoice2),建议使用 NVIDIA 显卡在 Linux 或 Windows Conda 环境下进行部署。1. 硬件配置要求 硬件项最低配置 (门槛)推荐配置 (流畅/快速)说明GPU / 显存NVIDIA 显卡,显存 6GB (如 RTX 2060 / 3060)NVIDIA 显卡,显存 8GB - 12GB+ (如 RTX 4060 Ti / 3090 / 4090)必须支持 CUDA;6GB 显存可运行 300M 模型,CosyVoice2-0.5B 建议 8GB 以上显存。系统内存 (RAM)16 GB32 GB 及以上模型加载和语音特征处理阶段会占用较多系统内存。硬盘空间预留 20 GB 固态硬盘预留 50 GB+ NVMe SSD预训练模型权重约 5GB–10GB,加上 PyTorch 环境与依赖库。操作系统Linux (Ubuntu 22.04) / Windows 10/11 (WSL2 或 Conda)Linux (Ubuntu 22.04 LTS)Linux 环境下系统的推理性能和显存利用率表现更佳。2. 本地部署步骤(基于 Conda + 源码)1.1. 环境准备与拉取代码:耗时约 3 分钟。打开终端,克隆带有子模块的官方仓库并创建 Python 3.10 环境:Bash# 克隆仓库(注意必须带 --recursive 提取子模块)
git clone --recursive https://github.com/FunAudioLLM/CosyVoice.git
cd CosyVoice

创建并激活 Conda 环境

conda create -n cosyvoice python=3.10 -y
conda activate cosyvoice
2.2. 安装依赖库与 C++ 文本前端处理工具:关键依赖配置。CosyVoice 需要 pynini 进行文本正则化处理,推荐直接使用 Conda 安装以避免 C++ 编译报错:Bash# 1. 使用 Conda 安装 pynini(全平台通用)
conda install -c conda-forge pynini=2.1.5 -y

2. 安装对应 CUDA 版本的 PyTorch(以 CUDA 12.1 为例)

pip install torch torchvision torchaudio --index-url https://download.pytorch.org/whl/cu121

3. 安装项目依赖

pip install -r requirements.txt
3.3. 下载模型权重文件:从魔搭社区/HuggingFace 下载。可以使用 Python 脚本从 ModelScope 快速下载预训练模型(推荐下载最新的 CosyVoice2-0.5B):Python# 在终端运行 python3 并执行以下代码
from modelscope import snapshot_download

下载 CosyVoice2-0.5B 到 pretrained_models 目录

snapshot_download('iic/CosyVoice2-0.5B', local_dir='pretrained_models/CosyVoice2-0.5B')
4.4. 启动 WebUI 界面:体验可视化网页交互。模型下载完成后,直接在终端启动 WebUI 服务:Bash# 指定加载的模型路径和启动端口
python3 webui.py --port 50000 --model_dir pretrained_models/CosyVoice2-0.5B
启动成功后,在浏览器访问 http://localhost:50000 即可体验 zero-shot 音色克隆、跨语言合成与情绪控制。3. 更省心的替代部署方案 Docker 镜像部署(适合 Linux / 服务器)官方提供了 Docker 编译与部署文件:Bashcd runtime/python
docker build -t cosyvoice:v1.0 .
docker run -d --gpus all -p 50000:50000 cosyvoice:v1.0
开源解压即用包(适合 Windows 桌面小白用户)如果不想折腾 Python / Conda 路径,可以在 B 站或 GitHub 上搜索开源社区制作的 CosyVoice 整合包,自带防报错环境与 WebUI 双击启动脚本,更加适合个人日常使用。

除了 OpenAI 的 TTS 模型之外,目前在英译汉配音、中英双语/跨语言音色克隆以及中文拟真度方面表现优秀的大模型,可以分为 开源大模型 和 商业级 API/云服务 两大阵营:1. 开源语音大模型(适合本地部署、私有化与二次开发)CosyVoice(阿里通义)核心优势:目前跨语言音色克隆(Cross-lingual)最强的开源模型之一。英译汉特点:即使只提供一段英文语音样本,它也能用该英文音色直接合成极其自然的中文语音,同时保留原声的音质和语气特点。对中英混合、多语言合成支持极佳。Fish Speech(Fish Audio)核心优势:基于 VQ-GAN 和 Llama 架构的开源 TTS 模型,零样本(Zero-shot)能力极强。英译汉特点:对英文发音和中文口语的转化非常平滑,感情丰富,支持中、英、日三语无缝切换,适合需要制作自然口播、动漫或角色配音的场景。ChatTTS核心优势:专为对话和口语场景设计的开源语音大模型。英译汉特点:自带极其自然的笑声、气音、叹气和停顿,能把英译汉后较为生硬的中文文本念出非常地道的“唠嗑感”,是目前口语拟真度的天花板之一。GPT-SoVITS核心优势:社区生态极其庞大的少样本音色克隆模型。英译汉特点:只需 5 秒音色样本即可完成微调,对于中英双语的韵律修正有非常丰富的社区工具链支持,适合需要定制特定主播/个人音色的场景。2. 商业级 API / 云端语音大模型(开箱即用,情感与音色极其丰富)ElevenLabs(Multilingual v2 & Dubbing API)核心优势:国际公认商业级 TTS 综合表现力第一。英译汉特点:其 Multilingual v2 模型支持极度逼真的中英文合成。此外,其内置的 AI Dubbing(自动翻译配音) 功能可以直接输入英文视频/音频,自动完成“文本翻译 + 音色克隆 + 时间轴对齐 + 导出中文语音”,非常适合做英文视频的本地化汉化。MiniMax(Speech-02 / T2A)核心优势:国内大模型厂商中语音合成表现力的第一梯队。英译汉特点:对复杂的中文上下文理解极深,能够根据英译汉后的文本语境自动匹配喜怒哀乐等情绪,发音饱满,非常适合影视解说、有声书和广告配音。火山引擎(字节跳动·豆包语音)核心优势:支撑抖音、剪映全网流行音色的底层语音引擎。英译汉特点:拥有海量的中文特色音色(如“毒舌电影解说”、“新闻播报”、“方言口音”等),对英文翻译过来的中文口语化表达调教得非常贴合短视频受众习惯。微软 Azure Neural TTS核心优势:工业级稳定性与音色库丰富度的行业标杆。英译汉特点:包含如“晓晓”、“云希”等经典高拟真音色,支持完整的 SSML 标签控制(语气、语速、停顿、情绪),适合大规模商业流水线或严谨的企业级应用。3. 选型建议需求场景推荐模型 / 工具核心理由英文视频/音频自动汉化配音ElevenLabs / CosyVoice支持 Cross-lingual,能直接用原英文主角的声线说中文追求极致的口语自然度与生活化语气MiniMax / ChatTTS / 火山引擎带有丰富的气音、停顿与情绪起伏,不像机械合成音完全免费、本地部署与私有化数据CosyVoice / Fish Speech显存占用可控,开源可商用,支持灵活接入 Python 流水线大规模稳定商业导出微软 Azure / 火山引擎 API高并发、超低延迟、音色一致性强

在 Linux 中保存环境变量,主要分为临时生效和永久生效(区分当前用户与全系统用户)三种方式。1. 临时保存(仅当前终端会话有效)适用于临时测试或一次性任务,关闭或重启终端后自动失效。Bashexport MY_VAR="my_value"
验证设置: 执行 echo $MY_VAR 查看输出。2. 永久保存 - 仅对当前用户生效(最常用、最安全)将环境变量写入当前用户的 Shell 配置文件中。Bash Shell(大部分 Linux 发行版默认):修改 ~/.bashrc 或 ~/.bash_profileZsh Shell:修改 ~/.zshrc操作步骤:打开配置文件(以 ~/.bashrc 为例):Bashnano ~/.bashrc
在文件末尾添加你的变量设置:Bashexport MY_VAR="my_value"

如果是想将某个目录添加到系统的 PATH 中:

export PATH="$PATH:/your/custom/path"
保存并退出(nano 中按 Ctrl + O 回车保存,Ctrl + X 退出)。使配置立即生效:Bashsource ~/.bashrc

  1. 永久保存 - 对系统所有用户生效(需要 sudo 权限)如果希望系统内所有用户和后台服务均可读取该变量:推荐做法(通过 /etc/profile.d/ 脚本):在 /etc/profile.d/ 目录下创建一个新的 .sh 配置文件:Bashsudo nano /etc/profile.d/custom_env.sh
    写入变量定义:Bashexport MY_VAR="my_value"
    保存退出,并使其立即生效:Bashsource /etc/profile
    常用管理工具命令查看所有环境变量: env 或 printenv查看单一变量: echo $MY_VAR删除/取消环境变量: unset MY_VAR(仅作用于当前会话;永久删除需从配置文件中抹去该行)