DeepSeek Tavern 提供三款专为酒馆角色扮演场景打磨的 TTS(文本转语音)模型。兼容 OpenAI /v1/audio/speech 接口格式,可直接接入 SillyTavern、Tavo 等前端。
API 端点
POST https://deepseektavern.com/v1/audio/speech
认证方式:Authorization: Bearer <你的API密钥>
模型列表
| 模型 ID | 类型 | 说明 |
|---|---|---|
tavern-v1-tts | 基础版 | 内置 9 种精品中英文音色,开箱即用,支持风格指令控制情绪和语速 |
tavern-v1-voicedesign | 音色设计版 | 文字描述定制音色 — 年龄、性别、口音、性格均可自由定义,无需参考音频 |
tavern-v1-voiceclone | 语音克隆版 | 提供参考音频,高保真复刻人声,可叠加风格指令 |
请求参数
| 参数 | 类型 | 必填 | 说明 |
|---|---|---|---|
model | string | 是 | 模型 ID,见上表 |
input | string | 是 | 要合成语音的文本内容 |
voice | string | 是 | 音色标识。基础版为音色名,音色设计版为文字描述,克隆版为 Data URL |
response_format | string | 否 | 输出格式:mp3(默认)、opus、aac、flac、wav |
speed | number | 否 | 语速倍率,范围 0.25 ~ 4.0,默认 1.0 |
内置音色(tavern-v1-tts)
| 音色名 | Voice ID | 语言 | 风格 |
|---|---|---|---|
| 默认音色 | default | 中文 | 甜美清新女声(中国集群 = 冰糖) |
| 冰糖 | 冰糖 | 中文 | 甜美清新女声 |
| 茉莉 | 茉莉 | 中文 | 温婉柔和女声 |
| 苏打 | 苏打 | 中文 | 年轻活力男声 |
| 白桦 | 白桦 | 中文 | 沉稳磁性男声 |
| Mia | Mia | 英文 | 标准美式女声 |
| Chloe | Chloe | 英文 | 活泼自然女声 |
| Milo | Milo | 英文 | 年轻阳光男声 |
| Dean | Dean | 英文 | 成熟稳重男声 |
调用示例
基础版 TTS — 预设音色
curl https://deepseektavern.com/v1/audio/speech \
-H "Content-Type: application/json" \
-H "Authorization: Bearer $DEEPSEEK_TAVERN_KEY" \
-d '{
"model": "tavern-v1-tts",
"input": "欢迎来到我的酒馆,今天想聊点什么?",
"voice": "冰糖"
}' \
--output output.mp3
音色设计版 — 文字定制音色
curl https://deepseektavern.com/v1/audio/speech \
-H "Content-Type: application/json" \
-H "Authorization: Bearer $DEEPSEEK_TAVERN_KEY" \
-d '{
"model": "tavern-v1-voicedesign",
"input": "各位听众,欢迎收听今天的科技资讯。",
"voice": "沉稳磁性中年男声,略带激情,适合科技新闻播报"
}' \
--output output.mp3
语音克隆版 — Data URL 上传参考音频
# 将参考音频编码为 Base64 Data URL
REF_AUDIO_B64=$(base64 -i reference_audio.mp3)
curl https://deepseektavern.com/v1/audio/speech \
-H "Content-Type: application/json" \
-H "Authorization: Bearer $DEEPSEEK_TAVERN_KEY" \
-d "{
\"model\": \"tavern-v1-voiceclone\",
\"input\": \"这是使用我的声音合成的语音。\",
\"voice\": \"data:audio/mpeg;base64,${REF_AUDIO_B64}\"
}" \
--output output.mp3
音色设计指南(tavern-v1-voicedesign)
通过自然语言描述即可生成全新音色,无需参考音频。描述写在 voice 参数中,越具体效果越好。
| 维度 | 说明 | 示例 |
|---|---|---|
| 年龄 | 目标音色的年龄段 | 20岁、中年、老年 |
| 性别 | 男声或女声 | 男性、女性 |
| 口音 | 地域口音特征 | 北方口音、南方口音、轻微京腔 |
| 音质 | 声音的质感特征 | 清澈、沙哑、磁性、低沉、明亮 |
| 性格气质 | 声音传递的性格感 | 温柔、知性、严肃、活泼、沉稳、元气 |
| 场景适配 | 适用的内容类型 | 新闻播报、故事讲述、游戏 NPC 对话 |
音色描述示例
# 知性女主播
"voice": "一个30岁知性女声,带轻微南方口音,语气温和亲切,适合播讲科技新闻"
# 沧桑老学者
"voice": "低沉略带嘶哑的老年男性学者,语速较慢,适合讲历史故事"
# 元气少女
"voice": "18岁元气少女,声音清脆明亮,语速偏快,充满活力"
# 游戏 NPC
"voice": "沧桑的中年男性铁匠,声音粗犷有力,带点不耐烦的语气"
语音克隆指南(tavern-v1-voiceclone)
参考音频要求
- 时长:约 30 秒
- 格式:MP3、WAV、M4A、FLAC、OGG
- 内容:单人自然说话即可,无需特定文本
- 环境:发音清晰,无背景噪音
使用方式
将参考音频 Base64 编码后作为 voice 参数传入:
{
"model": "tavern-v1-voiceclone",
"input": "要合成的文本",
"voice": "data:audio/mpeg;base64,<base64-of-reference-mp3>"
}
Data URL 格式说明
MP3:data:audio/mpeg;base64,...;WAV:data:audio/wav;base64,...。编码命令:base64 -i reference.mp3。
风格控制
所有模型均支持通过自然语言指令控制合成语音的情绪、语速和语气。支持以下风格类型:
- 基础情绪:开心、悲伤、愤怒、恐惧、惊讶、兴奋、委屈、平静、冷漠
- 复合情绪:怅然、欣慰、无奈、愧疚、释然、嫉妒、厌倦、忐忑
- 整体语调:温柔、高冷、活泼、严肃、慵懒、俏皮、深沉、干练、凌厉
- 方言:东北话、四川话、河南话、粤语
- 角色扮演:孙悟空、林黛玉
- 唱歌:在文本最开头加
(唱歌)标签
风格控制示例
# 温柔但坚定
"voice": "冰糖,语气温柔但坚定,语速稍慢"
# 热情兴奋
"voice": "茉莉,语气热情高涨,语速加快,充满兴奋感"
# 方言模式
"voice": "白桦,用东北话说,语气豪爽热情"
# 唱歌模式(在 input 文本开头加标签)
"input": "(唱歌)原谅我这一生不羁放纵爱自由"
在 SillyTavern 中使用
- 打开 SillyTavern 扩展面板 → TTS
- 选择 OpenAI Compatible 作为 TTS 提供者
- Provider Endpoint 填入:
https://deepseektavern.com/v1/audio/speech - Model 选择
tavern-v1-tts(或对应的模型 ID) - Available Voices 填入:
default,冰糖,茉莉,苏打,白桦,Mia,Chloe,Milo,Dean - 在 API 密钥管理中填入你的 DeepSeek Tavern 密钥
- 点击测试,确认听到语音后即可在聊天中使用
提示
基础版 tavern-v1-tts 适合大多数场景;如需特殊音色风格,可尝试 tavern-v1-voicedesign 用文字自由定义;如需高度还原特定人物声音,使用 tavern-v1-voiceclone。