DeepSeek Tavern 提供三款专为酒馆角色扮演场景打磨的 TTS(文本转语音)模型。兼容 OpenAI /v1/audio/speech 接口格式,可直接接入 SillyTavern、Tavo 等前端。

API 端点

POST https://deepseektavern.com/v1/audio/speech

认证方式:Authorization: Bearer <你的API密钥>

模型列表

模型 ID类型说明
tavern-v1-tts基础版内置 9 种精品中英文音色,开箱即用,支持风格指令控制情绪和语速
tavern-v1-voicedesign音色设计版文字描述定制音色 — 年龄、性别、口音、性格均可自由定义,无需参考音频
tavern-v1-voiceclone语音克隆版提供参考音频,高保真复刻人声,可叠加风格指令

请求参数

参数类型必填说明
modelstring模型 ID,见上表
inputstring要合成语音的文本内容
voicestring音色标识。基础版为音色名,音色设计版为文字描述,克隆版为 Data URL
response_formatstring输出格式:mp3(默认)、opusaacflacwav
speednumber语速倍率,范围 0.25 ~ 4.0,默认 1.0

内置音色(tavern-v1-tts)

音色名Voice ID语言风格
默认音色default中文甜美清新女声(中国集群 = 冰糖)
冰糖冰糖中文甜美清新女声
茉莉茉莉中文温婉柔和女声
苏打苏打中文年轻活力男声
白桦白桦中文沉稳磁性男声
MiaMia英文标准美式女声
ChloeChloe英文活泼自然女声
MiloMilo英文年轻阳光男声
DeanDean英文成熟稳重男声

调用示例

基础版 TTS — 预设音色

curl https://deepseektavern.com/v1/audio/speech \
  -H "Content-Type: application/json" \
  -H "Authorization: Bearer $DEEPSEEK_TAVERN_KEY" \
  -d '{
    "model": "tavern-v1-tts",
    "input": "欢迎来到我的酒馆,今天想聊点什么?",
    "voice": "冰糖"
  }' \
  --output output.mp3

音色设计版 — 文字定制音色

curl https://deepseektavern.com/v1/audio/speech \
  -H "Content-Type: application/json" \
  -H "Authorization: Bearer $DEEPSEEK_TAVERN_KEY" \
  -d '{
    "model": "tavern-v1-voicedesign",
    "input": "各位听众,欢迎收听今天的科技资讯。",
    "voice": "沉稳磁性中年男声,略带激情,适合科技新闻播报"
  }' \
  --output output.mp3

语音克隆版 — Data URL 上传参考音频

# 将参考音频编码为 Base64 Data URL
REF_AUDIO_B64=$(base64 -i reference_audio.mp3)

curl https://deepseektavern.com/v1/audio/speech \
  -H "Content-Type: application/json" \
  -H "Authorization: Bearer $DEEPSEEK_TAVERN_KEY" \
  -d "{
    \"model\": \"tavern-v1-voiceclone\",
    \"input\": \"这是使用我的声音合成的语音。\",
    \"voice\": \"data:audio/mpeg;base64,${REF_AUDIO_B64}\"
  }" \
  --output output.mp3

音色设计指南(tavern-v1-voicedesign)

通过自然语言描述即可生成全新音色,无需参考音频。描述写在 voice 参数中,越具体效果越好。

维度说明示例
年龄目标音色的年龄段20岁、中年、老年
性别男声或女声男性、女性
口音地域口音特征北方口音、南方口音、轻微京腔
音质声音的质感特征清澈、沙哑、磁性、低沉、明亮
性格气质声音传递的性格感温柔、知性、严肃、活泼、沉稳、元气
场景适配适用的内容类型新闻播报、故事讲述、游戏 NPC 对话

音色描述示例

# 知性女主播
"voice": "一个30岁知性女声,带轻微南方口音,语气温和亲切,适合播讲科技新闻"

# 沧桑老学者
"voice": "低沉略带嘶哑的老年男性学者,语速较慢,适合讲历史故事"

# 元气少女
"voice": "18岁元气少女,声音清脆明亮,语速偏快,充满活力"

# 游戏 NPC
"voice": "沧桑的中年男性铁匠,声音粗犷有力,带点不耐烦的语气"

语音克隆指南(tavern-v1-voiceclone)

参考音频要求

  • 时长:约 30 秒
  • 格式:MP3、WAV、M4A、FLAC、OGG
  • 内容:单人自然说话即可,无需特定文本
  • 环境:发音清晰,无背景噪音

使用方式

将参考音频 Base64 编码后作为 voice 参数传入:

{
  "model": "tavern-v1-voiceclone",
  "input": "要合成的文本",
  "voice": "data:audio/mpeg;base64,<base64-of-reference-mp3>"
}
Data URL 格式说明

MP3:data:audio/mpeg;base64,...;WAV:data:audio/wav;base64,...。编码命令:base64 -i reference.mp3

风格控制

所有模型均支持通过自然语言指令控制合成语音的情绪、语速和语气。支持以下风格类型:

  • 基础情绪:开心、悲伤、愤怒、恐惧、惊讶、兴奋、委屈、平静、冷漠
  • 复合情绪:怅然、欣慰、无奈、愧疚、释然、嫉妒、厌倦、忐忑
  • 整体语调:温柔、高冷、活泼、严肃、慵懒、俏皮、深沉、干练、凌厉
  • 方言:东北话、四川话、河南话、粤语
  • 角色扮演:孙悟空、林黛玉
  • 唱歌:在文本最开头加 (唱歌) 标签

风格控制示例

# 温柔但坚定
"voice": "冰糖,语气温柔但坚定,语速稍慢"

# 热情兴奋
"voice": "茉莉,语气热情高涨,语速加快,充满兴奋感"

# 方言模式
"voice": "白桦,用东北话说,语气豪爽热情"

# 唱歌模式(在 input 文本开头加标签)
"input": "(唱歌)原谅我这一生不羁放纵爱自由"

在 SillyTavern 中使用

  1. 打开 SillyTavern 扩展面板 → TTS
  2. 选择 OpenAI Compatible 作为 TTS 提供者
  3. Provider Endpoint 填入:https://deepseektavern.com/v1/audio/speech
  4. Model 选择 tavern-v1-tts(或对应的模型 ID)
  5. Available Voices 填入:default,冰糖,茉莉,苏打,白桦,Mia,Chloe,Milo,Dean
  6. 在 API 密钥管理中填入你的 DeepSeek Tavern 密钥
  7. 点击测试,确认听到语音后即可在聊天中使用
提示

基础版 tavern-v1-tts 适合大多数场景;如需特殊音色风格,可尝试 tavern-v1-voicedesign 用文字自由定义;如需高度还原特定人物声音,使用 tavern-v1-voiceclone