Skip to content

音频 API ​

通过 宁享Token 的音频 API,你可以完成文本转语音(TTS)、语音转文字(ASR)、音乐生成等任务。

支持的能力 ​

能力模型协议格式说明
文本转语音 (TTS)doubao-tts 系列 / seed-tts-2.0OpenAI 兼容多音色、情感、流式输出
音色克隆doubao-tts-icl-2.0 / seed-icl-2.0OpenAI 兼容声音复刻
音乐生成doubao-music / bgm / lyricsOpenAI 兼容全曲生成,含歌词与人声
文本转音效text-to-audio(已下架/暂未开放)OpenAI 兼容文本转音频

统一调用方式 ​

OpenAI 兼容端点:

POST /v1/audio/speech       # TTS
POST /v1/audio/transcriptions  # ASR(规划中,暂未开放)

文档目录 ​

计费 ​

  • TTS:按输入字符数计费(每千字符单价见控制台)。
  • ASR:规划中能力,暂未开放;开放后拟按音频时长(秒)计费。
  • Suno:已下架/暂未开放(历史按生成曲目数计费)。

所有费用以 CNY 结算。

常见问题 ​

支持哪些音频格式? ​

  • 输入(ASR,规划中):mp3 / wav / m4a / flac / ogg
  • 输出(TTS):mp3 / opus / aac / flac / wav
  • 输出(Suno,已下架):mp3(视频 mv 为 mp4)

是否支持流式 TTS? ​

支持,设置 stream: true 即可,响应为音频分块的 SSE 流。

© 2026 宁享Token. 保留所有权利。