音频 API
通过 宁享Token 的音频 API,你可以完成文本转语音(TTS)、语音转文字(ASR)、音乐生成等任务。
支持的能力
| 能力 | 模型 | 协议格式 | 说明 |
|---|---|---|---|
| 文本转语音 (TTS) | doubao-tts 系列 / seed-tts-2.0 | OpenAI 兼容 | 多音色、情感、流式输出 |
| 音色克隆 | doubao-tts-icl-2.0 / seed-icl-2.0 | OpenAI 兼容 | 声音复刻 |
| 音乐生成 | doubao-music / bgm / lyrics | OpenAI 兼容 | 全曲生成,含歌词与人声 |
| 文本转音效 | text-to-audio(已下架/暂未开放) | OpenAI 兼容 | 文本转音频 |
统一调用方式
OpenAI 兼容端点:
POST /v1/audio/speech # TTS
POST /v1/audio/transcriptions # ASR(规划中,暂未开放)文档目录
计费
- TTS:按输入字符数计费(每千字符单价见控制台)。
- ASR:规划中能力,暂未开放;开放后拟按音频时长(秒)计费。
- Suno:已下架/暂未开放(历史按生成曲目数计费)。
所有费用以 CNY 结算。
常见问题
支持哪些音频格式?
- 输入(ASR,规划中):mp3 / wav / m4a / flac / ogg
- 输出(TTS):mp3 / opus / aac / flac / wav
- 输出(Suno,已下架):mp3(视频 mv 为 mp4)
是否支持流式 TTS?
支持,设置 stream: true 即可,响应为音频分块的 SSE 流。
