Kimi(月之暗面)— OpenAI 格式
POST
/v1/chat/completions调用 Kimi 系列模型进行文本对话,兼容 OpenAI Chat Completions 协议。
Bearer Token
模型介绍
Kimi 由月之暗面出品,以超长上下文著称,支持单次输入 1M token,适合长文档摘要、多文件代码分析、长篇报告生成等场景。
支持模型
Kimi 模型列表
| 模型 | 上下文长度 | 最大输出 | 思考模式 | 工具调用 | 缓存 | 多模态 |
|---|---|---|---|---|---|---|
kimi-k3 | 1,000,000 | 1,048,576 | ✅ | ✅ | ✅ | 文本+图像 |
思考模式提示:开启思考(reasoning)后,思考内容计入
max_tokens——设置过小(如 <100)时思考可能占满配额,content返回空串且finish_reason=length。建议思考模式调用时max_tokens≥ 1024。
请求参数
请求参数
| 参数 | 类型 | 必填 | 默认值 | 描述 |
|---|---|---|---|---|
| model | string | 是 | - | 模型名称:kimi-k3 |
| messages | array | 是 | - | 消息列表,结构同 OpenAI 标准 |
| stream | boolean | 否 | false | 是否流式返回(SSE) |
| max_completion_tokens | integer | 否 | 131,072 | 最大输出 token 数,最大 1,048,576。官方当前推荐用本字段 |
| max_tokens | integer | 否 | - | 官方已标记 deprecated,建议改用 max_completion_tokens |
| temperature | number | 否 | 1.0 | 采样温度;kimi-k3 固定 1.0,传入其他值会报错 |
| top_p | number | 否 | 1.0 | 核采样概率 |
| reasoning_effort | string | 否 | max | 思考模式强度:low / high / max(仅 kimi-k3)。K3 始终开启思考,本字段用于调推理强度 |
| tools | array | 否 | - | 工具定义列表,超长上下文建议关闭 |
| tool_choice | string | 否 | auto | 工具调用策略:auto / none / required |
| prompt_cache_key | string | 否 | - | 上下文缓存键 |
| prompt_cache_options | object | 否 | ttl: 5m | Kimi 特有:mode 仅 implicit;ttl ∈ 5m / 1h。不传 = 默认开启缓存写入(5m 档) |
请求示例
bash
curl -X POST /v1/chat/completions \
-H "Authorization: Bearer YOUR_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "kimi-k3",
"messages": [
{"role": "user", "content": "用一句话介绍你自己。"}
]
}'长文档处理示例
python
with open("long_report.txt", "r", encoding="utf-8") as f:
long_text = f.read() # 假设 300k token
resp = client.chat.completions.create(
model="kimi-k3",
messages=[
{"role": "system", "content": "你是专业的金融分析师。"},
{"role": "user", "content": f"请提取以下报告中的关键财务指标:\n\n{long_text}"},
],
max_tokens=2000,
)响应示例
成功响应
json
{
"id": "cmpl-3bb05cf5cd819fbca5f0b8d67a025022",
"object": "chat.completion",
"created": 1735661000,
"model": "kimi-k3",
"choices": [
{
"index": 0,
"message": {
"role": "assistant",
"content": "文档要点如下:1. 营收同比增长 15%……"
},
"finish_reason": "stop"
}
],
"usage": {
"prompt_tokens": 310200,
"completion_tokens": 800,
"total_tokens": 311000
}
}注意事项
- 响应
id由平台按原厂形态归一:cmpl-+ 32 位 hex。 - 虽然支持 1M 上下文,但当输入超过 128k 时,响应延迟会显著上升,建议开启缓存(
prompt_cache_options)降低费用。 - Kimi 的思考过程以
<think>…</think>标签包裹,计为输出 token。 - 超长上下文场景下建议关闭
tools以避免误调用。
