Skip to content

Kimi(月之暗面)— OpenAI 格式 ​

POST/v1/chat/completions

调用 Kimi 系列模型进行文本对话,兼容 OpenAI Chat Completions 协议。

Bearer Token

模型介绍 ​

Kimi 由月之暗面出品,以超长上下文著称,支持单次输入 1M token,适合长文档摘要、多文件代码分析、长篇报告生成等场景。

支持模型 ​

Kimi 模型列表

模型上下文长度最大输出思考模式工具调用缓存多模态
kimi-k31,000,0001,048,576✅✅✅文本+图像

思考模式提示:开启思考(reasoning)后,思考内容计入 max_tokens——设置过小(如 <100)时思考可能占满配额,content 返回空串且 finish_reason=length。建议思考模式调用时 max_tokens ≥ 1024。

请求参数 ​

请求参数

参数类型必填默认值描述
modelstring是-模型名称:kimi-k3
messagesarray是-消息列表,结构同 OpenAI 标准
streamboolean否false是否流式返回(SSE)
max_completion_tokensinteger否131,072最大输出 token 数,最大 1,048,576。官方当前推荐用本字段
max_tokensinteger否-官方已标记 deprecated,建议改用 max_completion_tokens
temperaturenumber否1.0采样温度;kimi-k3 固定 1.0,传入其他值会报错
top_pnumber否1.0核采样概率
reasoning_effortstring否max思考模式强度:low / high / max(仅 kimi-k3)。K3 始终开启思考,本字段用于调推理强度
toolsarray否-工具定义列表,超长上下文建议关闭
tool_choicestring否auto工具调用策略:auto / none / required
prompt_cache_keystring否-上下文缓存键
prompt_cache_optionsobject否ttl: 5mKimi 特有:mode 仅 implicit;ttl ∈ 5m / 1h。不传 = 默认开启缓存写入(5m 档)

请求示例 ​

bash
curl -X POST /v1/chat/completions \
  -H "Authorization: Bearer YOUR_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "kimi-k3",
    "messages": [
      {"role": "user", "content": "用一句话介绍你自己。"}
    ]
  }'

长文档处理示例 ​

python
with open("long_report.txt", "r", encoding="utf-8") as f:
    long_text = f.read()  # 假设 300k token

resp = client.chat.completions.create(
    model="kimi-k3",
    messages=[
        {"role": "system", "content": "你是专业的金融分析师。"},
        {"role": "user", "content": f"请提取以下报告中的关键财务指标:\n\n{long_text}"},
    ],
    max_tokens=2000,
)

响应示例 ​

成功响应

json
{
  "id": "cmpl-3bb05cf5cd819fbca5f0b8d67a025022",
  "object": "chat.completion",
  "created": 1735661000,
  "model": "kimi-k3",
  "choices": [
    {
      "index": 0,
      "message": {
        "role": "assistant",
        "content": "文档要点如下:1. 营收同比增长 15%……"
      },
      "finish_reason": "stop"
    }
  ],
  "usage": {
    "prompt_tokens": 310200,
    "completion_tokens": 800,
    "total_tokens": 311000
  }
}

注意事项 ​

  • 响应 id 由平台按原厂形态归一:cmpl- + 32 位 hex。
  • 虽然支持 1M 上下文,但当输入超过 128k 时,响应延迟会显著上升,建议开启缓存(prompt_cache_options)降低费用。
  • Kimi 的思考过程以 <think>…</think> 标签包裹,计为输出 token。
  • 超长上下文场景下建议关闭 tools 以避免误调用。

© 2026 宁享Token. 保留所有权利。