Skip to content

private_deployment

约 633 字大约 2 分钟

2025-09-10

私有部署接口服务

模型服务

私有部署提供两种模型服务:

交融大模型

QwQ-32B

请求示例

import requests

url = "API/v1/chat/completions"

payload = {
    "model": "XXX",
    "messages": [
        {
            "role": "user",
            "content": "<string>"
        }
    ],
    "max_tokens": 512,
    "temperature": 0.7,
    "top_p": 0.7,
    "frequency_penalty": 0.5,
    "response_format": {"type": "text"}
    ]
}
headers = {
    "Authorization": "Bearer <token>",
    "Content-Type": "application/json"
}

response = requests.request("POST", url, json=payload, headers=headers)

print(response.text)

响应示例

{
  "id": "<string>",
  "choices": [
    {
      "message": {
        "role": "assistant",
        "content": "<string>",
        "reasoning_content": "<string>"
      },
      "finish_reason": "stop"
    }
  ],
  "usage": {
    "prompt_tokens": 123,
    "completion_tokens": 123,
    "total_tokens": 246
  },
  "created": 123,
  "model": "<string>",
  "object": "chat.completion"
}

接口文档

**请求方式:**POST

**接口地址:**api/v1/chat/completions

请求参数说明:

headers 参数:

参数名称参数说明参数示例数据类型是否必须
Content-Type类型application/jsonstringtrue
Authorizationapi keyBearer stringtrue

Body 参数:

参数名称参数说明参数示例数据类型是否必须
model要使用的模型的 IDQwQ-32Bstringtrue
messages至今为止对话所包含的消息列表[{ "role": "user", "content": "Hello!" } ]object[]true
messages.role提供信息的角色user(assistant、 system)stringtrue
messages.content信息内容Hello!stringtrue
temperature确定响应的随机程度,,介于 0 和 2 之间。较高的值(如 0.8)将使输出更加随机,而较低的值(如 0.2)将使输出更加集中和确定0.7numberfalse
top_p一种替代温度采样的方法,称为核采样,其中模型考虑具有 top_p 概率质量的标记的结果。所以 0.1 意味着只考虑构成前 10% 概率质量的标记0.7numberfalse
frequency_penalty频率惩罚。-2.0 和 2.0 之间的数字。正值会根据到目前为止是否出现在文本中来惩罚新标记,从而增加模型谈论新主题的可能性0.5numberfalse
max_tokens生成 token 的最大数量512integerfalse
response_format指定模型必须输出的格式的对象objectfalse
response_format.type工具的类型textstringfalse

响应状态:

状态码说明
200OK
401"Invalid token"
404"404 page not found"
503Model service overloaded. Please try again later.

响应参数说明:

参数名称参数说明参数示例数据类型
idid123string
choices选项[ { "message": { "role": "assistant", "content": "", "reasoning_content": "" }, "finish_reason": "stop" } ]object[]
choices.message主要信息{ "role": "assistant", "content": "", "reasoning_content": "" }object
choices.message.role响应角色assistantstring
choices.message.content响应内容Hello!string
choices.message.reasoning_content响应推理内容Hello! Nice to meet you!string
choices.finish_reason结束原因stop(eos、length、tool_calls)string
usagetoken 情况{ "prompt_tokens": 123, "completion_tokens": 123, "total_tokens": 246 }object
usage.prompt_tokensprompt 使用的 token 数123integer
usage.completion_tokenscompletion 使用的 token 数123integer
usage.total_tokens总共用的 token 数246integer
created响应的生成时间123integer
model模型QwQ-32Bstring
object"chat.completion"chat.completionstring