Skip to main content
POST
创建聊天补全
为给定的聊天对话创建模型响应。有关更多信息,请参阅 文本生成视觉音频指南。 支持的参数可能因用于生成响应的模型而异,尤其是较新的推理模型。下文会注明仅推理模型支持的参数。有关推理模型当前不支持的参数, 请参阅推理指南

流式响应

设置 "stream": true,即可在生成每个词元时接收服务器发送事件(SSE)。这可以缩短首词元响应时间,非常适合聊天界面。

流的结构

SSE 流中的每一行如下所示:
  • 每个 data: 行都是一个 JSON 对象。第一个数据块包含 role;后续数据块仅包含 delta.content
  • 流以设置了 finish_reason 的最终数据块结束,随后是字面量 data: [DONE] 行。
  • 如果使用工具调用,delta.tool_calls 会增量到达,应按 index 拼接。

处理错误和超时

  • 流中错误会作为普通 SSE 事件到达,其中包含 error 键而非 choices。请关闭流,并将错误返回给调用方。
  • 流断开(网络短暂故障、客户端超时)无法恢复,请重新发起请求。对于部分响应,不会收取超出已接收词元的费用。
  • 空闲超时:如果流超过 60 秒处于空闲状态(无词元),AIsa 会将其关闭。请将客户端读取超时设置为 120 秒,以留出安全余量。
  • 客户端背压:如果下游消费者处理缓慢,请停止从流中读取;AIsa 会限制传输速率,而不会丢弃词元。
流式与非流式采用相同的按词元费率。即使流在响应过程中被中断,已传输的词元仍会计费。

授权

Authorization
string
header
必填

Bearer authentication header of the form Bearer <token>, where <token> is your auth token.

请求体

application/json
model
string
示例:

"gpt-4.1"

messages
object[]
stream
boolean
示例:

false

logprobs
boolean
top_logprobs
integer
functions
object[]
function_call
示例:

"auto"

响应

200

成功完成