CoWork 文档
API 网关

流式响应

SSE 流式输出的用法与注意事项。

开启流式

对话补全与 Messages 接口都支持流式,在请求体加 "stream": true

{
  "model": "gpt-5.2",
  "stream": true,
  "messages": [{ "role": "user", "content": "写一首短诗。" }]
}

返回 Content-Type: text/event-stream,按 SSE 分块推送增量:

  • OpenAI 兼容chat.completion.chunk 分块,终止块 finish_reason 非空,最后发出 data: [DONE]
  • Anthropic 兼容message_startcontent_block_delta … → message_stop 事件序列,与官方格式对齐。

官方 SDK 的 stream=True / .stream() 用法无需任何额外改动。

注意事项

  • 客户端要按序消费并处理断连重试;网关不补发已消费的分块。
  • 代理链路上不要缓冲 SSE(例如 Nginx 需关闭 proxy_buffering),否则流式会退化成一次性输出。
  • 用量与计费在流结束后按整次请求结算,与非流式一致。

代理超时

CoWork 官网前端的代理对 /v1/images/* 与更新上传使用 1800 秒超时,其他路径默认 120 秒;自建客户端直连网关时请自行确认中间层超时配置。

本页内容