API 网关
流式响应
SSE 流式输出的用法与注意事项。
开启流式
对话补全与 Messages 接口都支持流式,在请求体加 "stream": true:
{
"model": "gpt-5.2",
"stream": true,
"messages": [{ "role": "user", "content": "写一首短诗。" }]
}返回 Content-Type: text/event-stream,按 SSE 分块推送增量:
- OpenAI 兼容:
chat.completion.chunk分块,终止块finish_reason非空,最后发出data: [DONE]。 - Anthropic 兼容:
message_start→content_block_delta… →message_stop事件序列,与官方格式对齐。
官方 SDK 的 stream=True / .stream() 用法无需任何额外改动。
注意事项
- 客户端要按序消费并处理断连重试;网关不补发已消费的分块。
- 代理链路上不要缓冲 SSE(例如 Nginx 需关闭
proxy_buffering),否则流式会退化成一次性输出。 - 用量与计费在流结束后按整次请求结算,与非流式一致。
代理超时
CoWork 官网前端的代理对 /v1/images/* 与更新上传使用 1800 秒超时,其他路径默认 120 秒;自建客户端直连网关时请自行确认中间层超时配置。