搭建了一个 sub2api来分发 gpt 订阅,之前一直使用正常,但是 gpt6 发布后,发现首字延迟爆高(20-120 秒)且 首字延迟 ≈ 整体用时

怀疑是 nginx 配置(排除,直连 sub2api 也一样)
怀疑是 sub2api BUG(排除, 社区其他人没有反馈)
怀疑是 落地 IP问题(排除,已换几个双 ISP,纯家宽,表现都一致)

于是直接拿 access_token 调用官方 api,也是一样。

求问下有没有遇到过这种场景的,是怎么解决的?

非常诡异的点在于

使用 gpt-5 系列的模型,是正常的

唯独使用 gpt-6 就出现这个问题

https://chatgpt.com/backend-api/codex/responses

上游直连复现了相同现象,6.1 的整段输出不是 nginx 或 sub2api 转发造成的。

模型HTTP首段正文正文 delta 数输出跨度
gpt-5.6-sol2005.26 秒3659.00 秒
gpt-6.1-sol20027.31 秒1一次性返回 398 字

两次均正常收到 response.completed,没有 Content-Encoding,返回 Transfer-Encoding: chunked。