GPT-5.6 试用了半天:强,但真的慢

📅 发布时间:2026/7/27 14:22:24
GPT-5.6 试用了半天:强,但真的慢 先说最直接的感受慢真的慢。我不是在跑一个几十万行代码库也不是让它自主工作两小时。只是让 GPT-5.6 Sol 审查一段 11 行的异步 Python单次等待就在 21 到 44 秒之间。把任务换成搜资料、读飞书文档、生成配图、写中英文文章并构建网站以后那种“模型还在想”的停顿会被不断放大。但它也确实强。对事务边界、行锁、阻塞 I/O、异常回滚、缓存一致性这些容易被普通代码审查漏掉的问题Sol 的四个推理档位都找全了。问题不在于它会不会做而在于什么任务值得等。这篇文章就是一次完整试用记录。它没有拿官方 benchmark 代替体验而是把我这次看到的耗时、token 和成本都摊开。我现在用到的 GPT-5.6 是什么OpenAI 在 2026 年 6 月 26 日先发布了 GPT-5.6 的有限预览系列里有三个长期档位Sol是旗舰模型Terra平衡能力与成本Luna主打速度和低价。到了我写这篇文章的 7 月 10 日GPT-5.6 已开始向符合条件的 ChatGPT 套餐逐步开放官方帮助页同时写明Codex CLI 至少需要0.144.0。我的环境是Codex CLI: 0.144.1 默认模型: gpt-5.6-sol 默认 reasoning effort: medium 日期: 2026-07-10 时区: Asia/Shanghai这点很重要。GPT-5.6 仍在滚动开放别人暂时看不到不一定是命令写错也可能是套餐、账号或 workspace 权限还没开。官方资料GPT-5.6 Sol 发布说明GPT-5.6 在 ChatGPT 与 Codex 中的可用性GPT-5.6 Sol API 模型页同一道题先测 Sol 的四个推理档位测试方法我准备了一段 11 行的异步 Python。里面人为放了 7 类问题同步 HTTP 阻塞事件循环、异常路径未回滚、提前返回未清理事务、远程 I/O 跨越事务和行锁、缓存先于数据库提交、用户不存在未处理、响应 JSON 未校验。四次调用使用完全相同的提示词只修改model gpt-5.6-sol model_reasoning_effort low | medium | high | xhigh测试通过codex exec --ephemeral --json串行执行。串行是为了避免四个请求同时抢本机与服务端资源。耗时取墙钟时间token 取 Codex 返回的turn.completed.usage。这是一次真实冷启动观察不是多轮统计 benchmark。实测结果推理档位耗时输入 token缓存输入输出 tokenreasoning token得分API 等价成本low27.28 秒19,1558,9607933317/7$0.0792medium21.26 秒17,4418,9607492687/7$0.0694high43.92 秒17,4168,9601,2607837/7$0.0846xhigh36.18 秒17,4168,9601,4661,0347/7$0.0907四次合计 75,696 token按 GPT-5.6 Sol 官方标准 API 价格折算约$0.3239。计算方式是未缓存输入$5/1M、缓存读取$0.50/1M、输出$30/1M。reasoning token 已包含在输出 token 中不重复计费。最有意思的不是 high 最慢而是medium 反而最快。这不代表 medium 永远比 low 快只能说明档位不是延迟的唯一变量。排队、缓存命中、输出长度、请求路由以及额外安全检查都会让单次结果抖动。这道题上high 和 xhigh 花了更多 reasoning token却没有换来更高得分。我的结论很简单日常代码审查先用 medium问题真的复杂、需要跨文件推演或多轮验证再提高档位。不要因为下拉框里有更高档就每次都拉满。再测 Sol、Terra、LunaGPT-5.6 的“档次”还可以指模型家族本身。于是我把 reasoning effort 固定为 medium再让三个模型回答同一道题。模型耗时得分输入 token缓存输入输出 tokenAPI 等价成本Sol21.26 秒7/717,4418,960749$0.0694Terra23.43 秒7/717,4169,472836$0.0348Luna31.44 秒6/716,2258,9601,406$0.0166价格来自官方公布的每百万 token 标准费率Sol 为$5/$30Terra 为$2.50/$15Luna 为$1/$6分别对应输入和输出缓存读取是输入价的 10%。这次 Luna 不但没有最快还漏掉了“响应 JSON 结构与name字段需要校验”转而指出了响应对象释放问题。后者也合理但不在预设的 7 项评分点里所以记为 6/7。不要根据这一轮就断言 Luna 比 Sol 慢。更可信的判断是Sol 适合难题和长链路工程任务但等待感最明显输出也贵。Terra 在这次小样本里保住了正确率成本约是 Sol 的一半是我更愿意日常使用的档位。Luna 的价格最低适合格式转换、简单修改和批处理碰到事务、并发和隐蔽正确性问题时最好加验证或换高一级模型。慢慢在哪里模型吐字速度只是一部分。Codex 做完整任务时时间还花在这些地方读取仓库规则、发现和加载技能、访问外部文档、调用浏览器或插件、生成图片、运行测试与构建以及在结果不确定时回头验证。GPT-5.6 的官方发布说明还提到两件事Sol 新增更深的maxreasoning effortultra会借助 subagents 处理复杂工作。它们不是我这次 CLI 四档单题测试的一部分也不能直接和xhigh画等号。产品界面、API 参数和 Codex 配置里的档位名称可能不同写自动化脚本时最好以当前客户端实际支持的配置为准。另一个容易忽略的因素是安全检查。官方说明部分生物和网络安全请求可能触发额外检查响应会明显变慢。我的题只是正常代码审查没有出现提示但“慢”不总是纯推理造成的。用 Codex Sites 做网站这次走到哪了我还让 Codex Sites 生成了一个“城市气象观察站”前端展示天气、空气质量和七日预报服务端计划通过 QVeris 动态发现并调用工具而不是把某个tool_id写死。这个场景很适合 Sites。它不是一张静态 landing page而是需要环境变量、服务端 API Route、缓存、错误状态、移动端适配、真实工具调用和发布地址的完整小应用。官方把 Sites 描述为由 ChatGPT 创建、托管、迭代和分享网站的能力。每一个部署 URL 都是生产部署发布时可以选择仅自己、workspace 成员或任何拿到链接的人访问。详情见 OpenAI Sites 文档。本轮真实结果Sites 最终不是从codex plugin list里找到的。它出现在支持该能力的 Codex App 界面中不是一个带独立sites命令的 CLI marketplace 插件。把完整 Prompt 交给 Sites 后它生成了 React/TypeScript 网站并部署到https://city-weather-lab-qveris.ax2675996.chatgpt.site/刚部署时匿名访问会返回401要求使用 ChatGPT 登录。把分享范围改成“互联网中的所有人”后无登录、无 Cookie 的请求返回200可以直接拿到完整页面。它仍带有X-Robots-Tag: noindex, nofollow所以属于“任何拿到链接的人可以访问”并不是会被搜索引擎主动收录的普通公开站点。托管由 OpenAI Sites 管理域名属于chatgpt.site外层经过 Cloudflare CDN。响应里的 Cloudflare 节点只能说明本次请求从哪个边缘节点进入不能据此推断源站物理位置。网站生成和发布已经成功但实时数据还没有打通。我直接请求北京、新加坡和伦敦的/api/weather三个接口都返回200响应中的source.demoMode均为truetoolId是demo-weather-current。这说明目前展示的是 Sites 生成的演示数据不能当成 QVeris 真实调用结果。下一步仍需在 Sites 设置中配置托管环境变量重新部署再核对脱敏后的 tool trace。当前验收结果验证项本轮结果后续验收标准Sites 入口Codex App 中可用CLI 插件列表不可见两种入口不要混为一谈网站生成已完成React/TypeScript 页面可正常返回在线地址已完成匿名访问返回200分享范围为互联网中的所有人QVeris 调用未完成当前demoMode: true北京、新加坡、伦敦返回真实天气页面展示脱敏后的 tool_id 与耗时凭证保护页面和接口响应未发现 API Key配置托管 secret 后再次检查浏览器源码、网络响应和构建产物响应式待补1440px 与 390px 截图无重叠、遮挡和横向溢出异常降级页面已预留状态真实调用尚未验证天气、预报、空气质量可独立失败保留最近一次成功数据这次已经拿到了 URL也确认了公开分享行为剩下最重要的不是再截几张漂亮界面而是把演示数据换成真实 QVeris 调用。真正完成的标准仍然包括实际 tool_id、调用耗时、失败切换、凭证检查以及桌面和移动端的视觉验收。这篇文章本身花了多少我把统计窗口固定为收到需求到第一次完整本地构建通过2026-07-10 12:16:51 至 12:27:42Asia/Shanghai墙钟时间10 分 51 秒。部分token主写作线程4,005,6154 次 Sol reasoning effort 实测75,696Terra medium 实测18,252Luna medium 实测17,631合计4,117,194合计包含 4,093,319 个输入 token其中 3,792,640 个为缓存输入和 23,875 个输出 tokenreasoning token 已包含在输出中。主线程按 Sol 费率计价六次独立测试按各自 Sol、Terra、Luna 费率计价合计 API 等价成本约$4.0148。这里的金额只是按 GPT-5.6 Sol 标准 API token 价格计算的等价原始成本不是 ChatGPT 或 Codex 订阅账单。当前会话还调用了飞书文档、网页检索、图片生成和本地构建第三方工具、图片与订阅权益不包含在这个 token 金额里。我的暂时结论GPT-5.6 给我的第一印象不是某个 benchmark 又高了几分而是它更像一个愿意把复杂工作做完的工程搭档。代码审查里它能稳定看到事务和缓存之间的关系写文章时它也能把来源核对、实测、配图和构建串起来。代价就是等待。简单任务用 Sol 的 high 或 xhigh常常是在花更多时间确认一个 medium 已经能答对的答案。Terra 可能是更实用的日常档位Luna 则需要更明确的验收条件。所以我的用法会是默认 Terra 或 Sol medium难题再升档批处理交给 Luna任何一次看起来很漂亮的结果都用测试和真实调用收尾。