Aioga
AI资讯 / 技巧观点
返回 AI资讯

Ploy 将 AI 智能体默认模型从 Claude Opus 4.8 切换至 GPT-5.6 Sol

Hacker News 热门(buzzing.cc 中文翻译)Aioga 编辑团队2026-07-12T23:41:11.951Z热度 70

Ploy 将其 AI 智能体默认模型从 Claude Opus 4.8 切换至 OpenAI 今晨发布的 GPT-5.6 Sol。在真实营销网站构建测试中,GPT-5.6 So...

技巧观点Hacker News 热门(buzzing.cc 中文翻译)

今日 AI 情报摘要

Ploy 将其 AI 智能体默认模型从 Claude Opus 4.8 切换至 OpenAI 今晨发布的 GPT-5.6 Sol。

在真实营销网站构建测试中,GPT-5.6 Sol 完成页面平均耗时 3 分 42 秒,较 Opus 4.8 的 8 分钟快 2.2 倍; 每次构建成本从 3.06 美元降至 2.22 美元,降低 27%; 输出 token 从 33.0K 降至 17.1K,视觉评分从 0.936 提升至 0.970。 迁移过程发现,GPT-5.6 会为所有 25 个工具参数填充默认值,导致 52%-64% 的文件读取返回空结果; 提示词指令和 OpenAI strict 模式均无法修复此行为。 此外,评估框架中约三分之一的原始失败源于针对旧模型的假设,而非模型本身问题。

中文正文 · AI 翻译

在四个月的时间里,没有任何前沿模型在我们的生产评估中超过 Claude Opus。GPT-5.6 做到了。这是我们在迁移过程中学到的东西。

Colorful Ploy inflatable forms connected by a translucent tube, representing a production AI agent migrating between model systems

截至今天,Ploy 的代理运行在 GPT-5.6 Sol 上,这是 OpenAI 今天上午发布的模型家族的旗舰级别。在几个月的时间里,没有模型达到我们替换 Claude Opus 的标准。GPT-5.6 Sol 做到了。在一次正面评价之后,我们将其设为每个 Ploy 工作区的默认模型。

Ploy 的代理构建和编辑生产营销网站。它规划页面,读取代码库,编写组件,生成图像,为自己的工作截图,并决定何时完成。我们测试每一次前沿发布版本时都会使用这个工作负载。在 Opus 占据默认槽的四个月期间(先是 Opus 4.7,然后是 4.8),我们测试的所有模型都无法超过它。GPT-5.6 是第一个做到这一点的模型。

首次评估运行暴露了几个失败模式,我们将在下面介绍。它也产生了强劲的结果。完成的构建所需时间不到实际时钟时间的一半,成本降低了 27%,并且评分达到或超过了我们现有模型。这些结果证明了迁移工作的合理性。

我们使用 Vercel 的 AI SDK:https://ai-sdk.dev/docs/introduction,但从 Claude Opus 4.8 切换到 GPT-5.6 Sol 仍然暴露了整个技术栈中供应商特定的假设。供应商在模型填充工具参数、缓存提示以及在回合间重放推理的方式上存在差异。

我们首先修复了评估框架,然后是工具模式、提示缓存和推理重放。

我们的评估套件将生产代理运行在固定工作区上。它涵盖了数百个用例,从“从零构建首页”到“此克隆请求是否可以安全执行”。对于构建用例,视觉评审会针对参考设计进行十项二元检查,例如“主图是全幅摄影场景”和“主要 CTA 是圆角矩形,而不是胶囊状”。我们还进行内容检查、工具轨迹检查和文件断言。我们针对完整追踪包括工具调用和模型文本,对每个失败进行分类。

首次跨模型运行暴露了评估框架中的一个问题。

我们的工具调用预算是按照 Opus 的顺序调用风格设计的。GPT-5.6 执行并行调用,并在正确解决问题的情况下超出了这些预算。我们的评估执行器也不支持批量文件读取,而 Opus 很少使用这一功能,而 GPT-5.6 经常使用。第一次运行中约三分之一的原始失败来自测试假设,而不是模型行为,这些失败分布不均。如果你正在评估一个挑战者与现任模型的表现差异,在信任通过率之前要先排查日志。否则,评估会奖励新模型表现得像旧模型。

一个省略 minScore 阈值的数据集继承了默认值 1.0,但没有任何东西标记了这一回退值。因此,GPT-5.6 “未通过”一个得分为 0.98 的 hero,而 Opus 即便通过了每个单独检查也“未通过”某个案例。两者的设计都是合理的,但隐式阈值让它们失败了。

Build-colorful-hero comparison: Opus's gradient hero passed at 1.0; GPT-5.6's color-block study scored 0.98 and failed only an implicit default threshold

在修复测试工具后,我们重新运行了重新设计测试套件,其中代理根据参考设计重建一个品牌的主页。

GPT-5.6 完成页面的速度快了 2.2 倍,成本低了 27%,输出的 token 量约为一半。同时,它写的代码也更少。在一个匹配示例中,Opus 生成了一个 17,957 字符的 globals.css,包含 174 个 CSS 变量,其中大部分颜色梯度未被使用。GPT-5.6 用 2,508 个字符和 45 个变量生成了一个可比较、有时甚至更好的渲染页面。

Claude Opus 4.8 completed CreateCards redesign passing all ten visual checks
GPT-5.6 completed CreateCards redesign passing nine of ten visual checks

GPT-5.6 擅长干净、紧凑网格布局,但如果没有强力引导,它容易收敛到这种风格。使用我们设计给 Opus 4.8 的旧测试工具时,GPT-5.6 Sol 经常忽略现有的设计系统,生成干净但通用化的输出。

Opus on the left reproduced the Clay brand system; GPT-5.6 on the right shipped a clean but generic page

我们在这里做的更改值得单独发一篇文章。我们的设计和工程团队改进了引导方法,直到 GPT-5.6 达到我们生产中要求的品牌一致性标准。

我们代理的代码工具有 25 个顶级参数。其中一个 action 是必需的,其余都是可选的。Claude 只发送它使用的两个或三个参数,省略其余参数。GPT-5.6 每次调用发送全部 25 个参数,将未使用的参数填充为合理值,例如 offset: 0、timeout: 120000 和 siteId: "00000000-0000-0000-0000-000000000000"。

我们在三天的生产代码(读取)日志中都看到了这个模式。

冗长并不是问题。文件读取的实现无法区分一个虚构的值和一个预期值。它将 offset: 0 当作真实参数处理,导致 GPT-5.6 有 52% 到 64% 的文件读取返回为空。该工具对于有效和空读取都返回 success: true,因此模型无法判断自己正在读取空文件。它通过更多的调用来补偿,但结果更差。

提示无法解决这个问题。一个提示工具描述指令“省略未使用的参数”仍然生成了 25 个参数中的 25 个。针对每个属性的“OPTIONAL,如果未使用则省略”提示也是一样。我们在 OpenAI 的严格模式中测量到相同的行为,采用严格模式将需要从每个模式中去掉 pattern、format 和 array-bound 验证。这种行为来源于模型发出函数调用的方式:https://developers.openai.com/api/docs/guides/function-calling,因此我们改为了修改模式。

有效的修复是在提供者边界进行模式转换。对于 OpenAI 系列模型,我们将每个可选属性重写为必需但可为空,使用 anyOf: [T, null]。这为模型提供了未使用参数的明确值。然后我们在共享工具调用边界的验证前去掉 null,因此工具实现无需改变。模型看到的模式表示未使用的值,而工具收到的输入与之前相同。

更改后,空文件读取从 52% 降至 0%。由于停止了重新读取空结果,代理在完成相同任务时调用工具的次数也减少了约 30%。

两个提供商都提供“提示缓存”,但实现方式不同。在考虑这些差异之前,GPT-5.6 的使用成本似乎比 Opus 高约 50%。造成差异的是我们的缓存配置,模型定价本身是正常的。

我们代理的提示以大约 29K 令牌的静态前缀开头(工具模式加核心系统提示),每次对话都相同。在 Claude 上,我们用 cache_control 标记缓存中断点,前缀可以在整个组织中共享。任何工作区的任何对话都可以使用一个共享条目,无需每个密钥的吞吐量预算。缓存命中率在 92% 到 96% 之间。

GPT-5.6 使用了不同的 OpenAI 缓存模型。早期的 GPT 模型会缓存隐式的部分前缀匹配。GPT-5.6 放弃了部分前缀匹配:https://developers.openai.com/api/docs/guides/prompt-caching,因此现在隐式缓存会根据最新消息创建完整提示条目。一个新的会话共享我们 29K 的静态前缀时,缓存了 0%。每个会话都会按照未缓存的费率重新计费完整前缀。GPT-5.6 还会对每个未缓存的提示应用 1.25× 的缓存写入附加费,无论应用是否使用缓存。

显式机制使用 prompt_cache_breakpoint 标记和强制性 prompt_cache_key。该键是缓存标识的一部分,因此相同提示但键不同不会产生缓存命中。每个键映射到一个缓存节点,该节点在 OpenAI 将流量分发到其他拥有独立冷缓存的节点之前,大约每分钟可支持 15 个请求。

主要的设计决策是哪个实体应该负责限定键的范围。

我们提供工作区范围的键,并将系统提示拆分为有断点的层,这与我们之前用于 Anthropic 的结构相对应:

Entry A 减少了会话首次调用的成本。当工作区内存发生变化时,请求会错过 Entry B,但仍命中 Entry A,然后写入一个新的 Entry B。这只需一次与上下文大小相等的写入,而不是重新计费完整的 29K 前缀。Entry C 是 OpenAI 的隐式完整提示链,它在会话内工作,因为我们的提示严格为追加模式。

OpenAI 的键分区防止了静态前缀在工作区之间的共享。Anthropic 可以共享前缀,因为其缓存是组织范围的,没有键分区。在 GPT-5.6 上,每个工作区在空闲窗口中需为一次 29K 的冷写入支付约 0.18 美元。成本是有限且可预测的。

更改之后,首次调用的缓存命中率从大约 0% 提升到 83.7%,未缓存输入令牌总数下降 28%,GPT-5.6 的每套成本低于 Opus。缓存配置错误导致了我们测量到的全部成本差异。当一个模型从冷缓存开始时,对模型之间的成本比较没有参考价值。

推理重放导致生产对话出现间歇性故障。GPT-5.6 的 Responses API 默认会将先前回合的推理作为服务器端项目引用进行重放,而我们的对话有时会出现 Item 'rs_...' not found 错误。将 store 设置为 false 可使 SDK 请求加密的推理内容:https://developers.openai.com/api/docs/guides/reasoning,并重放自包含的块而不是指向服务器状态的指针。我们还了解到,即使应用程序发送的字节是追加唯一的,服务器端的推理状态也可能改变有效提示。

GPT-5.6 今天上线,并已在 Ploy 上运行。你可以在 ploy.ai 免费开始:https://ploy.ai/auth/sign-up,提供一个网站以生成,并查看不到四分钟的生成效果。

Ploy 是一个 AI 层,可以规划、构建、发布并优化网站和活动。如果凌晨 2 点调试缓存节点分发听起来很有趣,我们正在招聘:https://ploy.ai/careers。

Ploy 自动构建、测试并优化你的网站。

情报判断

Aioga 编辑摘要

Ploy 在生产评估后,将网站构建与编辑智能体的默认模型从 Claude Opus 4.8 切换为 GPT-5.6 Sol。其测试显示,新模型平均构建更快、成本更低、输出 token 更少,视觉评分也有所提高。

背景分析

Ploy 的智能体负责规划页面、读取代码、编写组件、生成图像并检查最终结果。Claude Opus 系列此前连续四个月占据默认模型位置,GPT-5.6 Sol 是这段时间内首个达到其替换标准的受测模型。

Aioga 观点

Aioga 判断,这次迁移的重点不只是模型指标领先,还揭示了生产系统对特定供应商行为的隐性依赖。模型替换需要同时审查工具参数、提示缓存、推理回放和评估框架,不能仅依据单轮输出决定。

影响与后续

这组结果可能说明,在 Ploy 的营销网站构建工作负载中,GPT-5.6 Sol 具有效率和成本优势。但工具参数默认填充曾导致大量文件读取为空,表明模型能力提升并不等于可以直接无风险替换。 值得关注 Ploy 后续是否披露更完整的测试样本、失败分布及迁移后的长期生产表现。采用类似智能体架构的团队可先检查评估规则中的旧模型假设,并针对工具调用和文件读取建立回归测试。

来源与版权说明

本页正文由公开来源页面提取并按原有信息整理,同时保留来源、发布时间和原文入口。版权归原作者及来源网站所有,请通过原文链接核验和阅读来源版本。

抓取通道: 摘要聚合 · 原始域名: ploy.ai

来源: Hacker News 热门(buzzing.cc 中文翻译)

原文链接: 打开原始来源

Aioga 归档: 查看情报页

Content record: source-page · Updated: 2026-07-12T23:41:11.951Z

API 中转站
API RELAY · DEVELOPER INFRASTRUCTURE

API 中转站

统一接入主流 AI 模型 API,为开发、测试与生产环境提供稳定调用入口。

立即访问 api.w173.com
AIOGA SHARE POSTER

分享这篇 AI 情报

Ploy 将其 AI 智能体默认模型从 Claude Opus 4.8 切换至 OpenAI 今晨发布的 GPT-5.6 Sol。在真实营销网站构建测试中,GPT-5.6 So...

Hacker News 热门(buzzing.cc 中文翻译)2026-07-12T23:41:11.951Z
扫码打开文章详情扫码直达文章详情

Aioga 自动聚合全球 AI 动态,并保留来源信息用于核验与引用。