Thibault 宣布 Codex 和 ChatGPT Work 所有付费用户使用额度已重置,"迭代速度前所未有,基础设施扩容比预期更快"。同期确认 GPT-5.6 Sol "是一个非常强的模型",目前在外部基准测试中表现优异。他还暗示这可能连带触发了其他服务的 rate limit 重置。
https://x.com/thsottiaux/status/20783209504882979177月20日起,Claude Opus Fable 5 将以 50% 额度纳入所有 Max 和 Team Premium 订阅计划。Pro 和 Team Standard 用户继续通过 usage credits 使用 Fable,同时获得一次性 $100 赠额。官方坦言 Fable 需求预测极其困难,"这就是为什么我们分阶段向订阅计划开放"。
https://x.com/claudeai/status/2078302415804379218Levie 系统性论证了一条反直觉的经济学链条:AI 越便宜,总使用量越大,价值沉淀到全栈每一层。关键洞察在于,前沿最强模型作为任务的"编排层",将工作量分发给更便宜/更专精的模型完成大量 token 生成 — 效率提升反而可能推动前沿模型消费增长。唯一承压的是利润率,他认为"智能的利润最终会收敛到基础设施层的水平"。
https://x.com/levie/status/2078139206946459853Swyx 指出一个奇怪的现象:设置 Codex/Claude/Gemini/Devin 自动每周研究如何改善 SEO/AEO 这件事,本应早已商品化,却几乎没人做 — "你正在错过免费且未被开发的 alpha"(1019 赞)。他同时讨论 AEO(AI Engine Optimization)的下一步:当所有人都在做 AEO 优化,竞争会从"会不会做"转向 on-policy autoAEO vs generalizable AEO 的区分。
https://x.com/swyx/status/2078244735794413786Meta AI 高管指出企业从 chatbot 走向真正 AI 应用的瓶颈不是模型不够好,而是三项能力缺口:(1) Evals — 能否清晰定义场景、构建在线/离线评估体系,在模型的 quality-cost-latency 曲线上精准选型;(2) Harness — 是否有独立于模型的路由、多 agent 编排、上下文管理、工具调用和记忆系统;(3) Talent — 能否在前沿搭建这一切。"Talent 是最稀缺的一块。" 另外他指出 Kimi 不会直接伤害 Google,因为企业会通过 Google Cloud 消费 Kimi — "左手进右手出"。
https://x.com/realmadhuguru/status/2078131628262752550Steipete 分享了一个"又惊艳又痛苦"的体验:Codex 通过 browser use + computer use 打开 Chrome、导航到 PR 页面、点击评论框、跟 macOS 文件选择器搏斗 — 只为上传一张图片。他的建议:在 VM 里跑 Codex,避免抢走桌面焦点。他另一条获得 2500+ 赞的推文发问:"我们还在聊 loops 还是已经进入了 graphs 时代?" — 暗指 agent 编排范式正从简单的循环向更复杂的图结构演进。
https://x.com/steipete/status/2078318731785359634Anthropic Claude Code 团队成员分享了一个实用性极强的建议:在让 Claude 做完整实现之前,先花很少的 token 让它生成 mockup、schema、数据模型和概念验证。"这是避免花了几万个 token 才发现根本不想要这个结果的最佳方式。"(634 赞)
https://x.com/trq212/status/2078189833445654714Vercel 宣布沙箱数据下载免费开放,"是时候部署更多 agent 了"。同时向 shadcn 的发布速度致敬,暗示 Vercel 也在提升自己的 shipping 节奏。
https://x.com/rauchg/status/2078305023784620342Peter 描绘了一个即将到来的场景:不再盯着屏幕管理 agent,而是边走边"打电话"给 agent 分配任务,让它们通过语音汇报状态。他直言"一整天盯着屏幕管理 agent 会烧坏脑子",期待第一个实现这个 workflow 的 lab。
https://x.com/petergyang/status/2078276992470794531两条有洞察力的分享:(1) Build in public 不需要额外做内容 — 直接展示产品里正在发生的:一小段屏幕录制、第一版原型、或某个用户行为如何改变了你的设计决定。推理过程比制作精良更重要。(2) 几年前人们还对录会议感到不适,现在大家默认所有商业会议都在被录制 — 不是给人看的,是给 agent 看的。"技术真的能改变文化。"
https://x.com/zarazhangrui/status/2078086930756202924Replit 社区正在进行一场"ChessMaxxing"运动 — 对国际象棋历史的深度探索项目在平台上涌现。
https://x.com/amasad/status/2078273728618877326Anthropic 发布了一份极其详尽的 Claude Code 质量退化调查报告。过去一个月用户反映 Claude 变笨,根因是三次独立变更的叠加效应:
(1) 默认推理 effort 从 High 降到 Medium(3/4) — 初衷是解决 Opus 4.6 在 High 模式下偶发的超长 thinking 延迟和 UI 假死。内部 eval 显示 Medium 在大多数任务上智能略低但延迟大幅改善。但用户反馈"Claude 变傻了",4月7日恢复默认 High。
(2) 缓存优化 Bug 导致持续丢失推理历史(3/26) — 本意是当 session 闲置超过1小时后清理旧的 thinking block 以降低恢复成本。Bug 导致一旦触发阈值后,每次后续请求都继续丢弃思维链,Claude 变得健忘且重复。4月10日修复。
(3) 系统提示词加"减少啰嗦"导致编码质量下降 3%(4/16) — 为 Opus 4.7 的 verbose 特性做准备时加入了一条字数限制指令(工具调用间 ≤25 词,最终回复 ≤200 词)。更全面的 eval 套件发现编码质量下降 3%,4月20日撤销。
"这不是用户应该期待的 Claude Code 体验。我们从4月23日起重置了所有订阅用户的用量额度。"
Anthropic 提出了多项改进措施:更多内部员工使用公版 Claude Code、扩大 eval 套件、系统提示词变更增加 soak period 和 gradual rollout、建立 @ClaudeDevs 账号发布深度产品决策解释。有趣的是,在回溯测试中,Opus 4.7 成功发现了导致问题的 PR,而 Opus 4.6 未能发现。
https://www.anthropic.com/engineering/april-23-postmortemAnthropic 工程团队发布了一篇关于构建 Managed Agents 服务的深度架构文章,核心思想来自操作系统设计的古老智慧:为"尚未被设想的程序"设计抽象。
Managed Agents 将 agent 的三个组件虚拟化:Session(不可变事件日志)、Harness(调用 Claude 并路由工具调用的循环)、Sandbox(执行环境)。三者解耦后各自独立演进。
关键工程决策:"不要养宠物"(Don't adopt a pet)— 将"大脑"(Claude + Harness)与"双手"(Sandbox + 工具)以及 Session 分离。容器从"宠物"变成"牛群"(cattle),挂了直接重建。Harness 本身也不再带状态,通过 getSession(id) 恢复。
安全边界设计精巧:凭证永远不到达 Claude 生成的代码所运行的 Sandbox。Git token 在容器初始化时注入,MCP 工具通过专用 proxy 代理 OAuth token。
"解耦后,p50 首 token 延迟(TTFT)下降了约 60%,p95 下降了超过 90%。因为不需要容器的 session 不再等容器启动。"
文章还讨论了 context engineering:Session 作为"上下文对象"存在于 Claude context window 之外,通过 getEvents() 接口按切片访问事件流 — 避免了不可逆的 compaction 决策。
https://www.anthropic.com/engineering/managed-agentsClaude Managed Agents 支持在用户自控的沙箱中运行,并可通过 MCP 隧道连接私有网络内的服务。沙箱可在自有基础设施上运行,或使用 Cloudflare、Daytona、Modal、Vercel 等托管提供商。
MCP 隧道是亮点:只需部署一个轻量级网关,它发起一条出站连接,无需开放入站防火墙规则,无公网端点,端到端加密。内部数据库、私有 API 和企业系统变成 agent 可直接调用的工具。MCP 隧道在 Managed Agents 和 Messages API 中均已支持。
已有企业采用案例:Amplitude 用 Managed Agents + Cloudflare 构建 Design Agent、Clay 用 Daytona 运行 GTM 工程 agent Sculptor、Rogo 用 Vercel Sandbox 为金融机构构建分析 agent。
https://claude.com/blog/claude-managed-agents-updatesTakeaway:AI 计算供给永远追不上需求。
Sachin Katti 是目前科技界头衔最具时代感的人之一 — OpenAI 工业计算负责人。前斯坦福教授、多次创业者、Intel CTO,现在负责被许多人称为"人类历史上最大规模基础设施建设"。本期 MAD Podcast 的对话深入到模型层之下,聚焦算力与 AI 繁荣的物理现实。
数据中心的本质:"想象一下把电子变成 token 的巨型工厂。"Katti 描述的是比足球场还大的建筑,里面流动着"液金"(liquid gold)— 因为芯片温度极高,必须用液体冷却而非空气。整个建筑就像一个巨大的冰箱。
"我们每次以为'算力够用了,可以放缓了',现实总是给出负面惊喜 — 我们不应该放缓。"
Stargate 战略:Katti 澄清,Stargate 不是某个具体的合资公司,而是 OpenAI 整个算力策略的伞形品牌。"它是我们对如何规模化计算的持续学习过程。"合作伙伴包括微软、AWS、Google、Oracle、CoreWeave,以及自研部分。Abilene(德州)数据中心已经上线,用于训练最近两代模型,Oracle 正在密歇根和德州等地建设更多。
Jalapeno 自研芯片:从设计到 tape-out 仅 9 个月 — Katti 职业生涯见过最快的芯片开发。成功因素:前 Google TPU 团队的资深人才、与 Broadcom 的紧密合作、以及 OpenAI 独有的优势 — 知道自己未来的模型长什么样,可以在芯片设计阶段就做针对性优化。核心指标是"每瓦特 tokens 数"最大化。AI 本身也开始辅助芯片设计,Katti 相信"AI 为训练下一代 AI 设计系统"的递归世界并不遥远。
MRC 网络协议:当 10 万张 GPU 互联进行大规模训练时,故障是常态。MRC 是一种多路径 spray 协议:在任意两个芯片之间通过所有可用路径发送数据包,哪条路径先到就用哪条— 单条链路故障不再是阻断性事件。
能源与瓶颈:OpenAI 正在投资电网发电和输电基础设施,承诺"不消耗社区现有电力,而是新增发电能力"。核能"来得越快越好 — 这是密度最高、最清洁的能源形式"。但真正的瓶颈在物理世界:燃气轮机、变压器、电工、管道工 — 这些行业过去十年几乎没有新增产能,突然面临需求冲击。
企业级保证容量:"Guaranteed capacity 就是 Guaranteed tokens。"OpenAI 正在成为一种"智能公共事业" — 企业锁定未来的智能供给,就像锁定任何关键供应链资源一样。
轨道计算?"对于极客和工程师的我来说很兴奋,但它不会解决所有计算需求,只是军火库里的一个组件。关键在于卫星发射和硬件的经济学何时到达拐点 — 便宜到可以发射、坏了可以扔掉。"
https://www.youtube.com/watch?v=wEZBlmvxx4o