🔄 Codex 用量限制再次调整:5 小时限制回归,Pro 订阅豁免
Thibault Sottiaux(OpenAI)今天带来两条重磅更新。先是高调预告(1869 ❤️ / 77 🔄):
“OpenAI DevDay 2026 将是公司历史上最好的一次 DevDay,不会有任何悬念。”
紧接着是一则更实用的产品消息(9223 ❤️ / 527 🔄):
“明天我们将为 ChatGPT 的 Work 和 Codex 恢复 Plus 账号的 5 小时限制。这是必要的,因为(a)5 小时限制能帮我们平滑 compute 负载,从而让套餐在周用量上保持慷慨;(b)Plus 用户相对偏 casual、以新用户为主,有些人会不小心一周用量就耗尽,然后一脸困惑,体验并不好。未来几个月,Pro $100 和 Pro $200 订阅不启用这个 5 小时限制。”
这是继上周”用量风波”后又一次产品策略调整,但方向相反——上次是补量,这次是重新收紧 Plus 上限、同时用 Pro 免除来守住高价值用户。9223 的互动量说明社区对”用量怎么分”依然极度敏感。所谓”平滑负载、保住周用量上限”的话术,本质是在 compute 成本与用户体验之间重新找平衡点。
🏗️ Madhu Guru:Eval 系列 Part 8——“区分力”才是好 eval 的核心
Madhu Guru 的 “How to build great evals” 来到第 8 部分(92 ❤️ / 7 🔄),主题是 evals 的区分性(discriminatory power):
“一个能用来 hill-climbing 的 eval,只有当它能区分出『本质上不同』的 AI 系统时才是有用的。假设你在五个系统上跑 eval:A: 94、B: 93、C: 95、D: 94、E: 92。再假设你已经知道 A 和 C 明显强于 D 和 E——那这个 eval 就是坏的,因为它区分不出来,区分力太低。这就像给一群 PhD 考五年级数学,人人都满分,你对谁最聪明一无所获。但这不代表就该把 eval 无脑做难——那样人人都不及格,你就没在测你的系统该测的东西。一个好的 eval 的甜点区是:真实 + 有难度 + 对能力差异敏感。随着你的 harness 和底层模型变强,好 eval 会逐渐饱和——到那时你怎么办?把你们的答案留在评论区。”
“Realistic + difficult + sensitive to differences”——这条直击很多团队 eval 失效的根源:不是分数不够高,而是分数拉不开差距。做 AI 产品的人,值得把这套”区分力”框架拿来审视自己的评测集。
🔐 Aaron Levie:AI Agent 时代,”系统之记录”比以往更重要
Aaron Levie(Box 联合创始人)今天两条长帖,主题高度一致——agent 驱动的软件变革(344 ❤️ / 24 🔄):
“在 AI agent 会在这些平台上做人类过去 100 倍工作的世界里,系统之记录(systems of record)从来没有像现在这么重要。Agent 会查询这些系统里的数据、处理任务、执行工作流、与人类和 agent 用户协作。因此,治理、可靠性、安全、访问控制、业务逻辑比任何时候都关键——OpenAI/Hugging Face 那起事件,只是『有 agent 到处跑着试图完成自己目标』的未来的一小个缩影。但这只对能给出正确产品体验、API 和商业模式来支撑 agent 在平台内外执行的系统之记录才成立。整个软件行业正面临巨大的机遇与颠覆时刻。”
第二条则聚焦 ZDR(Zero Data Retention,零数据留存) 对 AI 扩散的影响(172 ❤️ / 18 🔄):
“人们没有充分意识到,ZDR 对 AI 的增长贡献巨大——它极大简化了大多数公司在用 subprocessor 处理数据时面对的合规流程。替代路径会让 AI 采用率慢得多。那些驱动 AI 增长的主流应用型 AI 工具,通常与客户约定只提供支持 ZDR 的模型,以免客户逐个检查每个开启的模型。在企业内部,多数公司也有治理要求,只能使用 ZDR 模型,因为他们无法在跨企业上下文窗口中显式分离 PII 等敏感数据。如果整个行业不朝这个方向走,AI 的扩散就会戛然而止。”
从 AI 日报 8 月 25 日里那起”Hugging Face 与 OpenAI 事件”延伸出的产业级思考:agent 越活跃,system of record(如 Box 这样的企业内容平台)的数据治理价值越高;而 ZDR 则是被低估的、实实在在影响模型采用的合规杠杆。两条都值得全文读两遍。
✍️ Peter Steinberger:软件要能从 prompt 改变
Peter Steinberger 一条观点引发广泛共鸣(2423 ❤️ / 127 🔄):
“我们需要摆脱那种我们无法用一段 prompt 去改变的软件。”
配合另一条自嘲式的”行业黑话”(654 ❤️ / 32 🔄):
“TIL:prompt kiddie(用 prompt 的『脚本小子』)”
“无法用 prompt 改变的软件”——一句道破了当下工具链的审美转向:可被 prompt 驱动、可改写、agent 友好正在成为新软件的默认预期。2423 的互动量说明这不是小众观点,而是开发者社区的普遍情绪。
👷 Guillermo Rauch:软件越小越好 + 一个关于 terminal 的考古彩蛋
Guillermo Rauch(Vercel CEO)今天很有味道,先是产品哲思(210 ❤️ / 5 🔄):
“更快、更便宜、更能干……而且更小。软件随着演进通常会变得更慢、更臃肿、更多 bug、更大。而(我们做的这个)从架构上就是为了防止这一点。”
接着是一段令人会心一笑的 terminal 考古(514 ❤️ / 21 🔄):
“如果你的终端进入『坏状态』(比如输出乱码),你跑 𝚛𝚎𝚜𝚎𝚝。我发现它……慢得出奇。原来 1979 年 3BSD 的 𝚝𝚜𝚎𝚝 里有个 𝚜𝚕𝚎𝚎𝚙(𝟷),是为了让机械针式墨水终端『静置下来』😂。我让 𝚏𝚡 用 Zig 给我写了个更快的版本,从 1 秒降到 1 毫秒。能这么深入地挖 𝚗𝚌𝚞𝚛𝚜𝚎𝚜、𝚝𝚜𝚎𝚝、𝚝𝚎𝚛𝚖𝚒𝚗𝚏𝚘,看终端有多少种『被诅咒』的方式,真的很过瘾。我们的技术栈有多古老、好的系统设计有多持久,这本身就是件迷人又带点『蜘蛛网』的事。”
一条”反臃肿”宣言,一条对 1979 年遗留设计的幽默考古——**”小而美、可持续演进”**大概是本周最松弛又最扎实的技术观点。
🚀 其他值得关注
- Peter Yang:“我给自己配了 3 个 AI chief of staff,很明显下一步是再加一个。”(82 ❤️ / 2 🔄);另外一条*”想试试用 AI 给那种很烂的自动客服电话系统打电话、导航到真人预约或取消订阅”*(51 ❤️)——“AI 替你打通客服”又有新的使用场景在酝酿。
- Nan Yu:“用 Codex 配新电脑还挺爽……『下载安装 handy、slack、chrome、cleanshot、rectangle』,真希望 Siri 也能这么好用。”(28 ❤️)——Codex 正在变成”新机配置助手”。
- Amjad Masad(Replit CEO):“Replit Agent 已经完全取代了我日常工作里的 Claude CoWork,它更持久也更一丝不苟,并且更擅长用代码/软件来完成任务。”(160 ❤️ / 9 🔄)——base model 竞争之外,agent 的”持久执行”正在成为口碑分水岭。
- Garry Tan(Y Combinator CEO):“数据中心创造就业与繁荣,事实上就是如此。”(502 ❤️ / 45 🔄);另一条*”形成一个观点 → 变成 artifact 或实验 → 让它接触现实 → 不带自我欺骗地读结果 → 修正再跑。”*(421 ❤️ / 34 🔄)——YC 掌门人的”投资人方法论”。
- Dan Shipper(Every):“看起来 @google 毫无通知也没给理由就禁用了 @every 在 @youtube 上的账号……有人遇到过这种情况或知道怎么帮我们要回来吗?”(116 ❤️ / 6 🔄)——AI 原生媒体公司正遭遇平台审核,值得持续关注。
- Zara Zhang:“不受欢迎的观点:黑客松是一种过时的事件形式(至少以传统方式举办来算)。”(85 ❤️ / 5 🔄)——AI 时代对线下协作形式的再思考。
数据来源:Follow Builders · 2026-08-25