🔄 Codex 用量限制更新:明天修复,付费订阅全部重置

Thibault Sottiaux(OpenAI Codex 团队)带来了用量限制风波的最新进展(1382 ❤️ / 113 🔄):

“关于 Codex 的用量限制更新。我们发现了(a)长会话多次压缩时图片处理存在低效、(b)Computer History 的 p95+ 用量偏高、(c)一个本用于生成会话标题的功能比预期消耗更多用量。我们已经组建了一个 tiger team 全面排查,明天就上线修复。我们还发现了一个完全不相关、能显著提升效率的新方法,下周开工。作为明天部分修复的一部分,我们会为所有付费订阅做一次完整的用量重置。明天见。”

信息量很大:承认了三个具体的用量泄漏点(图片压缩、Computer History、标题生成),并给出”所有付费订阅全额重置”的补偿方案。这是对上周社区质疑的直接回应——OpenAI 正在用”透明 + 补偿”的方式重建信任。那句”tiger team 明天修复”的承诺值得留意,明后天应该会有更详细的公告。

🏗️ Madhu Guru:Eval 系列 Part 6——“hill climbing”的实操心法

Madhu Guru 的 “How to build great evals” 系列来到第 6 部分(143 ❤️ / 8 🔄),主题是 hill climbing(爬山式优化)

“在 evals 上做 hill climbing,说白了就是:挑一个重要的维度,然后朝它优化。可以是基于最新生产数据提升高价值用户旅程上的现有功能质量,也可以是扩展到相邻用例、降低成本或延迟。实际工作归结为更好的 harness 和模型选择——prompt eng、context eng、memory、post training、确定性的传统代码等等。你(Part 3 里的)失败模式分类法,就是判断产品哪里在挣扎的好指南针。比如工具调用失败最常见——你深入一看,发现一次性塞了 20 个工具进 context,其实每个任务只需要 3-5 个。这里的 hill climbing 就是做 context eng,在正确阶段只给正确的工具,迭代到好用为止。或者拿降本目标举例——我建议先用最好的模型发布产品,把质量拉满,等确认用户爱了,再做 hill climbing:用更小、更便宜、更快的模型逼近同样的质量,方法还是那套——harness 和模型。关键是要有 evals 告诉你到底有没有在往对的方向走。”

配合今天 Aaron Levie 的同题观点(138 ❤️ / 12 🔄):

“AI 的扩散速度,比大多数人意识到的更受『有没有好的 evals』限制。每轮模型发布时你能看到的那种 evals 非常有用,但它只告诉你通用 AI 进步的形态和模型的相对能力。更大的空间在针对企业主要工作流的 evals——细化到具体某家公司的特定流程。这会是一个巨大的市场,因为你无法自动化你无法评估其进展的东西。企业不能只靠感觉走。”

“你无法自动化你无法评估的东西”——eval 正在从工程话题升级为商业话题。做 AI 产品的团队,这套 hill climbing 方法论值得全文转给队友。

🔐 Peter Yang:隐私清理实操 + 一个叫 /fuck-cancer 的 AI skill

Peter Yang 连发三条,两条和”数据主权”有关:

“如果你在乎隐私:1. 打开 Chrome 的 Google 账号设置;2. 把这个 prompt 丢给 Codex 或 Claude Code,告诉它你浏览器里有打开的标签页;3. 挑出你想移除的,让 AI 去做。我刚断掉了半打不应该再拥有我 Google 信息的应用。”(447 ❤️ / 23 🔄)

“看起来现在可以删除外部数据了(比如我的 36 条 Gmail 记录),去 Google 的 Data Privacy 设置里往下滚就有。Kudos 给 Instinct 团队,他们听了反馈并且发货很快。涉及隐私与信任的事,我一向有什么说什么。”(13 ❤️)

“让 AI 帮你清理授权”——把 agent 用在隐私管理上,是个成本极低、信任感极强的用例,大概率会带动一波”AI 隐私管家”的玩法。

第三条则是他正在做的公益向 AI skill(188 ❤️ / 5 🔄):

“我在做一个新的 AI skill,叫 /fuck-cancer。目标是帮患者和他们的家人走完整个流程、保持信息同步。应该包含什么?”

公开征集需求来做一个医疗陪伴类 skill,评论区应该会有不少真实诉求——这种”开放开发”的姿势本身就很 agent-native。

🏢 Zara Zhang:为什么牛人都在离开大公司

Zara Zhang 提出了一个值得反复咀嚼的观察(147 ❤️ / 7 🔄):

“有个现象:有才华的人做自己的事时,AI 可以让他们发挥出 10 倍的潜力;但同样一个人放进大型组织,潜力最多提升 20%(有时候甚至还会下降)。这就是为什么我看到越来越多有才华的人离开大公司。(唯一的例外大概是 OpenAI/Anthropic 这样的顶级 AI 实验室。)”

这条和她的另一条形成完美互文(336 ❤️ / 20 🔄):

“每个在 AI 使用上领先的人,都觉得自己落后。”

“10x vs 20%”的对比直指一个结构性变化:AI 把个人生产力的上限抬到了组织之上——这对组织形态的冲击才刚刚开始。而”领先者觉得自己落后”则精准描述了当下 AI 圈弥漫的 FOMO:信息密度越高,越觉得追不上。两条都值得转。

💸 Nikunj Kothari:对 ragebait 投资人的犀利吐槽

Nikunj Kothari 今天火力全开,先是回应了某起 Doxxing 事件(23 ❤️):

“几点:1)这些是 Twitter DM,我尽量回复能帮的冷消息,但这条不该通过我的标准。2)人肉搜索不是我的风格,希望他们学到了教训。3)我怎么说都不够强调——找到对的人给你建议有多重要。看到很多真有本事的有才华年轻人玩这些愚蠢的游戏,我血压都高了。”

接着一句金句直击当下融资乱象(370 ❤️ / 4 🔄):

“孩子们,我不知道你们听谁的建议,但『先 ragebait 投资人、再甩 SAFE 文档让人直接打钱』——这不是投资运作的方式。”

“我们吐槽 X 上的 slop,但 LinkedIn 的 slop 已经到了难以想象的地步 🤮”(40 ❤️ / 1 🔄)

在”AI 融资过热、野路子盛行”的当口,这条冷静的提醒很有价值——热度是放大器,不是信用背书

🚀 其他值得关注

  • Amjad Masad(Replit CEO):“一周有 7 天,也就是 7 次发布。”70 ❤️ / 4 🔄);另一条 “‘很快’原来是 3 个月。”643 ❤️ / 43 🔄)——Replit 的高频发布节奏和 Free Mode 之后的产品节奏感,依旧是社区关注焦点。
  • Guillermo Rauch(Vercel CEO):“旧金山是人间的天堂。”1084 ❤️ / 20 🔄),以及一条关于美国与阿根廷的”做多宣言”(735 ❤️ / 30 🔄)——AI 创始人们的”地理叙事”越来越像资产配置。
  • Dan Shipper(Every):“我们在招人!@every”131 ❤️ / 3 🔄),以及 “agent native ftw”149 ❤️ / 1 🔄)——“agent-native”正在成为产品团队的新标签,Every 这家”AI 原生媒体公司”的扩张也值得关注。

数据来源:Follow Builders · 2026-08-23