AI 热点综述 · 2026-09-12
今天的信号很集中:一边是 OpenAI 把打磨重心从”演示”转到”稳定性”,一边是 Agent 的基础设施层开始补齐——支付、文件、网关、长时运行。同时,多位一线从业者把话题拉回到同一个朴素问题上:怎么知道它真的在干活?
一、OpenAI 的”产品周”:不是 DevDay,胜似 DevDay
Thibault Sottiaux 在 X 上列了一串本周交付:Images 2.5、GPT-Live-1、Agents API、Data Agent、ChatGPT for Financial Services,并强调”这还不是 DevDay,下周还有得忙”。(4.2k 赞)
更值得注意的其实是他随后那条不那么光鲜的更新。针对社区反馈的质量问题,OpenAI 承认并修复了三类问题:
- 为旧模型写的 skills 触发过于频繁,或让模型不再检查自己的工作;
- 一个可选的上下文管理实验会导致提前停止、或回复到更早的消息——已关闭,估计影响 4–5k 用户;
- 移除了一批配置不良的引擎,它们对长尾流量造成了可测量的质量下降。
配套动作是”重置”(reset)额度。一个模型厂开始公开承认”长尾流量质量下降”并定位到具体实验,这本身比新功能更有信息量——能力竞争之外,可靠性正在变成可量化的运营指标。
另一个人事信号:OpenAI 招入 Git AI 团队(Aidan 与 Sasha),其开源工具帮助开发者理解编码 Agent 如何改动代码库。这意味着 Codex 的”可观测性”会成为企业落地的卖点。
二、Agent 基础设施:支付、文件、网关、长时运行
今天几乎每一条基础设施新闻都指向同一个判断:Agent 要真正干活,就得有人类早就有的那些原语。
- 支付:Coinbase CEO Brian Armstrong 在 No Priors 上抛出”我们不能让 AI 没有银行账户”。他给的数据很硬:卡交易的固定成本约 30¢ + 比例费,而观测到的 Agent 电商交易中约 76% 低于 30¢——用卡结算在结构上就不成立,稳定币与代币化才是 Agent 经济的地基。
- 文件:Aaron Levie 宣布可以把 Box 挂载到 Agent 沙箱,让 Agent 更容易读写”自己电脑”上的文件。”Agent 在企业里跑关键流程,就需要人一直拥有的那些原语。”
- 网关:Guillermo Rauch 透露 Tailscale 的模型路由由 Vercel AI Gateway 作为底层基础设施支撑,并给出一个精辟比喻——“AI Gateway 就是新的 CDN”:直连源站是脆的,自己造是又痛又贵。
- 长时运行:Ryo Lu 宣布 Cursor 上线”面向你大想法”的长生命周期 Agent。Amjad Masad 也在推 Replit 的 Routines with budgets(带预算的例程)。
把这些串起来看:Agent 正在从”一次性调用”变成”有预算、有文件系统、有支付能力、有路由层的常驻进程”。 基础设施的形状已经清楚了。
三、Evals 成为一等公民(这一次是工具链层面的)
今天有三条关于”如何衡量”的发言,指向同一个方向:
- Thariq(Anthropic) 发布 plugin evals,在插件目录里跑
claude plugin eval init就能验证 skills 在新模型上是否还有效;同时他提醒:“现在只看 pass/fail 分数已经几乎无法解读 evals”,很多失败来自过于严格的隐藏测试,有些情况下模型的答案比预期结果更合理。(两条合计约 2.7k 赞) - Dan Shipper(Every) 介绍他们过去三年坚持的”vibe checks”,现在正把它量化——团队搭了内部平台,让每个人基于真实日常工作做个人基准测试。”更高的 benchmark 分数并不能说明它在你真实工作上的表现。”
- Madhu Guru 把”在 evals 上投入不足”列为企业 AI 失败的头号原因之一。
从”写 skill 触发条件”到”验证 skill 是否还有效”,工具链开始闭环。这是一个成熟化的信号:Agent 生态的瓶颈正在从能力转向验证。
四、企业 AI 为什么失败:一份直白的复盘
Madhu Guru 的长帖值得原文照抄三个失败模式:
- 用旧剧本做 AI——CEO 指派亲信组建中央 AI 团队,从各部门抽调熟人。问题是技能断层:过去 15 年产品开发多是渐进式改进,而 AI 需要实验与发明。
- 在 evals 上投入不足——大多数企业不理解它的重要性,也不知道”好”长什么样。
- 从外部为公司造 AI——中央团队自封平台团队,造工具要求全公司采用;这些产品与真实工作流、上下文和一线判断脱节,得到的只有勉强的采用,而非真正的生产力提升。
他的解法同样直接:招真正做过 AI 产品的负责人;把 evals 变成一等公民;把最好的 AI 构建者嵌入业务职能里,和财务一起造、和销售一起造、和支持一起造。
对照 Peter Yang 的观点——“我对’软件工厂’持怀疑态度……过夜跑一个循环去造新东西,只要一个错误假设,整个 token 就浪费了”——两人其实在说同一件事:人类定义需求与检查结果这一环,目前还删不掉。
五、市场与组织:两个小观察
- Amjad Masad:”Replit 收购了一家完全建立在 Replit 上的公司。我预期这只是第一个。” 平台开始收获平台效应,这对”AI 原生创业公司”的退出路径是个有趣的注脚。
- Nikunj Kothari 谈 VC 归因:”成功有无数父亲,失败是孤儿。” 大型退出极其稀少,而这正是下一支基金的募资依据,因此未来两年会看到很多”重写历史”的操作。他给了个实在的建议:握紧你的创始人,他们才是真正的 reference check。
- Zara Zhang 对”一人公司”泼了盆冷水:”一个人借助 AI 确实能做很多,但从零造新东西可能是极度孤独的体验……当你没有和别人一起把身体绑在桅杆上时,极容易失去动力。”
小结
今天的三条主线互相咬合:
- 能力已经不是瓶颈,可靠性才是——OpenAI 公开修 bug、发 reset,比发新模型更说明问题。
- Agent 的地基正在铺完——支付(稳定币微交易)、文件(Box in sandbox)、路由(AI Gateway)、长时运行(Cursor、Replit Routines with budgets)。
- 验证工具链开始追上来——plugin evals、个人基准、企业 evals 一等公民化。
如果要用一句话概括 2026 年 9 月的这份切片:行业正在从”能做什么”转向”怎么证明它做成了、以及怎么让它稳定地做下去”。
数据来源:Follow Builders · 2026-09-12