AI 热点综述 · 2026-09-16
今天时间线上是两件事同时发生:一边是 OpenAI 的发布前夜——Sam Altman 一句只有船的表情包拿到 12219 赞;另一边是一次迟到的技术修正——Thariq 公开说”MCP 比 CLI 更适合大多数集成”,2429 赞。夹在中间的是 Dan Shipper 的一周实测:一个不吐字、只吐概率的模型,快 25 倍、便宜 600 倍。
一、MCP 反超 CLI:一次迟到的修正
Thariq 今天的原帖是当日最值得存档的技术观点(2429 赞、109 转发):
“我没料到会是这样,但我认为对大多数集成来说,MCP 比 CLI 更好。模型在工具调用上已经强了很多,我们可以 defer tools,而且 MCP 现在是无状态的。如果你需要组合/过滤数据,给你的 MCP 工具加上
query这类参数。”
这条之所以重要,是因为它是对过去一年”CLI 优先”共识的一次公开反转。MCP 早期的三个包袱——工具膨胀挤占上下文、SSE 有状态连接、模型不太会调——恰好是过去半年被逐个拆掉的东西:tool deferral 解决了上下文,无状态化解决了部署,模型能力解决了调用。
但更值得记的是他的落点不是协议之争,而是接口设计:”需要组合/过滤数据,就加 query 参数。”翻译一下:MCP 与 CLI 的胜负不在协议本身,而在你有没有把工具设计成模型能高效使用的东西。这也和昨天 Rauch 的”verifiers + skills 才是新框架”是同一家族的判断——约束和接口的质量,比能力的绝对值更重要。
二、Claude 进 Salesforce:分发发生在别人的产品里
Anthropic 官号宣布 Salesforce in Claude 进入 beta,带 37 个预置销售技能:约电话、审单子、做 pipeline 仪表盘、发预测,全程不离开对话(8891 赞、634 转发)。同日博客还有一条:Claude for Small Business 上线新的工作流、集成与培训项目。
对照 Josh Woodward 的 Gemini 侧动作:Gemini Notebook 面向学生开放——用约 100 种语言和你的课堂材料做实时口语问答,录讲座和笔记时音频自动存进指定 notebook;140+ 国家的学生还能白嫖 Google AI Plan(329 赞)。
两家在做同一件事:把模型塞进用户已经在用的工作流,而不是让用户来模型里工作。 区别只在切入口——Google 从校园和个人场景切,Anthropic 从销售和企业流程切。对做产品的人来说,这个方向已经没有争议了,有争议的只剩”你打算寄生在谁的界面里”。
三、模型可以不说话,只输出概率
Dan Shipper 的实测(1491 赞、74 转发)信息密度很高:
“我们几乎从不测试新的基础模型,但这个我们测了大约一周,很狂野。它不产出文字,产出概率。所以它可以在需要 Fable 级模型的场景里高效当 judge——但在我们的测试里快 25 倍、便宜 600 倍。”
把 Amjad Masad 的提问放在一起读,方向就更清楚了(326 赞):“如果你的输出域事先已知,为什么不干脆训一个模型输出 enum 上的 logprobs?”
两条合起来指向同一个判断:一大类被当成”LLM 应用”在做的东西,其实不需要生成文本,只需要在已知候选集上打分。 而一旦问题被这样重新表述,性价比的优势是数量级的——不是优化 20%,是便宜 600 倍。
四、Levie:企业扩散的那道鸿沟
Box 的 Aaron Levie 上了 Training Data,标题很有意思:《On Reinventing Yourself in the AI Age and Enterprise Diffusion》。播客开场是一段给大学生的建议——跟着 20 个账号、加入 Twitter,”你比同龄人领先一年还是落后一年,几乎就取决于你的 feed“。
他同日 X 长帖(203 赞、27 转发)则是延续昨天的判断:
“模型能力与企业想自动化的最终工作流之间存在一道巨大的鸿沟。这道鸿沟就是应用 AI 层的机会。你需要把智能连接到工作流上——往往要重新设计流程、聚合正确的上下文和数据、留出合适的人在环体验、做变更管理、做领域专属的 eval、管理数据和流程的安全与治理,还有很多。”
他的结论很反直觉但很扎实:即使模型以惊人的速度变强,这一层仍然必须存在,甚至可能变得更重要——因为能力越强,能被啃下的任务越复杂,不做这层的代价就越大。
和昨天他的”Agent 用量将是人类的 100 倍、我们只走了 1%”接起来看,Levie 连续两天讲的是同一件事:能力不是瓶颈,交付才是。
五、其余观察
- OpenAI 的”发布前夜”气氛:Sam Altman 只有一句 “big 🚢 this week and then for devday 🚢🚢🚢🚢🚢🚢”(12219 赞、545 转发,当日互动最高)。同日 Thibault Sottiaux 的”2026 是效率之年,周二是随机 swag 掉在你门把手上的一天”(4885 赞)。一个预告,一个自嘲,密度感很强。
- Vercel Labs 正式亮相:Guillermo Rauch 介绍这个”公开研究 + 实验”部门,并说了一句很 Vercel 的话——“247 million downloads in,我们也想公开说说我们在支持什么、在研究什么、哪些实验没成”(1080 赞)。另一条判断值得抄:“未来是多模型的。试图把选择藏起来会同时困惑和伤害客户”(380 赞)。技术向还有一条:Safari 27 支持 JSPI,libfx 用浏览器内置的 fetch 栈做 API 调用,”随着更多代码走向 native,WebAssembly 会在 web 的未来里扮演巨大角色”(284 赞)。
- Muse 的两面:Garry Tan 直给一句 “I think Muse is going to win tbh”(1543 赞);Peter Yang 则报告他让 Muse 去跟 Xfinity 谈有线电视账单,”很遗憾,失败了“(36 赞)。热度与现实的落差,一条对一条。
- 编排带来的增益开始可量化:Garry Tan 用 @capydotai 配 GStack/GBrain 处理存量 issue/PR,”用同样的前沿模型,本来要一天,实际不到一半时间“(247 赞)。
- Profound 的 D 轮:Aditya Agarwal 复盘——1.8 亿美元 D 轮、18 亿估值、Fortune 100 里三分之一在用。”我们不是找到了这家公司,我们是看着它成形。”(97/80 赞)
- Nikunj Kothari 给创始人的冷水:“资本是加速的武器。用得好你无人能敌;但如果你如此依赖它,一次下行就可能带来不那么美好的结果。” 他的建议是:先想清楚那条”不需要外部资本也能活下去”的默认路径(68 赞)。
- 人事与命名:Peter Steinberger 欢迎 Graham 加入(241 赞)。Amjad Masad 那条关于命名诅咒的总结值得一乐:”‘AI 安全’公司让 AI 不安全;’有效利他主义者’既无效又在纵容犯罪;’Irregular’ 一如既往地无能。“(659 赞)
小结
- 协议之争降温,接口设计升温。 MCP vs CLI 的答案不取决于信仰,而取决于模型工具调用能力 + 你有没有给工具设计好参数。约束的质量正在变成产品力本身。
- 分发发生在别人的产品里。 Salesforce、学生 notebook、门把手上的 swag——三家最大的玩家都在同一周做同一件事:把自己塞进既有工作流。
- 输出不一定是文字。 “概率即输出”把一大类任务从生成问题变成了打分问题,代价直接下降两个数量级。
- 能力不是瓶颈,交付才是。 Levie 连续两天的长帖都在说这一件事,而应用 AI 层的位置,恰恰因为模型变强而更牢固。
一句话概括:今天没人在争论模型谁更强,大家在争论的是——怎么把它塞进别人已经在用的东西里,以及怎么用十分之一的成本把它做对。
数据来源:Follow Builders · 2026-09-16