开源模型只剩六个月?Interconnects 的生死判断
🧠 发布动态
Fable 又悄悄更新了。 Anthropic 的编码专用模型持续迭代,Simon Willison 记录了最新一次 bump。没有大张旗鼓的发布会,但 Fable 的策略就是高频小步快跑 — 如果你在用 Claude Code 写代码,性能变化值得关注。 详情 →
💡 行业洞察
开源模型只剩六个月?Interconnects 的生死判断。
Interconnects 的最新分析直指要害:闭源模型的收入飞轮(收入 → 算力 → 更强模型 → 更多收入)正在形成一道开源实验室无法跨越的鸿沟。不是跑分的问题 — 是经济结构的问题。六个月,是开源阵营证明自己仍有竞争力的窗口期。如果你的产品押注在开源权重上,现在该认真评估 plan B 了。 详情 →
Claude Code 对话还没开始,33K token 已经没了。
有人做了详细拆解:Claude Code 每次对话的系统提示 + 工具定义占 33K token,而同类工具 OpenCode 只用 7K。这意味着你 200K 上下文窗口的实际可用空间比你想象的少得多 — 大约 70-80% 的上下文在你输入第一个字之前就被"基础设施"吃掉了。上下文窗口大小不等于有效可用上下文,这才是选工具时真正该看的指标。(424 likes | 236 RTs) 详情 →
延伸阅读:我们之前写过 三家 AI coding agent 怎么管上下文,对比了 Claude Code、Codex 和 Cursor 的上下文管理策略,和今天这个发现可以对照着看。
Meta 砍掉了 Instagram AI Muse。 这个功能允许用户用公众人物的脸生成 AI 图片 — 本质上就是官方 deepfake 工具。舆论反弹之后 Meta 果断下架。教训很明确:AI 功能上线前,先想清楚最坏的使用场景,别等用户帮你想。 详情 →
Apple 造车失败,却炼出了 M7 Ultra 的 AI 芯片。 Gurman 爆料:苹果取消的自动驾驶项目并非全无遗产 — 自动驾驶对实时推理的极端要求直接塑造了 M 系列芯片的 AI 架构。M7 Ultra 的神经引擎性能,可以追溯到当年为路况识别设计的加速单元。失败的产品,成功的技术沉淀。 详情 →
🏗️ 值得一试
1900 个 Agent 技能,一键安装 — 编码 Agent 时代的技能市场来了。
agentic-awesome-skills 已经拿下 43K star,汇集了 1900+ 个可安装的 Agent 技能,覆盖 Claude Code、Cursor、Codex CLI、Gemini CLI。不是又一个 awesome list — 每个技能都是可以直接 install 到你的 Agent 里的。这可能是 Agent 生态从"每个人自己写提示词"到"共享技能市场"的转折点。(43,008 likes | 6,826 RTs) 详情 →
全本地漏洞扫描器,代码不出本机。 用 14B 代码专用模型逐文件扫描漏洞,整个过程不联网、不上传。安全团队终于有了一个不用担心代码泄露的 AI 安全审计方案。先在非关键项目上试试效果。(112 likes | 16 RTs) 详情 →
📝 技术实战
生产环境迁移 GPT-5.6:快 2.2 倍,省 27%。 这不是发布会上的 demo 数据 — 是 Ploy.ai 把真实生产 Agent 从 GPT-5 迁到 GPT-5.6 的实测结果。延迟降了一半多,成本降了近三成。文章附了完整迁移清单,如果你还在 GPT-5 上跑 Agent,这是最实用的升级参考。(105 likes | 29 RTs) 详情 →
🔧 开发者工具
llama.cpp 修了一个静默截断 bug — 你的多模态管道可能一直是坏的。 嵌入的 NUL 字节会让提示词在那之后全部被截断,包括 assistant marker,而且没有任何警告。如果你的多模态管道偶尔莫名其妙输出很短的回复,大概率就是这个原因。b9979 已修复。 详情 →
llama.cpp 另一个多模态 bug 也修了。 Anthropic 转 OpenAI 格式的转换器会静默丢弃 tool_result 里的图片块 — 多模态工具输出直接报废。b9977 修复。如果你用 llama.cpp 做格式转换,这两个版本都要更新。 详情 →
sqlite-utils 4.1.1 发布。 Simon Willison 的数据管道瑞士军刀又更新了,主要是数据处理流程的体验优化。用 SQLite 做数据清洗的,顺手更新一下。 详情 →
loop.js:让一个"怀疑论者"来决定你的 Agent 什么时候该停。 一个新的 Agent 框架,核心设计是引入一个只读的 Verify Agent 作为"怀疑者" — 循环不是模型说"完成了"就停,而是验证者满意了才停。这个 verify-loop 模式值得借鉴到你自己的 Agent 架构里。(68 likes) 详情 →
延伸阅读:关于 AI 代码审查的局限性,可以看看我们昨天的文章 AI 写的代码,为什么不能只让 AI 自己审?
🔬 研究前沿
Rich Sutton 警告:一步优化陷阱正在拖垮 AI 研究。 "苦涩教训"的作者又发话了 — 这次他指出,AI 研究中普遍存在的"一步优化"思维(只看下一步的回报最大化)从根本上限制了系统的长期能力。如果你在设计奖励信号或评估框架,这篇值得反复读 — 你的 eval 可能正在掉进这个陷阱。(38 likes | 7 RTs) 详情 →
🎓 模型小课堂
系统提示与工具定义的"隐藏税"(System Prompt and Tool-Definition Overhead):你打开一个 AI 编程助手,觉得 200K 上下文窗口够大了?实际上,Agent 系统在你输入任何内容之前,就要先塞进去一大堆东西:系统提示词告诉模型"你是谁、该怎么做",工具定义描述每个可调用工具的参数和用法。Claude Code 的拆解显示这部分高达 33K token,占上下文的 70-80%。所以真正决定你能塞多少代码进去的,不是"上下文窗口有多大",而是"扣掉基础设施开销后还剩多少" — 这就是"有效可用上下文"的概念。
⚡ 快讯
- Next.js Canary 新增 Request Insights:开发模式下暴露请求历史和框架 span,内置可观测性终于来了。 链接
- Agent Draw:一边说话一边画 — AI Agent 在 TLDraw 画布上实时作图,文字之外的交互新范式。(42 likes | 15 RTs) 链接
- OpenAI 招家庭体验 PM:ChatGPT 要从生产力工具变成家庭助手,瞄准家长、老人、孩子场景。 链接
- Against Usefulness:一篇反直觉的文章 — 如果 AI 的目标不是"有用"呢?(76 likes | 21 RTs) 链接
- Vercel AI SDK 又修了 Groq 缓存上报:prompt cache 命中一直报 undefined,你的 Groq 成本估算可能还是错的。 链接
🎯 今日精选
开源模型的生存危机不在跑分,在经济飞轮。 Interconnects 的分析之所以刺痛,是因为它点破了一个结构性问题:闭源模型的商业收入正在形成"收入 → 算力投入 → 更强模型 → 更多收入"的正循环飞轮,而开源实验室没有这个引擎。跑分差距可以靠聪明的架构追赶,但算力差距是用钱堆出来的 — Meta 的 Llama 靠的是广告收入补贴,不是开源社区的捐款。六个月,是 Interconnects 给出的窗口期 — 在这之后,闭源模型在 Agent 能力、长上下文、多模态上的领先可能变成永久性的。对于押注开源权重的开发者和创业者来说,现在不是争论"开源够不够好"的时候,而是该问"如果开源掉队了,我的 plan B 是什么"。 详情 →
下期见 ✌️