OpenAI 推出 GPT Live — 实时 AI 有了自己的产品线
🧠 发布动态
OpenAI 推出 GPT Live — 实时 AI 有了自己的产品线。
不是 ChatGPT 加个语音功能那么简单 — GPT Live 是 OpenAI 专门为实时交互打造的独立产品线,直接对标现有的实时 AI 助手。这意味着 OpenAI 认为"实时对话"不是模型的附属功能,而是值得独立做的产品形态。对开发者来说,关注它的 API 接口和延迟表现 — 如果你在做语音交互或实时 Agent,这可能是新的基础设施选项。 详情 →
xAI 发布 Grok 4.5,社区直接引爆。
Grok 4.5 一出,Hacker News 上 432 likes、467 RTs — 在一个已经被新模型轰炸的一周里还能有这个热度,说明东西确实有料。又一个 frontier 模型加入战局,模型竞赛的节奏已经从"每季度一个"变成了"每周一个"。跑分和能力对比值得认真看一眼,尤其是跟你现在用的主力模型比。(432 likes | 467 RTs) 详情 →
Mistral 跨界了 — Robostral Navigate 瞄准机器人导航。
Mistral 不再只做文本和代码模型,直接发布了专门用于机器人导航的 Robostral Navigate。这是 frontier 实验室从"通用智能"走向"垂直场景"的又一个信号。对做机器人或具身智能(Embodied AI)的团队来说,终于有了一个来自主流模型厂商的专用方案,而不是自己拿通用模型硬适配。(392 likes | 93 RTs) 详情 →
🔬 研究前沿
Cognition 的 SWE-1.7 声称逼近 GPT 5.5 和 Opus。
Devin 背后的 Cognition 发布 SWE-1.7,宣称在编码任务上接近 GPT 5.5 和 Opus 的水平。244 likes、127 RTs,社区显然当真了。不过"接近"这个词弹性很大 — 建议拿你自己的代码库跑一遍再下结论,别光看官方挑的 benchmark 切片。(244 likes | 127 RTs) 详情 →
OpenAI 发了一篇"如何区分跑分里的信号和噪音":在所有厂商都在 claim SOTA 的这一周,OpenAI 自己发论文说"很多 coding eval 的差异其实是噪音"。讽刺?也许。但确实有用 — 他们给出了一套方法论来判断哪些跑分差异是真实的、哪些只是评测方式的偶然。下次看到"我们在 X benchmark 上领先 2%"的新闻,用这个框架过滤一下。(126 likes | 55 RTs) 详情 →
NVIDIA 和 HuggingFace 联手定义 Agent 时代的数据需求:Agent 的训练和评估需要什么样的数据?跟训练聊天模型完全不一样。两家联合发文梳理了开放数据策略 — 如果你在做 Agent 相关项目,数据管线该怎么建,这篇值得读。 详情 →
🔧 开发者工具
HuggingFace transformers 变成 vLLM 的原生推理后端:以前用 transformers 模型跑 vLLM 推理会有性能损耗,现在这个损耗没了。transformers 直接作为 vLLM 的 native-speed 后端,研究到生产的管线打通了。如果你在用 vLLM 部署模型,跑个 benchmark 看看新后端的提升。 详情 →
微软开源 Flint — 专为 AI Agent 设计的可视化语言:Agent 写代码没问题,但生成干净的数据可视化一直是短板。Flint 是一个领域专用语言(DSL),让 Agent 能直接生成图表。填补了一个真实的能力缺口 — 试试在你的 Agent 工作流里接入。(167 likes | 71 RTs) 详情 →
CrewAI 1.15.2:内联技能 + 动态模型选择:CrewAI 新版加了 inline skill 定义、向导中的动态 LLM 模型选择、以及 Flow Definition 编写功能。内联技能这一项就解决了之前多 Agent 编排中最烦人的配置摩擦。用 CrewAI 的赶紧升级。 详情 →
💡 行业洞察
Thomson Reuters 展示了受监管行业的 AI 落地真实路径:不是 demo,不是 POC — Thomson Reuters 详细分享了他们如何在法律和税务工作流中使用 Claude 构建生产级 AI 应用。这家公司有多保守不用我说,他们能上生产就说明企业 AI 在高风险场景中已经过了"能不能用"的阶段。做企业 AI 部署的,当实战手册看。 详情 →
Modal CTO:现有 AI 基础设施不是为 Agent 设计的:Modal 的 CTO Akshat Bubna 指出,request-response 架构根本不适合 Agent — 你需要为长时间运行、有状态、突发性的工作负载重新设计基础设施原语。两年前他们在 Latent Space 上说的话,现在有了实际的产品和数据支撑。做 Agent 基础设施的必听。 详情 →
布朗大学教授的线下考试实验:成绩暴跌 50%:怀疑学生用 AI 作弊,一位 Brown University 教授把期末考试改成线下 — 结果平均分直接腰斩。这不只是"学生在作弊"这么简单 — 它暴露了 AI 辅助学习制造的"能力幻觉":学生以为自己学会了,其实是 AI 会了。(40 likes | 15 RTs) 详情 →
📝 技术实战
Anthropic 市场运营团队实战 Cowork 自动化:不是"我们用了 AI"的空话 — Anthropic 自己的市场运营团队详细展示了他们用 Cowork 自动化报告和营销活动构建的具体工作流。哪些环节自动化了、怎么编排的、省了多少时间,都有具体数据。做市场运营的直接抄作业。 详情 →
Lilian Weng 35 篇论文的 Harness Engineering 分类法精华版:Latent Space 把 Lilian Weng 关于递归自我提升(RSI)的 harness engineering 综述浓缩成可操作的要点 — 35 篇论文一篇读完。如果昨天那篇原始论文太长没看完,这个精华版是最佳替代。 详情 →
🏗️ 值得一试
Fable Advisor:用 Claude Fable 做路由器的多模型编排工具:开源项目,核心思路是用 Claude Fable 作为元编排器,根据任务复杂度自动把请求分发给 Opus、GPT 或 Sonnet。解决了"这个任务该用哪个模型"的决策问题 — 如果你在多模型之间来回切换,值得试试让 AI 自己选。(152 likes | 13 RTs) 详情 →
Rabbithole:把学习变成无限画布:选中文字、提问、答案以可导航的文档形式分支展开 — 学习过程变成了一棵可视化的知识树。支持作为 MCP server 接入 Claude Code、Codex 等 Agent,把研究和编码工作流打通了。(134 likes | 15 RTs) 详情 →
🎓 模型小课堂
Benchmark 里的信号与噪音:这周 Grok 4.5、SWE-1.7、OpenAI 都在 claim 自己某项跑分第一 — 但这些数字真的能说明模型好坏吗?OpenAI 自己的研究发现,coding eval 中的很多"差异"其实来自评测环境的偶然因素:服务器配置、并发数、甚至运行时间都会影响分数。一个模型在 benchmark A 上领先 2%,可能只是因为测试那天服务器负载低。所以下次看到"SOTA"的标题,先问三个问题:样本量多大?跑了几次?用的什么硬件?能回答这三个问题的跑分才值得当真。
⚡ 快讯
- Claude Code v2.1.205:修复了 auto 模式下的 transcript 文件篡改风险,修复
--json-schema静默输出非结构化结果的 bug,修复--max-turns限制下消息丢失问题。schema 修复这一项就能帮不少团队省掉排查"幽灵故障"的时间。 链接 - Claude Code v2.1.204:修复 headless 会话中 hook 事件不流式传输的问题,防止远程 worker 在 hook 执行期间被误判为空闲回收。跑 CI/CD 和远程 Agent 部署的注意更新。 链接
- sqlite-migrate 0.2:Simon Willison 出品,sqlite-utils 的配套 schema 迁移工具。SQLite 工具链越来越完整了。 链接
- Onboard-CLI:基于 AST 和 LLM 的代码库可视化工具,帮你快速理解不熟悉的项目结构。(18 likes | 3 RTs) 链接
- github-code Web Component:一个 Web Component,直接在任何页面嵌入带语法高亮的 GitHub 代码片段 — 不用 iframe,不用 API key。写技术博客的福音。 链接
🎯 今日精选
成绩暴跌 50% 背后的真问题:AI 制造的"能力幻觉":布朗大学教授的线下考试实验不只是一个学术作弊新闻 — 它揭露了一个更深层的问题。学生在 AI 辅助下完成作业、通过考试、拿到学分,但当 AI 不在身边时,真实能力只有"AI 辅助水平"的一半。这个 50% 的成绩落差不只是证明学生在作弊,它暴露了 AI 辅助学习正在制造一种能力幻觉 — 而大学、雇主、整个资质认证体系都还没有识别和应对这种幻觉的框架。当"AI 原生"的一代毕业生进入职场,我们怎么判断他们到底会什么?这个问题,现在没有人有答案。 详情 →
下期见 ✌️