NewsletterBlogLearnCompareTopicsGlossary
English
RESEARCHINSIGHTLAUNCHTOOLTECHNIQUEBUILD

18 条资讯

Sol Ultra 给出了环双覆盖猜想的证明

🔬 研究前沿

Sol Ultra 给出了环双覆盖猜想的证明。

1974 年提出的环双覆盖猜想(Cycle Double Cover Conjecture),50 年来无人攻克 — 现在 GPT-5.6 Sol Ultra 交出了一份看起来成立的证明。这是 frontier 模型首次对一个长期未解的数学问题给出可信的解答。论文已公开,数学界正在验证中。证明本身是否最终成立还需要时间,但一个事实已经无法忽视:AI 生成候选证明的速度已经远超人类验证的速度。(300 likes | 254 RTs) 详情 →

Anthropic 发现 Claude 内部有一个隐藏的"概念空间"。 Anthropic 用一种叫 Jacobian Lens 的新技术,在 Claude 的推理层之间发现了一个抽象概念处理空间 — 模型在生成输出之前,会先在这个空间里"琢磨"概念。这是目前为止对 frontier 大语言模型(LLM)内部推理过程最清晰的一次观察,发现有些令人兴奋,有些则让人不安。 详情 →


💡 行业洞察

Apple 起诉 OpenAI,指控前员工窃取商业秘密。

AI 人才争夺战从暗战变成了明战 — Apple 正式对 OpenAI 发起商业秘密诉讼,指控前员工带走了核心技术。这不只是两家公司的恩怨,它可能为整个行业的人才流动立下法律先例。如果法院支持 Apple,以后从大厂跳槽去 AI 公司会变得更复杂。所有在 AI 公司之间跳过槽的人都该关注这个案子的走向。(293 likes | 133 RTs) 详情 →

Cognition 如何让 Claude Fable 5 通宵自主写代码。 Devin 背后的团队 Cognition 分享了他们的实战经验:怎么让 Claude Fable 5 跑一整夜的自主编码任务,而且第二天早上代码是能用的。这是目前最具体的一份 Agent 长时间自主运行的生产级案例 — 他们在信任机制、监督模式和故障恢复上的做法值得所有在做 Agent 工作流的团队学习。 详情 →

CASP 报告:博科圣地正在使用 frontier AI 工具。 这份 CASP 报告提供了目前最详实的公开证据,记录了恐怖组织如何实际使用 frontier AI 工具。AI 安全不再是假设性讨论 — 这份报告让所有做模型访问控制和安全策略的人都没法再说"还早"。做 AI 安全的,这是目前最有说服力的 misuse 案例研究。(161 likes | 137 RTs) 详情 →


🧠 发布动态

Anthropic 联手 UST 把 Claude 带进物理 AI 和实验室。

AnthropicUST 合作推出 Claude Science — 一个面向科研和物理 AI 工作流的定制化应用,集成了实验室工具、可审计的研究产出和计算资源。这标志着 Anthropic 最明确的一次向科学计算和机器人相关领域的扩张。如果你在做科研或物理 AI,值得去看看 Claude Science 能帮你做什么。 详情 →

Anthropic TypeScript SDK v0.111.0 上线"dreaming"支持。 SDK 新增了一个叫"dreaming"的 API 能力,加上基于 evaluated_permission 的会话工具调用门控。Dreaming 功能目前除了 SDK changelog 之外没有其他文档 — 这几乎可以确定是一个即将到来的 API 公告的前奏。先更新 SDK,等官方文档。 详情 →


🔧 开发者工具

Vercel AI SDK v7.0.20–7.0.22:三个版本连发 — v7.0.22 加入 Cartesia 语音供应商,支持 Sonic 3.5 语音生成和 Ink-Whisper 转写;v7.0.21 强制统一 zod/v4 导入;v7.0.20 把 repairToolCall 升级为稳定 API,修复了 Express/Next.js 的 chunked streaming 问题。语音生成内置了,repairToolCall 稳定了,值得更新。 详情 →

llama.cpp b9957:服务端工具大改,apply_diff 被移除。 这是个破坏性更新 — apply_diff 工具被移除,换成了更干净的 edit 工具,同时引入了新的 tools_io 抽象层。如果你依赖 llama.cpp 内置的 tool-use 服务端,升级前必须测试你的工具集成。 详情 →

Claude Code v2.1.206/cd 命令现在会提示目录路径,新增 /doctor 检查会建议你精简过大的 CLAUDE.md 文件,/commit-push-pr 自动允许 git push 到已配置的远程仓库。都是日常使用的体验优化,更新吧。 详情 →


📝 技术实战

HuggingFace PyTorch 性能分析第三弹:Attention 专场。 Transformer 里最吃性能、最难 profile 的就是注意力机制 — HuggingFace 这篇教程手把手教你怎么定位 attention 的性能瓶颈。无论你在优化推理还是训练吞吐,这些 profiling 技巧都能直接用上。 详情 →


🏗️ 值得一试

Frugon:找出哪些 LLM 调用可以用更便宜的模型搞定。 一个 MIT 协议的本地工具,分析你的 LLM API 调用模式,告诉你哪些调用换成便宜模型也不会掉质量。生产环境里 AI 成本最大的问题就是"所有调用都用最贵的模型" — 跑一遍你的 API 日志,可能立刻就能省钱。(51 likes | 10 RTs) 详情 →

微信公众号文章下载器:专为 Claude Code 和 Codex 设计。 把微信公众号文章(包括精选评论和互动数据)同步到本地数据库,专门为 AI 编码 Agent 做内容研究而设计。做中文 AI 内容 pipeline 的,这个工具填补了一个真实的缺口。(236 likes | 33 RTs) 详情 →


🎓 模型小课堂

Jacobian Lens 可解释性:想知道 AI 在给你回答之前到底在"想"什么?Anthropic 的 Jacobian Lens 技术做的就是这件事 — 它通过分析 Jacobian 矩阵(描述输入微小变化如何影响输出的数学工具),映射出 Claude 在不同推理层之间如何处理抽象概念。打个比方:以前我们只能看到模型说了什么,现在能看到它在说之前是怎么"琢磨"的。这很重要,因为随着我们让模型处理越来越难的问题(比如今天的数学猜想证明),理解它的推理过程而不仅仅是输出结果,将成为信任的基础。


⚡ 快讯

  • LangChain v1.3.13:新增 Meta 模型支持和显式 prompt 缓存。 链接
  • llama.cpp b9952:DeepSeek V4 flash attention 优化,KQ mask 强制 f16,推理提速。 链接
  • fable-method:把 Claude Fable 5 的 think/act/prove 工作流提炼成可移植技能,任何模型都能用。(73 likes | 10 RTs) 链接
  • MiniCPM5-1B-Claude-Opus-Fable5-Thinking-GGUF:1B 参数模型复刻 Claude Opus/Fable 5 的思维模式,任何机器都能跑。(142 likes | 2.2K downloads) 链接
  • AI 2040:一份关于未来 15 年 AI 发展的结构化情景分析。(110 likes | 77 RTs) 链接

🎯 今日精选

Sol Ultra 的证明本身不是最大的新闻 — 验证瓶颈才是:GPT-5.6 Sol Ultra 给出环双覆盖猜想的证明,50 年未解的问题可能被一个模型解决了 — 这当然是大新闻。但更值得思考的是它暴露出的结构性问题:当 AI 生成候选证明的速度远超数学家验证的速度时,稀缺资源从"创造力"变成了"严谨性"。这意味着接下来哪些开放问题会被优先攻克,取决于哪些问题的证明更容易被人类验证,而不是哪些更"重要"。数学研究的优先级排序可能会因此发生根本性的改变。同时,这也给所有 AI 辅助研究领域提了个醒:AI 能产出的速度已经不是瓶颈,人类能消化和验证的速度才是。 详情 →


下期见 ✌️