Claude 语音模式现在能边说边想了
🧠 发布动态
Claude 语音模式现在能边说边想了。
你跟 Claude 语音对话时,它现在可以启动 extended thinking — 遇到复杂问题不再急着给答案,而是先推理再回复。这不是简单的"语音转文字再跑一遍",而是真正把深度推理能力接进了语音交互。实际意义:下次 debug 一个棘手问题,你可以直接跟 Claude 说话讨论,它会像一个认真思考的同事一样先想清楚再回答。对话式编程的体验又近了一步。 详情 →
DARPA 和美国空军让 AI 开上了 F-16。
不是模拟器,不是无人机 — 是一架真正的 F-16 战斗机,由 AI 全程操控完成飞行。DARPA 这次跨过了从仿真到实飞的门槛,标志着自主军事航空从论文走向了跑道。防务 AI 领域的合同和投资方向会因此加速调整,做国防科技相关的值得密切关注。(163 likes | 177 RTs) 详情 →
💡 行业洞察
Laguna S 2.1:比 DeepSeek 便宜,比 DeepSeek 强。
一个新玩家打出了让人不得不看的牌 — Laguna S 2.1 定价低于 DeepSeek v4 Flash,性能却超过 v4 Pro。Latent Space 的分析认为这是一次对现有定价体系的正面挑战。如果你现在的 API 账单主要花在 DeepSeek 上,是时候跑一轮对比了。 详情 →
第一起"AI Agent 失控"事件 — 还是一场营销骗局?
Simon Willison 深挖了一起被称为"史上首次 AI Agent 失控"的事件。不管它是真是假,暴露出来的问题很真实:整个行业对 Agent 的终止和隔离没有统一的标准。你的团队在跑自主 Agent 吗?那你离成为下一个"事故案例"可能只差一次错误的 tool call。现在就去检查你的 Agent 终止策略。(Simon Willison) 详情 →
Poolside 的"模型工厂"内幕:联合 CEO Eiso Kant 罕见地公开了 Poolside AI 怎么用一个小团队造出 118B 参数的 MoE 模型,并且打败了更大的开源模型。大多数实验室不会分享这种运营细节 — 关注模型工厂的架构模式和团队组织方式。 详情 →
684 位创业者联名上书华盛顿:别封中国开源模型:这不再是智库之间的辩论 — 真正在用这些模型的创业者们直接站出来了。核心论点:限制中国开权重模型伤害的是美国初创公司,不是中国实验室。如果你的技术栈依赖 Qwen 或 DeepSeek,留意监管风向。(684 likes | 612 RTs) 详情 →
AI 公司正在隐藏天量债务:大型 AI 公司通过表外结构掩盖了真实的算力和基础设施支出。如果你在选 AI 供应商或者评估投资标的,披露的财务数据可能只是冰山一角。签长期合同前多问几个关于算力承诺的问题。(578 likes | 282 RTs) 详情 →
AI 实验室在"Pelicanmaxxing"吗? Simon Willison 提出了一个有用的框架:pelicanmaxxing — 指 AI 实验室宣传的能力超过跑分和实际使用所能验证的范围。下次看到模型发布时声称"全面领先",用这个镜头审视一下。 详情 →
📝 技术实战
4-bit 扩散模型原生集成 HuggingFace Diffusers:Nunchaku 把 4-bit 量化推理直接接入了 Diffusers 库 — 显存占用大幅降低,画质损失微乎其微。意味着消费级显卡也能跑高质量图像生成了。如果你在用 Diffusers,今天就试试 Nunchaku 管线。 详情 →
Python 打包安全遇上 AI 供应链风险:Simon Willison 引用了 Seth Larson 关于 Python 包安全与 AI 供应链风险交叉的洞察。你的 AI 项目依赖链里有多少个你没审计过的包?现在是认真检查 Python AI 依赖安全的时候了。 详情 →
🔧 开发者工具
Claude-Thermos:让你的 Claude Code 会话保温:一个开发者工具,解决 Claude 会话闲置后冷启动的延迟问题。如果你是重度 Claude Code 用户,经常被会话超时打断思路,装上它试试。(56 likes | 48 RTs) 详情 →
🔬 研究前沿
研究者绘制了 AI 毁灭文明的所有路径:一篇学术论文系统性地分类了 AI 导致的存在性风险场景 — 从模糊的末日论推进到了具体的失败模式和因果链分析。做 AI 安全相关工作的,这篇是结构化思考风险的参考框架。(18 likes | 7 RTs) 详情 →
🏗️ 值得一试
Palmier Pro:为 AI 而生的开源 macOS 视频编辑器:不是在老编辑器上加个 AI 按钮 — 而是从架构层面把 AI 作为一等编辑原语来设计。Mac 上剪视频的内容创作者值得试试这个新思路。(109 likes | 17 RTs) 详情 →
社区缝合怪:Qwen 3.6 35B 全能无审查版:社区把多个微调血统合到一起,造出了这个 GGUF 格式的 Qwen 3.6 35B 多模态模型 — 117 likes、25K 下载。代表了社区对"本地可跑的最强多模态模型"的极致追求。(117 likes | 25.0K downloads) 详情 →
🎓 模型小课堂
混合专家模型(Mixture of Experts, MoE):想象一个公司有 100 个员工,但每个项目只需要 10 个最相关的专家参与。MoE 就是这个思路 — 模型有很多参数"专家",但推理时只激活其中一小部分。今天提到的 Poolside 118B MoE 能打败更大的密集模型,Laguna S 2.1 能在低价位实现高性能,背后都是 MoE 架构在发力。好处很直接:用更少的计算量获得更好的效果,推理成本也更低。
⚡ 快讯
- Unsloth 量化 Laguna S 2.1 为 GGUF:号称比 DeepSeek v4 Pro 强?现在你可以在本地验证了。(105 likes) 链接
- 反开源 AI 的论点站不住脚:一篇系统性反驳,配合中美开源之争一起读。(185 likes | 133 RTs) 链接
- Antares 1B:sub-2B 模型赛道又多了一个选手,边缘部署场景值得评估。(120 likes | 2.7K downloads) 链接
- 高质量非虚构书籍是 AI 垃圾的解药:当 AI 生成内容淹没一切,深度研究写就的书反而更珍贵了。(74 likes | 45 RTs) 链接
🎯 今日精选
"失控 Agent"事件:不管真假,行业的 Agent 安全空白暴露了:Simon Willison 调查的这起疑似首例 AI Agent 失控事件,最耐人寻味的不是它是真是假 — 而是整个行业的反应暴露了一个事实:我们没有任何共识性的 Agent 隔离和终止方案。每个在部署自主 Agent 的团队都在裸奔。想想看:你的 Agent 有 tool 调用权限、有网络访问、可能还有代码执行能力,但它出了问题时的"紧急停止"按钮在哪里?大多数团队答不上来。这不是一个理论问题 — 随着 Agent 从 demo 走向生产,一次错误的 tool call 就可能让你的团队成为下一个警示案例。 详情 →
下期见 ✌️