谷歌一次发三个 Gemini 模型 — 包括首个网络安全专用模型
🧠 发布动态
谷歌一次发三个 Gemini 模型 — 包括首个网络安全专用模型。
Gemini 3.6 Flash 接替速度位,3.5 Flash-Lite 瞄准成本敏感场景,真正的亮点是 3.5 Flash Cyber — 主流大厂第一次把网络安全做成独立模型而不是通用模型的附加能力。安全团队终于有了一个不需要费劲 prompt engineering 就能理解漏洞上下文的模型。对于还在用通用模型做安全分析的团队,现在有了专门工具,值得第一时间测试。 详情 →
Qwen Image 3.0 直面视觉 AI 幻觉问题。 阿里 Qwen 团队发布图像生成大更新,主打"内容丰富、细节真实、知识准确" — 直接对标图像生成中最头疼的事实性问题。HN 上 537 赞说明输出质量确实有东西,国产多模态能力又进一步。(537 likes | 211 RTs) 详情 →
Jack Dorsey 押注:开发协作应该围绕 Agent 重建。 Dorsey 新产品 Buzz 把团队聊天、AI Agent 编排和 Git 托管塞进同一个平台。逻辑不是"给现有工具加 AI",而是"从 Agent 原生出发重建协作层"。方向大胆,但要说服开发者离开 GitHub + Slack 的组合,难度不小。(211 likes | 198 RTs) 详情 →
Poolside 发布 Laguna S 2.1,代码模型赛道继续加热。 Poolside AI 最新代码专用模型,HuggingFace 上 3000+ 下载,HN 212 赞 — 社区反馈指向实际能力提升而非单纯炒作。代码生成赛道越来越拥挤,但竞争对开发者只有好处。(212 likes | 3.1K downloads) 详情 →
📝 技术实战
Anthropic 公开了自己的 AI 原生安全开发手册。
当 AI Agent 写了你大部分代码时,安全流程怎么做?Anthropic 直接把自己内部的做法公开了 — 这不是安全白皮书的空谈,而是一个 frontier 实验室在生产环境里实际踩过坑后的方案。如果你团队在用 AI 辅助开发但安全流程还停留在人写代码的时代,这份清单值得对照自查。 详情 →
谷歌悄悄废弃了最新 Gemini 模型的 Temperature、Top-p 和 Top-k。 如果你在生产环境调用 Gemini API 并且设置了采样参数 — 它们正在被静默忽略。API 文档里一句话带过,没有迁移指南,没有大张旗鼓的公告。这打破了每个 LLM 集成都默认存在的控制假设。立刻审查你的 Gemini API 调用,确认采样参数是否还在生效。(22 likes | 6 RTs) 详情 →
🔧 开发者工具
Datadog 给 Claude Code 造了一个"万能适配器"。
Datadog 工程团队搞了个通用适配层,让 Claude Code 通过一个统一接口访问他们整个内部工具链。架构思路可以复用 — 把异构的内部工具统一包装成 Agent 可调用的接口,大型工程团队都能照着做。如果你公司内部工具七零八落,这个模式值得研究。 详情 →
Nativ:Mac 上的本地推理终于像样了。 Simon Willison 推荐的新工具,在 Mac 本地跑模型,不依赖云端。本地推理工具越来越成熟,对隐私敏感场景和离线开发越来越实用。Mac 用户可以试试。 详情 →
💡 行业洞察
OpenAI 与 HuggingFace 之间的安全事件,暴露了模型评测的信任裂缝。
AI 基础设施最重要的两家公司之间,在模型评测过程中出了安全事故。细节本身重要,但更值得关注的是它暴露的系统性问题:整个模型共享和评测管线里,信任假设太多,验证太少。如果你在跑第三方模型 eval,现在是时候审查一下你的安全实践了。(585 likes | 386 RTs) 详情 →
Claude Code 团队罕见露面,聊产品决策背后的逻辑。 Simon Willison 采访了 Claude Code 团队的两位负责人,谈了产品取舍、技术权衡和路线图思考。在 Bun 运行时切换的报道之后,这次补上了人的视角 — 想了解 Claude Code 下一步往哪走,这期值得听。 详情 →
🔬 研究前沿
独立测评:Kimi K3 和 Fable 打成平手。 Fireworks AI 发布第三方 benchmark,Kimi K3 在多项指标上追平 Fable — 这是首次来自非厂商的独立验证。Fireworks 同时服务两个模型,有真实的推理成本数据,比厂商自卖自夸可信度高。选模型前先看方法论。(162 likes | 88 RTs) 详情 →
NVIDIA 全面梳理物理 AI 的仿真现状。 这份发在 HuggingFace 上的综述覆盖了合成数据生成、sim-to-real 迁移和工具链全景 — 做机器人和具身智能的必读材料,帮你搞清楚这个领域到底走到哪了。 详情 →
Xaira 认为因果模型需要因果数据 — 所以他们自己建了实验室。 Latent Space 采访了 Xaira Therapeutics 的首席发现官和首席 AI 科学家。核心论点:与其在现有数据集上训练,不如投入重金生成专门的实验数据。这个逻辑不只适用于药物发现 — 任何需要因果推理的 ML 管线都该想想,你的训练数据到底能不能支撑你要的结论。 详情 →
🏗️ 值得一试
Grabette:开源的机器人操作数据采集系统。 训练机器人操作模型最痛的环节之一就是数据采集 — Grabette 直接开源了一套完整方案。配合 NVIDIA 的仿真综述,一个管合成数据,一个管真实数据,互为补充。在做机械臂训练的团队,现在就可以搭起来。 详情 →
🎓 模型小课堂
采样参数(Temperature、Top-p、Top-k):当大语言模型生成下一个 token 时,它实际上在一堆候选词上算出了概率分布。Temperature 控制这个分布的"锐度" — 值越低越确定,值越高越随机。Top-p(核采样)是只从累积概率达到阈值的那些候选里选。Top-k 更简单粗暴,直接只看概率最高的 k 个。这三个旋钮是开发者控制模型输出风格的基本工具 — 而谷歌今天宣布最新 Gemini 模型直接忽略这些参数,等于说"模型自己知道该怎么采样,你别管了"。如果你的生产代码依赖这些参数来控制输出一致性,现在必须确认它们是否还在生效。
⚡ 快讯
- Motif-3-Beta:新的文本生成模型入场,HuggingFace 119 赞,中端开源模型赛道又多一个选手。(119 likes | 125 downloads) 链接
- 白宫因中国 AI 政策内部分裂,Anthropic 支付创纪录版权赔偿:两件事放在一起看,监管和法律风险正在同时收紧。 链接
- 材料科学是 AI 扩展的隐藏瓶颈:不是算法也不是钱,下一代 AI 硬件的上限取决于材料创新。 链接
- Frontier 模型画蒙娜丽莎大比拼:GPT-5.6、Claude、Gemini、Grok 正面对决,直观感受各家视觉生成水平。(69 likes | 21 RTs) 链接
- 特朗普最新任命的 AI 沙皇已经辞职:CAISI 负责人刚上任就走人,美国 AI 政策的旋转门还在转。 链接
🎯 今日精选
谷歌悄悄废弃采样参数,"模型说了算"的时代来了:在所有人盯着三个新 Gemini 模型的时候,API 文档角落里的一行字才是今天最值得警惕的信号 — temperature、top_p、top_k 在最新模型上被标记为"已废弃并忽略"。这意味着 frontier 实验室现在认为模型自己能管好输出分布,不需要开发者手动调节。问题是,几乎每个 LLM 集成都假设这些控制旋钮存在且有效。如果你的生产系统依赖 temperature=0 来保证输出确定性,或者用 top_p 来控制创意写作的多样性,这些假设现在在 Gemini 上全部失效。更深层的信号是:当实验室开始收回开发者的细粒度控制权,用"模型知道最好"来替代,我们正在走向一个开发者对模型行为越来越缺少掌控力的未来。现在就去审查你的 Gemini 调用。(22 likes | 6 RTs) 详情 →
下期见 ✌️