NewsletterBlogLearnCompareTopicsGlossary
English
RESEARCHTOOLINSIGHTLAUNCHTECHNIQUEBUILD

18 条资讯

Anthropic 公开 Fable 5 完整越狱评估框架

🔬 研究前沿

Anthropic 公开 Fable 5 完整越狱评估框架。

这是头一次有 frontier 实验室把红队方法论开源到这个粒度 — 自动化攻击生成、分级严重性分类、回归测试套件,全部摊开给你看。Anthropic 的赌注很清楚:透明度加速防御的速度比武装攻击者更快。如果你在做安全评估,这套框架现在就是你的免费基线。 详情 →

Mythos Preview 发布窗口期高危 CVE 激增。 Epoch AI 的分析显示,Claude Mythos Preview 发布前后新报告的高危漏洞出现了统计显著的峰值。是相关性还是因果性尚无定论,但这是首个将 frontier 模型发布与漏洞发现率挂钩的实证数据点 — 这会深刻影响未来模型发布的安全争论。(18 likes | 4 RTs) 详情 →

Dispersion Loss:小模型训练的免费加速卡。 小语言模型(SLM)有个老问题 — embedding 空间会坍缩,导致表征能力打折。这篇论文提出的 dispersion loss 直接对抗这个现象。如果你在训练或微调 3B 以下的模型,加一行 loss 就能拿到免费的性能提升。(15 likes | 3 RTs) 详情 →


🧠 发布动态

HuggingFace Transformers 原生支持 KimiK 2.5–2.7。

Transformers v5.13.0 正式集成 Moonshot 的 KimiK 2.5–2.7 系列 — 开源多模态 Agent 模型家族。之前想跑这些模型得自己折腾适配,现在一行 pipeline() 调用搞定。想试多模态 Agent 能力但不想被 API 锁定的,门槛刚降到地板。 详情 →

Diffusers 把 NVIDIA Cosmos 3 接进标准 Pipeline。 Diffusers v0.39.0 带来了 Cosmos 3 — NVIDIA 基于 Mixture-of-Transformers 的统一世界基础模型,一个模型同时搞定世界生成、物理推理和动作生成。做具身智能(Embodied AI)原型的,这是你的新玩具。 详情 →


💡 行业洞察

DeepMind 和 A24 官宣研究合作 — AI 正式进入专业影视制作。

Google DeepMind 跟独立电影厂牌 A24(出品过《瞬息全宇宙》《月光男孩》)建立正式研究合作,探索 AI 在电影制作中的应用。这是 frontier AI 实验室首次与大型创意工作室的正式联姻 — 别小看这件事,它会定义 AI 工具进入专业创作流程的规则和边界。 详情 →

AIEWF 收官:Agent Loop 之争和下半年路线图。 AI Engineer World's Fair 的闭幕主题演讲围绕"什么该做成 Agent 循环、什么不该"展开了激烈争论。如果你在规划团队下半年的技术方向,闭幕总结里的 state-of-AI-engineering 报告值得一读。 详情 →

Vercel 首席软件官:Skills、Sandbox 和 Agent 可读网站是新基础设施。 Vercel 的 Andrew Qu 详细解释了他们的 Agent 框架"eve"是怎么构建的,核心论点是 Agent 不是在现有软件上加个 AI Tab,而是一种全新的软件形态。"Agent 可读网站"这个概念值得前端开发者认真思考 — 你的网站可能很快需要同时服务人类和 AI Agent。 详情 →

Simon Willison:开源 AI 缺口地图。 Willison 逐项列出了开源 AI 相对闭源提供商仍然存在的关键缺口。如果你押注开源模型上生产环境,这是一份清醒的能力清单 — 缺什么、机会在哪。 详情 →


🔧 开发者工具

Claude Code 把"Default"改名"Manual",对话不再自动继续。 v2.1.200 的两个 UX 变更:权限模式从"Default"改名为"Manual"(更直观),AskUserQuestion 对话框不再自动继续。如果你在半自主模式下跑 Claude Code,检查一下你的权限配置是否需要更新。 详情 →

llama.cpp 把 288 专家 MoE 路由融合成一个 CUDA 内核。 b9866 版本的重磅更新:对 288 专家模型(如 Step-3.7-Flash)的 topk-MoE 路由做了 CUDA 融合 — 从 ~330 次额外内核调用压缩到 batch size 1 时的一次融合调用。本地跑大 MoE 模型的,更新就是了。 详情 →

mcpsnoop:给 MCP 用的 Wireshark。 调试 MCP 工具调用一直是黑箱操作。mcpsnoop 作为透明代理坐在客户端和服务器之间,用 TUI 实时展示每条消息的收发。搞 MCP 集成的必备工具,下次调试直接上。(44 likes | 13 RTs) 详情 →


📝 技术实战

本地跑 Frontier 级开源模型实用指南。 254 个 HN 赞的高质量教程 — 从硬件选型、量化方案选择到推理服务配置,手把手教你在本地跑当前最强的开源模型。如果你因为隐私或延迟考虑自建推理,收藏这个当参考。(254 likes | 120 RTs) 详情 →


🎓 模型小课堂

越狱评估框架(Jailbreak Evaluation Framework):Anthropic 今天把自家的完整公开了。所谓越狱评估框架,就是 AI 实验室系统性探测自己模型安全边界的方法论 — 包括自动化攻击生成(让 AI 用各种花式 prompt 攻击自己)、分级严重性分类(哪些越狱只是烦人、哪些真的危险)、以及回归测试套件(确保修了一个漏洞不会打开另一个)。理解这套体系你就明白,为什么"越狱防护"是一场永远在进行的军备竞赛,而不是一个能画句号的终点线。


⚡ 快讯

  • GLM-5.2 跑在 AMD MI355X 上:2,626 tok/s/node,成本不到 Blackwell 的一半。AMD 在推理性价比上越来越能打。(32 likes | 9 RTs) 链接
  • Simon Willison 评 Fable 5 的伦理判断:独立视角分析 Fable 在模糊道德场景中的画线方式,配合 Anthropic 官方安全帖一起看。 链接
  • Vercel AI SDK v7.0.12–7.0.13:修复了 tool-result 排序问题 — 结果现在按原始调用顺序返回。跑 Agent Chain 的注意更新。 链接
  • Talos:把闲置 GPU 接入去中心化推理网络赚钱的客户端,通过 WebSocket 服务开源模型推理任务。(307 likes | 12 RTs) 链接
  • deptrust:AI Agent 的依赖安全扫描器 — 在 Agent 自动安装包之前检查已知漏洞,堵住 Agent 编码工作流中日益增长的供应链攻击面。(7 likes) 链接

🎯 今日精选

Anthropic 开源越狱攻击手册 — 一场豪赌还是行业拐点? 把自己的红队方法论完整公开,这在 frontier AI 实验室里是头一次。Anthropic 的逻辑是:透明度加速防御的速度,远超它武装攻击者的风险。但更深层的博弈在于 — 这一手逼着所有其他实验室做选择:要么跟进公开自己的安全评估方法,要么解释为什么不敢。如果行业跟进,我们可能会看到安全评估从各家的黑箱竞争,变成一套可审计的公共标准。对开发者来说,这套框架今天就能拿来当自己产品安全测试的起点。 详情 →


下期见 ✌️