Kimi K3 来了 — 史上最大开源模型,2.8 万亿参数
🧠 发布动态
Kimi K3 来了 — 史上最大开源模型,2.8 万亿参数。
Moonshot AI 放了个大的:总参数 2.8 万亿,MoE 架构下每次推理只激活 500 亿参数。跑分对标 Opus 4.8 级别,但定价对标 Sonnet 5 — 这意味着你用十分之一的价格就能拿到 frontier 级别的智能。开源、MoE、成本碾压,三张牌同时打出来,对那些还在为 API 账单发愁的团队来说,值得立刻跑一轮自己的 benchmark。 详情 →
Thinky Inkling 获 Latent Space 深度拆解 — 开源格局再次重塑。 975B 总参数、41B 活跃参数的多模态模型,Apache 2.0 协议,Latent Space 的独立评测为它补上了发布时缺失的第三方视角。加上同期发布的 Inkling-Small(276B-A12B),一周之内两个巨型 MoE 模型先后落地,开源模型的天花板正在被暴力抬高。 详情 →
💡 行业洞察
Cursor 加入 Fable 5 生产阵营 — 趋势已经无法忽视。
继 Base44 和 Cognition 之后,Cursor 成为第三个公开记录 Fable 5 生产部署的顶级开发工具公司。一周内三份"Working at the frontier"案例研究,都指向同一个结论:最难的 1% 编码问题,Fable 5 已经能接住了。当你的竞品都在用同一个模型,不跟进就是落后。 详情 →
Anthropic 发了一份给 CISO 看的 Agentic AI 指南 — 打法变了。
"零风险不是安全团队的职责" — 这个标题就说明了 Anthropic 的策略转变:不是绕过企业安全团队卖 AI,而是直接跟 CISO 对话。这份指南提供了一套实用的 Agentic AI 风险评估框架,包括权限控制、审计日志、人类监督回路的设计模式。如果你在推动企业内部 AI Agent 落地但卡在安全审批上,把这份文档转给你的安全负责人。 详情 →
开源 AI 生态报告出炉 — 时机刚好。 K3 和 Inkling 前脚发布,后脚这份全景报告就来了,用数据而不是感觉描绘开源 AI 的真实轨迹。HN 上 353 likes 说明社区共鸣强烈 — 在巨型开源模型扎堆发布的这周,这份报告是校准预期的最佳工具。(353 likes | 260 RTs) 详情 →
🔧 开发者工具
Claude Code 新增 /fork — 对话分叉成并行后台会话。
一个看起来不大但改变工作流的功能:/fork 把当前对话复制到后台会话(在 claude agents 里独立运行),你继续在原对话里干活。等于把 Claude Code 从单线程变成多线程 — 一边让 Agent 跑长任务,一边继续问问题。同版本还加了 WebSearch 频率限制,防止工具调用失控。升级后试试。 详情 →
CrewAI Skills Repository 转正 — Agent 团队有了可复用技能库。 CrewAI 1.15.4 把 Skills Repository 从实验性升级为稳定 API。这是一套可复用的技能抽象,让多 Agent 工作流里的能力可以模块化封装和共享。加上上周的拦截钩子(interception hooks),CrewAI 正在把"Agent 框架"做成"Agent 生产系统"。 详情 →
llama.cpp 新增 OpenCL MoE 内核 — 赶上了巨型 MoE 模型的节奏。 b10066 版本加入了 Q6_K 量化的 OpenCL MoE 内核。K3(2.8T)和 Inkling(975B)这种巨型 MoE 模型要在非 NVIDIA 硬件上高效推理,这个内核来得正是时候。没有 H100 的开发者,你的推理路径刚拓宽了。 详情 →
🔬 研究前沿
AI 在零知识虚拟机里找到了真 bug — 形式化验证都没查出来的那种。 AI 驱动的代码分析在 OpenVM 的 ZkVM 中发现了真实漏洞 — 这是一个正确性就是全部产品价值的领域。当形式化验证(formal verification)都会遗漏的 bug 被 AI 抓到时,"AI 辅助安全审计"就不再是概念了。(80 likes | 5 RTs) 详情 →
延伸阅读:如果你对 AI 代码审计的能力边界感兴趣,推荐看看 AI 写的代码,为什么不能只让 AI 自己审?
Simon Willison 实测 Kimi K3 — 发布热潮需要的冷水。 Willison 用他标志性的"画鹈鹕"测试和对抗性指令跟随评测把 K3 过了一遍。官方跑分是一回事,独立评测者的真实反馈是另一回事 — 在决定是否迁移之前,先看看他的发现。 详情 →
你的微调投资跨代还管用吗? Dharma AI 分析了一个关键问题:新一代模型发布后,你在旧模型上投入的 prompt 工程和微调优化还能保持优势吗?结论不是简单的"能"或"不能" — 如果你在某个模型上有大量优化投入,这篇必读。 详情 →
📝 技术实战
NVIDIA + HuggingFace 联手降低多 GPU 扩散模型微调门槛。 NeMo Automodel 整合进 Diffusers API — 你已经熟悉的接口,现在可以直接调度多 GPU 做视频和图像模型微调。不需要从零学新框架,直接在现有工作流上加速。 详情 →
6GB 显存训练生成式踢鼓模型 — 扩散音频走进消费级硬件。 一篇实操教程,用老旧的 Linux 台式机(6GB VRAM)训练音频扩散模型。生成式音频不再是 H100 集群的专属了,你那台吃灰的旧电脑可能就够用。(86 likes | 53 RTs) 详情 →
🏗️ 值得一试
KlaatCode:开源编码 Agent,智能路由号称降本 10 倍。 开源的终端 AI 编码助手,核心卖点是自动把查询路由到合适的模型层级 — 简单问题用便宜模型,复杂问题上大模型。104 stars 且 trending,在拥挤的编码 Agent 赛道里,成本优化这个切入点确实差异化。(104 likes | 11 RTs) 详情 →
Simon Willison 做了个 LLM 陈词滥调高亮器 — 发稿前抓住那些"delves"。 受到上周病毒式传播的"如何阻止 Claude 说 load-bearing"帖子启发,Willison 做了个实用工具来高亮 AI 生成文本中的典型口头禅。编辑 AI 生成内容的人都该试试 — 没有比发出去之后才发现满篇"值得注意的是"更尴尬的了。 详情 →
ReasonGate:会解释为什么拦你的 Prompt 注入防火墙。 开源项目,不只是二元的放行/拦截,而是告诉你为什么这条 prompt 被认为是注入攻击。可解释性在安全工具里极其稀缺,而生产环境中调试误报最头疼的就是不知道为什么被拦 — ReasonGate 直接解决这个痛点。(6 likes | 6 RTs) 详情 →
🎓 模型小课堂
混合专家模型(MoE)— 总参数 vs. 活跃参数:这周 K3(2.8 万亿总参数,500 亿活跃)和 Inkling(9750 亿总参数,410 亿活跃)先后发布,都是巨型 MoE 模型。为什么一个 2.8 万亿参数的模型推理成本只相当于 Sonnet 级别?因为 MoE 架构里,每个 token 只会激活一小部分"专家"子网络,其余专家处于休眠状态。总参数量是模型的知识容量上限 — 它学过多少东西;活跃参数量才决定推理成本 — 每次回答实际调用多少计算。所以看到"2.8 万亿参数"别被吓到,看活跃参数才知道你要付多少钱。
⚡ 快讯
- OpenAI Python SDK v2.46.0:新增项目级 service account API key 管理,多服务隔离凭证更安全了。 链接
- OpenAI Node SDK v6.48.0:同步 Python SDK 的 service account key 端点,Node 生态跟上了。 链接
- Anthropic Google Cloud TS SDK v0.0.6:升级 google-auth-library 到 ^10.2.0,修复 Vertex AI 认证兼容问题。 链接
- Vercel AI SDK v7.0.31:修复工具审批拒绝状态和非流式工具调用的 input event 排序 bug。 链接
🎯 今日精选
Kimi K3 的真正颠覆不在跑分 — 而在证明 MoE 经济学能用 Sonnet 的价格交付 Opus 的智能。 2.8 万亿参数听起来是个噱头数字,但背后的逻辑很实在:MoE 架构让你用 500 亿活跃参数的推理成本,获得 2.8 万亿参数的知识容量。当 frontier 级别的智能变成大宗商品价格,模型本身就不再是护城河了 — 真正的壁垒变成了生态锁定:你的工具链、Agent 框架、微调数据、用户习惯。OpenAI 押注 Frontier 平台,Anthropic 押注 Claude Code 生态,都在做同一件事 — 不是卖模型,是卖离不开的工作流。K3 的发布加速了这个转折点:当开源模型用十分之一的价格追平闭源,闭源厂商的 API 收入故事就需要新的叙事了。 详情 →
下期见 ✌️