DeepSeek V4 Pro 发布,推测解码直接写进权重
🧠 发布动态
DeepSeek V4 Pro 发布,推测解码直接写进权重。
不是推理框架层面的优化,是模型架构层面的。DeepSeek 把 DSpark 推测解码技术直接集成到 V4 Pro 的权重中 — 不需要外挂 draft model,模型本身就自带"先猜后验"的加速能力。论文和开源权重同日放出,HuggingFace 上已经可以下载。这意味着推理优化正在从"部署后的工程活"变成"训练时的设计决策",边界在模糊。(121 likes) 详情 →
Vercel AI SDK 直接跳到 v7,Breaking Changes 一箩筐。
Vercel AI SDK 从 v6 一步跨到 v7.0 — 作为前端 LLM 集成使用最广泛的框架,大版本更新意味着 API 抽象层有结构性变化。好消息是 Vercel 同步维护 v6 LTS(最新 v6.0.214),给了迁移窗口期。坏消息是:越晚迁移,债越多。现在就去看迁移指南。 详情 →
CrewAI 1.15.1 修了一个 SSRF 绕过漏洞。 如果你的 CrewAI Agent 有网页抓取能力,立刻更新 — 这次修复的是 scraping fetch 中的 SSRF 重定向绕过,攻击者可以利用它让你的 Agent 访问内网资源。新版还要求显式定义项目配置,开发体验更严格了。 详情 →
🔬 研究前沿
DSpark 论文:DeepSeek 如何让推测解码变成模型的原生能力。
714 个 HN 赞不是白来的。DeepSeek 的 DSpark 论文详细拆解了"draft-then-verify"推理加速如何从外挂组件变成权重内置能力 — 核心是在训练阶段就让模型学会自我验证草稿 token,而不是依赖独立的小模型做 draft。对做推理优化的团队来说,这篇论文重新定义了优化的起点。(714 likes | 293 RTs) 详情 →
AI 攻入射频芯片设计 — "黑魔法"迎来学徒。 IEEE Spectrum 报道,AI 正在突破模拟电路设计的壁垒。射频集成电路(RFIC)设计长期被认为过于依赖直觉和经验,难以自动化。现在 AI 开始在这个领域展现出能力 — 信号很明确:AI 的版图正在从数字/软件延伸到物理硬件。(169 likes | 117 RTs) 详情 →
🏗️ 值得一试
HeyGen 开源 HyperFrames:写 HTML,出视频 — 专为 Agent 管线设计。
HeyGen 开源了 HyperFrames — 一个把 HTML 模板渲染成视频的框架,专门为 AI Agent 管线设计。这填补了一个关键空白:程序化生成内容到视频输出之间一直缺一个轻量级桥梁。你的 Agent 生成结构化内容,HyperFrames 直接渲染成视频,不需要复杂的视频编辑 pipeline。做内容自动化的,值得立刻试。(31,767 likes | 2,959 RTs) 详情 →
Tidal Echo:手机到 Claude Code 的私密聊天通道。 一个 PWA 应用,把你手机和桌面端的 Claude Code 会话连起来 — 手机发消息,Claude Code 处理,结果通过推送通知回到手机。对需要在外面盯着长时间运行的 Agent 任务的开发者来说,这个 UX 模式很新颖。(42 likes | 16 RTs) 详情 →
📝 技术实战
llama.cpp OpenCL Flash Attention 大重写:智能 KV Tile 分类。 b9828 版本引入了 prefill prepass 内核,会把 KV tile 分为全遮罩、混合和无遮罩三类 — 全遮罩的直接跳过计算。对用 AMD/Intel GPU 跑本地模型的开发者来说,这是实打实的性能提升,非 NVIDIA 硬件终于得到认真对待了。 详情 →
llama.cpp CUDA 快速路径:strided tensor 拷贝加速。 b9827 用 cudaMemcpy2DAsync 替换了逐元素标量拷贝 — 针对的是行连续但整体不连续的 tensor 布局,这在实际推理中是常见瓶颈。NVIDIA GPU 用户更新后应该能看到可测量的吞吐提升。 详情 →
🔧 开发者工具
Ollama 修了一个 Windows Vulkan GPU 误路由 Bug。 v0.30.11 修复了 Windows 上 Vulkan 后端的 iGPU/dGPU 分类反转问题 — 推理被默默路由到错误的 GPU 上,性能损失巨大但你根本不知道。Windows + Vulkan 用户立刻更新。同时新增了 thinking 能力检测,支持 OpenCode 集成。 详情 →
llama.cpp OpenVINO 2026.2.1 自包含发布包。 不再需要单独管理 OpenVINO 依赖了 — release 包现在是自包含的。Intel 硬件用户跑 llama.cpp 的门槛又降了一级。 详情 →
💡 行业洞察
OpenAI 挖走 Uber 印度负责人,消费级 AI 竞争转向新兴市场。 OpenAI 让 Uber 印度前负责人来掌管其最大的非美国市场 — 信号很清楚:当模型能力趋同,分发和本地化能力比跑分更重要。印度 5 亿智能手机用户是一块必争之地,OpenAI 在赌消费级 AI 的增长引擎在新兴市场。 详情 →
Simon Willison 推荐 Dean W. Ball 的 AI 治理框架。 Dean W. Ball(Mercatus Center)是目前对 AI 能力与监管设计交叉领域写得最清楚的人之一。Willison 的推荐值得关注 — 做产品的如果只看技术不看政策,迟早会被监管打个措手不及。 详情 →
🎓 模型小课堂
推测解码(Speculative Decoding):大模型生成文本时是一个 token 一个 token 地"想"出来的,速度瓶颈就在这里。推测解码的思路是:先用一个快速方法"猜"出一串 token(草稿),再用大模型一次性验证哪些猜对了 — 猜对的直接用,猜错的重来。传统做法需要一个独立的小模型做"猜"的工作,但 DeepSeek 的 DSpark 把这个能力直接写进了模型权重 — 不需要外挂,模型自己就能边猜边验。什么时候有用?长文本生成、延迟容忍度高的场景收益最大;短回复或显存紧张时反而可能帮倒忙。
⚡ 快讯
- Simon Willison 评 OpenAI:Willison 的引用点评一如既往地穿透公关话术,直指实质变化。 链接
- Timothy B. Lee 的 AI 经济学视角:通过 Willison 的策展浮出水面,Lee 从政策经济学角度分析 AI,补上了纯技术报道缺失的维度。 链接
- Vercel AI SDK v6 LTS 持续维护:v7 发布的同时 v6 也在更新(v6.0.214),Vercel 给了明确的迁移窗口期。 链接
- AI SDK xAI Provider 补丁:v3.0.99 对齐最新 provider 接口,Grok 集成保持同步。 链接
- LangChain-Fireworks 依赖更新:langchain-fireworks 1.4.3,纯依赖维护,无用户可见变化。 链接
🎯 今日精选
DeepSeek 把推测解码烤进权重 — 推理优化正在变成模型设计决策:DeepSeek V4 Pro 同日放出模型和论文,把 DSpark 推测解码直接集成到模型权重里 — 这不只是又一个推理优化技巧,而是一个范式信号。传统上,推测解码是部署阶段的工程优化:训练好模型,再想办法加速推理。但 DeepSeek 把这条线往前推了一步,让模型在训练时就学会自我草稿和验证,彻底模糊了"模型架构"和"推理基础设施"之间的边界。这意味着未来的模型竞争不只是比参数量和跑分,还要比"模型本身有多懂得如何高效运行自己"。对做推理部署的团队来说,优化的起点可能要从"选什么推理框架"变成"选什么模型架构"。 详情 →
下期见 ✌️