NewsletterBlogLearnCompareTopicsGlossary
English
RESEARCHLAUNCHTOOLINSIGHTTECHNIQUEBUILD

22 条资讯

Gemini 3.5 Flash 拿到 Computer Use 能力 — 谷歌最快的模型开始操控桌面了

🧠 发布动态

Gemini 3.5 Flash 拿到 Computer Use 能力 — 谷歌最快的模型开始操控桌面了。

Gemini 3.5 Flash 现在能控制桌面和浏览器 UI,直接对标 Anthropic 的 Computer Use。关键在于"Flash 级定价" — 把 Agent 桌面自动化的成本拉到一个新量级。之前 Computer Use 基本是 Claude 的独占领地,现在谷歌用速度和价格来抢市场。如果你已经有 Agent 工作流,今天就值得跑个对比测试。(147 likes | 91 RTs) 详情 →

Vercel AI SDK 升级到 v7.0,Breaking Changes 不少。

AI SDK v7.0 三个要注意的:遥测 API 转正(experimental_ 前缀全部移除)、ToolResultOutput 废弃的 media 类型被删、prepareStep 的消息覆盖行为修正。大版本升级,先查你的 import 再动手。(无 engagement 数据) 详情 →

CrewAI 1.15 全面拥抱声明式 YAML 流程。 CrewAI 现在可以用 YAML 定义多 Agent 流水线 — 条件表达式、组合动作、内联 Crew 定义全部支持,CLI 还加了对话式 TUI。这是 CrewAI 声明式路线以来最大的一次发布,搞多 Agent 编排的可以试试新语法。 详情 →

Ollama 自动安装 Claude Code 和 OpenCode。 Ollama v0.30.11 加了对编码 Agent 的自动安装支持,还能自动检测模型的 thinking 能力 — 定位很清晰:做本地推理层,让编码 Agent 在上面跑。Windows 上 Vulkan 的 iGPU/dGPU 分类也修了。 详情 →


🔧 开发者工具

Anthropic 给远程 Claude Code 会话加了设备信任验证。

企业安全团队的好消息 — 现在可以要求设备通过验证才能查看或操控开发者的本地 Claude Code 会话。远程协作场景下,这道信任边界挡住了未授权访问。Team/Enterprise 管理员,去后台开 Trusted Devices。 详情 →

Claude Code v2.1.193:classifyAllShell 让每条 Bash 命令都过分类器。 新设置 autoMode.classifyAllShell 把所有 Bash 命令(不只是任意代码模式的)都路由到自动模式分类器。另外 transcript 里现在能看到拒绝原因,还加了 OpenTelemetry 日志事件 — 搞可观测性的有福了。 详情 →

AI SDK xAI Provider 加入 Grok 4.3 和 Build 模型。 @ai-sdk/xai 新增 Grok 4.3、grok-build-0.1 和 grok-imagine-image-quality 模型 ID,还支持 nonemedium 两档推理强度。这是 xAI 最新模型阵容的首个 SDK 集成。 详情 →

llama.cpp 拿到 SYCL 张量并行 — 双 GPU 推理不再是 NVIDIA 专属。 llama.cpp b9788 加了 --split-mode tensor 的 SYCL 支持,实现了和 CUDA 对等的 backend-specific all-reduce。Intel/AMD 双卡用户,你们终于是一等公民了。 详情 →


🔬 研究前沿

Lilian Weng 写了 Scaling Laws 的终极指南 — 也指出了幂律在哪里失效。

Lilian Weng 这篇长文可能是目前公开讨论 Scaling Laws 最全面的一篇 — 从 Chinchilla 到 compute-optimal training,再到幂律框架的局限性。核心洞察:大家引用的那些 scaling law 建立在对数据质量、混合比例和评估方法的假设之上,而这些假设在 frontier 训练规模上会崩。如果你在做训练预算决策,这篇是新的参考基准。 详情 →

AllenAI 逐 token 测了混合架构在哪里比纯 Transformer 强。 混合架构(Attention + 状态空间层)在某些 token 类型上显著优于纯 Transformer — AllenAI 的分析粒度细到了单个 token 级别。在评估混合模型 vs 纯 Transformer 时,这比笼统的跑分有用得多。 详情 →

Un-0 用耦合振荡器生成图像 — 不是扩散,不是自回归。 Un-0 提出了一种基于物理的图像生成方法:用耦合振荡器动力学替代扩散过程。这是一个真正的新范式,不是在已有框架上微调,而是开辟了一个全新的生成模型设计空间。(87 likes | 16 RTs) 详情 →

Trakkr 测了主流 AI 模型的政治倾向。 用结构化方法测量各大 AI 模型的政治偏见,HN 上 213 条评论说明这个话题有多敏感。如果你的产品涉及政治敏感内容,这份报告值得作为模型选型的参考维度之一。(104 likes | 213 RTs) 详情 →


📝 技术实战

一条命令在 HuggingFace 上起一个 vLLM 推理服务。 HuggingFace Jobs 现在支持一行 CLI 启动托管 vLLM 服务器 — 不用管基础设施,不用配 GPU 集群。想快速跑个模型评测或搭个 staging 环境?这个方案把门槛降到了最低。 详情 →

Hello-Agents:从 Agent 基础到生产级多 Agent 系统。 GitHub 上在涨的教程项目,填补了"hello world Agent demo"和"真正的 Agent 系统设计"之间的断层。从基础概念到生产实践,一步步带你搭。在建第一个多 Agent 系统的,值得过一遍。(127 likes | 3 RTs) 详情 →


💡 行业洞察

OpenAI IPO 推迟到 2027 — 连锁反应已经开始。 纽约时报报道 OpenAI 倾向于明年再上市,需要更多时间巩固收入和治理结构。这不只是 OpenAI 自己的事 — 公开市场的估值锚定直接影响所有 AI 创业公司的融资倍数。如果你在融资,注意下游效应。(85 likes | 57 RTs) 详情 →

Simon Willison 谈 AI 责任归属:Agent 搞砸了谁来赔? 当 AI Agent 在生产环境中执行真实操作时,liability 框架决定了你能不能上线。Simon Willison 的分析很实际 — 不是学术讨论,而是你发布 Agent 产品前应该想清楚的法律边界。 详情 →

Latent Space 宣布"Meta-Harness 之夏"来了。 Latent Space 造了个新词 — 在编排层上面再套编排层,Agent 框架的框架正在野蛮生长。这个趋势判断很准:从 LangChain 到 CrewAI 到各种 workflow engine,现在已经开始卷"谁来编排这些编排器"了。 详情 →


🏗️ 值得一试

OpenKnowledge:开源的 AI-first 知识管理工具。 Inkeep 推出的开源项目,直接对标 Obsidian 和 Notion,但从第一天就为 AI 工作流设计。HN 上 175 分说明确实有需求 — 想要 AI 原生笔记体验又不想被锁定的,试试。(175 likes | 79 RTs) 详情 →

OpenTag:在 Slack 和 GitHub 里 @agent 就能调 Codex 或 Claude Code。 开源方案,把 Slack 和 GitHub 里的 @agent 提及路由到 CodexClaude Code,结果直接回到对话线程里。不想用平台方的私有 Agent 集成?自己部署一个 OpenTag。(136 likes | 16 RTs) 详情 →


🎓 模型小课堂

Compute-Optimal Training(Chinchilla Scaling):2022 年 DeepMind 的 Chinchilla 论文给出了一个影响深远的结论 — 给定固定算力预算,模型参数量和训练数据量应该等比例缩放。这直接改变了整个行业的训练策略,从"堆参数"转向"数据和参数一起堆"。但今天 Lilian Weng 的深度分析揭示了一个被忽略的问题:Chinchilla 的幂律假设了均匀的数据质量和固定的评估方式,而在 frontier 级别的训练中,数据质量差异、混合比例选择和评估方法本身都会让 scaling law 的预测偏移。当单次训练预算突破 10 亿美元,你不能再简单外推了。


⚡ 快讯

  • MCP TypeScript SDK:发布 server-legacy 包,冻结 v1 SSE 传输和 OAuth,给 MCP v2 迁移提供干净的过渡路径。 链接
  • Claude Code v2.1.190:v2.1.187 和 v2.1.193 之间的稳定性修复版本。 链接
  • Google Finance:退出 beta,发布新 Android App。 链接

🎯 今日精选

Lilian Weng 的 Scaling Laws 深度拆解 — 驱动千亿美元训练投资的共识正在裂开:过去三年,整个 AI 行业的训练预算决策建立在一组 scaling law 之上 — 给够算力和数据,模型就会按幂律变强。但 Weng 的这篇综述系统性地指出了这个框架的断裂点:数据质量不均匀、混合比例选择、评估方法的主观性,每一个都能让"compute-optimal"的定义漂移。当 frontier 训练从 1 亿美元跳到 10 亿美元,简单的 Chinchilla 外推不再可靠。这不是说 scaling laws 没用 — 而是说我们对它的理解需要升级。对于任何在做训练预算决策的团队,这篇文章是新的必读参考。 详情 →


下期见 ✌️