Gemini 3.5 Flash 也能操控电脑了 — Flash 级定价改变了算术题
🧠 发布动态
Gemini 3.5 Flash 也能操控电脑了 — Flash 级定价改变了算术题。
Google DeepMind 把 computer use 能力带到了最快的模型上。之前 computer use 只在 Claude 和 Gemini Pro 级别可用,现在 Flash 级定价意味着 agentic 桌面自动化的成本直接降了一个数量级。对开发者来说,这不只是"又多了个选择" — 而是原来 ROI 算不过来的自动化场景突然可行了。去试试 API,跟 Claude computer use 对比一下延迟。 详情 →
OpenAI 发布首颗自研芯片,Broadcom 代工。
继 Google TPU、Amazon Trainium 之后,OpenAI 正式加入自研芯片阵营。和 Broadcom 合作的这颗芯片目标很明确:降低对 NVIDIA 的依赖,从根上压低推理成本。短期内不会影响 API 定价,但信号很清楚 — AI 大厂都在把算力供应链攥在自己手里。关注后续 OpenAI API 的价格变动。(463 likes | 296 RTs) 详情 →
Krea 2 发布:12B 开源图像模型,小身板大能量。 Krea 放出 12B 参数的开源权重图像模型,Turbo 和 Raw 两个版本已上 HuggingFace(878+ 下载)。跑分声称 SOTA,关键是完全可自托管 — 不想被闭源图像 API 绑定的团队,去 HuggingFace 拉下来跑个对比。(323 likes | 35 RTs) 详情 →
Qwen AgentWorld:35B MoE,只激活 3B 参数。 Qwen 专门为 Agent 任务训练的 MoE 模型,35B 总参数但只激活 3B — 意味着消费级显卡就能跑,同时在工具调用和规划能力上可能不输大模型。做 Agent 的团队,值得拿来和你现有的 backbone 模型对比一下。(140 likes | 223 downloads) 详情 →
💡 行业洞察
Anthropic 公开了人机协作的实战手册。
不是泛泛而谈"AI 会取代人类吗",而是具体到:怎么设计工作流让 Agent 和人各干各的强项? Anthropic 把自己内部的 Human-Agent Team 设计框架发出来了 — 包括任务分工原则、反馈回路设计、失败模式处理。正在把 Claude 部署到生产环境的团队,这是必读材料。 详情 →
Qualcomm 收购 Modular — 连 Mojo 语言一起买了。 Qualcomm 拿下 Modular(Mojo 语言和 MAX 推理平台的创造者)。这不只是买一个推理引擎 — 而是把唯一一个有可能挑战 C++ 成为设备端 AI 系统语言的选手收入囊中。边缘推理的格局可能因此改写。用 Mojo 或 MAX 的团队,评估一下这次收购对你的影响。(115 likes | 29 RTs) 详情 →
Databricks CTO:每家公司都需要自己的 Agent Cloud。 Databricks 的 CTO Matei Zaharia 和联合创始人 Reynold Xin 做了一期罕见的双人深度访谈,核心观点:开放生态会赢,每个企业最终都需要一套自己的 Agent 云基础设施。做企业 AI 数据栈的,去听里面的架构模式。 详情 →
AI 实验室在招哲学家 — 不是为了 PR。 《经济学人》报道,各大 AI 实验室正在加速招聘哲学背景的人才,方向是对齐、政策和模型行为。这说明当前最难的问题不是算力和工程,而是概念性的 — 什么该做,什么不该做,边界在哪里。(110 likes | 102 RTs) 详情 →
🔧 开发者工具
Claude Code 新增 /rewind — 上下文重置也能后悔了。 v2.1.191 加入 /rewind 命令,可以恢复到 /clear 之前的对话状态。对长时间编码会话来说,这就是上下文管理的 Ctrl+Z。另外修复了后台 Agent 被停止后又复活的 bug — 跑多 Agent 工作流的一定要更新。 详情 →
Anthropic Python SDK v0.112.0:system.message 流式事件支持。 开发者现在可以在流式响应中接收系统级消息。另外修复了 memory 工具的父目录创建问题 — 用持久化记忆功能的 Agent 要注意更新。 详情 →
📝 技术实战
NeMo AutoModel:多卡训练最烦的部分被干掉了。 NVIDIA 和 HuggingFace 联合发布 NeMo AutoModel,自动选择最优的并行策略(张量/流水线/数据并行)。以前多 GPU 微调最痛苦的是手动配置并行参数,现在 AutoModel 帮你搞定。下次微调任务试试,对比一下配置时间。 详情 →
NVIDIA 45°C 液冷方案:数据中心用水量降到接近零。 NVIDIA 公开了一套液冷架构,运行温度 45°C,几乎不消耗水资源。这直接解决了 AI 数据中心扩张的最大环境争议 — 很多新 GPU 集群的审批就是卡在用水问题上。做基础设施的团队,转给你们的 infra 同事看看。(144 likes | 106 RTs) 详情 →
🔬 研究前沿
FFASR 排行榜:语音识别终于要在真实场景下比了。 HuggingFace 推出新的 ASR(自动语音识别)基准测试,聚焦真实世界条件 — 噪音环境、口音、领域专业术语。之前的 ASR 评测都是录音棚级别的干净音频,现在终于有标准化的方式来比较真实场景表现了。去看看你用的 ASR 服务排第几。 详情 →
🏗️ 值得一试
RubyLLM:Ruby 终于有自己的全能 AI SDK 了。 统一接口对接 Claude、GPT、Gemini 等主流模型 — 填补了 Python 和 TypeScript 几年前就解决的空白。HN 上 333 赞说明 Ruby 社区对这个的需求有多强烈。跑 Rails 又不想引入 Python 依赖的团队,去看看。(333 likes | 51 RTs) 详情 →
Tupper:开源的 AI 代码执行沙盒。 在自己的机器上安全运行 AI 生成的不可信代码。解决了一个关键痛点 — 做代码执行 Agent 但不想用或不能用 E2B、Modal 这类云沙盒的团队,现在有了自托管方案。(122 likes) 详情 →
🎓 模型小课堂
Computer Use vs. Tool Use — 两种让 AI "动手"的方式:Tool Use 是结构化的 — AI 通过定义好的 API 调用工具,比如"查天气"、"发邮件",输入输出都是明确的 JSON。Computer Use 则是像素级的 — AI 直接看屏幕截图、移动鼠标、点击按钮,跟人操作电脑一模一样。前者快、稳、便宜,但只能做预定义的事;后者慢、贵、不稳定,但理论上能操作任何软件。Gemini Flash 把 computer use 带到了 Flash 级定价,意味着 agentic 桌面自动化从"技术演示"变成了"经济上可行" — 大规模自动化那些没有 API 的老系统,成本终于算得过来了。
⚡ 快讯
- Anthropic TS SDK v0.106.0:TypeScript SDK 同步支持 system.message 流式事件,与 Python SDK 保持功能对齐。 链接
- OpenAI Node SDK v6.45.0:新增
afterCompletionhook,可在工具调用循环后注入日志、缓存等逻辑。 链接 - CrewAI 1.14.8a4:修复技能包解压时的符号链接路径穿越漏洞,用 CrewAI Skills 的立刻更新。 链接
- llama.cpp b9784:Qualcomm Hexagon DSP 大重构 — 32×32 分块权重重排、核参数融合,骁龙设备推理速度显著提升。 链接
🎯 今日精选
Qualcomm 收购 Modular — 买的不是推理引擎,是边缘 AI 的未来筹码:表面上看,Qualcomm 买了一个 AI 推理优化平台。但仔细想想 — Modular 的 Mojo 语言是目前唯一一个有可能在设备端 AI 领域挑战 C++ 地位的系统级语言,而 MAX 平台是少数能跨硬件统一推理部署的方案。Qualcomm 这一手,不只是补自己的推理能力短板,而是在押注一个判断:AI 计算正在从云端向终端迁移,谁掌握了设备端的编程语言和推理栈,谁就掌握了下一个十年的基础设施话语权。 结合今天 llama.cpp 对 Hexagon DSP 的大幅优化,骁龙平台上的 AI 推理生态正在快速成型。对开发者来说,如果你还没关注边缘推理,现在该开始了。(115 likes | 29 RTs) 详情 →
下期见 ✌️