NewsletterBlogLearnCompareTopicsGlossary
English
LAUNCHTECHNIQUEINSIGHTTOOLRESEARCHBUILD

20 条资讯

Claude Cowork 告别桌面端,随时随地开干

🧠 发布动态

Claude Cowork 告别桌面端,随时随地开干。

你的 Agent 工作流不再被钉在 Mac 上了。Claude Cowork 现在支持网页和移动端 — 会话在云端运行、跨设备保持状态。出门在外用手机检查 Agent 进度,回到工位无缝接上。Max 计划用户优先开放,这是 Anthropic 把 Cowork 从"开发者工具"推向"生产力平台"的关键一步。(Max 计划优先) 详情 →

Google 反击:Gemini API 上线后台 Agent 和远程 MCP。

Google 给 Gemini API 的 Managed Agents 加了三样东西:后台任务执行、远程 MCP 支持、更完善的 Agent 生命周期管理。翻译一下:你可以把 Agent 扔到 Google 的基础设施上跑,不用自己维护长连接和状态管理。Anthropic 有 Cowork,Google 有 Managed Agents — 生产级 Agent 托管现在是多供应商赛道了,选谁取决于你的云归属。 详情 →

Anthropic 带着 Claude Code 和 Cowork 进军政府市场。 不只是卖 API — 是把 Agent 编码和协作能力直接输出给公共部门。继上周 Alberta 网络安全案例之后,Anthropic 的企业/政府路线图越来越清晰:先让政府用上 AI 编程,再用合规优势锁住客户。 详情 →

sqlite-utils 4.0 正式发布,带来完整的数据库迁移。 Simon Willison 那个"$149 让 AI 写的库"从上周的 RC 走到了正式版。4.0 的核心功能是 schema 迁移 — sqlite-utils transform 命令现在能处理列重命名、类型变更、约束修改,不再需要手写 ALTER TABLE 然后祈祷。用 SQLite 做原型的,升级吧。 详情 →


🔧 开发者工具

Claude Code v2.1.203 打磨生产细节。 登录过期预警、手动模式标识、MCP roots/list 改进 — 不是大版本,但跑 Claude Code 生产环境的团队会感谢这些小修。登录快过期时提前告诉你,比突然断掉好太多。 详情 →

HuggingFace 到 SageMaker 一键部署。 以前从 Hub 拉模型到 SageMaker Studio 要手动导出、配置、部署 — 现在一个按钮搞定。评估开源模型的速度直接提了一个数量级。 详情 →


📝 技术实战

Claude Code 官方出了模型和 effort 选择指南。 什么时候用 Opus,什么时候 Sonnet 就够?effort 调到 low 能省多少 token?这篇指南终于把 Claude Code 里那些"玄学调参"变成了有据可依的决策框架。核心建议:探索性任务用高 effort + 强模型,机械重复用低 effort + 快模型。听起来直觉,但很多人一直在用 Opus 跑 lint fix。 详情 →


🔬 研究前沿

Lilian Weng 画出了 AI 自我改进的全景图。

从 I.J. Good 1965 年的"超级智能机器"设想到今天能优化自己训练循环的 AI 系统,Lilian Weng 用一篇长文把递归自我改进(Recursive Self-Improvement)的脉络梳理得清清楚楚。她提出的分类框架覆盖了四种 harness 模式:自我对弈、自我蒸馏、自我修正、自我进化。这不是科幻 — Anthropic 和 Google 都已经在产品里用上了其中的工程模式。必读。 详情 →

AI 在 Cloudflare 密码学库里找到了真 bug。 (70 likes | 9 RTs) ZK Security 团队用 AI 辅助审计 Cloudflare 的 CIRCL 密码学库,发现了人类代码审查漏掉的实现缺陷。不是"AI 找到了一个格式问题" — 是密码学实现层面的真实漏洞。AI 在安全审计领域的价值终于有了硬证据。 详情 →


💡 行业洞察

早期用户揭示 Cowork 哪些工作流真的好用。 Anthropic 发了一篇用户案例集,展示 Cowork 的实际使用模式。有意思的发现:最受欢迎的不是"帮我写代码",而是"帮我理解这个代码库" — 新人 onboarding、遗留系统理解、跨团队知识传递。Cowork 的杀手级场景可能不是生产力,而是认知负载的转移。 详情 →

Latent Space 发布 Fable 终极指南。 (Latent Space) 上周 Fable 5 发布后各路评测满天飞,Latent Space 把散落的反应整理成一篇系统性分析 — 从跑分到实际体验,从定价策略到对竞品的影响。想一篇文章搞懂 Fable 意味着什么,看这篇就够了。 详情 →

"把 AI 自动化掉"的悖论。 (92 likes | 48 RTs) 一篇很有嚼头的文章:当自动化层本身变成瓶颈时,加更多 Agent 不但不能解决问题,反而制造新的复杂性。这是对"什么都加 Agent"共识的冷静反思 — 有时候问题不在模型,在编排。 详情 →


🏗️ 值得一试

Rowboat:本地优先的开源 Claude Desktop 替代品。 (75 likes | 23 RTs) 模型在本地跑,数据不出机器,UI 跟 Claude Desktop 一样好用。适合不能把代码发到云端的团队 — 安全合规要求高的企业终于有了一个像样的选择。 详情 →

rocketplaneIO:不用外传数据的 AI SRE。 (122 likes) 零侵入 eBPF 观测 + AI 诊断修复,BYO-LLM(自带模型),支持离线部署。关键卖点:它能诊断并通过 guardrail 约束的操作修复 K8s 问题,而且全程数据不出集群。跑 K8s 又对数据敏感的,认真看看。 详情 →


🎓 模型小课堂

递归自我改进 Harness(Recursive Self-Improvement Harnesses):Lilian Weng 的论文刚好给了一个解释的窗口。想象你训练了一个 AI,然后让这个 AI 反过来优化自己的训练数据、评估标准、甚至训练方法 — 这就是递归自我改进。"Harness" 是套在外面的工程框架,决定 AI 能改什么、怎么改、改完怎么验证。目前主流有四种模式:自我对弈(AlphaGo 式)、自我蒸馏(大模型教小模型再反哺)、自我修正(跑完 eval 自己改代码)、自我进化(修改自己的目标函数)。Anthropic 和 Google 都在产品里用上了前三种。理解这个框架,就是理解"AI 怎么让自己变得更好"的工程本质。


⚡ 快讯

  • ThinkingCap-Qwen3.6-27B:给 Qwen 3.6 27B 加上结构化推理能力的社区微调,HuggingFace 上 103 likes。(103 likes | 46 downloads) 链接
  • HuggingFace 模型原生跑在 Microsoft Foundry:又一个云厂商把 Hub 做成一等公民模型来源。 链接
  • SkyPilot + HuggingFace 零出口费存储:多云跑 AI 最大的隐性成本被干掉了。 链接
  • Vercel AI SDK v6.0.221 修了 streamText 的超时 bug:之前超时只管初始连接不管整个 step,生产环境的隐形炸弹。 链接
  • 一家咨询公司收 $10K/周 专门删 AI 生成的代码:"AI 技术债"正式成为一门生意。(19 likes | 7 RTs) 链接
  • Cowork Web/Mobile 发布说明确认 Max 计划优先开放:想尝鲜的检查一下你的计划等级。 链接

🎯 今日精选

Lilian Weng 的自我改进分类学揭示:递归自我改进不再是思想实验,而是工程模式。 Weng 在这篇长文里做了一件别人没做过的事 — 把散落在各个论文和工程博客里的自我改进方法整理成一个系统化的分类框架。她的核心论点很清楚:递归自我改进已经从 I.J. Good 的哲学猜想变成了可以工程化实施的模式。结合今天的新闻来看,Anthropic 在 Cowork 里用 Agent 协作实现任务自动改进,Google 在 Gemini API 里上线 Agent 生命周期管理 — 两家都在基础设施层面为这些 harness 模式铺路。掌握了这些模式的团队将获得复利式的能力增长,而其他人还在线性地训练模型。这篇文章是今年目前为止最值得精读的技术博客之一。 详情 →


下期见 ✌️