NewsletterBlogLearnCompareTopicsGlossary
English
LAUNCHINSIGHTTOOLTECHNIQUERESEARCHBUILD

20 条资讯

GPT-5.6「Sol」预览来了 — 下半年的基准线就是它

🧠 发布动态

GPT-5.6「Sol」预览来了 — 下半年的基准线就是它。

OpenAI 放出下一代 frontier 模型 GPT-5.6 的预览。虽然完整跑分还没出,但从 OpenAI 自家内部使用数据看(Research 部门 AI 输出量暴涨 56 倍),他们显然已经在用更强的东西了。对开发者来说,现在该做的不是等跑分,而是开始规划集成策略 — 因为这次拿到 API 可能没那么容易(详见下方行业洞察)。 详情 →

Anthropic 统一 Claude API 限速 — Sonnet 和 Haiku 终于不再是二等公民。

重大调整:SonnetHaiku 的速率限制现在和 Opus 完全一致,付费层级从五档简化为三档(Start、Build、Scale),大部分组织自动升级。翻译成人话:你用便宜模型跑生产不再被限速卡脖子了。之前因为限速被迫选更贵模型的团队,现在可以重新算账。 详情 →

DeepReinforce 发布 Ornith-1.0 模型家族。 9B / 35B / 397B 三个规格同时上线 HuggingFace,9B 已有 GGUF 可本地跑。35B 是本地部署的甜蜜点 — 性能够用、显存可控。开源模型生态又多了一个值得测试的选手。(118 likes | 1.0K downloads) 详情 →

Liquid AI 推出 LFM2.5 — 230M 参数的超小模型。 8300+ 次下载说明市场对边缘推理的需求是真实的。230M 参数意味着这东西能跑在手机、IoT 设备甚至微控制器上。如果你在做端侧 AI,这个模型值得评估。(112 likes | 8.3K downloads) 详情 →


💡 行业洞察

美国政府将决定谁能用 GPT-5.6 — 商业 AI 模型首次设国家级门槛。

这条是今天真正的大新闻。OpenAI 确认 GPT-5.6 的用户需要经过美国政府审核,这是主流商业模型第一次实施国家级准入控制。不是出口管制,是连国内使用都要审。对全球开发者的影响:frontier 模型正在从"付费即用"变成"资格审查"。(744 likes | 860 RTs) 详情 →

Anthropic 的 Mythos 获批向"可信伙伴"开放。 美国政府批准 Anthropic 将 Mythos 模型提供给经过审查的国内合作伙伴。和 GPT-5.6 的准入控制放在一起看,模式已经很清楚了:frontier 模型正在走军工产品的分发路径。对中国开发者来说,这意味着最强模型的 API 可能会越来越难拿到,押注国产模型和开源方案的理由又多了一个。(101 likes | 44 RTs) 详情 →

OpenAI 内部 AI 使用量爆炸式增长。 自 2025 年 11 月以来,Research 部门的 AI 输出 token 中位数增长了 56 倍,客服 32 倍,工程 27 倍,法务 13 倍。这不是"我们在用 AI"的 PR 稿 — 这是 AI Agent 从实验品变成核心基础设施的硬数据。如果你的团队 AI 使用量还在线性增长,可能需要反思工作流了。 详情 →

2026 年开源模型 vs 闭源模型的真实差距。 Doubleword AI 做了一份详细分析,结论是:在通用推理和编码上差距在缩小,但在 Agent 能力和长上下文可靠性上,闭源模型仍然领先明显。考虑到 GPT-5.6 和 Mythos 都开始设准入门槛,开源模型的战略价值只会越来越高。(87 likes | 73 RTs) 详情 →


📝 技术实战

2000 人围攻 Simon Willison 的 AI 助手 — 攻击图谱全公开。

Simon Willison 放出了他让 2000 人红队攻击自己 AI 助手的详细结果。不是理论分析,是真实的攻击模式分类 + 防御策略。每个在做 AI 对外产品的开发者都该读 — 你的用户里一定有人会尝试这些招数。 详情 →

CVE-2026-LGTM 事后复盘:AI 安全在生产环境翻车实录。 同样来自 Simon Willison 的深度复盘,把一个真实的 AI 安全漏洞从发现到修复完整拆解。抽象的"AI 安全"在这里变成了具体的时间线、代码和决策。检查你自己的系统有没有类似模式。 详情 →

2026 年的 GPU 编程课 — 专为 ML 系统设计。 MLC.ai 出品,覆盖推理和训练优化中真正用到的 kernel 和内存模式。不是泛泛的 CUDA 入门,是面向 ML 系统工程师的实战教程。下次做推理优化前先看看。(55 likes | 8 RTs) 详情 →


🔧 开发者工具

WorkWeave 开源模型路由器:直接嵌入 Claude CodeCodexCursor 的智能模型选择器 — 根据任务自动切换最优模型,不需要改工作流。HN 上几小时内 133 赞。如果你同时用多个 AI 编码工具,这个值得试。(133 likes | 85 RTs) 详情 →

Claude Code v2.1.195 更新:新增 CLAUDE_CODE_DISABLE_MOUSE_CLICKS 全屏模式控制,修复了 hook 匹配器对连字符标识符(如 code-reviewermcp__brave-search)的子串误匹配问题,macOS 语音输入也修了。如果你在用自定义 hook,务必检查匹配规则。 详情 →


🏗️ 值得一试

Lemma Platform:开源的人机协作工作空间,定位是在单个 AI 编码 Agent 之上加一层团队协作层。GitHub 上 110 星,热度在涨。适合想让多个 Agent 协同工作的团队试水。(110 likes | 27 RTs) 详情 →

GITVERSE:把任意代码仓库逆向工程成架构分析 + AI 可读的重建提示词。用途很直接 — 让 Agent 快速理解陌生代码库,或者生成可移植的项目蓝图。(98 likes) 详情 →


🎓 模型小课堂

能力阈值(Capability Thresholds):今天 GPT-5.6 和 Mythos 都需要政府审批才能分发,背后的核心概念就是"能力阈值" — 当一个 AI 模型的能力超过某条看不见的线,就会触发监管干预。这条线在哪?目前没有公开标准,但从今天的新闻看,它大概在"能自主完成复杂任务"附近。对开发者来说,理解这些阈值在哪,决定了你的产品能不能拿到 frontier 模型的 API。这不再是技术问题,而是合规问题。


⚡ 快讯

  • Vercel AI SDK v6.0.213:新增 generateAudio 一等公民支持,音频生成和文本、图像统一接口。 链接
  • langchain-anthropic v1.4.8:修复流式输出中 content_block_start 事件丢失首段文本的 bug,生产环境用流式的赶紧更新。 链接
  • llama.cpp b9820:优化多 GPU 推理同步策略,减少 CUDA 分布计算中的同步等待。 链接
  • CrewAI 1.15.1a1:修复 Agent 抓取外部 URL 时的 SSRF 重定向绕过漏洞,安全相关,尽快更新。 链接
  • IEEE Spectrum:AI 正在迫使数学界面对认识论难题 — 当 AI 能生成证明但人类无法完全理解时,什么才算"理解"?(8 likes | 4 RTs) 链接

🎯 今日精选

美国政府给商业模型设门槛 — 这不是个案,是分发体系的根本转变:GPT-5.6 需要政府审核用户资格,Mythos 只对"可信伙伴"开放。把这两条放在一起,你看到的不是两家公司的个别政策,而是一个新分发范式的诞生。Frontier 模型正在从"付费即用的 SaaS"变成"按资质分级的受控资源"。这意味着什么?全球 AI 市场将按地理位置和安全等级分层,每个开发者都需要为"你的产品能不能访问最强模型"做预案。押注单一闭源供应商的风险在急剧上升,开源和国产模型的战略价值被重新定价。对中国开发者而言,这个趋势更值得警觉 — 当 frontier 模型有了"边境管制",你的技术栈需要 Plan B。 详情 →


下期见 ✌️