NewsletterBlogLearnCompareTopicsGlossary
English
TOOLINSIGHTTECHNIQUELAUNCHRESEARCHBUILD

18 条资讯

通义千问 3.8 Max 来了:2.4 万亿参数,瞄准编码

🧠 发布动态

通义千问 3.8 Max 来了:2.4 万亿参数,瞄准编码。

阿里云一次性放出两个重磅 — 2.4T 参数的 Qwen 3.8 Max 和针对编码协作优化的 27B 版本,全部开源。Max 版本直接对标 GPT-5 和 Claude,Latent Space 的跑分拆解显示编码任务表现亮眼。2.4T 是什么概念?比大多数闭源模型参数量都大,而且你可以下载。对国内开发者来说,这可能是目前最强的可自部署编码模型。 详情 →

Liquid AI 发布 LFM2.5-2.6B:为你的手机造的 Agent 模型。 只有 2.6B 参数,专为端侧 Agent 部署设计,HuggingFace 上线即拿下 4.7 万次下载。架构上做了大量针对边缘场景的优化 — 如果你在做端侧 AI 产品,这是目前最值得试的小模型之一。(144 likes | 47.4K downloads) 详情 →

Mistral 发布 Shieldstral:3B 开源安全过滤模型。 支持文本和图像的多模态内容审核,小到可以本地部署,当你的 pipeline 的安全护栏用。开源社区终于有了一个不依赖 API 调用的内容过滤方案 — 跑在本地,延迟低,数据不出门。(284 likes | 69 RTs) 详情 →

LG AI Research 发布 K-EXAONE 2.0:750B 参数 MoE,活跃参数仅 37B。 韩国 LG 正式进入前沿模型竞赛 — 这是一个非美国实验室交出的 frontier 级模型,信号很明确:大模型研发正在全球化。750B 总参数听着吓人,但 MoE 架构下只有 37B 活跃参数,推理成本远低于同规模稠密模型。(116 likes | 325 downloads) 详情 →


🔧 开发者工具

Anthropic 终于出了 Claude 成本管控指南。

跑 Claude 的团队都该看 — Anthropic 发布了首份完整的成本可视化与控制指南,覆盖用量仪表盘、速率限制、消费告警、组织级管控。不是泛泛而谈,而是具体到怎么设置 spend alerts、怎么在组织层面限制预算。生产环境跑 Claude 的,今天就对照检查一遍你的消费设置。 详情 →

Interconnects 上线开源模型采用率仪表盘。 哪些开源模型真的有人在用,哪些只是跑分好看?Interconnects 的公开仪表盘追踪下载量、部署量、社区 fork 数,给了生态一个数据驱动的视角。选模型别只看排行榜,看看真实采用率。 详情 →


💡 行业洞察

Latent Space 拆解 ChatGPT Work 到底怎么运作的。

这是目前最详细的外部拆解 — Memory(记忆)、Proactivity(主动性)、Scheduling(定时任务)、Browser Use(浏览器操作)、Plugins、Skills and Tools,六大模块逐一拆开。核心发现:OpenAI 的护城河不是模型质量,而是把聊天机器人变成"持续在线的同事"的编排层。每个在做 Agent 产品的团队都该认真研究这套架构,别自己从零造轮子。 详情 →

谷歌 2026 年 7 月 AI 大事记:一文补完你错过的一切。 模型更新、产品发布、研究里程碑全部打包 — 当参考文档用,扫一遍看看有没有漏掉的。 详情 →

国际刑警组织:AI 已驱动非洲超过一半的网络犯罪。 语音克隆、深伪诈骗、自动化钓鱼 — 规模已经超出执法能力。这不是"未来的担忧",是正在发生的事。做安全的、做 AI 治理的,这组数据值得存档。(108 likes | 52 RTs) 详情 →


📝 技术实战

35.3 万人上了谷歌的免费 AI Agent 课程 — 他们造了什么?

Kaggle 的 AI Agents Intensive 吸引了 35.3 万学习者 — 谷歌公开了课程结构、完成率和学员实际构建的项目。这个规模本身就是信号:Agent 开发正在从小众技能变成主流技能。课程材料免费,值得扫一遍看看有没有你能用的。 详情 →


🔬 研究前沿

当跑分失效:基准测试饱和的系统性研究。 这篇论文系统记录了主要 AI 基准测试如何在模型进步中丧失区分能力 — 并提出了检测基准何时"过期"的指标。下次看到"新 SOTA"的公告,先问一句:这个 benchmark 还有效吗?(72 likes | 78 RTs) 详情 →

三值化 20B MoE 模型在 iPhone 上跑出 120 token/s。 Deep Grove 的 Maple-Preview 用三值权重(ternary weights)把一个 20B 的混合专家模型塞进了 iPhone — 120 token/s 的速度已经完全可用。端侧推理到达有用模型规模的速度比预期快得多。(31 likes | 10 RTs) 详情 →

OpenAI 精选十大数学与理论计算机科学突破。 涵盖优化、复杂度理论、算法设计中与 ML 相关的最新进展 — 快速扫一遍,看看有没有跟你领域相关的。HN 389 赞,质量有保证。(389 likes | 673 RTs) 详情 →


🏗️ 值得一试

MiniMax H3 现在可以在 Mac 上本地跑了。 Simon Willison 介绍了 PipeNetwork 的 MLX 移植版 — Apple Silicon 用户不需要云端 GPU 就能跑这个开源视频模型。 详情 →

MiniMax H3 生态爆发:ComfyUI、GGUF、INT8 全到齐。 Comfy-Org 的 ComfyUI 集成拿下 440 赞,GGUF 量化版 4 万次下载,INT8 变体也已就位 — 社区正在把 H3 变成覆盖各种硬件的生产级方案。按你的显存挑一个版本开干。(440 likes | 40.0K downloads) 详情 →


🎓 模型小课堂

活跃参数 vs. 总参数:MoE 模型为什么"虚胖"? 今天发布的 K-EXAONE 有 750B 总参数但只有 37B 活跃参数,千问 Max 2.4T — 这些数字到底什么意思?混合专家模型(Mixture-of-Experts,MoE)把参数分成很多组"专家",每次推理只激活其中一小部分。想象一家有 100 个员工的公司,每个项目只需要 5 个人干活 — 你有 100 人的知识储备,但只付 5 个人的工资。这就是为什么 750B 的 MoE 模型能跑在连稠密 70B 都吃不消的硬件上,也是为什么"参数量"越来越不能直接等于"能力"或"成本"。


⚡ 快讯

  • OpenAI 公开第三方网络安全评估结果:独立安全评估的透明化先例,值得其他 frontier 实验室跟进。(31 likes | 2 RTs) 链接
  • Simon Willison 翻出 Steve Yegge 的一段话:关于平台思维的经典论断,放在今天的 AI 语境下依然精准。 链接
  • Palantir 季度利润破 10 亿美元,CEO Karp 称 AI 行业是"马克思主义的":商业包装成哲学 — Palantir 在把自己定位为"企业信得过的 AI 替代方案"。 链接

🎯 今日精选

Latent Space 拆解 ChatGPT Work — OpenAI 的真正护城河不是模型,是编排层:这篇拆解文章值得每个做 Agent 产品的人仔细读。ChatGPT Work 的架构分为六大模块 — Memory(跨会话记忆)、Proactivity(主动触发)、Scheduling(定时任务)、Browser Use(浏览器操作)、Plugins(插件)、Skills and Tools(技能与工具)。核心洞察是:把聊天机器人变成"持续在线的同事",靠的不是更强的模型,而是让模型记住你、主动找你、按时干活的编排系统。这套架构设计让 ChatGPT 从"你问我答"进化成了"帮你盯着、替你跑腿"。每个在造 Agent 的团队都该研究这份拆解,别急着自己发明轮子 — OpenAI 已经趟过的坑,没必要再趟一遍。 详情 →


下期见 ✌️