Simon Willison 发布 condense-json 1.0,专治上下文窗口不够用
🔧 开发者工具
Simon Willison 发布 condense-json 1.0,专治上下文窗口不够用。
往 LLM 塞结构化数据的都知道痛点 — JSON 太啰嗦,token 烧得快。condense-json 的思路很直接:把 JSON 压缩成更紧凑的格式再喂给模型,读起来一样,token 少一大截。Simon Willison 出品,实用性有保障。如果你的 pipeline 里有大量 JSON 进上下文窗口的场景,今天就值得试一下。 详情 →
🔬 研究前沿
Laguna S2.1、Inkling、Kimi K3 集体改写开源模型格局。
Interconnects 的 Nathan Lambert 画了一张图,结论很清楚:开源/开放权重模型正在逼近帕累托前沿(Pareto Frontier),而且不是一家在冲,是三家同时到位。Laguna S2.1 在推理效率上表现突出,Inkling 走的是通用路线,Kimi K3 则在中文场景有明显优势。真正的信号不是哪个模型最强 — 而是训练出有竞争力模型的能力正在从 Big 3 向外扩散。选模型这件事,"谁最好"永远是错误的问题,"你愿意接受哪些取舍"才是。 详情 →
💡 行业洞察
联邦法官驳回 xAI 请求,明尼苏达"脱衣 AI"禁令站稳了。
xAI 试图用第一修正案挑战明尼苏达州的 AI 深伪脱衣应用禁令,结果法官不买账 — 禁令维持。这个判决的意义远超一个州:它证明了州级 AI 内容监管能扛住宪法挑战,而且其他州正在看着。在联邦层面迟迟无法就 AI 立法达成共识的当下,各州正在悄悄拼出一张监管拼图。如果你的产品涉及 AI 生成内容,现在就该追踪你所在州的待审 AI 法案。 详情 →
📝 技术实战
"哈布斯堡青蛙":一个暴露模型真实差异的个人基准测试:让模型画一只"带哈布斯堡下巴的青蛙"SVG — 听起来是搞笑,但实测下来出奇地有用。这个 prompt 同时考验空间推理、指令遵循和创意理解,不同模型的差异一目了然。比起看排行榜上的抽象分数,这种"个人基准"反而能快速告诉你一个模型到底行不行。下次评估新模型,不妨先让它画只青蛙。(83 likes | 42 RTs) 详情 →
🎓 模型小课堂
帕累托前沿(Pareto Frontier):想象你在选手机 — 续航和轻薄不可兼得,你能做的是在"续航最好的轻薄机"和"最轻薄的长续航机"之间选一个最优解。把所有最优解连成一条线,就是帕累托前沿。在模型评估里也一样:把成本、速度、准确率画在一张图上,落在帕累托前沿上的模型意味着"在不牺牲某项指标的前提下,没有别的模型能全面超越它"。今天提到的 Laguna S2.1、Inkling、Kimi K3 就是在这条曲线上各占一席 — 没有绝对最好,只有最适合你的取舍。
⚡ 快讯
- AI 公开信追踪器:Simon Willison 梳理了这几年所有关于 AI 发展的公开信,哪些真的推动了变化,哪些只是行为艺术,一目了然。签下一封之前先看看。 链接
- Hank Green 坦言 AI 使用"不健康":这位知名 YouTuber 公开承认自己对 LLM 产生了类似成瘾的依赖 — 这是目前最高调的"AI 依赖症"自白。 链接
- AI 海报再夺俄亥俄州博览会冠军:2022 年科罗拉多事件后,大家以为比赛规则会跟上 — 并没有。(65 likes | 38 RTs) 链接
🎯 今日精选
明尼苏达禁令存活,州级 AI 监管正在拼出联邦做不到的拼图:xAI 的第一修正案挑战失败,表面上看是一家公司输了一场官司,但深层信号更值得关注。在联邦层面,民主党和共和党在 AI 监管上几乎没有共识,立法遥遥无期。但各州没在等 — 明尼苏达、加州、科罗拉多已经各自出手,而且法庭正在给这些州法背书。讽刺的是,xAI 的挑战可能反而强化了它试图推翻的先例。对 AI 公司来说,现实很清楚:你面对的不是一部联邦法律,而是 50 个州各自画的红线。合规成本在上升,而且会继续升。 详情 →
下期见 ✌️