跳到主要内容

AI Builders Digest — 2026-06-23

🧠 模型发布

GLM-5.2 — Z.ai(原 Zhipu AI)开源 753B 参数编码专用模型,采用 MIT 许可证。支持 1M token 上下文窗口,专为长时间编码 agent 场景设计——大型代码库处理、多步骤工程任务、扩展推理会话。新增 High/Max 两级思考力度控制。API 成本仅为 GPT-5.5 的 1/6,可自由自托管,无区域限制。可用性: 开源(MIT),权重已发布至 Hugging Face。评价: 在美国限制 Anthropic Fable 5 海外访问的同一周发布,成为非美国开发者最现实的替代选择。

Sakana Fugu — 东京 Sakana AI Labs 发布多模型编排系统 Fugu,不追求单一模型最大,而是通过一个指挥模型协调多个专家模型(含第三方 frontier LLM)协同工作。Fugu Ultra 在 SWE-Bench Pro 上达到 73.7 分,接近 Anthropic Fable 5 水平。通过单一 OpenAI 兼容 API 接入,开发者无需重构现有应用。可用性: API 访问,暂不支持 EU/EEA。评价: 多模型路由架构或许比单一更大模型更具战略价值——天然规避 vendor lock-in 和出口管制风险。

🔥 新产品发现

Oak — 专为 AI agent 设计的 Git 替代品,支持更自然的 agent 协作工作流 [HN 148👍 142💬]

Recall — Claude Code 本地项目记忆工具,让 agent 跨会话记住项目上下文 [HN 127👍 81💬]

OpenMontage — 全球首个开源 agentic 视频制作系统,12 条 pipeline、52 个工具、500+ agent 技能,将 AI 编码助手变为完整视频工作室 [GitHub Trending 2938⭐]

Palmier Pro — AI 原生的 macOS 视频编辑器 [GitHub Trending 2463⭐]

Codebase Memory MCP — 高性能代码智能 MCP 服务器,将代码库索引为持久知识图谱,支持 158 种语言,毫秒级查询,单静态二进制零依赖 [GitHub Trending 1185⭐]

mattpocock/skills — 来自 TypeScript 专家 Matt Pocock 的实战技能集合,直接取自他的 .claude 目录 [GitHub Trending 2051⭐]

ByTedance Deer Flow — 字节跳动开源的长周期 SuperAgent 框架,集成沙箱、记忆、工具、技能、子代理和消息网关,可处理分钟到小时级的复杂任务 [GitHub Trending 738⭐]

Garry Tan's GStack — YC CEO Garry Tan 公开自己的 Claude Code 配置:23 个定制工具,涵盖 CEO、设计师、工程经理、发布经理、文档工程师、QA 等多个角色 [GitHub Trending 573⭐]

Laguna by Poolside — Poolside 发布的 foundation model,专为 agentic coding 和长周期开发任务设计 [PH]

📰 博客更新

OpenAI News(6月22日)

  • Daybreak: Tools for securing every organization in the world — OpenAI 推出 Daybreak 网络安全计划,发布完整版 GPT-5.5-Cyber(CyberGym 85.6% SOTA)、Codex Security 插件更新、Daybreak 合作伙伴计划。核心观点:AI 已改变安全领域,瓶颈从「发现漏洞」转向「修补漏洞」。Codex Security 已扫描 3000 万+ commits、30000+ 代码库,7 万+ 发现被人工标记为已修复。

  • Patch the Planet — 与 Trail of Bits 合作的开源安全计划,为 cURL、Go、Python、Sigstore、pyca/cryptography 等 30+ 开源项目提供 AI 辅助漏洞发现和补丁开发。Trail of Bits 工程师用 Codex 在不到一天内构建了完整的 fuzzing lab(手动需数周)。

Anthropic Engineering

  • Scaling Managed Agents — Anthropic 详解 Managed Agents 架构设计:将 agent 解耦为 session(追加日志)、harness(循环调用 Claude 并路由工具调用)、sandbox(执行环境)三个组件,类比操作系统虚拟化硬件的思路。关键洞察:harness 编码的模型能力假设会随模型升级而过期(如 Sonnet 4.5 有 context anxiety 而 Opus 4.5 没有),因此接口设计比实现更重要。

  • Harness design for long-running apps — 受 GAN 启发设计 generator + evaluator 多 agent 结构,解决「AI 自评不可靠」(模型总是自信称赞自己的平庸输出)问题。三 agent 架构(planner、generator、evaluator)可在多小时自主编码中产出高质量全栈应用。

  • Claude Code auto mode — 用户批准 93% 的权限提示,auto mode 用双层分类器(输入层 prompt injection 扫描 + 输出层基于 Sonnet 4.6 的 transcript 分类器)替代人工审批,在安全性与效率间取得平衡。

🐦 开发者动态

Box CEO Aaron Levie — 高度评价 Sakana Fugu 的多模型路由理念:通过单一 API 将任务分发给最合适的模型处理,自动管理模型选择、委派、验证和合成。Levie 认为这正是大多数应用层 AI 产品构建 agent harness 的方式,而在模型持续创新的当下,路由层将产生巨大价值。另发文指出 agent 将比人类多 100 倍地使用软件,这对数据保护、审计、权限管控提出全新要求。

Vercel CEO Guillermo Rauch — 展示团队对 vercel.com 首页的性能优化成果,"Every frame scrutinized"——从渲染、布局、WebGPU shader 到阻塞脚本全面优化。另分享观点:「Coding agents 会从你身上榨干每一滴 IKEA 效应」,提醒开发者注意自主权被悄悄侵蚀的风险。

YC CEO Garry Tan — 在可用 AGI 到来的 2026 年,个人语境(personal context)的收集比智力本身更重要。「AGI 给你智力,你仍需收集个人上下文才能真正 unlock。」为此开源了 GBrain(个人及公司知识库系统)。

Peter Yang — 转发「HTML 是 agentic 视频制作的基础」观点:agent 没有视觉智能,但 HTML/CSS/JS 是 LLM 的原生语言。通过 HTML 可以承载素材、图片、资产、SVG,从而构建视频 agent。

Peter Steinberger (OpenClaw) — OpenClaw 创始人回应 hype 退潮后的真实状态:质量反而在提升,团队在壮大,作为非营利组织与 VC 背景的竞争对手形成差异化。本周是 OpenClaw 有史以来最强的一周。

Designer Ryo Lu (Cursor) — 在 ryOS 中构建了 Books 应用,从 Cursor mobile 开始,手工调优动画和纹理。支持任意 epub,通过 ryOS 账户同步进度。

Zara Zhang — 防止 AI 生成垃圾内容的经验法则:输入(上下文)长度应是输出的 3-5 倍。如果输入远短于输出,几乎一定会产出 slop。

🎙️ 播客摘要

Training Data: Google DeepMind's Logan Kilpatrick — Why the Model Eats the Harness

Google AI Studio 和 Gemini API 负责人 Logan Kilpatrick 分享了对 AI 发展的深度思考。核心观点:模型能力正在快速超越外围 harness 设计的限制。他引用了一个生动的例子——演讲中有人用 Omni 实时编辑视频,把一只狗加入舞台画面,观众真的朝狗的方向看去并笑了——这种对物理世界微妙理解的表现让 Kilpatrick 感到震撼。他讨论了代理式 AI、AI 编码、世界模型等话题,强调随着 Gemini API 和 Google AI Studio 的发展,开发者正在获得越来越强大的能力。关键洞察:当模型能理解如此细微的上下文和物理直觉时,传统的 prompt 工程和 harness 设计可能会成为瓶颈,而非赋能。