跳到主要内容

AI Builders Digest — 2026-06-08

新产品

本周值得关注的 AI 新产品和开源项目:

  • Lowfat — 可插拔的 CLI 过滤器,号称能为 LLM 调用节省 91.8% 的 token 消耗。通过智能过滤无用输入,显著降低 API 成本。[HN 151👍]

  • Lathe — 利用 LLM 学习新领域而非跳过它。独特的教育理念:让 AI 帮你深入理解一个领域,而不是代替你走捷径。[HN 247👍]

  • Sidekick — 基于 Zot(Zed 的编码 agent)的 macOS 编码 agent,一键访问。轻量级 AI 编程助手,聚焦本地快速响应。[HN 12👍]

  • YourMemory — 将 agentic memory 视为剪枝问题而非囤积问题。聪明的记忆管理思路 —— 忘记什么和记住什么同样重要。[HN 19👍]

  • Jo — AI 原生编程语言,在编译期捕获 prompt injection。从语言层面解决 AI 安全痛点,设计思路非常独特。[HN 10👍]

  • Lessons from running Claude Code swarms at scale — 大规模运行 Claude Code agent swarm 的经验帖,涉及任务分发、并发控制、成本管理等实操踩坑分享。[HN 10👍]

  • Ccgs – Collaborative Claude Code sessions in Git — 在 Git 分支中协作 Claude Code 会话的 CLI 工具,允许多人共享和版本化管理 AI 编码会话。[HN 6👍]

  • Sub-Agent MCP — 通过 MCP 协议实现 LLM 子 agent 编排和任务委派的工具,面向复杂的多 agent 协作场景。[HN 6👍]


博客精选

Anthropic Engineering

  • How We Contain Claude — Anthropic 分享如何安全地"约束"Claude,包含安全架构、沙箱设计和红队测试的实践经验。对于理解大模型安全部署非常有参考价值。

  • Managed Agents — 如何管理和编排 AI agent 的技术实践。探讨 agent 生命周期管理、任务分配、监控回滚等工程层面的挑战。

  • Claude Code Auto Mode — Claude Code 的自动模式技术详解,包括决策机制、执行流程和安全边界。深入了解 coding agent 的自动化工作方式。

  • Building a C Compiler — Anthropic 用 Claude 构建 C 编译器项目的工程复盘,展示 LLM 在系统编程方面的实际能力边界。

  • Demystifying Evals for AI Agents — AI agent 评估方法论的深度梳理,涵盖基准设计、评估指标和结果解读,对想要构建 agent 系统的人很有帮助。


开发者动态

  • Swyx (builder, cognition/temporal 关联): 观察到研究论文 alpha 和实验室发表几乎"死亡"的现象——研究者发现与其和营销部门斗争,不如直接离职创业,利用加州的非竞业禁令保护自己的隐性知识拿到 >$100M 融资。

  • Peter Yang (Product at Roblox): "agentic coding crack 比打游戏还上瘾"——他对 Codex 等工具的沉迷感同身受。同时吐槽 Codex 的线程管理急需改进,希望能按"等待审批"和"正在工作"来过滤和排序。

  • Madhu Guru (前 Google Gemini/Veo 产品负责人): 模型路由是一个真实难题——需要针对具体任务对模型做基准测试,在质量和成本之间找到平衡点。而这个困难本身也蕴含着巨大的机会。

  • Aaron Levie (Box CEO): Token 成本已经成为企业级客户最关心的话题之一。这对 AI 行业是强烈看多信号——说明 AI 系统正以从未预料到的规模被实际使用。

  • Garry Tan (YC CEO): 澄清 Paxel 的隐私策略——代码文件内容不会上传云端,但其他用户数据可能上传。同时表达对本地模型的乐观:随着本地模型越来越好,Paxel 的本地能力会越来越强。

  • Dan Shipper (Every CEO): 从柏拉图《普罗泰戈拉篇》的 techne(技艺)与 aidos/dike(敬畏与正义)的界限讨论,联想到 LLM 的意识问题。金句:"LLMs are not conscious. LLMs are not not conscious. Both true."


播客精选

Unsupervised Learning Ep 89: AI Research Legend's Honest Assessment of Where We Are — Lucas Kaiser

The Takeaway: Transformer 论文合著者 Lucas Kaiser 提供了对当前 AI 领域的坦诚评估——transformer + reasoning + agents 的组合已经远超预期,但"学习"这个根本问题可能仍未解决。

Lucas Kaiser(Transformer 论文作者之一,曾在 Google 和 OpenAI 担任核心角色)在接受 Unsupervised Learning 采访时坦率评价了当前 AI 的状态。他每天花数小时与 Codex 对话,称 agent 是他过去 20 年 ML 研究生涯中最大的工作方式变革——量化来看,复现一篇论文的时间从三周缩短到两天。

他的核心观点是:transformer 在 scaling law 下表现出惊人的能力,但从"学习"的根本角度看,它仍然需要万亿级别的 token 才能习得人类从小样本就能掌握的概念。他形容说:"LLM 会学到概念,但会在穷尽所有其他选项之后才学——而人类不是这样学习的。"

关于推理(reasoning),他认为这确实带来了质变——Codex 能和他讨论高等数学、解决数学研究问题,"我从没想过在这个时间尺度上能有一台计算机像真正的研究者一样和我讨论数学。这太疯狂了。"但当他作为 ML 研究者回看,又觉得"我们还没有真正解决学习这个问题"。

他对编码 agent 的实际生产力改观:不仅仅是 5-10 倍的加速,更重要的是改变了工作节奏——他可以同时启动三个实验并行推进。他提到一个有趣的副作用:因为不再需要看每个类名和函数细节,反而让他能更专注于"机器学习层面的全局思考"——损失函数、batch 策略、整体架构,这使他的思维比以往更清晰。

他也坦诚了局限:把 agent 丢到后台跑一夜让它改进模型,结果是"它会开始做一些非常 trivial 的 tweak";而它有时会擅自添加看似合理但多余的 loss。他把这种工作方式形容为"研究者的轻度精神病"。

对于未来,他看好后 transformer 架构的研究方向(多个实验室在探索),但认为 attention 机制大概率会保留。他提到 Waymo 在处理施工区域的泛化失败案例——人类少年轻松搞定的事 AI 至今做不到——暗示物理世界中"数据有限"的问题才是真正瓶颈。

收听完整播客


Generated through the Follow Builders skill: https://github.com/zarazhangrui/follow-builders