AI Builders Digest — 2026-07-05
🧠 模型发布
Mistral Leanstral 1.5 — Mistral AI 于 7 月 2 日发布的开源形式化验证模型,基于 119B 参数 MoE 架构(6.5B active),Apache-2.0 许可证,256k 上下文窗口。在 miniF2F 上达到 100% 饱和,解决 587/672 道 PutnamBench 题目(每道约 $4,远低于 Seed-Prover 1.5 的 $300+),在 FATE-H(87%)和 FATE-X(34%)上创下 SOTA。还在真实开源仓库中发现 5 个此前未知的 bug。可用性: Hugging Face 开源权重,免费 API 端点 leanstral-1-5 已上线。评价: 将 Lean 4 形式化证明的成本降低了两个数量级,把正式验证从学术玩具变成了实用的工程工具。
NVIDIA Nemotron-Labs-TwoTower — NVIDIA 开源的双塔扩散语言模型,基于 Nemotron-3-Nano-30B-A3B 骨干网络(Mamba-2 + Transformer MoE 混合架构)。将模型拆为冻结的 AR 上下文塔和训练的扩散去噪塔,实现了 2.42x 推理吞吐量提升,仅损失 1.3% 质量(保留 98.7%)。可用性: NVIDIA 开放模型许可证下开源权重。评价: 不需要重训就能把生成速度翻倍,对自部署推理场景意义重大。
🔥 新产品发现
-
mattpocock/skills (973⭐) — Matt Pocock 的 Claude Code Skills 合集,面向"真正的工程师",直接从 .claude 目录提取的实战技能包 [GitHub Trending]
-
herdr (707⭐) — 终端里的 agent 多路复用器,同时管理多个 coding agent 会话 [GitHub Trending]
-
meetily (718⭐) — 开源 AI 会议助手,基于 Rust,4x 更快 Parakeet/Whisper 实时转录 + 说话人分离 + Ollama 摘要,100% 本地运行 [GitHub Trending]
-
Chrome DevTools MCP (304⭐) — Chrome DevTools 官方推出的 MCP 工具,让 coding agent 直接控制浏览器调试面板 [GitHub Trending]
-
asgeirtj/system_prompts_leaks (471⭐) — 汇总各大模型的 system prompt 泄露(Claude Fable 5、Opus 4.8、Codex、GPT-5.5、Gemini 3.5 Flash 等),持续更新 [GitHub Trending]
-
agentskills/agentskills (351⭐) — Agent Skills 开放规范与文档,旨在标准化 AI agent 的能力描述与发现 [GitHub Trending]
-
Slopo (HN 91👍 55💬) — 基于 embedding 模型的代码重复检测 CLI 工具,比传统 AST/文本匹配更智能
-
Fortress (HN 7👍) — 开源修改版 Chromium,专为 browser agent 设计,防止被目标网站检测和封锁
-
Contextify (HN 7👍) — 将 Claude Code 会话记录导入 Codex,反之亦然,实现跨 agent 上下文互通
-
TaskPeace (HN 7👍 7💬) — 通过 MCP 供 AI coding agent 拉取任务的任务队列,实现 agent 间的异步协作
📰 博客更新
Anthropic Engineering
-
Scaling Managed Agents: Decoupling the brain from the hands — 深入剖析 Managed Agents 架构设计:将 agent 分解为 session(仅追加日志)、harness(编排循环)、sandbox(执行环境)三层抽象,实现类似 OS 虚拟化硬件的解耦效果。从"宠物式"单体容器迁移到"牛群式"可替换组件,解决了调试困难、会话丢失、客户 VPC 接入等实际问题。
-
How we built Claude Code auto mode: a safer way to skip permissions — 用户接受 93% 的权限请求,导致审批疲劳。Auto mode 引入双层分类器:输入层 prompt injection 探测 + 输出层 Sonnet 4.6 驱动的转录分类器(先快速单 token 过滤再 CoT 深入)。捕获了删除远程分支、上传 GitHub token 到内部集群、对生产数据库执行迁移等危险行为。
-
Harness Design for Long-Running Apps — 长任务 harness 设计模式,探讨 context anxiety(模型因接近上下文限制而提前收尾)等问题的缓解方案
-
Infrastructure Noise — 基础设施噪音对 agent 性能的影响分析
-
Building a C Compiler — 用 Claude 构建 C 编译器的工程实践
-
AI-Resistant Technical Evaluations — 设计抗 AI 作弊的技术评估方法
-
Demystifying Evals for AI Agents — AI agent 评估体系的去神秘化
🐦 开发者动态
Swyx (swyx · dxtips/cognition/temporal) — 反思了一个有趣的讽刺:"Tools for thought" 领域的创业者花了近十年做漂亮画布和可视化 demo,结果被低对比度、设计粗糙的 CLI 工具彻底碾压——因为这些 CLI 直接帮你完成了 commodity thinking。工具消费化 > 工具美学化。
Cat Wu (_catwu · Claude Code + cowork @Anthropic) — 分享小技巧:用 Claude Code + computer use 设置 Claude Tag,指向文档后自动连接团队的 GitHub repo、数据仓库、Google Drive 和其他数据源。同时号召大家分享用 Fable 5 做的 demo(479👍)。
Thariq (trq212 · Claude Code @Anthropic) — "与 Fable 合作最重要的部分是发现自己的未知。" 他展示了一套完整工作流:用 HTML artifact 作为思考的画板,反复迭代提示词来发现自己不知道但需要告诉模型的信息。这个帖子获得了 3389👍 和 260 次转发。
Guillermo Rauch (rauchg · Vercel CEO) — 推"Agentic Self-Improvement"理念:让 agent 审查自己的历史运行记录,发现低效、错误和冗余工具调用,然后自动生成新的 prompts 和 skills。可观测性是关键——Vercel 上部署时内置 agent 可观测性。
Aaron Levie (levie · Box CEO) — 长篇思考:AI 之战的核心是 context 之争。应用层能组织关键知识、管理权限、持续改进 agent 上下文,这才是远超纯 LLM wrapper 的价值所在。能跨模型路由任务——frontier 模型负责规划编排、低成本模型处理大批量工作——的应用层将成为胜负手。
Zara Zhang (zarazhangrui · Builder) — "人们越来越不愿意购买工具。如果只是工具,他们觉得可以用 coding agent 自己搭。愿意付费的是'雇佣了自己没有的专业知识'。" 感觉像 AI 时代的 SaaS 危机——工具层被代理化,真正的价值是 expert-as-a-service。
Peter Steinberger (steipete · OpenClaw) — 把 80,000 条自己的推文喂给 Fable 让它吐槽自己(267👍)。另一条金句:如果觉得 Codex 设计能力差,试试 "use imagegen to re-imagine this design and implement that"(1175👍)。
Dan Shipper (danshipper · Every CEO) — 分享 Fable 5 的真实使用案例:个人 iOS 应用端到端 5M tokens、清空整个产品 backlog 20M tokens、回复每封未读邮件和 Slack 消息 30M tokens。"Fable 帮你在泳池边工作:无价。" 顺便推出了 Fable 5 prompt 库。
🎙️ 播客摘要
The MAD Podcast with Matt Turck — Why NVIDIA Is Giving Away AI Models | Bryan Catanzaro
Bryan Catanzaro 领导 NVIDIA 的 Nemotron 团队,手下数百名 AI 研究人员。这个岗位让他对开源 vs 闭源 AI 的争论有极难得的视角——因为 NVIDIA 既有能力训练 frontier 级模型(Nemotron 3 Ultra 刚成为美国最强的开源权重模型),又在为整个行业的训练和推理提供算力。
核心洞察:效率才是唯一的扩展法则。 Catanzaro 提出一个反直觉的观点:既然我们已经逼近硬件极限(电力、冷却、制程),增加智能的唯一途径就不是"投入更多算力",而是更聪明地使用已有资源。他用了一个巧妙的类比——我们建造工具,建造 "外部器官"帮我们解决问题:厨房就是外部的胃,现在我们在创造外部大脑。这个外部大脑意味着什么?没人真正知道。
关于 NVIDIA 怎么养 AI 研究团队:Catanzaro 透露的核心管理哲学是——如何让几百个聪明人共同构建一个模型,而不是各自写一百篇论文。这个挑战不是技术性的,而是组织设计问题,但最终决定了一个研究机构能不能产出真正有用的成果,而不是漂亮的 paper count。
"If you accept as the truth that we're gonna be running at the limit, then what that means is that the way to get more intelligence is to be more efficient. We can't get more intelligence by applying more force if we're already at the limit. We have to be more thoughtful about how we use what we have."
对 Agent 生态的启示也清晰:既然 GPU 算力到了天花板,让 agent 更高效的秘密就不在购置更多 H100,而在于更好的 harness 设计、更聪明地管理 token 预算、以及像 TwoTower 这样的架构创新。