跳到主要内容

AI Builders Digest — 2026-07-25

🧠 模型发布

Claude Opus 5:Anthropic 称其在 Frontier-Bench、GDPval-AA、ARC-AGI 3、Zapier AutomationBench 与 OSWorld 2.0 等 coding、知识工作和 computer-use 评测上达到新的领先水平;在 CursorBench 3.2 的最高 effort 下,表现与 Fable 5 峰值相差不到 0.5%,但单任务成本约低一半。可用性:闭源,已上线 Claude 全平台、Claude API、Claude Code 与 Claude Cowork;API 价格为输入 $5、输出 $25 / MTok,另有约 2.5 倍速度的 Fast mode。评价:重点不是刷新价格,而是把接近 frontier 的 agentic coding 能力下放到更适合日常使用的成本档位。

Apertus 1.5:ETH Zurich、EPFL 与 CSCS 在 7 月 24 日发布的开放模型升级版,新增图像与音频理解,并改进 reasoning、instruction following 和 tool use;同时推出 Apertus Mini 系列。可用性:Apache 2.0 开源,模型套件已在 Hugging Face 提供,CSCS 为其用户及瑞士学术社区提供 inference API。评价:它的价值不在于和私有 frontier 模型拼榜单,而在于把训练数据、代码与开发过程置于可检查的 sovereign AI 基础设施中。

Instella-MoE:AMD 发布 fully open 的 16B MoE LLM,每 token 激活 2.8B 参数,采用 Gated MLA 与 FarSkip-Collective;AMD 报告称后者让预训练速度提升 12.7%,在 expert parallel inference 中将 TTFT 最多降低 39.2%。可用性:开源,完整权重、训练配置、数据配比、中间 checkpoint 与 inference code 均公开,基于 AMD ROCm、Primus 与 Miles 构建。评价:这是一次从硬件、训练栈到模型 artifact 都开放的端到端示范,规模不大但工程信号很强。

🔥 新产品发现

  • Claude-thermos:保持 Claude session 温热,减少长时间等待和重新初始化,适合频繁切换的 coding agent 工作流。[HN 106👍 83💬]
  • ego-lite:为 AI agent 提供零配置、零成本的浏览器自动化,并可共享已登录的 browser state。[GitHub Trending,884⭐ today]
  • mattpocock/skills:从真实 .agents 目录整理出的工程技能集合,适合作为 coding agent 的可复用上下文。[GitHub Trending,2224⭐ today]
  • Agent-Reach:用一个 CLI 让 agent 搜索和读取 X、Reddit、YouTube、GitHub、Bilibili、小红书等来源,不依赖付费 API。[GitHub Trending,477⭐ today]
  • pi:集成统一 LLM API、agent loop、TUI 与 coding agent CLI 的 agent toolkit。[GitHub Trending,781⭐ today]
  • OpenMontage:开源 agentic 视频制作系统,包含 12 条 production pipeline、100 多个工具和 700 多个技能与知识文件。[GitHub Trending,333⭐ today]
  • X402vps:为 AI agent 提供按小时用 USDC 计费的 Docker 容器,面向短时、可丢弃的推理或工具执行环境。[HN 12👍]
  • The new Firecrawl /search:面向 AI agent 的 Search API,主打更准确的检索结果。[PH]

⚙️ 工具更新

Claude Code v2.1.219

查看 changelog

  • 默认 Opus 模型切换为 claude-opus-5,支持 1M context;Fast mode 价格为 $10/$50 per Mtok。
  • 新增 sandbox.network.strictAllowlist,可在 sandbox command 中拒绝未列入 allowlist 的 host,而无需每次提示。
  • 新增 DirectoryAdded hook,支持 session 中通过 /add-dir 或 SDK 注册新工作目录后触发自动化逻辑。
  • headless stream-json init event 新增 mcp_server_errors,列出因配置校验被跳过的 MCP server;终端运行也会显示启动警告。
  • 支持更深层 subagent 的 stream-json 转发,并修复 mid-stream API error 时 claude -p 丢失已生成答案的问题。

📰 博客更新

Claude Blog

  • Claude Code now supports artifacts:Claude Code 可以把 session 中的调查、代码、连接器数据和推理整理成可分享、可持续更新的 live artifact,例如 PR walkthrough、incident 页面、dashboard 或 release checklist;同一链接支持版本历史和恢复。Feed 标记的发布时间为 6 月 18 日。

Anthropic Engineering

Feed 提供了以下新条目,但没有正文或摘要,因此仅保留标题与直链:

🐦 开发者动态

  • Swyx(AI 开发者与投资人):分享了自己连续 dogfood 一个 agentic GitHub clone 的体验,产品已经包含 Workers for Platforms 提供的内置 CI/CD,准备继续打磨后公开;他还称赞 Poolside Small 的开放评测数据集,认为公开完整 eval dataset 有助于检查 reward hacking。
  • Thibault Sottiaux(OpenAI Codex 与 ChatGPT):展示 ChatGPT desktop app 的 Jarvis、Samantha、TARS 式语音交互,主打离开键盘也能完成工作。
  • Peter Yang(AI 教程作者):设想让多个 ChatGPT Voice thread 同时运行,形成一个可以互相协作并向用户汇报的语音团队。
  • Madhu Guru(Meta AI 负责人):把 agent 身份与权限管理提到台前:一个员工可以生成数百个 agent,父子 agent 是否继承权限、生命周期如何定义、如何审计,都需要新的 IAM 模型。
  • Amjad Masad(Replit CEO):介绍一个通过 MCP 把 Replit 接入 autonomous agency 的案例,重点是把“agency model”从编码扩展到整个业务流程;同时分享 chess autoresearch agent 自动改进 LLM fine-tuning 的实验。
  • Guillermo Rauch(Vercel CEO):表示 Vercel 上的 Python code 启动速度已自动提升约 2 倍,并继续强调 AI Gateway 的快速迭代。
  • Aaron Levie(Box CEO):认为 AI 更像专业领域的 force multiplier;真正懂行的人更能纠正 agent、判断输出质量并把结果纳入工作,因此专业能力不会消失,反而更重要。
  • Claude(Anthropic):Claude Voice mode 现在可以调用更强的 Opus、Sonnet 模型,并在对话中使用已连接的 email、calendar 等工具;更新向 mobile、desktop 和 web 的 public beta 推出,增加西班牙语、法语、印地语和日语支持。

🎙️ 播客摘要

The Biggest Chip Ever Built:Why OpenAI Runs On It | Cerebras CEO Andrew Feldman

核心观点:AI inference 的下一场竞争,可能不只是模型能力,而是每个用户每秒能拿到多少 token。Cerebras CEO Andrew Feldman 从 wafer、SRAM 与 GPU decode 的差异讲起,解释为什么 Cerebras 的晶圆级芯片比 GPU 大得多,却能在 inference 场景中换来更低延迟。对开发者而言,关键概念是 prefill 与 decode:前者更像批量处理,后者更受 memory bandwidth 和芯片通信影响,而 agent 会把大量连续 decode 请求转化为新的基础设施压力。

Feldman 还谈到 HBM、CoWoS、3nm 等供应链瓶颈,以及 OpenAI、Broadcom、AWS Trainium 和 Cerebras 如何围绕专用 silicon 重组。一个反直觉的判断是,CUDA 可能不再是 NVIDIA 永久的 moat,因为当 inference 变成云产品,tokens per second、可预测延迟和 API 级体验会比单纯的 GPU 通用性更直接地影响采购。Cerebras 的路线也说明,deep tech 往往要经历多年“没人关心”的阶段,直到 workload、资本与软件生态同时成熟。