AI Builders Digest — 2026-07-07
🧠 模型发布
Tencent Hy3 正式版发布 — Apache 2.0 开源,295B MoE 专注 Agent 工作负载 7 月 6 日,腾讯混元团队正式发布 Hy3 完整版,采用 MoE 架构,总计 295B 参数、21B 激活参数,支持 256K 上下文窗口。最大变化:从预览版的 Tencent Hy Community License 全面转向 Apache 2.0 开源许可,消除了全球商业使用的法律障碍。评测数据:Agentic Search 方面 84.2 BrowseComp / 91.0 DeepSearchQA,超越所有开源模型并接近 Claude Opus 4.8 和 GPT-5.5;MCP-Atlas 工具编排 79.1 居开源第一;幻觉率从预览版 12.5% 降至 5.4%。编码方面 SWE-bench Verified 78.0,落后于 GLM-5.2(84.2),但参数规模仅为后者的一半。可用性:Apache 2.0 开源,OpenRouter 免费两周,腾讯云 API 1 RMB/百万 input tokens。评价:Apache 2.0 许可策略是最大亮点,搜索+工具编排能力是当前开源最佳选择之一。
LongCat-2.0 权重正式上线 — 美团 1.6T 参数开源编码模型,MIT 许可 7 月 4 日,美团将 LongCat-2.0 的 141 个 INT8 权重分片上传至 Hugging Face。1.6T 总参数 MoE,约 48B 激活参数,原生 1M token 上下文窗口,MIT 许可证。此前以代号 "Owl Alpha" 在 OpenRouter 上匿名运行两个月,成为该平台使用量最高的编码模型。基准测试:SWE-bench Pro 59.5(超越 GPT-5.5 的 58.6),Terminal-Bench 2.1 70.8,SWE-bench Multilingual 77.3。该模型完全基于国产 AI ASIC 集群(5 万张卡)训练和推理,无需 NVIDIA 硬件。可用性:MIT 开源,OpenRouter 上 $0.75 input / $2.95 output 每百万 token。评价:国产芯片全栈训练的标志性成果,MIT 许可 + 接近前沿的编码能力使其成为开源编码 agent 的有力竞争者。
🔥 新产品发现
- addyosmani/agent-skills — 生产级工程技能集,为 AI coding agent 提供高质量工程实践指南 [GitHub Trending 1112⭐]
- alibaba/page-agent — 基于 JavaScript 的页面内 GUI agent,用自然语言控制网页界面进行自动化操作 [GitHub Trending 892⭐]
- diegosouzapw/OmniRoute — 免费 AI 网关,支持 231+ 提供商(含 50+ 免费),RTK+Caveman 压缩可节省 15-95% tokens [GitHub Trending 749⭐]
- MakerChecker — 扫描你的 AI Agent 危险能力 — 开源工具,扫描检测 AI agent 是否具备危险能力(40 票 HN)
- Peek-CLI: 让 Claude Code 看到浏览器 — CLI 工具,为 Claude Code 提供浏览器截图和 DOM 访问能力(11 票 HN)
- Heckle — 将 Bug 的完整浏览器上下文发送给 coding agent — 捕获浏览器上下文(console、network、DOM)自动发送给编码 agent 辅助修复(5 票 HN)
- Excalibur — 开源 AI coding agent,面向产品工程师 — 开源的自主编码 agent,专注于产品工程场景(7 票 HN)
- ScreenCI — 从 E2E 测试自动生成产品演示视频 — 基于 Playwright E2E 测试自动生成实时更新的产品演示视频(7 票 HN)
- Nixmac — 用自然语言管理 Nix-darwin 配置,让 macOS 声明式配置更易用 [PH]
- Mozaik — TypeScript 运行时,用于构建自组织 AI agent 系统 [PH]
⚙️ 工具更新
Claude Code v2.1.202 (Jul 6)
- 新增
/config中的 "Dynamic workflow size" 设置,用于控制动态工作流的 agent 规模(小/中/大),作为指导性建议而非硬性限制 - 新增
workflow.run_id和workflow.nameOpenTelemetry 属性,方便从 OTel 数据重建工作流运行轨迹 - 修复了 Ctrl+R 历史搜索在扫描中接受/取消时的崩溃问题
- 修复了后台 session 使用
/rename后重启时名称被重置的问题 - 修复了客户端证书轮换期间的 mTLS 握手失败问题
- 修复了 Remote Control(移动端/Web)发送命令到交互式 session 时报 "Unknown command" 的问题
- 修复了 Remote Control 发送无标题图片/文件时被静默丢弃的问题
- 修复了 SSH 环境下
claude auth login输出的登录链接不可点击的问题
📰 博客更新
Anthropic Engineering
- How We Contain Claude — Anthropic 分享了他们如何通过多层安全架构来"contain"(约束)Claude,涵盖 sandbox、权限隔离、输出过滤等安全实践
- April 23 Postmortem — 针对 4 月 23 日事件的详细复盘,分析故障根因和修复措施
- Eval Awareness: BrowseComp — 关于 BrowseComp 评估基准的研究,探讨模型在浏览任务中的评估意识与能力边界
🐦 开发者动态
Nan Yu (Linear 产品负责人):认为"炫耀同时开 10 个 Claude Code 标签页"只是表演,真正的工程效率不是靠堆 agent 数量实现的。指出"实时策略游戏式"的 agent 管理模式是死胡同——现有 AI 已能击败 99% 人类玩家,靠微操取胜没有意义。
Cat Wu (Anthropic Claude Code + Cowork):分享了一个新的 Claude Code 工作流——用于候选人 sourcing:告诉 CC 职位需求和背景,CC 自动执行动态工作流找到 100 个候选人,附带 LinkedIn、Twitter、博客、播客和一句话推荐,生成 artifact 邮件发送。整个过程从锁定笔记本电脑出门到手机上查看结果。
Garry Tan (Y Combinator CEO):认为人类财富的真正约束从来不是资源,而是好的想法和实现它们的杠杆。AI 刚刚为所有人消除了杠杆约束,剩下的只有想法本身。在另一条推文中分享了大阪观察:日本三十年零增长的实验证明,当无法再竞争"更多"时,人们会竞争"更好",而更好和更多同时发生才是真正的突破。
Sam Altman (OpenAI CEO):自家大孩子第一次说出两个词的组合,他感叹这个认知成就和 GPT-5.6 发现新数学一样令人惊叹(11,071👍)。
Dan Shipper (Every CEO):在 Fable 上发布了一个关于 "make no mistakes" 的寓言;另一条推文调侃:"帮我把这个按钮颜色改一下"——"好的,我刚刚启动了一个 100 个 agent 的集群来帮你完成这个任务"。
Amanda Askell (Anthropic 哲学家/伦理学家):吐槽从医生那里获取概率是人生中最不必要的 boss 战——即使你恳求他们给出一个区间主观概率(基本上就是在问直觉),也很难得到答案(1,382👍)。
Nikunj Kothari (fpvventures 合伙人):批判 VC 会议模式——30 分钟对着背得滚瓜烂熟的 deck 聊天,不如直接做产品演示或头脑风暴。认为双方不如把自己的"prompts"上传到 Claude 自动完成数字化对接。
Zara Zhang (Builder):重新推荐了自己之前构建的代码理解技能工具(现在代码理解正成为热门话题,125👍)。
🎙️ 播客摘要
No Priors — 大规模 Test-Time Compute 如何改变 AI 评估、安全与研究 嘉宾:OpenAI 研究科学家 Noam Brown
核心观点:当前 AI 评估框架已经严重过时。Noam Brown 指出,在 GPT-3 时代,即使给它 $10,000,000 的推理预算,它也做不了什么。但今天的模型能力是推理投入的函数——$10 的预算和 $10,000,000 的预算会产生天壤之别的结果。现有的 Responsible Scaling Policies 只评估模型本身的静态能力,完全不考虑 test-time compute 这个变量。Brown 认为,行业需要在什么预算水平下评估模型这个问题上达成共识,否则安全评估就是空谈。他还讨论了递归自我改进的前景以及前沿竞争格局的下一个转折点。
"The problem is we're in a world now where the capability of the model is a function of how much money you put into it, basically. Give it a budget of $10,000, it can do a lot more than what it can do with a budget of $10."
🎬 YouTube