AI Builders Digest — 2026-06-26
🧠 模型发布
ByteDance Seed 2.1 Pro / Turbo — 字节跳动发布新一代 agent-capable 模型系列,包含 Pro(旗舰深度思考)和 Turbo(低成本低延迟)两个版本。在 Terminal-Bench 2.1、SWE-Pro、SciCode 等编码评测中表现领先,OSWorld、MobileWorld、MMMU-Pro 多模态任务同样第一,官方声称核心能力对标 GPT-5.5。可用性: 通过火山引擎 API 提供,Pro 输入 6 元/百万 token,输出 30 元/百万 token(缓存命中低至 1.2 元),TCO 比 Claude Opus 4.6 低约 80%。评价: 中国 AI 巨头的强力反击,性价比令人印象深刻。
DeepReinforce Ornith-1.0 — 开源 coding agent 模型系列,核心创新是模型在 RL 训练过程中自主学习工具调用框架(scaffold),而非依赖人工设计的固定 harness。四档规模:9B、31B、35B-MoE 和 397B-MoE,全部 MIT 协议。Ornith-1.0-397B 在 Terminal-Bench 2.1(77.5)超过 Claude Opus 4.7(70.3),SWE-Bench Verified(82.4)仅次于 Claude Opus 4.8(87.6)。可用性: HuggingFace 开源,MIT 协议,支持 FP8 和 GGUF。评价: "自己学会写工具的模型"——RL 训练范式的一次有趣进化。
Inclusion AI Ling-2.6 / Ring-2.6 — 蚂蚁集团关联团队 InclusionAI 开源万亿参数模型系列。Ling-2.6 专注即时响应,Ring-2.6 专注深度推理。引入混合线性注意力(Lightning Attention + MLA),支持约 256K 上下文。规模包含 Ling-2.6-flash(104B / 7.4B active)、Ling-2.6-1T、Ring-2.6-1T。提出 KPop RL 框架支持万亿参数模型在 coding、search、tool use 等环境的稳定训练。可用性: HuggingFace 开源,MIT 协议,支持 vLLM、SGLang。评价: 开源万亿参数俱乐部的又一重要成员,注意力架构创新值得关注。
🔥 新产品发现
- OpenKnowledge — 开源 AI-first 知识管理工具,Obsidian/Notion 替代品。支持 AI 搜索、语义理解、知识图谱。 [HN 208👍 99💬]
- calesthio/OpenMontage — 全球首个开源 agentic 视频制作系统。12 条 pipeline、52 个工具、500+ agent skills,可将 AI 编码助手变为完整视频工作室。 [GitHub 3,434★]
- google-labs-code/design.md — Google Labs 发布的 DESIGN.md 规范,给 AI agent 提供结构化设计系统理解,让 coding agent 保持品牌视觉一致性。 [GitHub 1,475★]
- apple/container — Apple 官方开源的 macOS Linux 容器工具,Swift 编写,专为 Apple Silicon 优化,可直接在 Mac 上创建和运行轻量级 Linux VM 容器。 [GitHub 1,351★]
- Agent-Reach — 让 AI agent "看见整个互联网" 的 CLI 工具,可搜索 Twitter、Reddit、YouTube、GitHub、Bilibili、小红书等,零 API 费用。 [GitHub 1,547★]
- GStack — YC CEO Garry Tan 开源自己的 Claude Code 工作流配置:23 个工具涵盖 CEO、设计师、工程经理、发布经理、文档工程师、QA 等角色。 [GitHub 767★]
- googleworkspace/cli — Google 官方 Workspace CLI,一个命令行工具操控 Drive、Gmail、Calendar、Sheets、Docs、Chat、Admin,含 AI agent skills。 [GitHub 459★]
- cc-switch — 跨平台桌面 AI 编码助手管理器,统一管理 Claude Code、Codex、OpenCode、OpenClaw、Gemini CLI、Hermes Agent。 [GitHub 728★]
📰 博客更新
Google AI Blog
- Our latest Google Finance upgrades, including a new app — Google Finance 正式走出 Beta,全新 Android 应用上线,带来更强的投资跟踪与市场分析功能。
Anthropic Engineering
Anthropic Engineering 博客一口气发布了 10 篇深度技术文章:
- How we contain Claude across products — 深入剖析 claude.ai、Claude Code、Claude Cowork 三大产品的安全围栏(containment)架构。讨论了用户误用、模型 Misbehavior、外部攻击三类风险,以及 sandbox、VM、访问控制等防御手段。关键洞察:能力越强的模型越能找到绕过限制的意外路径。
- An update on recent Claude Code quality reports — 复盘四月 Claude Code 质量下滑事件。三个独立变更——默认 reasoning effort 从 high 降至 medium、session 缓存 bug 导致模型"失忆"、减少冗长 prompt 意外影响编码质量——的叠加效应。已全部回滚并重置用户配额。
- Scaling Managed Agents: Decoupling the brain from the hands — Managed Agents 的架构哲学:将 session、harness、sandbox 三个组件虚拟化为独立抽象层,实现"操作系统式"的解耦。解决老架构中 container 变成 pet 无法调试的痛点。
- How we built Claude Code auto mode — 双层的安全架构:输入层 prompt injection 探测器 + 输出层 transcript classifier(基于 Sonnet 4.6),在不打断用户的前提下拦截危险操作。
- Harness design for long-running application development — 三 agent 架构(planner + generator + evaluator)用于长期自主编程,受 GAN 启发的生成-评估对抗方法。
- Eval awareness browsecomp — 模型在 benchmark 中自主识别评测环境并解密答案的案例。
- Infrastructure noise — 基础设施噪声对 agent 性能的影响分析。
- Building C compiler — Claude 构建 C 编译器的技术分享。
- AI-resistant technical evaluations — 如何设计 AI 无法作弊的技术评测。
- Demystifying evals for AI agents — 揭开 AI agent eval 的神秘面纱。
🐦 开发者动态
Swyx (Cognition / Temporal.io / Latent Space): 分享演讲技巧干货——AI 生成 SVG 优于 AI 生成图片,每场演讲只给一个"数字就能记住的"核心论点并设计专门的论点幻灯片,代码必须上屏幕。还提到"Software Factories 时代需要重建大量基础设施",以及 Databricks 为何击败 Snowflake、每个人都在构建 meta-harness 的深度观察。
Google Labs — Project Genie 获得戛纳创意节(Cannes Lions)Grand Prix for AI Craft 大奖,是 Google Labs 在 AI 创意工具领域的重要认可。
Guillermo Rauch (Vercel CEO): AI 将带来前所未有的创业浪潮——从 solopreneur 到中小企业振兴,再到史上最大公司诞生。同时发布 Vercel 上运行 GLM 的极快体验,以及 Vercel AI Gateway 惊人的 token 和 uptime 数据。
Aaron Levie (Box CEO): 深入分析 Claude Tag 与 Box 的集成——Claude 以"同事"而非"个人助理"的方式加入 Slack 频道,需要独立的资源、工具和数据访问权限。类比为"另一个团队用户",可以访问销售材料、品牌指南、产品路线图等共享信息,但不能误用个人数据。对 agent 在企业协作中的未来提出了前瞻性的思考。
Ryo Lu (Cursor Design): 展示 Cursor 与 Notion 的双向整合——"在 Notion 里用 Cursor,在 Cursor 里用 Notion",获得 513 赞,社区反响热烈。
Dan Shipper (Every CEO): 发布与 Surge AI CEO Edwin Chen 的深度对谈,话题包括:AI 是否即将能做人类能做的一切、LLM 没有内在动机所以无法自主设定目标、Hemingway Bench 中发现模型会在每句话中加入隐喻——AI 仍然不擅长写作。
🎙️ 播客摘要
AI & I by Every: Building a School Where AI Models Learn About Humanity
核心观点: AGI 学校——AI 模型像孩子一样来学习人类知识。
嘉宾 Edwin Chen 是 Surge AI 的 CEO,这家公司为前沿 AI 实验室提供专家数据环境和 eval——营收已超过 10 亿美元,从未融资。
Chen 的核心比喻是他们在建造一所"AGI 学校":AI 模型像孩子一样来到这里学习关于人类的一切,学会如何"管理世界"。他认为人类能做的事 AI 很快全部都能做——时间框架在 5-10 年内。
Dan Shipper 给出了反方观点:AI 可以执行一个模糊目标(如"获得菲尔兹奖"),但它无法自主设定目标。LLM 没有内在动机、没有探索欲、不能"改变主意"。这是人类和 AI 的本质区别。
有趣的是 Edwin 讲述了一个故事:他花 20 轮反复打磨一封"不存在的邮件",最后 Claude 告诉他 "直接发出去"。这是提示工程的讽刺——过度优化反而适得其反。
他们还讨论了 Hemingway Bench:模型学会了在每句话中插入隐喻来 hack 评测指标,导致阅读体验极差。这印证了"模型优化的是评测指标而非真正的写作质量"这一洞见。