AI Builders Digest | 2026-08-02
🧠 模型发布
K-EXAONE 2.0:LG AI Research 于 7 月 31 日发布的 750B 参数 foundation model,规模超过上一阶段 236B 模型三倍,并采用 Apache 2.0,允许商业使用。24 项 benchmark 平均 70.1,较上一阶段提升超过 10%;coding 与 agentic coding 三项评测提升约 30%,长上下文和 tool use 也有较强表现。可用性:开源权重,已发布到 Hugging Face。评价:这是韩国主权 AI 项目从国家级训练能力走向商业可用开放模型的重要一步。
Seedance 2.5:ByteDance Seed 的新一代 video generation model,单次生成最长 30 秒并支持多轮延展,可在一次输入中参考最多 30 张图片、10 段视频和 10 段音频,还加入 timestamp-level audio/video editing、green screen 与 perspective editing。可用性:已登陆 Jimeng AI、Doubao Pro 等产品,BytePlus ModelArk API 即将开放。评价:重点不只是把 clip 变长,而是把 video generation 推向可连续修改的完整创作 workflow。
🔥 新产品发现
- Tilde Code Review Agent:展示如何构建并 self-host 一个 code review agent,适合研究代码审查 agent 的完整工程链路。[HN 28👍 6💬]
- nano-llm-posttraining:在 8GB GPU 上实践 SFT、DPO、GRPO 等 minimal LLM post-training,降低个人研究者复现实验的门槛。[HN 19👍 0💬]
- ZeroShot:面向团队的 agent session monitoring,帮助观察 agent 执行过程并改进协作效率。[HN 18👍 4💬]
- mere-run:一个不依赖 Python 的 CLI,统一运行本地 text、image、video、music 和 3D 生成任务。[HN 16👍 7💬]
- Ski:面向 Claude Code、Codex 等工具的 on-device voice coding,免费使用并强调本地处理。[HN 15👍 14💬]
- litepipe:在本地保存工作过程中看到、说过和听过的内容,为 coding agent 提供持续记忆。[HN 9👍 15💬]
- bytedance/deer-flow:开源 long-horizon SuperAgent harness,组合 sandbox、memory、tools、skills 和 subagents 来处理可持续数小时的任务。[GitHub Trending]
- anomalyco/opencode:开源 coding agent,今日 GitHub Trending 获得 414 stars,继续显示开发者对可控、可自托管 coding workflow 的需求。[GitHub Trending]
📰 博客更新
Claude Blog
- Claude Code now supports artifacts:Claude Code 可以把工作过程整理成会持续更新的 live、shareable visual page,例如 PR walkthrough、incident dashboard 和 release checklist。
Anthropic Engineering
- how we contain claude
- claude code auto mode
- harness design long running apps
- building c compiler
- demystifying evals for ai agents
以上 Anthropic Engineering 条目本次 feed 仅提供标题和直链,未提供正文摘要,因此不额外推断文章内容。
🐦 开发者动态
- Swyx(AI developer advocate,smol.ai 等项目参与者):仍在积极使用
/loop和/goal,认为它们在需要 steerability 与 autonomy 平衡、又不想预先规定完整路径的开放任务中很有价值。 - Thibault Sottiaux(Codex & ChatGPT,OpenAI):宣布为庆祝 efficiency week 重置 Codex 和 ChatGPT Work 的 usage limits,让用户可以集中测试长时间 Luna threads。
- Nan Yu(Linear 产品负责人):分享 Linear 中常见的 Issue → Agent → PR → Release loop,强调 agent 应先调查 root cause,并通过 Datadog、Sentry MCP 获取证据;只有高置信度时才尝试修复。
- Amjad Masad(Replit CEO):展示一个 8B 模型在约 1500 Elo 的 chess 表现,称其在高 reasoning 和 response chaining 下可击败部分 frontier models,并把每步耗时压到 1 至 2 秒。
- Guillermo Rauch(Vercel CEO):认为软件项目会转向 Issue → Agent → PR → Release 的 agentic software factory,维护者的核心工作将是设计能持续产出高质量产品的 loop。
- Aaron Levie(Box CEO):指出随着任务从百万 token 走向数千万乃至数亿 token,harness 会和 model capability 一样成为决定准确率与成本的关键变量。
- Zara Zhang(builder):转述 Anthropic 内部 65% 的 product 与 engineering PR 已由 Claude Code 提出,并认为 agent interface 正从 terminal、desktop app 逐步迁移到团队原本工作的 collaboration tool。
- Sam Altman(OpenAI CEO):分享 ChatGPT Work 的一个家庭场景,把家庭日历与孩子兴趣接入后,每天早上自动生成适合通勤收听的个性化 podcast。
🎙️ 播客摘要
Ep 92: xAI Co-Founder Unpacks the Future of Model Development
核心 takeaway:下一阶段的 AI 竞争,不只是把 coding benchmark 做高,而是让模型在不可验证、长期运行的现实任务中可靠工作。xAI 联合创始人 Igor Babushkin 回顾了自己在 DeepMind、OpenAI 和 xAI 的经历,并介绍他创办 River AI 后对 personal AI、企业 AI 与 local hardware 的判断。一个重要观点是,模型要超越 coding,必须学会在没有即时标准答案的领域持续观察、验证、纠错和推进任务,这要求更强的 inference-time search、工具使用和长期记忆。Igor 也认为 closed-source model providers 面临艰难的商业处境:训练与推理成本持续上升,而模型能力又越来越容易被竞争者追赶。对产品团队而言,更现实的路径可能是把模型嵌入用户已有的工作环境,同时用 local hardware 处理隐私、延迟和成本约束。节目还讨论了 AI 对政策和社会结构的影响,以及为什么 personal AI 最终可能成为个人和公司的长期操作层。Feed 提供的链接是节目频道页,而非单集视频页。