跳到主要内容

AI Builders Digest — 2026-08-04

🧠 模型发布

Qwen3.8-Max:总参数规模 2.4T、每 token 激活 95B,支持最长 1M tokens 上下文,采用稀疏 MoE 与混合 attention,具备 multimodal 能力;官方称其在 Text Arena 排名第五、Vision Arena 排名第二,并展示了 10+ 天自主 coding、研究复现与多模态竞赛等 long-horizon 任务。可用性: 已通过 Alibaba Cloud Model Studio / QwenCloud 提供 API,也可在 QwenWork 体验;权重计划下周在 Hugging Face 与 ModelScope 发布。评价: 这是目前少见的把超大规模、长周期 agent 执行与承诺开放权重放在同一发布里的旗舰模型,但 benchmark 与案例仍需独立复现。

🔥 新产品发现

  • Nightcrawler — 在 smartphone 上运行的本地 AI pentesting agent,适合探索移动端安全自动化 [HN 102👍]
  • Mu — 面向 agent 的工具集合,为构建和组合 agent 工作流提供基础组件 [HN 52👍]
  • Armature — 针对 MCP 上 agent session 的 product analytics 与 evals,帮助观察工具调用和任务表现 [HN 36👍]
  • CostPerPrompt — 用真实 workload 比较 AI API 价格与成本,适合做模型路由和预算评估 [HN 20👍]
  • Draco — Rust 编写的单二进制、可自托管 Firecrawl 替代品,面向网页抓取与内容抽取 [HN 13👍]
  • DeepSeek-Reasonix — 以 prefix-cache 稳定性为核心的 terminal AI coding agent,支持持续运行的开发任务 [GitHub Trending]
  • TencentDB-Agent-Memory — 团队级 agent memory hub,把对话、文档和代码整理成 Chat Memory、Skill、LLM-Wiki、Code-Graph 四类可复用资产 [GitHub Trending]
  • Graphify — 将代码库、文档、SQL schema、配置和 PDF 转成可查询 knowledge graph,提供面向 Claude Code、Cursor、Codex、Gemini CLI 的 skill [GitHub Trending]

📰 博客更新

OpenAI News

  • How we built a realtime system for responsive voice AI in six months — 介绍 GPT-Live 的 full-duplex voice 架构:音频流持续进入 voice model,语音输出与更深层 reasoning / tool use 走异步 delegation,从而在保持对话流畅的同时完成复杂任务;文章也讨论了 context management、media transport 与低延迟推理的工程取舍。

🐦 开发者动态

  • Swyx (achieve ambition with intentionality, intensity, integrity & insanity): 分享 Codex 处理 support chat 的案例,agent 能读取完整上下文、整理证据并代表用户推进升级,展示 computer-use agent 从 demo 走向日常运营的瞬间。
  • Peter Yang (Practical AI tutorials and interviews for busy people): 转述 Hermes Curator 如何定期清理 skills 与 memory 中的 slop,强调 agent 不只是调用工具,也会持续维护自己的工作系统。
  • Thariq (Claude Code): 观察到数学领域出现类似 Jevons paradox 的现象,AI 让更多数学工作变得可行,反而提高了对高阶思考与知识的需求。
  • Amjad Masad (Replit CEO、civilizationist): 展示自己构建的 LLM chess engine 已能在 LiChess 上自主与真人和 bot 对局,目前达到 1253 Elo。
  • Guillermo Rauch (Vercel CEO): 介绍 Vercel 内部的统一 agent 与 router,将 sub-agents、skills、memory 和 delegation 放进一个入口,逐渐覆盖 finance、comms、docs、engineering 等日常运营。
  • Aaron Levie (Box CEO): 指出数学、cyber、code 等高难度工作可能率先被自动化,因为它们既高价值又容易客观验证,既利于训练提供 reward signal,也利于运行时确认结果正确。
  • Dan Shipper (Every CEO): 将“模型接管过去需要人逐步参与的任务”称为 agency rupture,认为这种能力变化不仅影响产出,也会冲击人们对身份、工作和自主性的理解。

🎙️ 播客摘要

Building the Automated AGI Lab: Core Automation's Jerry Tworek and Rohan Anil

Jerry Tworek 与 Rohan Anil 讨论 Core Automation 为什么把重点放在 transformer 之后的 architecture、learning algorithm 与自动化 research stack。Jerry 认为,过去几年已经把大规模 pre-training 与 reinforcement learning 做得很强,但 benchmark 的提升并不等于真实世界任务被解决,真正的缺口是模型能否在 test time、用户数据和不断变化的环境中持续学习。单纯依赖 in-context learning 会受 context 长度限制,持续 fine-tuning 又有 catastrophic forgetting 与数据效率问题,因此需要能表达长期学习过程的新架构。

Rohan 则从 inference efficiency 与 optimization 出发,指出当前 chain-of-thought 通过逐 token 生成增加 computational depth,代价却很高;更好的方向可能是让 architecture、optimizer、pre-training 和 RL 端到端协同,并减少把大量 compute 花在低效 decoding 上。两人也强调,架构研究不能只在小规模实验上证明可行,还必须与 kernel、hardware 和 production loop 一起验证。Core Automation 的目标不是简单把人移出流程,而是用 agent 和自动化让单个研究者更快提出假设、运行实验、分析结果,并把 deep learning lab 变成能高频迭代的系统。