AI Builders 周报 — 2026-09-28
🧠 模型发布
-
GPT-6 Sol / GPT-6 Luna(OpenAI,9 月 22 日):Sol 与 Luna 将 GPT-6 Astra 的专业工作、编码、computer use 与 factuality 能力下放到更低成本档位;API 价格分别为输入/输出每百万 token $2/$10 与 $0.10/$0.50,较 GPT-5.6 对应价格约低 50%。Sol 已在 AutomationBench、FrontierCode、DeepSWE 等测试中展现很强的 agent 性价比;两者可通过 API 使用,Sol/Luna 也进入 ChatGPT Work 与 Codex,Luna 面向 Free/Go 桌面端开放。判断:本周最值得关注的不是单纯分数,而是 frontier 能力的成本曲线明显下移。
-
Claude Opus 5.5(Anthropic,9 月 22 日):Claude 5.5 家族首个模型,面向长时 agentic coding、computer use 和 knowledge work;API 价格为输入/输出每百万 token $4/$20,cache read $0.20,比 Opus 5 便宜,官方称典型工作负载总成本下降 40%、输出速度提升 30% 以上。支持 Claude Platform、AWS、Google Cloud、Azure,模型 ID 为
claude-opus-5-5。判断:如果实际长任务表现接近官方评测,它会把“高能力 + 可持续运行成本”推到更现实的生产区间。 -
Grok 4.7(SpaceXAI,9 月 21 日):新 base model 配合更长的 RL 训练,重点提升多小时 coding、knowledge work、自检与长上下文管理;CursorBench 4.0 为 46.3%,DeepSWE v1.1 高 effort 为 71.0%,API 价格为输入/输出每百万 token $2/$6,另有 2 倍输出速度的 fast variant。已在 Grok Build、Cursor、Grok API、第三方 coding harness 与 model router 上线。判断:定位很清晰——以 $2/$6 价格切入长任务开发,而不是只追求单轮问答榜单。
-
MiMo-V2.6 Pro / Flash / Pro-Ultraspeed(Xiaomi MiMo,9 月 21 日):两款全模态开源模型与一个高速变体,覆盖 code、visual、cyber、3D spatial reasoning 和 computer-use agent。官方披露 Pro 在 Artificial Analysis Intelligence Index 得分 46,并在 DeepSWE v1.1 上从 58.4 提升到 72.6;系列支持 1M context 的 RL 训练,代码、训练环境与技术报告一并开源,Ultraspeed 版本输出速度最高可达 Pro 的 20 倍。判断:它把“开放权重 + agent RL + 多模态操作”组合得很完整,但官方 benchmark 仍应结合独立复现解读。
🔥 新产品发现
- Reladraw — 一种由用户决定布局位置的 diagram language,适合需要可控图形生成的开发者。[HN 389👍]
- TinyAIArena — 让 AI agents 直接对战的竞技场,可作为 agent 行为观察与实验入口。[HN 93👍]
- chess-postmortem-skills — 一个用于分析棋局的 Claude Code skill,把 agent 工作流带到具体的棋局复盘任务。[HN 75👍]
- Doom or Bloom — 用互动方式绘制个人 AI world view,适合快速表达对 AI 未来的判断。[HN 56👍]
- Ekselio — 面向 finance workflow 的 local-first AI 工具,重点是让敏感业务流程留在本地。[HN 40👍]
- Agentic CUDA Kernel Optimizer — 用 agent 自动探索 CUDA kernel 优化方向,面向 GPU 性能工程实验。[HN 37👍]
- Recurse — 帮助更快开发与部署 specialist agents 的平台,聚焦垂直 agent 的交付速度。[HN 8👍]
- Paper-docx — agent-native 的 Python-docx fork,项目宣称可减少 78% 的 DOCX 失败,适合文档生成流水线。[HN 6👍]
- GoodSocials — 面向 LinkedIn 的 AI social media manager,主打更偏 authentic 的内容生成。[Product Hunt]
- Token Forecaster — 在发送 LLM 请求前预测回复可能运行多久,适合需要控制延迟与预算的应用。[Product Hunt]
- Jango — 让 AI agents 像真实用户一样测试 multi-user app,面向端到端 QA 场景。[Product Hunt]
- SocialGPT — 通过聊天编辑视频时间线,把自然语言交互接到视频剪辑工作流。[Product Hunt]
📰 博客更新
Anthropic Engineering
- Scaling Managed Agents: Decoupling the brain from the hands 讨论如何把 session、harness 与 sandbox 解耦,让 agent 的“脑”和执行工具可以独立替换、失败恢复,并通过稳定接口连接任意工具或 MCP server。
- Building a C compiler with a team of parallel Claudes 复盘 16 个并行 Claude agent 在约 2,000 次 Claude Code session 中构建 Rust C compiler 的实验,重点是测试、任务锁、容器隔离和长时自主开发的边界。
- Designing AI resistant technical evaluations 总结技术面试 take-home 如何随着模型能力提升而失效,并介绍通过更长时限、模拟 accelerator 和更难被 AI 直接套解的任务来恢复区分度。
🐦 开发者动态
- Guillermo Rauch(Vercel CEO)提醒不要把未经验证的 AI prose 当成理解:他以一个被误归因的 compiler performance 案例为例,强调阅读、核验和真正理解不能被“看起来像解释”的文本替代。
- Thariq(Claude Code,Anthropic)回顾一年前用 Claude Code 做视频的早期实践,指出当时每个结果仍需要大量人工迭代和纠错,也侧面展示了视频 agent 工作流在一年间的进步。
- Peter Yang(AI 教程与访谈作者)分享用 Gemini audio API 构建 conversational Japanese 学习应用的实践:10 节课、每节 10 个短语,体现 audio API 从 demo 走向具体学习产品的路径。
- Garry Tan(Y Combinator CEO)展示用
@capydotai与 GStack 的/autoplan处理生产 bug,并提到 GPT-6 medium reasoning,重点在于把 agent 接入真实 issue,而不是只做一次性代码生成。 - Peter Steinberger(OpenClaw / OpenAI)转发一个让他感到“像 AGI”的 agent 演示,反映开发者社区对高自治、可组合 agent 行为的关注正在升温。
🎙️ 播客摘要
- No Priors:Why Diffusion Will Win AI Inference with Inception Co-Founder and CEO Stefano Ermon:The Takeaway:扩散式语言模型当前最现实的突破口是 inference economics,而不是立即取代 autoregressive 模型。 Inception 联合创始人 Stefano Ermon 解释了从图像 diffusion 到离散文本/代码 diffusion 的研究路径:模型以并行去噪处理多个 token,工作负载更接近训练,也更适合 GPU,因此能在保持 OpenAI-compatible API 的同时降低延迟。对 voice agent 等场景,速度直接影响交互体验;团队称 Mercury 已在生产中使用,并通过自建 serving engine 解决传统 vLLM/SGLang 栈无法直接承载的问题。访谈也强调,这条路线的代价是生态尚不成熟、训练与 post-training 基础设施需要自建,未来价值取决于 diffusion 模型是否能把更快 inference、可控生成和更高 data efficiency 延伸到更广的任务。
Generated through the Follow Builders skill: https://github.com/zarazhangrui/follow-builders