跳到主要内容

AI Builders Digest — 2026-07-11

🧠 模型发布

GPT-5.6 Sol / Terra / Luna — OpenAI 于 7 月 9 日发布新一代旗舰模型系列,分三个档次:Sol($5 输入 / $30 输出 per 1M tokens)、Terra($2.50 / $15)、Luna($1 / $6)。Sol 在复杂推理、企业级文档分析和 agentic coding 任务上大幅超越 GPT-5.5,Box AI 内部评测显示其在金融、医疗、公共事业等场景均有显著提升。同时支持 GPT Live 语音交互和 Codex 集成。可用性: API 全面开放,已集成 GitHub Copilot、Microsoft 365 Copilot。评价: 定价分层清晰,Sol 在 dollars-per-task 上堪称新的标杆,但三档命名(Work vs Codex)引发了用户困惑。

Grok 4.5 — xAI 于 7 月 8 日发布,1.5T 参数,专为 coding 和 agentic 任务打造的模型。使用真实 Cursor 开发者 session 数据进行训练,在 Artificial Analysis Intelligence Index 上排名第四(得分 54),超越所有 Gemini 和开源模型。定价 $2 / $6 per 1M tokens,比 Claude Opus 4.8 便宜 60%+。Elon Musk 称其"Opus-class,但更快、更 token-efficient"。可用性: 公开 API、Grok Build。评价: 以极低价格提供接近前沿的 coding 能力,对开发者生态的冲击不可小觑。

Meta Muse Spark 1.1 — Meta 于 7 月 9 日发布,支持 1M 上下文窗口、多模态 agentic coding、并行 subagent 编排、zero-shot MCP 和 computer use。同时推出 Meta Model API 公开预览(OpenAI 兼容)。定价 $1.25 / $4.25 per 1M tokens,与 Haiku 4.5 和 GPT-5.6 Luna 竞争。可用性: Meta AI app、meta.ai、API 预览。评价: Meta 首次正式入局 coding agent 战场,多模态 agent 编排能力令人印象深刻,定价极具攻击性。


🔥 新产品发现

Microsoft Flint — 微软推出的 AI agent 可视化语言,agent 可生成图表和可视化来展示推理过程。 [HN 344👍 135💬]

OfficeCLI — 面向 AI agent 的 Office 套件 CLI,支持读写 Word、Excel、PowerPoint 文件,无需安装 Office,开源免费。 [GitHub ⭐1224]

CubeSandbox — 腾讯云出品,轻量级 AI agent 沙箱,支持即时并发、安全隔离。 [GitHub ⭐291]

DesktopCommanderMCP — 给 Claude 的 MCP server,赋予 terminal 控制、文件搜索和 diff 编辑能力。 [GitHub ⭐328]

Chrome DevTools MCP — Chrome DevTools 官方出品的 MCP server,让 coding agent 可以直接调试浏览器。 [GitHub ⭐145]

FableCut — 浏览器内视频编辑器,AI agent 可完全驱动,零依赖。 [HN 95👍 58💬]

BrowserOS — 开源 agentic 浏览器,ChatGPT Atlas / Perplexity Comet 的替代方案。 [GitHub ⭐54]

Abralo — 免费在单个窗口中运行多个 Claude Code agent,支持并行工作。 [HN 31👍 21💬]


⚙️ 工具更新

Claude Code v2.1.206

  • /cd 命令新增目录路径自动补全,与 /add-dir 行为一致
  • 新增 /doctor 检查,可建议裁剪 CLAUDE.md 中模型能从代码库自行推导的内容
  • /commit-push-pr 自动允许 git push 到仓库的 push remote
  • Gateway: /login 支持 Anthropic 运营的公共网关
  • 后台 agent 在 Claude Code 更新后自动升级,无需手动重启
  • 修复了过期登录导致"模型选择有问题"误导性错误的问题

📰 博客更新

Anthropic Engineering

OpenAI News


🐦 开发者动态

Josh Woodward (VP, Google / Google Labs / Gemini App) — 在收集了 1400+ 条用户反馈后,整理出 Top 10 需求榜单:Google Workspace 集成的可靠性(#1)、工具调用改进(#2)、聊天文件夹组织(#3)、MCP 和自定义技能(#4)、Deep Research 导出 NotebookLM(#5)等。承诺将逐一改进。

Thibault Sottiaux (OpenAI, Codex & ChatGPT) — 为庆祝 GPT-5.6 Sol 发布,将在 24 小时内两次重置 ChatGPT Work 和 Codex 的 rate limit。同时宣布 Rajan Agarwal 加入 OpenAI 负责模型研究和 coding 能力提升。

Guillermo Rauch (Vercel CEO) — 指出本周是"模型发布周",预测 Meta Spark 1.1、Grok 4.5 和 GLM 5.2 将显著抢占 token 市场份额。强调 agentic 任务需要高智能+快速响应,并暗示开源模型即将变得"极快"。

Aaron Levie (Box CEO) — 发布 Box AI 对 GPT-5.6 Sol 的企业级评测:Sol 在金融(76% vs 71%)、医疗(58% vs 46%)、公共事业(74% vs 63%)、生命科学(60% vs 51%)等场景均显著优于 GPT-5.5。Sol 的优势在于能主动核查源文档而非照单全收。

Sam Altman (OpenAI CEO) — 强调 GPT-5.6 Sol 在 dollars-per-task 上取得了巨大进步,回应了企业关于 AI 成本的担忧。同时宣布联合创始人 Fidji Simo 因健康原因离开 OpenAI。

Amjad Masad (Replit CEO) — 推广 Fable 在 Replit 上的体验。并指出 LLM 市场格局正在快速变化——6 个月前 VC 还在担心 Anthropic 垄断,现在已有多个强力竞争者。

Peter Yang (AI 教程创作者) — 对 OpenAI 发布会的深度点评:GPT-5.6 Sol 是他用过最靠谱的模型,"永不放弃";GPT Live 语音可能是比模型更新更重要的发布;但 ChatGPT Work vs Codex 的命名策略令人困惑,建议统一。

Nikunj Kothari (FPV Ventures 合伙人) — 用幽默方式总结本周模型发布潮:GPT-5.6 三种口味、Grok 4.5 抢跑 24 小时、Fable 5 被政府"禁飞"三周后回归、Sonnet 5 让免费 tier 比一月份企业级还好用、美团开源 1.6T 参数的 LongCat-2.0、字节跳动 Seedream 5 Pro 比 GPT Image 2 便宜 4 倍。

Garry Tan (YC CEO) — 测试了 Meta Muse Spark 1.1(内部代号 Hornbill)在 OpenClaw 上的表现,评价很高。

Madhu Guru (前 Google Gemini 团队,现已加入 Meta) — 宣布加入 Meta 负责 AI 产品。指出 SWE agent 已改变软件工程,但大多数行业的 agent 应用仍处于早期阶段。

Dan Shipper (Every CEO) — 称 GPT-5.6 Sol 是"知识工作的黄金标准"。同时调侃 ChatGPT Work vs Codex 的命名问题:"所以开发者不工作?"


🎙️ 播客摘要

Unsupervised Learning Ep 90: AI Pioneer Jürgen Schmidhuber on the State of AI Today

核心观点: AI 先驱 Jürgen Schmidhuber 认为当前 AI 行业的 CapEx 狂热严重过度,不看好模型公司的"递归自我改进"护城河论。

Schmidhuber——被纽约时报称为"AI 之父"——在一场罕见的深度对谈中给出了与主流 AI 叙事截然不同的判断。他认为今天的模型缺少真正推动科学发现的能力,真正的 AGI 需要媲美人体的硬件(如灵巧的双手),而不仅仅是"屏幕背后的智能"。他对 AI 安全性持相对乐观态度,认为担忧被夸大了。

最引人注目的是他对 AI 公司资本支出的看法:虽然他对 AI 技术本身非常乐观,但对模型公司前景"深度悲观"。他认为当前上千亿美元的资本支出热潮远远超出了实际需求,且"递归自我改进"不会成为任何公司的护城河——因为底层技术会快速商品化。他同时指出,没有硬件突破(如机器人本体),真正的 AGI 无法实现。

▶️ 观看完整访谈