AI Builders 周报 — 2026-08-24
🧠 模型发布
DeepSeek-V4-Flash-Vision-Exp — 多模态实验版模型上线
DeepSeek 于 8 月 21 日发布 DeepSeek-V4-Flash-Vision-Exp(实验版,model='deepseek-v4-flash-vision-exp'),为其 V4 家族补上视觉理解能力。这是一款多模态实验模型:在纯文本能力(agent、reasoning、world knowledge)上与官方 DeepSeek-V4-Flash 持平,但在需要视觉理解的多模态 agent 评测上相比 V4-Flash 实现巨大跃升,官方称其多模态 agent 能力已接近 Opus-4.8。
关键数据:Terminal Bench 2.1 83.9、NL2Repo 57.7、DeepSWE 59.3、DSBench-Hard 63.6、AutomationBench (Public) 25.7、ApexBench (Pass@1) 36.5、Agents' Last Exam 27.3、Chartography 64.3、ZeroBench (Pass@5) 35.0。
可用性:登录 DeepSeek API 平台即可调用,支持 OpenAI 兼容的 Chat Completions 与 Responses API;支持 JPEG/PNG/GIF/WebP、单请求最多 600 张图、单图最大 32 MiB(Files API file_id 64 MiB)。同批上线了 Files API(上传一次图片后按 file_id 复用,节省带宽),以及新的 DeepSeek Harness 0.1.1(开箱支持新模型)。
一句话点评:把 V4-Flash 的成本效率与视觉理解相结合,是为多模态 agent(读图、看截图、做图表)补上关键短板的一步,且视觉能力直逼 Opus 级别。
🔥 新产品发现
- OzBrain:面向「agent 与团队之间」的共享大脑——一个跨 agent 与协作成员共享的知识内存。[HN 85👍 50💬]
- Proliferate:开源、可自托管的 Codex 复刻,可接任意 coding agent。[HN 45👍 16💬]
- ParqDB:在浏览器里直接对 HTTP 上的 Parquet 文件做向量搜索,无需后端。[HN 26👍 4💬]
- AgentSight:基于 eBPF 的 AI agent 可观测性方案,无需改代码即可监控 agent 行为。[HN 16👍]
- Argentic:为 AI 抓取 agent 设计的 L402 Lightning「过路费」计费方案(toll booth)。[HN 9👍 7💬]
- openai/codex:OpenAI 的终端版轻量 coding agent,本周持续登上 GitHub Trending。[GitHub Trending]
- superset-sh/superset:agentic IDE,可并行编排 100+ 个 coding agent,用自己的订阅跑任意 agent。[GitHub Trending]
- VoltAgent/awesome-agent-skills:精选 1000+ 个官方与社区 agent skills,兼容 Claude Code、Codex、Gemini CLI、Cursor 等。[GitHub Trending]
- heygen-com/hyperframes:为 agent 设计的「写 HTML、渲染成视频」工作流。[GitHub Trending]
- anthropics/claude-plugins-community:Claude Cowork 与 Claude Code 的社区插件市场(只读镜像)。[GitHub Trending]
- tinyhumansai/openhuman:本地优先的「个人 AI 超级智能」——构建你的生活记忆、编排 agent 集群与工作流。[GitHub Trending]
- ruvnet/RuView:用普通 WiFi 信号做实时空间感知、生命体征监测与存在检测,完全无需摄像头。[GitHub Trending]
- us/crw:Rust 编写、Firecrawl/Tavily 的轻量替代,含给 AI agent 用的 MCP server。[GitHub Trending]
- Claude Academy:Anthropic 官方学习中心(Product Hunt 上架)。[PH]
- AutoClaw:跨桌面、浏览器与聊天的工作 agent。[PH]
- Antigravity IDE Extensions:Google Antigravity agent 直接嵌入现有编辑器。[PH]
📰 博客更新
Anthropic Engineering
以下条目由 feed 提供标题和直链,未提供正文摘要:
Claude Blog
🐦 开发者动态
- Thibault Sottiaux(Codex 与 ChatGPT,OpenAI):更新 Codex 的 rate limit 情况——定位到长 session 多次压缩使用图片时的低效、Computer History 的 p95+ 高占用,以及某个被误用的生成功能,正在针对性改进。[1382👍]
- Peter Yang(AI 教程与访谈创作者):分享一个隐私技巧——在 Chrome 中打开特定网址,用 Codex 或 Claude Code 运行时告诉它浏览器有打开的标签页,即可一次性挑选并清理第三方数据。[447👍]
- Madhu Guru(Meta AI 高级总监,曾任 Google 主导 Gemini/Veo):「How to build great evals」第 6 篇——在 evals 上 hill climbing 就是挑一个真正重要的维度持续优化,并贴合最新数据分布。[143👍]
- Amjad Masad(Replit CEO):调侃某产品「pretty soon」的结果是 3 个月后落地,延续其对 shipping 节奏的观察。[643👍]
- Aaron Levie(Box CEO):认为 AI 的普及率受「是否有好的 evals」制约,远超多数人认知——模型发布附带的 evals 很有用,但只刻画了通用 AI 进步的形态。[138👍]
- Zara Zhang(Builder、哈佛'17):一句值得玩味的判断——「每个在 AI 使用上领先的人,都觉得自己落后了」,折射出当下 AI 能力的快速膨胀。[336👍]
- Dan Shipper(Every 创始人兼 CEO):力挺「agent native」(agent 优先)的产品设计取向。[149👍]
🎙️ 播客摘要
AI & I by Every:Microsoft CTO Kevin Scott 谈「为 agent 而生的互联网」(Best of the Pod)
Takeaway: 去年的焦点是 scaling laws,今年的主题已经切换到 the agentic web(agent 化的互联网)。Kevin Scott 提出「capability overhang(能力过剩)」的概念:模型推理能力其实已经超前于我们现在把模型用在产品里的程度,整个行业需要集体把模型具备的能力真正交付给用户。
他尤其强调,如果 agent 要真正有用,就必须替用户采取行动——调用工具、改动系统、读取多样化的信息源,这就需要一套「长得像互联网」的生态。他主张微软内部所有系统都讲一套标准协议与自家 agent 互通,并把 MCP 类比为 agentic web 里的 HTTP、NL Web 类比为 HTML——正如 HTTP/HTML 成就了今天的互联网,简单、可组合、开源的协议将决定 agent 能否真正「做事情」。
另一个关键短板是 agentic memory(agent 记忆):当前 agent 过于「事务性」,一次任务结束记忆就可能被清空、下次从零开始,这严重阻碍了把越来越复杂的任务委托给 agent。在他看来,让记忆在任务之间延续、并围绕开放协议构建可互操作的生态,是今年最值得关注的方向。