每日编辑摘要

№ 20260824

NVIDIA 把 Agent 算力叙事推进到 CPU 与太空,Grok Bot 生态与字节办公 AI 同日大动作

当天最重要的变化集中在三条线上。算力侧,NVIDIA 的首颗 Agent CPU Vera 从 5 月的“评估”进入 SpaceXAI 正式部署,同时 Meta 开源了面向 AI 以太网的 RDMA 传输协议 MetaRoCE,GPU 之外的网络与 CPU 层成为新的基础设施战场。产品侧,Grok Bot 因开放试用、逆向工程公开与一批真实用例成为社区…

当天最重要的变化集中在三条线上。算力侧,NVIDIA 的首颗 Agent CPU Vera 从 5 月的“评估”进入 SpaceXAI 正式部署,同时 Meta 开源了面向 AI 以太网的 RDMA 传输协议 MetaRoCE,GPU 之外的网络与 CPU 层成为新的基础设施战场。产品侧,Grok Bot 因开放试用、逆向工程公开与一批真实用例成为社区焦点,SpaceX 收购 Cursor 的消息也在同一窗口发酵;字节则将 TRAE、扣子整体并入豆包。安全侧,DeepSeek Harness 被披露 9.8 分极危远程代码执行漏洞,给正在快速扩散的 Agent 框架敲了警钟。多个企业数字与模型传闻以单方来源为主,下文逐条标注边界。

一:NVIDIA 的 Agent 算力叙事:Vera CPU 落地 SpaceXAI,Rubin 效率与显存缩水传闻并存

NVIDIA 宣布 SpaceXAI 正式部署 Vera CPU,用于下一代 Agentic AI 工作负载,这是 Vera 在 5 月送测 Anthropic、OpenAI、SpaceXAI、Oracle 之后首次从“评估”转正。Vera 被定位为第一颗从设计之初瞄准 AI Agent 的 CPU:88 个自研 Olympus 核心,LPDDR5X 带宽最高 1.2TB/s;NVIDIA 称在 Agentic AI、强化学习与数据处理负载中,其任务完成速度最高可达传统 x86 CPU 的 1.8 倍。逻辑在于 Agent 的调用工具、跑 Python、起沙箱、检索上下文等环节大量发生在 CPU 上,需要 CPU 接住 GPU 前后的“杂活”,让 GPU 保持满载。SpaceXAI 同时被确认在开发第一代 Starmind AI 卫星,计划以优化版 Vera Rubin NVL72 机架为基础,把同一套架构延伸到轨道计算,但卫星仍处规划阶段,无发射时间表。

同一天还有两条 NVIDIA 数字形成对照。官方博客称 Vera Rubin NVL72 在智能体工作负载下每兆瓦吞吐量较 GB300 NVL72 最高提升 30 倍、每百万 token 成本降低至 35 倍,这是公司自测口径。SemiAnalysis 则爆料 Rubin Ultra 主流版本可能只保留 192GB HBM4 8-Hi,从最初 1TB 一路下调(1TB HBM4E → 768GB → 384GB → 192GB),甚至低于普通 Rubin 的 288GB,同时从 4-die 退回 2-die、面向 NVL576 的 576 GPU 规模。显存“缩水”若属实,意味着 NVIDIA 把赌注从单卡容量转向 scale-up 域规模。该规格尚未获 NVIDIA 官方确认。

源链接:

二:Meta 开源 MetaRoCE:为 AI 以太网重写 RDMA 传输层

Meta 设计并开源了 MetaRoCE,一个专为 AI 工作负载在通用以太网上打造的 RDMA 传输协议,规范、参考软件实现与合规测试套件已通过 Open Compute Project(OCP)发布。与依赖 PFC(优先级流控)的 RoCE 方案不同,MetaRoCE 把智能放到端点:原生支持乱序交付、多路径、无损容忍和双向拥塞控制,无需 PFC 即可在百万 GPU 规模下提供高吞吐、低尾延迟。对上层最友好的部分是兼容性——现有 RDMA Verbs API 和软件栈无需修改即可运行。

这是网络层少有的“重写传输协议”级别动作。若 MetaRoCE 真能在通用以太网上替代 PFC 式调优,AI 集群的组网成本与运维复杂度都可能下降;但百万 GPU 规模声明目前来自 Meta 自身,实际集群验证与生态采纳仍需时间观察。它与 NVIDIA Vera CPU 同属一个方向:当 GPU 算力不再是唯一瓶颈,网络与 CPU 开始决定集群效率上限。

源链接:

三:Grok Bot 生态爆发:从收购、开放到逆向工程与“AI 员工”

Grok Bot 是本日社区热度最高的单一产品。产品侧,它向 SuperGrok Plus、Cursor Pro、Cursor Teams 开放,并为其他用户提供免费试用;同一窗口,多条帖子称 SpaceX 以约 600 亿美元收购 Cursor、其创始团队全员成为亿万富翁,马斯克在收购后向 Cursor 团队表示“不习惯输”。收购金额与细节目前只有 X 帖子来源,未见官方公告,应视为未经证实的市场消息。

工程侧出现两件有实证的事。一是 Grok Bot 0.18.0 打包时未关闭 source maps,开发者 Bennett 据此逆向还原出约 44 万行可读 TypeScript 运行时与 5.4 万行 React 渲染层,并在此基础上做了功能扩展:把会话路由到 Cursor、Claude Code、Codex、OpenRouter 四个后端,搭 MCP 工具桥,加本地 Docker 沙箱与用量统计。这既是闭源产品被“解剖”的案例,也说明其架构分层(渲染层 → preload 窄桥 → 主进程 → coordinator → host)本身设计得清晰。二是社区涌现大量真实使用报告:有人在 Grok Bot 里搭了 6 个职能的“AI 员工”流水线并保留支出审批;有人报告 143 个任务、花费 64 美元跑完一个百万美元生意的部分环节。这些数字均为用户自述,不构成普遍性证明,但“AI 员工”“AI 公司”的用法在一天内集中出现,本身是需求信号。

源链接:

四:字节整合办公 AI:TRAE、扣子并入豆包

据《智能涌现》独家,字节跳动对旗下办公 AI 产品完成团队整合:TRAE、扣子(Coze)团队整体并入豆包体系,TRAE Work 与扣子将和豆包在工作场景的产品能力整合,TRAE IDE 及 CLI 作为豆包品牌下的编程产品线继续发展,产品和运营团队向豆包产品负责人赵祺汇报。字节官方回应称旨在协同产品与技术资源、用户权益不受影响。8 月年中全员会上,梁汝波把业务战略概括为“高度优先,粗主干,优化长期”,明确豆包要成为“主干”AI 业务。

这一整合把字节的办公 AI、编程工具与通用助手收拢到单一品牌下,方向是减少产品线内耗、集中火力。消息源为单一媒体独家,字节官方仅确认“协同资源”,未披露组织细节;后续产品是否保留原品牌、团队如何融合仍待观察。

五:DeepSeek Harness 曝 9.8 分极危 RCE:Agent 框架的安全边界问题

奇安信威胁情报中心披露,DeepSeek 开源 Agent 框架 DeepSeek Harness(DSH)存在未授权远程代码执行漏洞,编号 QVD-2026-57410(暂无 CVE),评级 9.8 分“极危”,受影响版本为 0.1.1-rc.2。问题出在 DSH Web 服务 /api 接口的信任判断:它用 HTTP Host 请求头判断请求是否来自本机回环地址,而 Host 头可由客户端自行构造,导致公网或局域网部署、且无额外身份认证时,攻击者可绕过限制访问高权限 RPC 接口,进而以服务进程权限执行任意系统命令。

缓解条件是默认监听仅限本机回环,风险集中在 Docker 端口映射、反向代理等暴露场景。这个漏洞的典型性在于:Agent 框架天然拥有 bash、文件读写与代码执行能力,任何认证缺陷都会直接升级为 RCE;随着 DSH、Pi、Grok Bot 一类 harness 快速普及,这类“能力很大、默认配置偏信任”的工具会成为攻击面。奇安信标注 POC 与技术细节已公开,用户应尽快检查网络暴露并等待官方修复。

六:开源模型梯队:Qwen3.8-27B 本地化、OX-Alpha 神秘模型、Apodex 1.1 开源

开源侧三条线并行。其一,Qwen3.8-27B 继续充当“消费级硬件上限”的标尺:有用户在 16G 内存 M1 上以 GGUF 形式跑通无审查版,有用户称其 WebDev 跑分超过 DeepSeek V4 Flash High,还有评价认为它与 Muse Glimmer 一起抬高了本地 Agent 的天花板。这些多为单用户实测,但方向一致:27B 量级的模型正在把“半年前的前沿”搬到游戏显卡上。

其二,神秘模型 OX-Alpha(0x-alpha)当天在 OpenRouter 上被观测到约 5 万亿 token 的调用量,约为 Claude Opus 5 或 GPT-5.6 Sol 的 30 倍,且当前免费;预测市场(成交量低)暗示其出自 Z.ai。有人将其与 DeepSeek-V4-Flash-Vision-Exp 对比后认为性能占优、且“不太像只有 100B”。模型归属与参数量均未证实。

其三,Apodex AI 1.1 开源:35B 规模 Mini 版基于 Qwen3.5-35B-A3B-Base 继续训练,面向长任务、工具调用与 Agent 协作,Apache 2.0,推荐 262K 上下文;配套 FrontierAgent 框架主打“长时间研究 + 文件交付 + 多 Agent + 可复现实验”,在 FrontierFinance 上拿到 50.2。量化版可单卡 5090 运行,适合数据敏感场景。UC Berkeley 的 FreeToken 同日在社区传播:面向 MoE 的边缘推理引擎,8GB 显存可跑 Qwen3.6-35B。开源模型的“可本地部署”与“Agent 专用”两个标签正在合流。

七:MCP 补上企业级能力:官方路线图与托管式身份认证

MCP 官方团队公布未来 6–12 个月路线图:长时任务(流式、服务端推送、中途转向)、用 HTTP 统一本地服务器的传输(相对 stdio)、面向大型目录的渐进式发现、Agent 的标准身份与委托权限、以及对照规范生成的 SDK。路线图把 MCP 从“连接协议”推向“分布式 Agent 运行时的公共底座”。

同日 Anthropic 上线 Enterprise-managed authentication:Claude Team 与 Enterprise 客户可直接通过自己的身份提供商(IdP)统一管理 MCP Connector 的认证与访问权限,管理员集中配置谁能访问哪些 Connector,员工登录后自动连接,无需单独 OAuth 授权。社区数据还提到一个现象:企业级 Agent 里 MCP 的使用率远超 Skill。身份、权限、审计这些“企业级基础设施”开始补齐,是 MCP 从开发者玩具走向采购清单的关键一步。

八:视频生成成本战:Wan 3.0 打三折,H3 推理加速 27.7 倍

AI 视频的价格与延迟同日出现两个量级变化。价格侧,Wan 3.0 上线 Topview:生成 30 秒视频约 1.20 美元,是 Seedance 2.5(约 3.60 美元)的三分之一;新版本支持原生 30 秒、文本/图片/Omni Video 输入、最多 20 个参考素材与更精确的局部编辑。有用户对比:用 Seedance 跑 3 版的预算,Wan 能跑 9 版。Seedance 2.0 Fast 的价格也被晒出低至 0.026 美元/条,一个月前同类生产还接近 1 元人民币/秒。

延迟侧,MiniMax 官方公布 NVIDIA SANA 团队在其 H3 上的 Sol Engine 工作:把生成拆成 4 步低分辨率 H3 草稿 + 3 步目标分辨率 LTX 精修(Sol-Attn),单张 GB200 上 768p 首帧延迟从 414 秒降到 14.93 秒(27.7 倍),并称单节点月产能可达 37.8 万条视频、GPU 毛利率 97% 以上。这些数字均为公司口径,未独立验证;但“视频从批处理走向近实时交互”的方向,与价格战叠加后,正在改写视频生成的单位经济模型。

九:具身智能的“数据墙”:真机数据瓶颈与资本躁动

宇树市值蒸发 1900 亿的讨论之外,当天出现一篇来自 WRC 参会者转述的行业现场观察,把具身智能的卡点概括得很朴素:多数机器人公司仍处于 Demo 阶段,产品与融资很多,但离稳定、泛化、规模化很远;真正的瓶颈不是本体而是数据——真机数据采集成本约数百至上千元/小时,通用机器人可能需要百万小时级真实数据,绝大多数创业公司的“弹药”不够烧;合成数据在家庭等开放场景会明显劣化,Sim-to-Real 尚未收敛。该观察还认为国内创业公司可能打不过大公司(资源差距,如对方一次采购 20 个激光雷达),并看好 Tesla 的 FSD 数据闭环能力。这是一份强单源现场报告,观点鲜明但非抽样统计。

资本侧,HubToday 转述小鹏物理 AI 业务融资超过 9 亿美元,IRON 机器人有 76 个自由度(手部各 21 个),计划 2027 年向中外客户交付;ResNet 作者任少卿创办的物理 AI 基础模型公司获蔚来战略投资。融资热度与“数据墙”的现实并存,是当前具身赛道最突出的张力。

十:Agent 经济学:token 白菜化,搜索与工具变贵

当天多组数据指向同一趋势:模型推理成本快速下降,但 Agent 的边际成本重心开始转移到模型之外的环节。20VC 的 GP Paul Bonnet 用铝做类比:1852 年铝约 1200 美元/公斤,1954 年跌至 0.48 美元/公斤(跌超 99.9%),但市场规模扩大约 1300 倍;他认为 AI token 可能正在经历类似过程,且 Agent 时代 token 的主要消费者将从人变成机器,最大的机会属于“token 便宜 10 倍、100 倍之后才成立”的新品类。一组实测案例支撑“便宜模型的价值不止省钱”:有人把月均近 5000 美元的 AI 账单切到 Kimi 后降到 278 美元,于是敢尝试更多任务。

搜索侧出现反向信号。Parallel 发布 Search Fast API,1000 个搜索结果 1 美元、平均延迟约 700ms;其测试称在完整 Agent 任务中,Parallel Fast 的搜索成本占比不到 12%,而 Brave 约 48%、Exa 约 48%、Tavily Basic 达 68%,整体任务成本可降 2.2–2.79 倍。配套数据是近几个月 Intelligence Index ≥60 的模型成本下降 8.5 倍、≥50 的下降 12.5 倍。当模型越来越便宜,Search、Browser、Context、Memory、Sandbox 这些外围基础设施开始占据越来越大的成本比例,Agent Stack 的定价战才刚刚开始。

高价值单点

  • GPT-5.6 登陆 Kiro:OpenAI 将 Sol、Terra、Luna 三款模型接入软件开发智能体 Kiro,称 Terra 在 Terminal-Bench 2.1 中完成任务成本降低约 82%,由 OpenAI 与 AWS 合作优化(公司口径)。
  • Claude 文本水印机制拆解:rasbt 用 52 页 PPT 拆解 Anthropic 水印——在 sampling 阶段用 secret key 干预候选词选择,形成仅 Anthropic 可检测的统计模式,无需重训模型;短文本、代码数学、大规模改写会削弱水印。
  • Claude 网页/桌面端流式渲染提速:Anthropic 重写 streaming renderer,长回答流式渲染约快 4 倍,慢速笔记本卡顿减少 9 倍,120Hz MacBook 可全程 120fps;瓶颈从模型推理延伸到前端渲染。
  • Anthropic 新模型代号流出:社区发现 claude-melon-eap、claude-marshmallow-eap 两个预发布模型,猜测对应 Opus 5.1 与 Haiku 5;仅个人猜测,未证实。
  • SSI 或于本周发布首个模型:多条线索指向 Safe Superintelligence 本周发布模型(8 月窗口、持续学习突破传闻、早期测试者称“今年最重要发布之一”);全部为传闻拼图,无人确认。
  • Perplexity 挖角 NYU 教授:Andrew Gordon Wilson 加入担任 Head of Research,研究方向点名 Continual Learning 与 Agentic Collaboration,并称后续还有大公告;仍保留 NYU 教职。
  • NVIDIA ACES 论文:用“Skill Lift”(同一任务加载/不加载技能各跑一遍的完成度差)评估 Agent 技能,947 组配对案例、58 个生产技能;结构扫描分数与 LLM 评审质量相关性仅 0.14,说明现有技能门禁预测力弱。
  • Cartwheel 动作生成 Scaling Law:该公司称构建最大规模人类动作数据集并训练数百个 Motion Model,发现自回归与 Flow Matching 两条路线都遵循可预测的 compute-optimal scaling law;公司自述,未同行评审。
  • Thinking Machines 安全研究资助:为开源权重模型安全研究提供最高 5 万美元 Tinker Credits(算力而非现金),覆盖后训练风险评估、危险能力检测等方向。
  • 台湾 B300 GPU 走私案侦结:基隆地检署起诉 9 人;130 台 B300 服务器通过多层审核获批,74 台已转售/出口至受禁国家,56 台被拦截;一名英伟达台湾员工被认定为核心放行人物,涉案非法利益约 2120 万美元。
  • Term Finance 治理攻击:基于以太坊的借贷协议被攻击者取得治理控制权,盗走约 850 万美元;未利用代码漏洞,七天提案延迟与否决机制均未阻止。
  • 中国前沿模型 ECI 差距分析:据 Epoch 数据,中国前沿模型绝对能力落后美国约 4–5 个月,但 GLM 5.1(ECI 151)、Kimi K3(157)已跨过 Opus 4.5 发布时的“可用性阈值”(约 150),Coding/Agent 实际体验差距明显缩小。

🕐 小时信号精选

PT 时间 信号 为什么值得记住
00:00 GitHubDaily 推荐 12 章、7500 行“从零训 GPT”教材 低门槛长文教材,最终可训 151M 参数模型
01:00 Darkbloom:250 台闲置 Mac 组成推理网络接入 OpenRouter 分布式“剩余算力层”首次跑通真实美元收入(年化约 10.2 万美元)
02:00 商汤开源 SenseNova U1.5 Lite(8B,单卡可跑) 原生图像编辑 + 4K 输出的原生多模态小模型
04:00 Grok 在中国/香港网络下可直接使用(Pieter Levels 实测) ChatGPT/Claude 未开放香港,Grok 成为中港直连的西方头部模型
06:00 Tibo 首次讲清 Codex“Reset”机制起源 补偿用户额度的“草台”机制成为社区文化符号
08:00 Andrew Trask 估算 AI 每日文本产量超人类(254T vs 131T 词) AI 输出总量已超过人类,质量与用途问题随之放大
10:00 DeepSeek-V4-Flash 以 5.71 token/s 跑在 Mac M5 Pro 消费级硬件运行前沿模型的又一样本
12:00 NVIDIA Nemotron 3.5 Lightning 位列开源模型 top-4(pinchbench 86.4%) 开源 agent 模型竞争加剧
16:00 Stanford 发布 PsychAdapter,恢复生成文本的个体化语气 针对 LLM 训练数据“单一声音”问题的修正方法
18:00 free-claude-code 登 GitHub 趋势第一(4.9 万星) 聚合 50 家第三方免费额度的 Claude Code 代理,月免费 token 超 13 亿

编辑结论

这一天没有单一“发布级”事件,却有多个结构性信号同时出现:算力竞争从 GPU 延伸到 CPU 与网络(Vera、MetaRoCE),Agent 产品从“聊天框”走向“可被逆向、可组建团队、可算账”的工具(Grok Bot),大厂组织开始为 Agent 办公收拢阵线(字节豆包整合),而 DeepSeek Harness 的极危漏洞提醒所有人:框架能力越大,默认信任配置的风险越高。开源模型、视频成本与 Agent 基础设施的价格战同时在加速,下一阶段的竞争重心很可能从“模型多强”转向“整条 Agent 栈多便宜、多安全”。

来源与方法

当日审阅 20 个小时抓取档与 aihot-morning、aivalley、hubtoday、openai-blog 等命名源,信号池判定为 rich。多数企业数字(NVIDIA 效率、MiniMax 加速、Parallel 成本)为厂商或用户自述口径,模型发布传闻(SSI、Anthropic 新模型、OX-Alpha 归属)未经官方确认,已在正文标注边界;部分 X 帖子互动量仅作热度参考,不作为事实证据。

微信搜一搜:智简 Smart&Concise 公众号二维码

关注公众号

智简 Smart&Concise

微信搜一搜,获取独立开发与 AI 实践更新。