每日编辑摘要

№ 20260813

DeepSeek 一天三连:V4 Pro 正式版发布遇事故、Harness 开源、API 全面涨价;Gemini 3.7 Flash 半价登场

8 月 13 日(PT)是 2026 年以来模型发布最密集的一天之一。DeepSeek 在同一窗口内完成三件事:V4 Pro 正式版上线(随后被社区发现部署异常、疑似回滚后重发)、开源 agent 运行时 DeepSeek Harness v0.1、并宣布 API 全面涨价;Google DeepMind 发布半价的 Gemini 3.7 Flash;…

8 月 13 日(PT)是 2026 年以来模型发布最密集的一天之一。DeepSeek 在同一窗口内完成三件事:V4 Pro 正式版上线(随后被社区发现部署异常、疑似回滚后重发)、开源 agent 运行时 DeepSeek Harness v0.1、并宣布 API 全面涨价;Google DeepMind 发布半价的 Gemini 3.7 Flash;OpenAI 端出 GPT-5.6 的 Ultrafast 极速模式和一位新 CRO;xAI 的 Grok 4.6 与 Grok Bot 也在同一时间线内扩散。主线是 agent 竞争从“模型能力”扩展到“运行时 + 成本”的完整维度,而 DeepSeek 的发布事故提醒:模型炼得出来,发布环节同样会出错。

主题一:DeepSeek V4 Pro 0813 正式版:上线、回滚、重发

DeepSeek 于北京时间 8 月 13 日晚在 APP、网页端和 API 同步上线 V4 Pro 正式版(模型名 deepseek-v4-pro),官方公布的 Agent 成绩包括 HLE(wo/w tools)42.7/60.0、Terminal Bench 2.1 为 87.9、Cybergym 83.3、DeepSWE 从预览版 12.8 提升至 62.7、全栈开发基准 71.1,并声称“性能超过 Opus 4.8、接近 Fable 5”。官方还强调原生支持 OpenAI Responses API,社区称“一键把 Codex 后端换成 DeepSeek 不用改代码”。

但社区实测与官方宣传出现明显落差。多位用户反馈 0813 上线后复杂任务思考时间“短得离谱、基本不超过 10 秒”,凌晨疑似紧急回滚;DeepSeek 官网一度撤下正式版发布通知,被社区称为“可能是 DeepSeek 第一次发布失败”。随后 API 返回的模型指纹从可读格式(如 fp_v4pro_20260812_prod0820_fp8_kvcache)突然变成纯 32 位哈希,且 Pro 与 Flash 同时切换,指向线上推理栈的一次明确变更。最戏剧性的是社区在 Hugging Face 上发现:上传的 V4-Pro-0813 仓库 config 与 V4 Flash 一致(hidden_size 4096、43 层、256 个 routed experts、64 个 attention heads,而 Pro 应为 7168、61 层、384 experts、128 heads),仓库一度下架,重传后不仅 config 改回,部分 safetensors 权重的 SHA256 与文件大小也发生变化。

证据边界:官方 benchmark 为厂商自测;发布事故、回滚与权重变更均为社区观察(MaxForAI、karminski-牙医等),DeepSeek 官方未公开解释。若“发错模型”成立,这更像部署与发布环节的问题,而非模型本身能力归零。

同日 DeepSeek 宣布 API 全面涨价:8 月 17 日零点起实行峰谷双价,缓存命中输入价最高涨 12 倍、输出涨约 4.5 倍,非高峰输出约 $1.98/百万 token、高峰约 $3.96。即便涨价,其价格仍显著低于 Fable 5($10 输入 / $50 输出),社区共识是“涨完仍是同级别最便宜”。社区对正式版的详细解读还提到:Terminal Bench 87.9 只比最贵的 Fable 5 低 0.1,Cybergym 83.3 与 Fable 5 打平,DeepSWE 从预览版 12.8 干到 62.7,且原生支持 OpenAI Responses API、为 Codex 做了专门优化;模型新增三档推理强度(简单任务 low、日常 agent high、复杂任务 max),把推理预算与价格直接挂钩。官方还披露了内部自建基准 DSBench-FullStack / DSBench-Hard:FullStack 排序为 Fable 5(77.2)> Kimi K3(73.7)> Opus 4.8(71.6)> V4 Pro 0813(71.1),Hard 则为 Opus 4.8(71.7)> Fable 5(68.3)> V4 Pro(67.2)> Kimi K3(63.0)——在 DeepSeek 自己定义的高难 agent 任务里,Opus 4.8 反超更新的 Fable 5。该基准尚未公开题目与数据分布,结论需谨慎。

发布事故之后,社区验证仍在进行:有测评者称已烧掉约 1 亿 token 排查 V4 Pro 0813 的问题所在,并预告发布评测与硬核解析视频;也有用户对比 Pi + V4 Pro 与 Claude Code / Codex / Gemini / Grok 的手感差异。这些属于单帖实测,不能当作对模型能力的定论,但“官方发布版本与社区体验不一致”本身已构成当天的重要信号。

源链接:

主题二:DeepSeek Harness v0.1:把 agent 运行时整个开源

DeepSeek Harness(DSH)v0.1 于北京时间 8 月 13 日晚发布开发者预览版,MIT 许可,基于 Cordis 元框架,核心设计是“一切皆插件”:模型、工具、技能、会话、沙箱、文件系统、循环、编排乃至 UI 均可自由组合与替换。发布后数小时内 GitHub stars 从 2.4 万冲到 3 万以上,社区称其为“agent 时代的 emacs / foobar2000”。

从泄漏的系统提示词和社区代码阅读看,DSH 不是又一个聊天框:它定义了几套执行模式——标准模式(写代码、改仓库)、PTC 模式(Programmatic Tool Calling,用 TypeScript 一次组合多步工具调用,五次往返收成一次)、极简模式(只留持久 bash 和按绝对路径改文件的 str_replace_editor)、创造模式(在活的运行时上执行模型写的 JavaScript,自定义 agent 预设)。运行时层面包含 KV 缓存感知设计(不修改历史前缀、变更末尾追加)、长任务 Goal 状态、session resume/fork 后 Goal 需重新 rearm、以及“Ralph Loop”——每轮创建一个完全失忆的新 agent,只通过共享 Workspace 保留长期记忆。Session 采用 Event Sourcing,追加日志为准、状态为投影。默认由 deepseek-v4-flash 驱动。

社区评价两极。支持方称“把内部训模型、跑生产用的 harness 全放出来,这才是真开源”;反对派则认为对日常写代码的开发者“重得毫无必要”,并反馈并行复杂任务时前端易卡死、API 404 等体验问题。还有开发者把 DSH 比作“agent 时代的 emacs”(Pi 是 vim),玉伯称其让人想起 foobar2000——一个高度可组合、靠社区插件生态生长的软件形态。发布后当天已出现 DSH 桌面版、搜索插件(dsh-find-plugin)、插件精选列表(awesome-dsh-plugin)与 Tokei 的 Day-0 支持,插件生态的启动速度相当快。

证据边界:系统提示词与架构分析来自社区阅读,论文含大量范畴论符号但工程判断存在分歧。这件事的意义在于:开源 agent 运行时成为新的竞争焦点,“模型 × Harness 才是完整 agent 能力”的判断正在被更多实验室接受。

源链接:

主题三:Gemini 3.7 Flash:三周迭代、价格减半

Google DeepMind 发布 Gemini 3.7 Flash,距离 3.6 Flash 仅三周,主打编程与智能体任务,输入/输出定价为每百万 token $0.75 / $3.75,是原 3.6 Flash 的一半;Google 侧称 introductory price 持续到年底,OpenRouter 渠道半价到 8 月 27 日。模型支持 1M context、reasoning、tool calling、多步规划与多模态,Cline 等工具当天接入。DeepMind CEO Hassabis 与多位研究者密集背书“闪电般快”。

社区评价:与 Grok 4.6、DeepSeek V4 Pro 同日发布相比,Gemini 的声量“安静得可怜”,但 GA 版本对生产用户价值明确——此前 Preview 的并发与稳定性是主要痛点;Cline 官方称“基准结果接近前沿水平”(该说法需以官方基准为准),有研究者提到其 PDF 理解能力明显增强,社区注意到模型卡上甚至出现了 PDF 演示;同时有观察者质疑 Gemini 3.5 Pro 是否被跳过(“直接奔 4.0 训练去了”),这一点尚无官方确认。意义在于 Flash 系列的发布节奏(3 周一代)叠加半价,把编码与 agent 工作的单位成本继续压低,与 DeepSeek 的涨价形成方向对比。

源链接:

主题四:OpenAI:GPT-5.6 Ultrafast 极速模式与商业化高层更替

OpenAI 发布 GPT-5.6 构建者指南和 Ultrafast 服务层:同一 Sol 模型在 Ultrafast 下比 Standard 最高快 14 倍、输出速度最高 750 tokens/s,由 Cerebras 提供算力,目前 Limited Preview,Jane Street、Podium、Basis、Rogo 等已在测试;相比之下,7 月底刚推出的 Fast Mode 只有 2.5 倍速度、2 倍价格。官方给出的应用场景集中在实时语音、故障响应、金融研究、客服等对延迟敏感的 agent 场景。构建者指南还披露:启用保留推理和压缩后,Sol 在 ARC-AGI-3 上从 13.3% 跃升至 38.3%,输出 token 减少约 6 倍;Luna 在 BrowseComp 上以 84.04% 追平 GPT-5.5(84.36%),单次成本从 $33.27 降至 $1.33;新增推理持久化、原生多智能体编排与程序化工具调用等 API 能力。

商业化层面,OpenAI 一周内连失两名高管:8 月 11 日 COO Brad Lightcap 离职,8 月 13 日 CRO Denise Dresser 离职(加入仅 8 个月,5 月还公开称企业客户贡献 40% 收入、预计年底 50%);继任者 Dali Rajic 来自 Google 旗下 Wiz(此前任 President/COO),同时有报道称 Greg Brockman 正在重新加强对日常运营的影响力。证据边界:人事信息来自 WSJ/Axios 转述(社区单源),OpenAI 官方仅确认任命。在 IPO 与组织重构并行的节点上,商业化最高层连续换人值得关注。

源链接:

主题五:Grok 4.6 与 Grok Bot:xAI 的 agent 双线推进

SpaceXAI 与 Cursor 合作推出 Grok Bot,一个可连续操作应用与网站、完成后返回结果的通用 agent:能研究线索、更新 CRM、处理发票、复现 bug、在用户电脑关闭时继续跑已学习的工作流,beta 面向 SuperGrok Heavy 与 Cursor 订阅者,团队席位 $120/月起、个人 $200/月。同一天 Grok 4.6 扩散:Perplexity CEO Aravind Srinivas 称在其 Wide-And-Deep-Research 基准上用 Perplexity Computer harness 评测,Grok 4.6“干净地落在性能/成本 Pareto 前沿”;Warp 当天接入;多位实测者评价“智能接近 GPT-5.6 Sol、接近 Opus 5/Fable 5,但更快更便宜”。埃隆·马斯克还放风 Grok 4.7 将在约一个月内发布,并称其真实工程能力“如果被超越会很惊讶”(厂商/创始人自述,需标注)。

社区围绕“谁更划算”出现直接对照:一方称 Grok 4.6 在“每次成功成本”上领先 V4 Pro,另一方称 V4 Pro 同提示词下比 Grok 4.6 快一倍。这些多为单次实测,不构成普遍结论。意义:xAI 在模型、订阅与 agent 产品三条线上同时加码,与 Cursor 的合作把 Grok 直接送进最活跃的编码 agent 用户群。

源链接:

主题六:X 开源“For You”推荐算法并推出“限流”自查工具

X 将“For You”页面的推荐算法开源,并同步推出一个自查工具:用户可查看上个月自己的账号或单条帖子是否被打上“限制可见性(Limiting Labels)“标签,还能把数据下载下来自行分析。功能目前是试点:随机抽取部分账号,注册满 1 年且上月发帖不少于 10 次。社区对开源内容的权重解读:预测引用权重 5×、预测关注 4×,通过 DM 或复制链接分享有额外奖励;重复文本会被标记为 COPYPASTA_SPAM;“不感兴趣”、拉黑、静音与举报对分数有负向影响,其中举报权重最强;点赞贡献的 SimClusters 发现分有 8 小时半衰期;账号信誉 UserCredV2 更接近信任/权威度量,关注质量比数量更重要。

意义:把内容分发的“明牌”公开,既是一次透明化尝试,也让创作者第一次能系统性地看到限流判定。需要说明的是,公开的权重数值用于预测事件,不代表每次互动都会精确加减分。

源链接:

主题七:开源模型三连:Qwen3.8-2.4T-A95B、MiniMax Music 3.0、小红书 dots.tts

阿里开源 Qwen3.8-2.4T-A95B:2.4T 参数、95B 激活参数,主打自主编码、深度研究与端到端智能体执行,硅基流动提供 Day-0 支持,API 定价输入 $2.00、输出 $6.00、缓存输入 $0.25(每百万 token)。

MiniMax 发布 Music 3.0:开源权重、定位“生产级”的全能音乐生成模型,输入创意概念和可选歌词即可一次性完成作曲、编曲、演奏与制作,最长支持五分钟,已在 ComfyUI 本地运行,官方称“开源到 AGI 到来为止”。同日 MiniMax H3 宣称登顶 Video Edit Arena(官方自测,注意证据边界)。

小红书 dots 团队开源 20 亿参数全连续端到端自回归语音合成模型 dots.tts,官方称在 Seed-TTS-Eval 三个子集上取得最佳平均内容准确度和平均说话人相似度(厂商自测)。

三件事的共同点:开源权重正在覆盖音乐、语音等此前以闭源为主的模态,且“开源 + Day-0 推理平台支持”成为标配。此外社区还在实测 MiniMax H3 的本地部署(双 4090 记录)与 Seedance 2.5 的视频微表情对比,属于单帖体验,不构成基准结论。

源链接:

主题八:agent 研究信号:水印、skill 代价与记忆基准

Anthropic 为 Claude 文本加入不可感知的机器可读水印(8 月 2 日及以后发布的模型生效),覆盖 chatbot、API 与 Claude Code,图像端有类似系统,官方口径是满足欧盟 AI 法案透明度要求;X 上出现“因水印取消 Claude 订阅”的讨论,属个别用户行为观察,不代表普遍趋势。

两份 agent 相关论文在同日被广泛转述。其一是微软与同行的工作:把 307 次 agent 失败归因于已加载的 skills(125 次功能性失败、182 次效率回退),发现“看似相关的 skills 反而推动 agent 错误实现或遗漏任务要求”,成本回退的最大来源是过度验证(67 例)与重型实现管道(30 例),且与提示长度无关——skills 会把验证清单悄悄变成强制性工作。

其二是 Harness-IF:逐条评估 256 条 AGENTS.md 规则,在 12 个前沿模型上 raw accuracy 为 72.1%–85.9%,剥离“模型本来就会这么做”的巧合后(Against-Prior)降至 66.1%–78.6%,所有模型都下降 3.6–7.4 个点;优先级不随提示深度排列——系统提示、项目文件与用户指令的优先级高于工具与技能描述。此外,UC San Diego 团队构建的 agent 记忆基准把记忆拆成四项能力(准确检索、测试时学习、长程保持、选择性遗忘),所有被测系统(纯上下文、RAG、外部记忆模块)至少有一项不达标,“多数系统对检索很强、对遗忘避而不谈”。

这些研究合起来指向同一个工程教训:agent 的能力不仅取决于模型,还取决于加载了什么规则、技能与记忆机制——加得越多不一定越强。

源链接:

高价值单点

🕐 小时信号精选

PT 时间 信号 为什么值得记住
00:00 DeepSeek V4 Pro 0813 上线后社区实测不佳,复杂任务思考时间异常短 发布事故的第一波现场证据
01:00 DeepSeek 官网撤下 V4 Pro 0813 发布通知 “首次发布失败”讨论升温
03:00 内部基准 DSBench 被挖出,Hard 档 Opus 4.8 反超 Fable 5 自建基准暴露实验室优化方向
04:00 DeepSeek 涨价图传开:缓存命中输入价最高涨 12 倍 价格体系从“地板价”转向峰谷定价
05:00 API 指纹从可读格式变为 32 位哈希,Pro/Flash 同时切换 线上推理栈切换的间接证据
07:00 DeepSeek Harness 开源,数小时破 2.4 万 stars 开源 agent 运行时成为当天第二主线
08:00 DSH 破 3 万 stars;标普 500 首触 7800 热度与市场情绪同频
09:00 Gemini 3.7 Flash 正式发布,Cline 当天接入 半价工作模型加入价格战
10:00 OpenAI CRO Denise Dresser 离职消息传开(WSJ 报道) 商业化高层连续更替
11:00 Hugging Face 上 V4-Pro-0813 的 config 与 Flash 一致被确认,仓库下架重传 发错模型的实锤线索
12:00 X 开源 For You 算法并推出限流自查工具 内容分发规则首次可验证
13:00 Claude 桌面版新增 auto-continue 复选框 agent 长任务体验的小改进

编辑结论

这一天最实质的变化不是某个模型的分数,而是 agent 竞争的坐标系变了:DeepSeek 用“正式版 + Harness + 涨价”三连击,把“模型能力、运行时可替换性、单次调用成本”摆到同一张桌上讨论,虽然发布过程出了事故,但开源 Harness 与新的价格体系都是长期影响大于单日波动的动作;Google、OpenAI、xAI 在同一天各自出牌,方向一致——围绕编码与 agent 场景,拼模型、拼运行时、拼每成功成本。对开发者而言,今天值得记住两件事:agent 表现是“模型 × Harness × 你加载的规则”共同作用的结果,以及便宜和快正在成为比榜单分数更硬的竞争维度。

来源与方法

审阅 30 个原始抓取文件(20 个小时快照 + 10 个命名来源),其中 5 个命名来源有实质内容,另有 4 个小时快照缺失(06/20/21/22 点)。主要事件均有跨源或强单源支撑;厂商自测基准、社区单帖实测与人事转述已在相应位置标注证据边界。信号池:rich。

微信搜一搜:智简 Smart&Concise 公众号二维码

关注公众号

智简 Smart&Concise

微信搜一搜,获取独立开发与 AI 实践更新。