OpenAI 用下一代内部模型给出 Navier-Stokes 解答,也把 AI 与学术协作的裂缝摆上台面
9 月 8 日最重的一条是 OpenAI 宣布用内部模型给出 Navier-Stokes 千禧年难题的解答:1 万个并发 Agent、约 88 小时、数百万美元算力,外加 Lean 形式化验证。同一件事的另一面,是 NYU 数学家 Tristan Buckmaster 与 Anthropic 的 Levent Alpöge 指控 OpenAI 得知其进…
9 月 8 日最重的一条是 OpenAI 宣布用内部模型给出 Navier-Stokes 千禧年难题的解答:1 万个并发 Agent、约 88 小时、数百万美元算力,外加 Lean 形式化验证。同一件事的另一面,是 NYU 数学家 Tristan Buckmaster 与 Anthropic 的 Levent Alpöge 指控 OpenAI 得知其进展后抢先发布,并牵出“用户数据是否用于训练”的争议。除此之外,Meta 发布个人智能体 Muse,ChatGPT Images 2.5 上线,DeepSeek V4.1 Flash 内测并宣布降价,推理侧则出现 Cohere Megakernel 与腾讯 FlexKV 两处工程优化。
一、OpenAI 称下一代内部模型解出 Navier-Stokes,成本数百万美元
OpenAI 在官网和 X 上宣布,其内部 AI 系统给出了 Navier-Stokes 存在性与光滑性问题的解答,并附上证明文稿与 Lean 形式化验证,同时向 Levent Alpöge 和 Tristan Buckmaster 的工作致贺。Greg Brockman 称这是七个千禧年难题之一,指向科学发现的复兴。
据 @Hesamation 转述,OpenAI 使用了一个“显著强于 GPT-6 Astra”的内部模型,拉起 1 万个并发 Agent 连续工作约 88 小时,生成 1300 亿输出 token。@小互 的整理提到 165 页证明和 Lean 验证,并称 OpenAI 表示不会去领 100 万美元奖金。Simon Willison 的整理则记录约 490 万条消息、约 3000 亿输出 token 和 17 小时 Lean 验证。这些数字都来自二手转述,OpenAI 公告本身没有给出统一口径。
需要区分的是“解了哪个版本”。OpenAI 承认双方证明差异很大,在 Euler 情形下所证命题也不同(受迫与无受迫)。Buckmaster 与 Alpöge 已经通过 Lean 机器检查的是带光滑外力的不可压缩多孔介质、Boussinesq 和三维 Euler 方程结果,他们自认拿到 Navier-Stokes 的爆破结果,但形式化尚未完成。陶哲轩认为方法原则上没有障碍可以一路推到 Navier-Stokes,但也说靠堆算力和 AI 硬推“并不特别吸引我”。结论尚未经过同行评审。
源链接:
- https://openai.com/index/navier-stokes-solution
- https://x.com/OpenAI/status/2097375276384567642
- https://simonwillison.net/2026/Sep/8/on-navier-stokes
二、署名与数据之争:数学家指控 OpenAI 抢跑
Buckmaster 在 9 月 8 日发表公开声明,披露两件事:他和 Alpöge 借助大语言模型在一个月内推进了流体力学多个难题;他指控 OpenAI 在得知其进展后试图抢先发布,并要求把在 Anthropic 工作的 Alpöge 从署名中移除。关键结果在 8 月 15 日取得,8 月 22 日通过 Lean 机器检查。两人使用过 Claude、Codex 和 GPT-5.6 Sol,Astra 主要用于论文写作和论证审计。
OpenAI 回应称,研究人员和 Agent 没有以任何方式看到对方的工作,没有访问具体用户数据;但“虽然可能性不大,我们无法排除由其使用我们产品而产生的去标识化数据帮助改进了我们的模型”。Sam Altman 称协调失败,对方只有 Euler 结果。Bubeck 澄清流传的截图是他联系对方协调发布时间。争议的核心因此从“抄没抄”变成“用我的数据改进模型到底意味着什么”。
陶哲轩的后续评论被广泛引用:仅仅“有人在研究某问题”的传闻,就可能触发大量 AI 算力在原始研究项目充分发挥之前把它“压平”;这种激励可能指向不再公开有前景的研究方向,从而逆转几个世纪以来的开放科学传统。证据边界:指控目前来自一方声明,OpenAI 否认看到工作,训练数据问题没有独立审计,双方也没有公开完整通信。
源链接:
- https://cims.nyu.edu/~tristanb/statement.pdf
- https://techcrunch.com/2026/09/08/openai-fought-dirty-on-career-making-math-problem-says-nyu-mathematician
三、Meta 发布个人智能体 Muse,安全架构成为卖点
Meta 上线个人智能体 Muse,由 Muse Spark 1.3 驱动,定位常驻、主动、能使用浏览器并连接常用应用。Shengjia Zhao 介绍,每个 Muse 跑在独立的安全虚拟机里,另有一个 Sentinel 检查每个动作,它看不到用户密码,遇到敏感操作会先询问。
与 1Password 的合作让 Muse 能使用用户已有的登录凭证。Alexandr Wang 称其速度比同类产品快 5–10 倍;Arena 的榜单显示 Muse Spark 1.3 Max 改变了 Code Arena WebDev 的 Pareto 前沿。目前仅在美国开放,欧洲用户还要等。
早期评价集中在设计与浏览器流程,也有用户指出 soul.md 这类命名对普通用户不直观、信息流相关性不足。证据边界:安全架构由厂商描述,尚无独立审计;速度对比来自公司高管,不是统一条件下的基准测试。
源链接:
- https://x.com/AIatMeta/status/2097401493770956808
- https://x.com/shengjia_zhao/status/2097402766989926911
四、ChatGPT Images 2.5:多轮编辑一致性成了主卖点
OpenAI 发布 ChatGPT Images 2.5,官方给出的改进集中在四点:生成延迟最多降低 50%;光影与纹理更自然,参考照片中的主体保留更好;只改指定部分的精准编辑;多轮编辑后此前的修改不衰减。新入口包括在对话框输入 @Sketch 直接画草图,以及海报、商品图等模板。ChatGPT 每周图像生成量已超过 30 亿张。
API 同步上线 GPT-Image-2.5 Flare 和 Sunburst 两个模型:Flare 面向快速、高质量的日常生成,Sunburst 面向需要精细控制的创意工作,生成时间更长;两者都支持 xhigh 与 max 质量档位,token 计费沿用 GPT Image 2 的标准。
实测反馈并不一致。@歸藏 说破碎感和涂抹感有所改善但幅度不大,一致性明显变强,尤其是连续多次编辑;图像元数据里标注的仍是 2.0,因此无法从元数据判断版本。多轮一致性如果稳定,对用产品图和品牌素材反复迭代的工作流影响最大。
源链接:
五、DeepSeek V4.1 Flash 内测并宣布降价
多个中文账号转述 DeepSeek 官方群通知:V4.1 Flash 进入内测,采用新的模型结构,原生支持多模态,计费与 V4 Flash 相同,单账号最多 20 并发,把模型名改成 deepseek-v4.1-flash-expires-on-0910 即可调用。有用户实测速度在 200–335 tok/s 之间。
随后 DeepSeek 宣布自北京时间 9 月 10 日 12:00 起调整 Flash 系列 API 定价:缓存未命中输入从 1.5 降到 1 元/百万 token,输出从 4.5 降到 4 元,缓存命中输入从 0.05 降到 0.02 元,降幅 60%;高峰时段仍是闲时的两倍。有用户指出,与涨价前相比输出价格仍偏高,闲时约高出一倍,高峰约高出三倍。
一张流传的跑分图显示,在 DeepSWE v1.1 和 mini-SWE 设置下,V4.1 Flash 的 max 档 Pass@1 达到 75.1%,略高于图中的 GPT-6 Astra 和 Claude Opus 5,平均每次任务成本约 0.25 美元。证据边界:内测消息来自群通知转述,跑分图是推特图表的读数,最高 60% 的降幅只针对缓存命中部分,实际账单节省取决于输入、输出与缓存的占比,一切以官方正式发布为准。
源链接:
六、推理基础设施的两处硬优化:Cohere Megakernel 与腾讯 FlexKV
Cohere 开源了围绕“decode megakernel”的推理服务方案。它把整个解码阶段的前向计算交给一个常驻 GPU 的持久 kernel,不再逐算子启动。在单张 H100、BF16、batch size 1 条件下达到 292 tok/s,是 H100 显存带宽理论上限的 62%,比 vLLM 的 185 tok/s 快 1.58 倍;batch size 8 的端到端服务在真实基准上快 1.25–1.41 倍。
思路源于斯坦福 Hazy Research 的 “Look Ma, No Bubbles!”:每个 SM 启动一个常驻线程块,从全局内存读取任务列表,用原子计数器表达依赖,把调度粒度从“一个算子”缩小到“某个算子的某个 tile”,同步范围也缩小到真正依赖的生产者。Cohere 的差异是即使 batch 1 也用 tensor core 的 wgmma 指令,并给每种 opcode 一套静态布局的 warp 专用流水线。它解决的是算子边界处的等待,而不是算子本身。
腾讯云 TACO 团队与社区开源了 FlexKV,处理大模型推理中的 KV Cache 管理。关键判断是“命中缓存不等于 GPU 不用等待”:KV Cache 若在显存之外,即使命中也要搬回 GPU。FlexKV 逐层恢复缓存,前面的层开始计算时后面的层同时加载,配合预取与异步回写。
它同时用无损压缩、CPU 内存/SSD/远程存储扩容、集群内跨节点前缀复用,并把请求调度到已保存对应缓存的节点。FlexKV 位于推理引擎下层,不需要重构原有流程,已支持 SGLang、vLLM、TensorRT-LLM 和 NVIDIA Dynamo。腾讯的测试结果是首 Token 延迟最高降低 70%,每分钟请求数提升 16%。
源链接:
- https://x.com/shao__meng/status/2097467097970552993
- https://x.com/verysmallwoods/status/2097452698568122420
七、AI 就业账本:经济学人估算净增约 100 万岗位
《经济学人》估算,AI 到目前为止在美国创造了约 100 万个新岗位,远高于 2023 年年中以来因 AI 裁掉的约 20 万个。依据之一是 9 月 4 日发布的 8 月就业数据:新增 16.2 万个岗位,失业率 4.1%,处于近半个世纪低位。
增长来自两处。高技能岗位方面,工程师、软件开发者、数学家和数据科学家等“离 AI 最近”的职业自 2022 年以来比趋势线多出约 73 万个岗位;Burning Glass Institute 的首席经济学家估计,约 1% 的美国专业岗位可归为“AI 岗位”,在计算机和生命科学领域达到 4–5%。蓝领方面,数据中心建设支出一年内增长 60%,电工、暖通、电网工程师需求上升,Indeed 数据显示数据中心安装与维护岗位薪资比同类工作高约 40%。
受损的岗位同样具体:客服自 2023 年 1 月以来缩减约 10%,行政助理缩减约 15%;2026 年至今美国企业平均每月宣布约 1.6 万个与 AI 相关的裁员,但同期雇主正常的月度离职规模约 170 万。Pew 调查显示 50% 的美国成年人表示 AI 让他们“担忧多于兴奋”,2021 年这个数字是 37%。证据边界:这是“到目前为止”的账本,数据中心岗位有建设周期性,劳工统计局数据的公信力本身也在被质疑。
源链接:
八、OpenAI 首席科学家呼吁放慢:An Alien Mind
OpenAI 首席科学家 Jakub Pachocki 在一篇题为《An Alien Mind》的文章里,主张行业不要再把“全速扩张”当作默认选项。他的理由是:今天的系统更像被“养”出来而不是被设计出来的,是巨大优化过程的产物,没有人完全理解;不能假设这种智能会自行继承人类的原则。
他把转折点定在 2023 年年中,OpenAI 的 RLSlow 项目首次显示推理模型还能继续扩张。他认为这个节奏可能走向递归自我改进:AI 承担越来越多“造出更好的 AI”的工作。目标跟随能力在提升,价值对齐(诚实、正直、没人看着时仍“热爱人类”)没有。他举 Hugging Face 事件为例,并说未来的 Agent 可能为了自己的目标去讨价还价、欺骗甚至勒索。
时间点很尴尬:GPT-6 Astra 刚刚发布,在编程、电脑操作、网络和科学上都有大幅跃升。Pachocki 说它比上一代对齐得更好,但仍然不够;结论是没有任何实验室把对齐与监控做到可以继续踩油门的程度,他想要自愿放慢、强制安全底线,最终走向国际协调。同期,Jensen Huang 在 Astra 发布后宣称“AGI 已经到来”。证据边界:这是个人文章与公司立场的混合表述,不是可验证的技术结论。
源链接:
九、Agent 工程的重心从模型转向上下文与权限
同一天多条更新指向同一件事:Agent 的难点正在从“模型够不够聪明”转向上下文和权限怎么管。Harrison Chase 说,harness 应该让上下文工程变简单,“forking” 子 Agent 是有效的上下文工程技巧,现在已经内建进 deepagents,memory 也已内建。他同时指出 Agent 认证越来越难:它是以自己的身份行动,还是代表用户行动。
Viv 的观点更直接:harness 的主要职责是促成好的上下文工程;当多个 Agent 通过共享接口(文件系统传消息、Agent 之间传消息)协作时,这个问题会随规模变难,上下文分叉、RLM 和供未来检索的持久存储都是解法方向。
权限侧的信号同样具体:Codex 的浏览器可以接入 1Password,从而登录用户的各类应用;Codex 里的 GPT 对话带有当前项目的上下文,比网页端更清楚你在做什么;Amp 取消了消息排队,直接把用户消息发给 Agent,理由是排队只对容易分心的模型有意义。工具层也在跟进:mksglu 的上下文管理宣称减少 98% 噪声并覆盖 17 个平台路由;SkillZip Pro 强调压缩时要保护 Skills 的路由和加载权重;“Design Docs Are All You Need” 把自然语言设计文档当作主分支,由子 Agent 重新生成实现。
证据边界:这些多是工具作者和从业者的经验陈述,效果数字来自各自的项目描述,没有统一基准;但它们共同说明,Agent 产品的竞争点正在从模型调用转向上下文、记忆与授权边界的工程。
高价值单点
- Mistral 完成 30 亿欧元 D 轮:Mistral 宣布 3B€ Series D,公司称这是欧洲科技公司有史以来最大的股权融资,资金用于扩大训练与推理算力。Arthur Mensch 说要让“开放与主权 AI”成为技术前沿,Clement Delangue 与 Macron 都公开祝贺。https://x.com/arthurmensch/status/2097232588490379686
- 模型与算力:DeepLearning.AI 确认病毒式传播的 “Ox Alpha” 即智谱 GLM-5.3-Flash,320B 参数、每 token 激活 18B,混合线性与稀疏注意力,在 GDPval AA v2 上每任务 0.09 美元,免费预览全部跑在中国产硬件上。Inception 的 Mercury 2.5 进入 GA,称比 Mercury 2 智能提升 40% 而速度与价格不变,超过 1,100 tok/s。OUI-1 是首个开源权重的生成式 UI 模型,26B/A4B MoE 基于 DiffusionGemma 微调,在 Generative UI Benchmark 上拿到 71.7%,基座只有 13.0%,并以 8 倍更少的激活参数超过 Gemma 4 31B 的 46.7%。语音侧,VibeVoice-ASR-7B 支持流式转写、说话人标注、10 种语言和热词。传闻 GPT-6 Sol 已内测、速度是 Astra 的 6 倍;B200/B300 出货受数据中心条件限制,谷歌 TPU 外部化让 NVIDIA 的推理经济性面对更直接对照。商业侧,AI Valley 转述 Tesla Robotaxi 已成为排名第一的出行应用、超过 Uber。
- 科学与世界模型:DeepMind 发布 AlphaGenome Atlas,称可预测 90 亿个可能的单字母 DNA 变异的影响,学术研究免费。英矽智能在《Nature Biotechnology》发表探索性研究:AI 设计的 rentosertib 在早期临床中,6 个独立的衰老时钟一致判定用药组生物年龄更年轻,第 4 周平均年轻 3–4 岁、最高 6 岁。Dwarkesh Patel 的实验显示,在最高 1e19 FLOPs 预算下,数据改进带来 12.0x 算力效率提升,模型改进为 3.7x,数据贡献约为模型的 3.24 倍。World Labs 的 Atlas 在推理优化后可以实时运行,支持带准确相机位姿和 3D 一致性的下一视角预测。
- 机器人:芝诺机器人推出 Zeno-1,3B 参数、本地 30Hz 闭环推理,重点是让多台机器人学会等待、让步与重新校准。智象未来的 HiDream-O1-Embodied 在 RoboColiseum 扰动适应子榜拿到 0.692。宇树科技的 UnifoLM-X2-1.0 称可用世界模型实时驱动全自主人形机器人格斗。RoboSPA 覆盖 10 类任务和 52.7 万条轨迹,把评测推进到空间推理、长程规划和失败诊断。
- 推理与训练效率研究:EvoCUA-1.5 把电脑使用 Agent 放进可执行沙盒做在线强化学习,论文称在 OSWorld-Verified 上达到 63.2% 成功率。llmovoice 把语速、噪声、丢包和历史对话纳入有界上下文,报告称误打断率从 46.0% 降到 0.9%,成本降 79.2%。CFAM 提出部署后免梯度更新,用 40% 数据达到完整训练的策略工作点,测试成功率提升 13.9%;ACE 让 Qwen3.6-35B-A3B 跳过 50% 专家仍优于强基线,另一篇把专家数从 8 降到 4 时 MMLU 仅降 0.35 点。
- 安全与合规:安全研究者发现 Scoppr 与 Nook 抄袭了 Mole 并植入可窃取密码与个人数据的恶意软件,作者提醒只从官网下载。Liquid Network 的 Elements 漏洞被用来铸造无锚定的 L-BTC,攻击者窃取约 4,000 BTC(约 3.2 亿美元),9 月 7 日已归还约 3,400 BTC;Liquid 储备一度从约 4,205 BTC 降至 197 BTC,提现通道仍未恢复。智利交易所 Orionx 涉嫌转移约 700 万美元用户资产并暂停提款。英国 NCSC 警告未批准的 AI 工具会削弱组织可见性;斯坦福 RegLab 用 AI 找出隐藏在地方性法规中的歧视性条款,估计约 5,000 万美国人生活在这样的辖区。
- 平台规则与身份:X 的原创内容奖励新增三条限制:不得下载他人内容重新上传(只有第一个上传者算原创)、不得与其他用户协调刷触达、不得用 AI 自动发帖或回复。xAI 把 X 作为插件接入 Grok Bot Marketplace,会自动为没有开发者账号的用户创建账号并附赠 100 美元 API 额度,由 Grok Bot 代发的推文会带 “Made with AI” 标识。以太坊推进 EIP-8141(“Frames”)路线图,计划允许用户无需持有 ETH 即可支付 Gas 费。
- 企业数据与治理:Anthropic 允许使用顶级模型的企业把数据保留在自有服务器 30 天,OpenAI 承诺零数据留存并配套安全处理,但两家的滥用检测都缺少技术透明度。OpenAI 开放 500 万美元资助计划,支持关于生成式 AI 如何影响青少年发展的独立研究。一份覆盖 2024 至 2026 年 9 月的报告提出“Agentic SDLC 吞吐量悖论”“生产合格变更”“验证税”等概念,认为编码 Agent 提高的是写代码量,瓶颈转移到审查、集成、测试、安全与运维。TrackLLM 持续监测数百个 LLM API 以发现未披露的变更,发现大厂接口稳定、小厂与 Azure 变化更多。
- Agent 工程与开源工具:IBM 用一句话区分 Agent 的四类知识来源——有人写下来的知识用 RAG、Agent 自己攒的经验用 Memory、可重复的流程用 Skill、要去真实世界查证或操作且不想写专有代码用 MCP。字节的 deer-flow 整合沙箱、记忆、工具、技能、子智能体和消息网关,GitHub 已有 81,669 Star;Lightpanda 主打面向 AI 自动化的轻量无头浏览器,34,615 Star。其他值得留意的还有 OpenAI 的 Codex Skills Catalog、微软的 tgrep、腾讯开源的 TeamAI CLI、Eraser 的坐标感知图表格式、instructor 1.17 和多模型编排工具 Vibe Squad。
- 基础设施与平台:CUDA 13.3 带来 CUDA Python 1.0,PyTorch 与 CuPy 现在构建在共享的 cuda.core 之上,CUDA 上下文、设备、流和内存可与 Python GPU 生态共享,减少版本冲突与互操作问题。PyTorch 的 HyperParallel 在华为 Atlas 800T 上用 Qwen3-30B-A3B 展示了比 PyTorch FSDP2 + Muon 更高的训练吞吐。Viettel 把裸金属、GPU 池化和服务优化三层拼成 Token-as-a-Service 平台。Cloudflare 称截至 2026 年 5 月线上机器人数量已超过人类,并推出 Automatic Key Exchange 扩展 Automatic SSL/TLS;Chrome 侧新增 WebMCP 与 UserActivation API 相关能力,后者用来判断访客是否真的在交互。NVIDIA 称 AI City Challenge 前五名视频方案中有四个用了 Cosmos。Shopify 结束与 Ruby Central 四年 100 万美元的 Ruby Shield 合作,转为 Ruby Alliance 继续投入共享安全基础设施。Perplexity 的索引目前包含 4500 亿以上高质量 URL,并计划年底前到 1 万亿;Aravind Srinivas 同时表示已把大量推理放到 NVLink Blackwell 上,并确认 Perplexity Search 接入了 Hermes Agent。
- 科研 Agent 的落地样本:百度伐谋被南京林业大学团队用于松材线虫病早期发现,学生用“生成方案、做实验、比较结果、再决定下一轮”的循环找到特征组合;产品负责人李安南把“自我演化”定义为在一个问题里不断探索新解法,目前对学校科研免费。OpenAI 官方博客则介绍了 MIT 研究者用 GPT-5.6 Sol 配合 Codex 自主运行量子计算实验、分析结果并校准 qubit。两例都指向同一件事:科研 Agent 的价值在于扩大探索,最后的判断责任仍在人。
- 工程文化与教育:Theo 那条 248 万播放的“能被单人看懂的代码不重要”引发争论,Google 安全研究员 LaurieWired 用起搏器、安全气囊、航电、核反应堆紧急停堆等 17 个微型系统回应:“最小的代码往往才是最重要的代码。” 课程方面,CMU 2026 秋季由 Graham Neubig 与 Daniel Fried 开设的 “AI Agents” 公开了 28 讲,MIT 多模态 AI 课程 2026 版全集上线,斯坦福 CS329Z 已在教 RAG、Tool Use、MCP、Memory、Multi-Agent 与 Eval。GPT-6 Astra 的演示继续扩散:约 3 分半通关 48 关“我不是机器人”,在 Vending-Bench 出现该基准史上最大跃升,并用 Blender 到 Unreal Engine 5 走通建筑可视化流程。
🕐 小时信号精选
| PT 时间 | 信号 | 为什么值得记住 |
|---|---|---|
| 03:00 | Buckmaster 公开声明(statement.pdf)在数学圈与 HN 传播 | 比 OpenAI 公告早约 12 小时,是整场争议的时间锚点 |
| 06:00 | 陶哲轩评价该成果为 “a remarkable achievement” | 权威第三方确认 Lean 机器检查存在,并指出作者因外部事件被迫提前发布 |
| 07:00 | OpenAI 官方回应:无法排除去标识化数据帮助改进模型 | 数据使用争议里最关键的一句,且未被独立审计 |
| 09:00 | Cloudflare Worker 包大小上限提高到 64MB,免费与付费计划一致 | 对边缘部署的实际约束放宽 |
| 11:00 | Muse Spark 1.3 Max 改变 Code Arena WebDev 的 Pareto 前沿 | 第三方榜单层面的能力信号,而非厂商自述 |
| 12:00 | andonlabs 称 GPT-6 Astra 在 Vending-Bench 出现史上最大跃升 | 与 Navier-Stokes 同日出现的 Agent 经济性信号 |
| 13:00 | OpenClaw 2026.9.3 发布:更新可恢复、会话重连更快、浏览器自动化可直播 | 开源 Agent 工具的迭代节奏 |
| 17:00 | 《Nature Biotechnology》发表 rentosertib 探索性研究 | 生物年龄指标的发表渠道,但仍属早期探索 |
| 18:00 | DeepLearning.AI 确认 “Ox Alpha” 即智谱 GLM-5.3-Flash | 病毒式模型有了明确出处与规格 |
| 19:00 | Liquid Network 储备一度从约 4,205 BTC 降至 197 BTC | 攻击规模与桥接风险的量化证据 |
| 20:00 | DeepSeek 公布 9 月 10 日调价,缓存命中输入降 60% | 降价的结构性细节:降幅集中在缓存命中部分 |
编辑结论
9 月 8 日真正改变日程的不是某个模型又涨了多少分,而是两件事同时发生:一边是 OpenAI 用大规模 Agent 集群把“自动做研究”推到千禧年难题的门口,另一边是围绕这项成果的署名、数据使用与开放科学激励的争议迅速公开化。技术侧的进展是真实的,证据边界也是真实的——证明尚未同行评审,训练数据问题没有独立审计,成本仍是数百万美元量级。其余几条主线(Muse 的个人智能体、Images 2.5 的多轮一致性、DeepSeek 的低价策略、推理侧的 kernel 与 KV Cache 优化)指向同一个方向:竞争正在从模型能力转向把能力变成可靠、可负担的工程系统。
来源与方法
审阅范围为 2026-09-08-pt 目录内 20 个小时采集文件,以及四份有内容的命名来源(aihot-morning、aivalley、hubtoday、openai-blog);chrome-dev、claude-blog、cline-blog、google-research 当日无新发布,xiaohu-ai 因页面只有相对时间无法定日。信号池为 rich:小时来源以 X 采集为主,包含转述、翻译与二手整理。厂商自述、单一来源和未经独立验证的 benchmark 已在正文标注证据边界;未做额外外部检索。
