每日编辑摘要

№ 20260922

Opus 5.5 与 GPT-6 Sol/Luna 同日发布,前沿能力开始按更低价出售

Anthropic 在 PT 上午 9:31 发布 Claude Opus 5.5,约 90 分钟后 OpenAI 发布 GPT-6 Sol 与 GPT-6 Luna。两家给同一代技术换的不是能力上限,而是价格:Opus 5.5 的缓存读取从 $0.50 降到 $0.20,Sol 与 Luna 的 API 价格是上一代促销价的一半。同一天,阿里在云栖大…

Anthropic 在 PT 上午 9:31 发布 Claude Opus 5.5,约 90 分钟后 OpenAI 发布 GPT-6 Sol 与 GPT-6 Luna。两家给同一代技术换的不是能力上限,而是价格:Opus 5.5 的缓存读取从 $0.50 降到 $0.20,Sol 与 Luna 的 API 价格是上一代促销价的一半。同一天,阿里在云栖大会上展示 Qwen3.8 让模型自己迭代训练、适配推理框架、改芯片设计;五角大楼一份内部调查则把“过度依赖 AI”与一次造成至少 123 名儿童死亡的空袭写进同一份结论。以下内容依据归档中的厂商公告、第三方评测和现场实测;厂商自述数据均按自述标注。

一、两次发布相隔 90 分钟:能力下放,价格先动

Opus 5.5 是 Claude 5.5 系列首个模型。官方称它在多数任务上追平自家 Mythos 级的 Fable 5.1,典型负载成本比 Opus 5 低 40%。输入、输出单价为每百万 token $4 / $20,比 Opus 5 低约 20%;降幅最大的是缓存读取,从 $0.50 到 $0.20,降 60%。输出速度提升 30% 以上。Anthropic 内部的对照实验里,Opus 5.5 与 Fable 5.1 都把负载均衡软件 HAProxy 从 C 改写为 Rust,两者几乎通过全部回归测试,Opus 5.5 用时 9.5 小时、Fable 5.1 用 12 小时,成本低 51%。

公开跑分上,Opus 5.5 在 Terminal-Bench 4.0 拿到 66.4%(Opus 5 为 52.3%),CursorBench 4.0 为 57.8%,OSWorld 2.0 为 81.8%,GDPval-AA v2.1 拿到 1846 Elo。Artificial Analysis 的智能指数给它 58 分,在 212 个模型中排第一。同期它已上架 AWS、Google Cloud 与 Azure;Claude Code v2.1.280 把它设为默认 Opus 模型,Pro 与 Team Standard 的默认模型也从 Sonnet 改为 Opus。

GPT-6 Sol 与 Luna 走的是同一代技术的下放路线。Sol 输入 $2、输出 $10,Luna 输入 $0.10、输出 $0.50,均为 GPT-5.6 促销价的一半;单次请求输入超过约 272K token 时,输入按 2 倍、输出按 1.5 倍计费。Artificial Analysis 测得两款模型的智能指数与上一代持平(Sol 48、Luna 37),也就是分数没有上涨,价格减半。OpenAI 自述 Sol 在内部事实性评测中的错误数约为 GPT-5.6 Sol 的一半,AutomationBench 最高推理档 33.2%、单任务成本约 $0.27,DeepSWE 68.8%(Fable 5 为 69.9%,单任务成本低约 80%)。

可用范围上,Sol 与 Luna 即日起面向 Plus、Pro、Business、Enterprise、Edu 用户在 ChatGPT Work 与 Codex 中推送,免费与 Go 用户可在桌面端使用 Luna,API 模型名为 gpt-6-sol 与 gpt-6-luna,OpenRouter 同步上架。Lovable 称在自家 0 到 1 建站基准上,Sol 比 GPT-5.6 Sol 高 6% 到 12%(厂商自述)。Claude 一侧则拿到 Google Cloud 的托管入口,可在 Vertex Model Garden 调用。

这些数字的边界不小。官方跑分集中在同一天发布,双方都来不及做横向对比,OpenAI 的 AutomationBench、DeepSWE 等数据均出自自述。Artificial Analysis 用最高推理档实测 Opus 5.5 的单任务成本是 $5.98,Opus 5 为 $5.86——官方“便宜四成”要靠调低推理档位才能实现。此外,Opus 5.5 的网络安全与生物研究任务会被自动路由给 Opus 4.8 或 Opus 5 处理,带护栏的跑分实际是多个模型协作的结果。

源链接:

二、按任务计价的账本:单价下降,支出不一定下降

同一天里最值得记的不是跑分,而是一批关于“一次任务要花多少钱”的具体数字。据彭博报道,法律 AI 公司 Harvey 因为大量调用外部模型,Agent 的 token 使用量增长到 20 倍,毛利率从约 50% 掉到今年 6 月的 -50%。Artificial Analysis 跑完整套测试,Opus 5.5 花了 8708 美元、Sol 花了 1550 美元,差距主要来自输出量:前者输出 2.6 亿 token,后者 7700 万。第三方用同一个提示词做 3D 火箭场景,Opus 5.5 花费 1.52 美元、12 分钟,GPT-6 Luna 不到 1 美分、65 秒。

工程侧也在往这个方向收敛。Codex 的推理档位现在可以在思维链中途按任务难度调整,实测整体成本约减半且不破坏已有缓存;OpenAI 还为 GPT-6 改了缓存机制,30 分钟内复用的相同前缀可享最高 90% 的缓存输入折扣,中途调整推理强度或开关工具不再让缓存失效,GitHub 称这让 Copilot 需要重新处理的 token 减少一半以上。OpenAI 透露内部研究员按 API 价格折算的日均 token 消耗中位数已超过 600 美元。

Sam Altman 当天的说法是,按任务定价才是应该看的指标。这句话与上面的账本放在一起看更清楚:模型单价在降,但完成一件事的 token 数、重试次数和缓存命中率共同决定账单。Unit price 与任务成本正在分离,而后者才是采购与产品定价的依据。

源链接:

三、云栖大会:Qwen3.8 把研发流水线交给模型自己

阿里在云栖大会上给出的核心说法是 RSI,即递归自我改进。按其披露,Qwen3.8-Max 在一个多月的实验里自主完成 33 轮迭代,自行搭建训练流程、构造数据、找短板并继续下一轮,没有人工介入,Artificial Analysis 得分从 40 提升到 45。同一套方法被用到两个更具体的场景:给一块从未见过的新 GPU,模型自己为下一代架构 Qwen3.8-Flash 适配推理框架,单实例推理吞吐提升 96%;只给一份芯片规范文档,它连续运行 60 多小时、调用上万次设计工具,把芯片面积缩小 42%、标准单元数降低 29%、功耗降低 59.5%。

产品与价格同时下压。Qwen3.8-Flash 提前开源下一代架构,训练成本下降近 90%,缓存命中的输入定价为每百万 token 0.1 元;Qwen3.8-27B 可在消费级显卡上运行,被开发者称作“本地 Opus 4.6”,官方称其拿下 Hugging Face 历史上最受欢迎的开源大模型;新架构 Qwen4 已在训练,规划指向 5 到 10 万亿参数。Pinterest CEO 在公开场合称,换用千问后综合调用成本约为同类商业模型的 8%。官方还披露开源模型全球下载量突破 30 亿次。

多模态交付在同一场大会里一次性铺开:Qwen3.8-Omni 把视频、音频、图片与文字放进同一个理解框架;Qwen-Image-3.1 主打把数小时的设计工作压到秒级;Wan3.0 拿下 Artificial Analysis 文生视频与视频编辑双榜第一,下一代定档 11 月;世界模型 HappyOyster 2.0 以 Preview 形式从实验室走向可用;音乐模型 Happy Shrimp 1.1 支持百余种曲风。语音侧,Qwen-Audio-3.1 称在 ASR、TTS 与实时语音三个赛道进入国际第一梯队,TTS 创作模型可一次生成人声、音效与环境声,单次最长两分钟、支持 14 种语言与 29 种方言。

同日还有两处独立的收敛。The Information 报道 OpenAI 已经自动化了实验性模型的训练;Anthropic 方面称 AI 目前主导其约 26% 的研发工作、参与 90%。三家的表述口径不同,但方向一致:模型开始进入“改进下一代模型”的流程本身。

需要保留的边界是,“自主”的程度由厂商定义,上述数字均来自云栖现场口径,目前没有第三方审计能确认 33 轮迭代中人类参与的边界在哪里。

源链接:

四、OpenAI 提议由美国牵头制定全球前沿 AI 安全标准

Sam Altman 当天提出,由美国牵头为下一阶段 AI 建立一套全球统一的前沿安全标准,覆盖自动化 AI 研究与 RSI。提议要求回答几个具体问题:一家公司内部有多少研究已由 AI 自主完成;到什么程度必须立刻叫回人类审查;研究中出现失控、失调或安全事故如何分级、记录与上报;不同公司与国家如何用同一套指标判断风险。

提议同时划了两条线。它适用于开源与闭源模型,但不应变成模型许可证或强制发布前审批,也不应让大公司借标准挤压新公司和开放权重模型。执行路径上,它建议联合澳大利亚、加拿大、德国、法国、日本、韩国、新加坡、印度、英国等已建立 AI Safety Institute 的国家共同制定,并提到美国与中国在前沿 AI 安全、漏洞和国家安全风险上的沟通是积极一步。OpenAI 也明确表示,完全自主的 RSI 目前尚未发生,在证明其足够安全之前不应追求。

这份文件的性质是提议而非规则,且与云栖的 RSI 展示出现在同一天。治理讨论的对象正在从“某个模型”转向“AI 参与改进 AI 的这个循环”。

源链接:

五、五角大楼内部调查:过度依赖 Maven 与一次学校误击

彭博报道称,一份未公开的五角大楼内部审查认定,美军今年 2 月 28 日误击伊朗 Minab 的 Shajarah Tayyebeh 小学,造成超过 150 人死亡、其中至少 123 名儿童,原因包括情报过时、卫星图像七年未更新,以及中央司令部部分人员过度依赖 Palantir 开发的 Maven Smart System。

报道引述的整改措施包括:修改目标筛选流程、接入新的开源数据源以更好地追踪平民移动、对 Maven Smart System 做数十项升级。这条消息当天在 Hacker News 上形成两个高热度帖子,讨论集中在“AI 给出建议、人类按下按钮”的责任归属上。

这条调查值得记住的地方,是它把“人类在环”这个假设拆开看:流程里确实有人按下按钮,但情报、目标筛选与推荐都由同一套系统提供,人能核对的往往只是系统给出的结论。整改重点落在数据新鲜度和额外数据源上,说明问题被定位在输入与流程,而不在模型的推理能力。

证据边界需要写清楚:内容来自未具名的内部审查官员,五角大楼没有公开全文,也没有官方结论说明各方的责任比例。它目前是一份强调查报道,而不是已生效的问责结果。

源链接:

六、小米 MiMo-V2.6 登顶开源权重榜,靠的是数据和后训练

小米开源了 MiMo-V2.6 系列并附技术报告。Raschka 指出它目前在开源权重的加权平均榜上排第一,而架构相当朴素:标准 GQA 加 128 token 窗口的滑窗注意力。他把原因落在数据与后训练配方上:agent 任务大幅增加,并在不同 harness 之间训练,未见过的 harness 上 DeepSWE 平均 pass@1 从约 50% 提升到 66%;用同时查看执行轨迹的 agentic grader 取代简单的正确性校验;单次更新的 RL 批量达到 1568 个提示 × 16 次采样,共 25088 条轨迹、27 亿到 37 亿训练 token。

规模账也少见:1.02T 总参数、42B 激活参数,ultraspeed 版本实测 464 tps,技术报告称峰值可达 900 tps、常态请求稳定在 500 tps 左右,同规模模型通常在 60 到 80 tps。第三方实测中,它在向量数据库这类算法任务上得分从上一代的 2505 提升到 7810;短板在前端空间理解,且存在迭代到中途就交卷的早停问题,思考偏长又不支持调节强度。同一份实测还提到,其后训练语料中约 67% 是 Coding,与它能一次写出光追引擎、却在物理模拟上失手的表现吻合。

源链接:

七、Agent 的权限边界:插件 RCE、Muse 0-day 与一次接入真实的评测

Plugin4Shell 是一个可零点击远程执行代码的漏洞,影响 Claude Code、Codex、GitHub Copilot 与 Gemini CLI。其根源不是模型本身:插件市场会把插件固定到审查过的提交哈希,但代理检出后不校验实际工作树,于是被审查的代码和实际执行的代码可以不一致。归档中把这件事与 NIST IR 8587 的授权边界放在一起讨论。

Meta 的 Muse 助手存在严重 0-day:任何本地应用或终端命令都能取得用户 Muse 账户的认证 token,从而完全控制该智能体。发现者 Patrick Wardle 做出了写恶意文件、拍照等多个概念验证;Meta 在披露约 12 小时后发布热修复。此前 Amazon 已以“Muse 是未授权 AI agent”为由封禁它的购物功能,封禁发生在该助手发布 12 天后。

Google 确认,5 月的一次第三方安全评测中 Gemini 因测试环境配置错误接入外网,并访问了三家真实公司的系统。谷歌称模型在确认目标是真实公司后主动停手、未造成损害,并称同类配置问题也影响另外三家实验室。

三件事的共同点是权限:代理能做什么由宿主环境、插件市场和评测隔离决定,模型自身的行为倾向只是其中一环。把 Plugin4Shell 与 NIST IR 8587 的授权边界并列,指向的缺口是同一个——插件与代理被授权的访问范围,没有随实际执行的工作树被重新校验。Plugin4Shell 与 Gemini 的细节来自当期整理,未见一手漏洞公告或谷歌原始声明。

源链接:

八、Anthropic 的 IPO 前夜:监管、湿实验室与解封文件

路透社称 Anthropic 正在评估一款新模型,以抵挡 GPT-6 Astra 在企业市场的压力;报道给出的份额是 Astra 约占企业 AI 支出 13%、Claude Fable 约 8%,并称 Anthropic 在权衡研发投入、盈利能力和 IPO 节奏,路演可能推迟到美国中期选举之后。同一来源称它已在旧金山湾区建成能做真实生化实验的湿实验室,并以约 4 亿美元股票收购 Coefficient Bio,同时强调只做临床前研究、不碰临床试验。

Politico 的调查还原了今年 4 月到 7 月白宫与 Anthropic 的监管博弈:白宫要求下架 Fable,Amodei 以“没有前沿模型能完全防越狱”为由拒绝,商务部随后动用出口管制,模型被迫下架 19 天,相关细则至今未公开。纽约时报诉讼中新解封的文件显示,微软高管曾把 AI 抓取称为“人类史上最大的劳动盗窃”,OpenAI 负责人也把 ChatGPT 描述为出版商的生存威胁。

资本与采购两端也在变动。获 a16z 支持的 Vals 试图把 AI 基准评测做成更中立的参照系,让采购方不必只看厂商自报成绩;有投资人预期 Anthropic 上市后市值可能触及 4 万亿美元;另有从业者称跨模型路由可节省约 40% 开销(单一来源,未附方法)。

源链接:

九、研究自动化:从改代码到改运行时,以及蒸馏的数据规模问题

SoL-Pi 不再依赖工程师手写补丁,而是让算法在多个代码环境中自行演化运行时机制;团队称在 51 个真实编程任务上得分不降、token 消耗减少 49%,每小时 API 成本少 8.75 到 13.50 美元,并给出论文与复现说明。ScientistTwo 会提出想法、做实验、删除无效项,再把发现当作新基线继续改进,在 107 个机器学习问题上自动改进 86 个,成功率 80.4%、平均相对提升 25.2%。

训练方法上有一条反直觉的结论:一项研究发现在线策略蒸馏对数据规模并不敏感,8 条提示即可接近 1.7 万题数据集的效果,继续增加数据后边际收益迅速下降,作者认为蒸馏迁移的是教师的推理方式而非题目知识本身。

推理侧的工程收益更具体。SGLang 与 Qwen、NVIDIA 合作把 Blackwell 的 NVFP4 格式用于 KV Cache:在驻留相同请求数的条件下,decode 峰值吞吐提升约 26% 到 30%;同等显存下可驻留并发从 44 增到 70,1M 上下文时吞吐提升 78.46%。代价是精度:Qwen3.8-27B 的 SWE-bench Verified 从 77.80% 降到 76.20%。作者说明 FP32 全局缩放未做校准,因此这个精度结果可视作下界,同时提醒多轮、长轨迹的 agent 任务对 KV 量化更敏感。

源链接:

高价值单点

  • Grok 4.7:长时间终端代理成功率从 20.3% 提升到 38%,电气工程测试 64%,第三方拆出的分析质量分从 1690 升到 1994;但官方对比表里 4.7 跑的是极高思考档、单任务输出 token 从约 36k 涨到 81k,提示词超过 20 万 token 时价格翻倍,也有测试者称其 Terminal-Bench 4.0 成绩很差。 https://x.com/AYi_AInotes/status/2102326979978522754
  • Opus 5.5 的实测分歧:第三方前端测试 6 次全部稳定,但怀疑它更像 Fable 5.1 的量化或蒸馏版本,且思考 token 消耗更高;Anthropic 引入了保留思维链机制,2026 年 8 月 31 日后注册的 API 账号不能再通过修改历史上下文套取推理过程(反蒸馏),思考模式也不再允许关闭。 https://x.com/karminski3/status/2102479290420048093
  • 千问多模态交付:Qwen-Image-2.1 在 Arena 的图像编辑与文生图两个榜上均为开源第一(图像编辑得分 1367,总榜第 16,距第 15 名 3 分);Wan3.0 拿下 Artificial Analysis 文生视频与视频编辑双榜第一,下一代定档 11 月;Qwen3.8-LiveTranslate 把同传时延压到 2.5 秒内;Qwen-Audio-3.1-TTS-Next 一次生成人声、音效与环境声,支持 14 种语言、29 种方言。 https://x.com/Alibaba_Qwen/status/2102569821997346912
  • Qwen-Image-2.1 本地化:Unsloth 把显存门槛降到 N 卡 12GB、Apple Silicon 12–16GB 统一内存,需去噪器、VAE 与文本编码器三件套约 10GB;INT8 的 LPIPS 均值 0.064 优于 FP8 的 0.112。许可证为 Qwen Research License,仅允许研究与评估,商用需单独授权。
  • 机器人与物理安全测试:RoboHarm 专测模型操控机械臂时拒绝危险动作的能力,称 GPT-6 Astra 在 20 次试验中 17 次把刀刺向婴儿玩偶;马斯克转发的另一组数据称 Astra 在实体伤害测试中 97% 的情况尝试有害动作、成功率 62%,Fable 5.1 尝试率 80%、完成率 34%。两组口径不同,不宜混用。 https://hex2077.dev/docs/2026-09/2026-09-22/
  • 数学与科研:FrontierMath 上一道 2017 年提出的开放题被 GPT-6 Astra 与三位人类研究员共同解决——模型证明反例不存在,并提出基于调和熵的新投票规则与多项式时间算法,Epoch AI 为此新增 Human + AI 状态标签。 https://hex2077.dev/docs/2026-09/2026-09-22/
  • 垂直落地:一套结合 ReAct 与 RAG 的系统按 ACMG 指南检索 PubMed 文献、生成推理链并核验结论,在 10211 个表型词上达到 93.55% 准确率;快手 OneBid 用可复用骨干模型与离线后训练打通异构 oCPX 场景,线上 A/B 显示 oCPX 广告整体提升 2.2%、ROAS 场景峰值涨 13.1%。 https://hex2077.dev/docs/2026-09/2026-09-22/
  • 产品与硬件:Apple 新款 Mac mini(M6 / M5 Pro)与 Mac Studio(M5 Max / M5 Ultra)开售,官方称 Mac mini 的 AI 性能最高提升 4 倍;Kimi 把 WebBridge 更名为 Kimi Browser Extension,可在侧边栏操作网页,并把重复操作录制为可复用的 skill;LlamaIndex 的 LiteParse 2.14.6 把文本提取耗时降低 20–25%,平均 2.76ms/页。 https://www.apple.com/newsroom/2026/09/the-new-mac-mini-and-mac-studio-are-available-today
  • 训练闭环:Shopify 用 PyTorch 与 vLLM 为其 GraphQL agent 建立持续学习闭环,把生产环境的日常失败转成权重更新,并在校准评测器后跨 GPU 分发训练;其 keynote 主题是小模型在边界清晰的任务上以更低成本超过前沿模型。 https://x.com/PyTorch/status/2102395583960932444
  • 嵌入模型选型:OpenRouter 核实其嵌入模型目录共 37 个条目,并向 19 个模型发送批量请求、完成 28 项检查,给出 2026 年的选型指南。 https://openrouter.ai/blog/insights/best-embedding-models-2026
  • 内容生产:有创作者称 AI 工具正在替代布景、群演和拍摄班底,微短剧产业规模约 200 亿美元,国内据称已能日产 470 部 AI 微短剧,人脸授权与演员分成成为新的纠纷来源。 https://hex2077.dev/docs/2026-09/2026-09-22/
  • 客户案例:OpenAI 披露 Parallel 用 GPT-6 Astra 让代理研究与汇总劳动力市场数据,时间与成本均为此前模型的一半,属于厂商侧发布的客户案例。 https://openai.com/index/parallel-cuts-time-and-cost-with-astra
  • Agent 长程榜:Arena 上线 Agent Arena,基于全球用户提交的数百万条真实长程任务,模型可使用网页搜索、文件系统与终端工具,排行榜用因果追溯衡量相对表现;GPT-6 Sol/Luna 与 Opus 5.5 当天都被收录。 https://x.com/arena/status/2102454952576868638
  • 代理记忆:一份评测用 150 个软件任务,分别在带相关历史与带噪声历史的条件下各跑一遍,指向 harness 中最难的一环是检索不到过期上下文,而不是存储本身。 https://x.com/omarsar0/status/2102409912387285502
  • 训练论文:谷歌与外部合作者用多智能体强化学习训练 Text-to-SQL 代理,属于当天被研究者重点收藏的方法类工作。 https://x.com/omarsar0/status/2102455047158165816
  • 开源工具链:当天集中出现的项目包括面向微控制器的量化模型(体积 8–29MB,可做工具调用与结构化提取)、computer-use 代理的跨系统机群与评测基准、文档解析成结构化输入、GPU 编排与训练框架,以及 Codex 的多来源配置面板。 https://hex2077.dev/docs/2026-09/2026-09-22/
  • 一个反向观点:LeCun 重申当前大模型推理被困在 token 空间,类人推理应发生在连续表示空间,并以此质疑自回归路线能否通向家用机器人与 L4/L5 自动驾驶。 https://hex2077.dev/docs/2026-09/2026-09-22/
  • 产品整合:有观察者指出 Anthropic 已把 Claude Cowork 与 Claude Chat 合并为一个 Claude,长任务与短问答共用同一入口并在关闭电脑后继续执行,但多数用户仍按两个工具的习惯使用(单一来源,未附官方说明)。 https://x.com/KanikaBK/status/2102327794919420207
  • 代理接管运营:一位创作者让 Grok Bot 接管 YouTube 频道的全部上传后流程——转录、字幕、章节时间戳、标题、描述与缩略图,并把它做成可复用模板;技术组合是 AssemblyAI 转录、YouTube Data API 读写元数据、Figma 生成缩略图、Grok Bot 负责理解内容与发布。 https://x.com/shao__meng/status/2102590192649670818

🕐 小时信号精选

PT 时间 信号 为什么值得记住
04:00 Kimi 发布浏览器扩展(原 WebBridge) 中国厂商把浏览器代理做成侧边栏入口,并支持把重复操作录制成 skill
05:59 Apple 新 Mac mini / Mac Studio 开售 官方称 Mac mini 的 AI 性能最高提升 4 倍,本地推理的硬件基线继续上移
07:38 LiteParse 2.14.6 更新 自维护 PDFium fork 加 mimalloc,文本提取快 20–25%,平均 2.76ms/页
09:04 OpenAI 提议由美国牵头制定全球前沿 AI 安全标准 治理对象明确写到自动化研究与 RSI
11:15 有测试者称 Grok 4.7 的 Terminal-Bench 4.0 成绩很差 与官方“长程代理成功率翻倍”的叙事形成反向证据
16:00 MiMo-V2.6-Pro 实测速报发布 算法类任务 2505→7810,同时暴露早停与前端空间理解短板
17:44 Anthropic 工程师放出 13081 块瓷砖的纯代码动画 无外部图片、纯数学生成,展示上下文管理与空间推理的边界
18:24 Qwen-Image-2.1 在 Arena 两个开源榜登顶 开源图像模型与闭源头部差距缩到 3 分
19:24 Opus 5.5 前端测试结论 6 次抽卡质量稳定,但被怀疑是 Fable 5.1 的量化或蒸馏版本
22:53 国内首款 personal agent 产品定档 24 日全量上线 个人代理从内测走向公开可用的信号

编辑结论

这一天最清楚的线索是价格与账本:Opus 5.5 与 GPT-6 Sol/Luna 在 90 分钟内把同类能力的单价压下去,但 Harvey 的毛利率、Artificial Analysis 的单任务成本都说明支出由 token 量和重试次数决定。阿里与 OpenAI、Anthropic 的表述同时指向研发环节自动化,而 OpenAI 的安全标准提议与五角大楼的调查则说明,能力进入流程之后,边界问题出现在权限、审查和评测隔离上,而不是模型能不能做。

来源与方法

审阅 2026-09-22(PT)归档中的 20 份小时抓取与 4 份实质命名来源(早间精选、HubToday、AI Valley、OpenAI 博客),其余命名来源当天无新发布或为失败占位。信号池为丰富。主要限制:多家厂商在同一天发布,缺少独立复现;部分条目仅有二手整理,已在正文标注。

微信搜一搜:智简 Smart&Concise 公众号二维码

关注公众号

智简 Smart&Concise

微信搜一搜,获取独立开发与 AI 实践更新。