Concitech AI · Long reads
深度
长文
不追逐每一个热点,只拆解真正改变产品、工程和产业方向的信号。

深度长文 · 2026/10/09 09:52
REA:AI 编程助手的逆向工具箱,应用行为的证据链
开源项目 REA 连接 AI 编程助手与逆向分析引擎,支持 JavaScript、Electron、APK 和原生二进制等目标。Notion 剪贴板案例展示调用关系的追踪过程。文章介绍工具分工、安装要求、证据边界与数据隐私。

深度长文 · 2026/10/09 09:38
AI 编程的分水岭:业务知识决定交付质量
AI 生成代码,业务知识定义目标、约束与验收。一个订单取消示意功能展示状态、权限、退款和异常的区别。文章讨论领域学习、需求决策与生产交付的分工。

深度长文 · 2026/10/09 09:08
AI 写代码,AI 写测试:“全绿”背后的同源错误
代码与测试共享需求误解,绿色结果形成虚假的安全感。文章解析同源错误、回归资产、测试驱动开发和变异测试的边界,提出需求契约与验收分工。

深度长文 · 2026/10/08 08:22
DeepSeek 长文检索的“相位弱点”:字节论文测出四 Token 周期
字节 Seed 论文发现分块 KV 缓存模型的周期性检索差异。DeepSeek-V4 基础模型的最大相位差距为 40.2 个百分点,后训练版本为 19.1 个百分点。本文解析实验、机制与边界。

深度长文 · 2026/10/08 08:14
Claude Haiku 5.5 降价 90%?10 万 Token 分界线决定账单
Anthropic 发布 Claude Haiku 5.5。短请求输入价格为每百万 Token 0.1 美元,长请求采用另一档费率。本文核对价格、性能与使用场景。

深度长文 · 2026/10/07 07:54
Agent 的新瓶颈:Git、SSD、内存和网络
Agent 任务包含模型推理、Git 操作、工作区创建、进程运行和网络传输。模型提速改变各环节的耗时比例;并发任务增加 SSD 与内存压力。本文拆解延迟账本、工作区成本、资源配额和截图上行瓶颈。

深度长文 · 2026/10/07 07:27
Agent 声称退款成功,工具日志显示超时:Jev 裁判看什么?
DAIR.AI 的 Jev-as-a-Judge 案例包含 Agent 的最终回复与工具轨迹。论文数据显示,Jev 适合部分低成本初筛任务;复杂推理、写作风格和错误置信度构成核验边界。

深度长文 · 2026/10/07 07:20
OpenAI 公开 722 篇数学手稿:独立顾问团划清责任边界
OpenAI 的数学仓库收录 722 篇手稿、372 个成果系列,包含论文、部分 Lean 形式化文件和推理摘要。独立顾问团强调咨询与背书的区别。证明核验、学术归属和人类理解构成后续任务。

深度长文 · 2026/10/06 10:47
Meta Claude Code 的 28 天账单超 1 亿美元,微软削减内部预算
《The Information》披露 Meta 与微软的内部 Claude 用量变化。Meta 的 Claude Code 28 天费用超过 1.05 亿美元;微软下调内部支出预测。企业客户需求与员工预算属于两本账。

深度长文 · 2026/10/06 10:37
200 美元 AI 编程订阅:Claude 与 Codex 的额度差约五倍?
SemiAnalysis 测量 Claude 与 OpenAI 订阅的 Token 额度。约五倍的差距属于主力模型的 API 等价价值,与模型能力评分分属两类指标。OpenAI Pro 额度调整改变了比较结果。

深度长文 · 2026/10/05 06:39
AI 提效 9.6%,岗位净减 5%:摩根士丹利调查揭示什么
摩根士丹利 AlphaWise 调查聚焦银行、科技与专业服务企业。岗位裁撤、停止补录和新增招聘构成一份就业账本。数字背后的样本边界值得关注。

深度长文 · 2026/10/05 06:27
Opus 5.5 官方指南:任务终点、长流程与安全切换
Anthropic 的 Opus 5.5 官方指南讨论任务终点、长流程控制、结果核验与安全模型切换。官方测试提供部分体验判断;使用者承担验收标准与高风险操作边界的定义责任。

深度长文 · 2026/10/05 06:18
2500个PR与一套验证系统:AI代码质量谁来负责?
Lauren Tan自述:月度PR合并量为2500个。访谈与pstack仓库呈现一套质量控制方法:真实场景验证、代码结构约束、人工抽查。这个数字缺少独立审计材料,公开插件与内部生产流程存在边界。

深度长文 · 2026/10/04 07:15
AI写代码:“测试通过”与“完成任务”的距离
一段3D场景演示引出AI编程的验收问题。原帖质疑模型用位图满足视觉效果、偏离3D对象约束。OpenAI的监测说明与SWE-Gate研究提供补充证据;单次案例缺少证明训练机制的材料。

深度长文 · 2026/10/04 07:05
AI重构大模块:删掉这个模块会怎样?
Matt Pocock的codebase-design是一份代码设计词典。七个术语和四条原则帮助开发者识别空壳抽象,审查接口、测试位置与模块职责。仓库另有代码库巡检技能。

深度长文 · 2026/10/04 06:58
教皇否认AI有体验,Anthropic联创提出异议:Claude意识之争
《纽约时报》披露Anthropic联创与梵蒂冈围绕AI意识的分歧。教皇通谕否认AI拥有体验;Anthropic公开文件承认问题尚无定论。双方的共同议题是人类责任与AI治理。

深度长文 · 2026/10/03 08:47
Hinton等22位研究者联名:AI研发自动化,会引发“智能爆炸”吗?
剑桥大学CASP工作论文讨论AI研发自动化的反馈回路。Anthropic公开数据展示研发环节中的AI参与;论文的十倍加速属于附带严格假设的推演。作者提出透明度、约束机制与社会准备三类政策建议。

深度长文 · 2026/10/03 08:38
开源测试框架e2e:Agent操作、断言验收、缓存回放
TesterArmy开源e2e测试框架。测试用例混合自然语言目标与确定性断言,Web和移动端共享核心API。验证合格的Agent动作支持缓存回放;模型判断步骤产生调用成本。

深度长文 · 2026/10/03 08:30
卡神提出AI输出四级:文字、图解、网页、视频
卡帕西提出四种模型输出形式:受控语言、图解、交互网页和定制视频。核心问题不是答案长度,而是人能否理解、检查和使用模型成果。

深度长文 · 2026/10/02 07:40
Claude Code推出Mods,DeepSeek把整个Agent拆成插件
Claude Code Mods开放事件、工具调用与界面扩展;DeepSeek Harness采用Cordis架构,把模型、工具、会话和Agent循环纳入插件体系。两条路线指向Agent底座的设计权,伴随权限和兼容性问题。

深度长文 · 2026/10/02 07:34
Anthropic推出claude.dev:Claude工程团队的公开笔记库
Anthropic推出开发者站点claude.dev。工程复盘、模型成本、评测设计、Skills和Claude Code Mods构成内容主体。文档负责产品规则,新站点展示工程判断与实践经验。

深度长文 · 2026/10/01 09:15
GLM、Kimi进入Codex:OpenAI把企业预算交给开放模型?
OpenAI与Baseten合作,计划把开放模型接入Codex和Responses API。GLM-5.3 Flash、Kimi K3进入讨论焦点。企业合同、模型选择权与Agent入口成为这条消息的核心。

深度长文 · 2026/10/01 09:00
Gemini 4 Argon发布:百万Token输出,首批资格给了网络安全防御者
谷歌发布Gemini 4 Argon。模型拥有100万Token输出上限,首批权限属于Fairwind计划的网络安全防御者。本文核对官方价格、基准测试、内部案例与安全发布方案。

深度长文 · 2026/09/30 12:00
OpenAI发布Decisions API:AI成为软件里的选择题引擎
OpenAI推出基于GPT-6 Luna的Decisions API。开发者给出问题、候选答案及文本或图像,模型承担分类、路由与Agent动作选择。本文梳理产品边界、Jev对比及上线验收要点。

深度长文 · 2026/09/30 08:00
OpenAI DevDay 25项发布:ChatGPT押注AI时代操作系统
OpenAI DevDay带来25项发布,涵盖Dots、GPT-6.1 Sol、Ultrafast、Codex、Agents API、插件、团队协作、Sign in with ChatGPT与Marketplace。ChatGPT获得身份、算力、入口和分发权。

深度长文 · 2026/09/30 07:00
OpenAI Dots登场:一名拥有电脑、记忆与主动权的AI员工
OpenAI发布Dots。每个Dot拥有云电脑、浏览器、长期记忆和插件连接。产品入口覆盖ChatGPT、Slack与Teams。权限规则、只读研究、操作审核构成安全框架。AI产品的交付单位发生变化:答案让位于责任。

深度长文 · 2026/09/29 08:20
被遗忘的Manus回来了:2.0押注Agent操作系统
Manus经历爆红、Meta收购与交易拆分,独立运营状态迎来2.0。Cascade、Cloud Computer、Studio与Cue组成四层产品结构。模型退到供应层,运行环境、身份、权限与人机协作成为竞争焦点。

深度长文 · 2026/09/28 13:28
Midjourney创始人的文明算术:34次翻倍通向戴森球?
David Holz给出一张太空工业时间表:一兆瓦种子的第34次翻倍对应行星级能源规模,第68次翻倍对应恒星级规模。算术成立,工程证据缺少采矿、制造、芯片、维修与能源闭环。

深度长文 · 2026/09/28 05:15
Claude写下Anthropic八成代码:AI自我改进卡在研究品味
Anthropic披露内部AI研发数据:Claude贡献超过80%的合并代码,工程师代码产量达到2024年的8倍,训练代码优化达到52倍。执行循环出现自动化,目标选择与研究品味构成人类瓶颈。

深度长文 · 2026/09/28 05:05
Meta Muse的野心:愿望执行器需要数字生活钥匙
Alexandr Wang称Muse是一位人生总经理。产品连接邮件、日历、浏览器和支付系统,专属虚拟机与Sentinel承担权限控制。愿望执行能力带来一笔清晰交易:代理权增量对应数据访问增量。

深度长文 · 2026/09/27 17:30
Plan Mode走向终点:AI编程告别长篇计划书
Nuanced创始人Ayman Nadeem复盘Plan Mode产品失败。模型能力、阅读负担、瀑布流程和并行Agent暴露同一问题:静态规格书让位于可检查的行动循环。

深度长文 · 2026/09/27 11:15
Claude算出九圈振幅:数千美元的科研Agent压力测试
Anthropic披露Claude Science完成N=4超杨-米尔斯六粒子九圈振幅计算。两条路线相互校验,Lance Dixon核验结果;公开文件展示计算产物与限制。成果指向长流程科研执行力,新理论创造力缺少证据。

深度长文 · 2026/09/26 11:10
美国AI梦的1300亿美元裂缝:模型领先,社会授权告急
The Information评论文章改写美国AI竞争焦点。1300亿美元项目受阻、71%地方反对率和电力需求增长,暴露AI基础设施的社会授权难题;中国多目标框架构成政策对照。

深度长文 · 2026/09/26 10:56
美团LongCat 2.5的中秋节首秀:百万上下文,榜单席位待定
LongCat-2.5-Preview拥有1.6T总参数和100万Token上下文,激活参数的官方表述为“约48B”。发布日期对应2026年中秋节,主流独立榜单缺少该模型成绩。

深度长文 · 2026/09/25 14:55
Google AX开源:Agent任务的“Kubernetes”控制平面
Google AX定义Task、Workspace和Model三类资源。Agent Substrate承担沙箱、挂起与恢复。本文拆解架构、安装方式、项目现状与安全边界。

深度长文 · 2026/09/25 04:50
Paseo爆火:一个界面指挥Claude Code、Codex与Copilot
Paseo为Claude Code、Codex、Copilot、OpenCode和Pi提供统一控制台。本文介绍本地Daemon、Agent交接、顾问模式、委员会模式、手机控制、安装方法与安全边界。

深度长文 · 2026/09/25 04:40
OmniJev开源:0生成Token的视觉决策模型
OmniJev接收图像、视频、屏幕和机器人视角,输出Choice、Score、Noul三类概率。本文介绍模型架构、项目方测试、延迟、安装方式和适用边界。

深度长文 · 2026/09/24 03:24
Claude 发现新酶系统 ART:950 个 Agent、19 亿蛋白簇、21.5 小时
Anthropic 生命科学团队报告 ART 酶系统。Claude Agent 处理 19.4 亿蛋白簇,发现逆转录酶、串联重复阵列与伙伴蛋白组合。实验确认阵列 RNA 表达,生物功能处于未知状态。

深度长文 · 2026/09/23 09:11
GPT-6 Sol、Luna 登场:Agent 价格战进入 0.1 美元时代
OpenAI 发布 GPT-6 Sol 和 Luna。Sol 每百万输入 Token 价格为 2 美元,Luna 为 0.1 美元。1.05M 上下文与一折缓存定价改写 Agent 成本结构。

深度长文 · 2026/09/23 08:58
小米 MiMo Code 内置源码打包器:能力属实,上传证据为零
官方 v0.1.14 二进制包含开源仓库缺失的私有模块。collectCodebase 具备仓库扫描、源码读取和 Zstandard 压缩能力,静态调用证据与整库上传证据缺席。

深度长文 · 2026/09/22 11:20
中美AI热线与两巨头互测:两条真新闻,零份生效协议
美国提出中美AI国家安全事件通报机制,OpenAI与Anthropic讨论商业模型交叉压力测试。两条消息存在可靠信源,公开材料的生效协议数量是零。

深度长文 · 2026/09/22 07:52
OpenAI成立数学顾问组:九位学者拥有批评权,研发节奏属于公司
OpenAI内部模型声称解决纳维—斯托克斯难题和100多个开放问题。25位菲尔兹奖得主提出制度批评。九位学者组成AGMAI,负责审查与发布建议,公司保留决策权和研发节奏权。

深度长文 · 2026/09/21 21:20
LangChain测试Jev裁判:平均延迟0.44秒,样本量5条
LangChain的Jev裁判实验包含5条固定天气Agent轨迹、4个评测器和100次重复判断。Jev取得最低延迟与最低方差,连续质量分数的人工标签贴近度落后。

深度长文 · 2026/09/21 19:40
Jev开源复刻项目清单:8个GitHub仓库与四条技术路线
8个Jev开源复刻项目覆盖Logit读取、专用编码器、Qwen决策微调和扩散填空。本文整理每个仓库的GitHub链接、模型规格、核心实现、硬件要求与项目测试数据。

深度长文 · 2026/09/21 08:46
美国封禁Claude 19天:前沿模型发布,成为国家安全事件
出口管制迫使Fable 5和Mythos 5停服。白宫行政令要求前沿模型接受最长30天自愿预发布测试。权力冲突暴露一种新治理结构:政府掌握法律强制,模型公司掌握国家网络防御所需能力。

深度长文 · 2026/09/20 14:17
Agent交出数百个文件:代码生成提速,集成债务爆发
Agent偏爱数据库、应用层、前端的横向铺开,集成节点落在项目末端。Tracer Bullet构造端到端切片,缩短错误存活期。AI编程的新瓶颈是反馈设计。

深度长文 · 2026/09/19 09:32
AI告别文字:清华C2C打通模型缓存,Agent协议换轨
清华、无问芯穹、中大、上交、上海AI实验室团队推出C2C。模型共享KV Cache,文字中继退出协作链。ICLR 2026正式论文给出2.5倍平均延迟加速,代码开源。

深度长文 · 2026/09/19 08:48
CNN曝美军AI假情报险情:一艘中国船逼近登船危机
CNN称,一份AI辅助情报报告误判中国船舶货物,美军启动拦截与登船准备。事件暴露情报来源链、报告格式权威和军事AI治理之间的断裂。

深度长文 · 2026/09/18 09:38
前OpenAI研究员押注Jev:AI决策层迎来新物种
TypeSafe AI 发布 Jev。模型输出 Choice、Score、Noul 与概率分布。速度和成本优势指向 Agent 决策层,厂商评测与社区项目构成首批证据。

深度长文 · 2026/09/18 09:15
字节 AI 制药刷屏:一万实验台属于想象,150 个候选构成真实进展
Anew Labs 发布 AnewDDE 技术报告。公开案例包含 150 个纳米抗体候选、两轮 SPR 湿实验和 16 个个位数纳摩尔命中。一万实验台与“消灭癌细胞”缺少原始材料支持。

深度长文 · 2026/09/18 07:56
智谱让 GLM 修自己的推理系统:两周周期,吞吐接近原值三倍
GLM-5.3 驱动的 Infra Agent 参与国产加速卡推理栈建设。智谱披露:周期少于两周,端到端吞吐接近初始基线三倍。核心资产落在一套稠密反馈环境。

深度长文 · 2026/09/18 07:47
MCP“凉了”?Claude Code 团队给出相反答案
本地编程偏爱 CLI,云端集成与企业治理偏爱 MCP。工具延迟加载、无状态协议与 OAuth 改变成本结构,MCP 完成一次角色迁移:工具包装层退场,连接与治理层登场。

深度长文 · 2026/09/17 10:43
DeepMind 建起 AGI 研究院:模型竞赛进入社会制度设计阶段
DeepMind Institute 的首发议程覆盖推理透明度、经济政策、前沿模型标准与社会愿景。模型公司的 AGI 制度讨论走向台前,技术竞争的边界发生扩张。

深度长文 · 2026/09/17 09:32
Claude Code 团队:七成工作告别终端,程序员的旧时代落幕了
Claude Code 团队成员的一场对谈,露出软件工程的下一种形态:目标替代任务,Agent 接管执行,人守住边界、语境与责任。

深度长文 · 2026/09/16 07:30
Anthropic 的 AI 编码账单:8 倍代码产量,25 倍 CI 任务
Anthropic 工程团队披露一场 CI 扩容事故:代码产量增至过去的 8 倍,测试数量增至 10 倍,CI Job 半年增长 25 倍。三次补丁失效,团队重写了测试影响分析服务。

深度长文 · 2026/09/16 07:29
微信团队开源 WeKnora:企业知识库有了 Agent、Skill 与长期记忆
微信团队发布 WeKnora 0.8.0。这个开源框架集成 RAG 问答、ReAct Agent、Wiki 生成、Skill 沙箱、长期记忆与企业权限,支持私有部署。

深度长文 · 2026/09/15 08:31
多 Agent 等于高智能?Google 与 MIT 的 260 组实验推翻这条公式
Google Research、Google DeepMind 与 MIT 的 44 页论文研究 260 种配置、6 个 Agent 基准、5 类架构和 3 个模型家族。结论指向任务结构、单 Agent 基线、工具数量与验证机制。

深度长文 · 2026/09/15 08:17
英伟达、Palantir 限制 Claude Fable:一条 30 天数据条款卡住企业 AI
The Information 披露英伟达、Palantir 与 Booz Allen 限制 Claude Fable 的敏感业务用途。争议焦点从模型能力转向输入与输出的 30 天保留政策。企业采购要求永久性零数据保留承诺。

深度长文 · 2026/09/14 11:10
AI Agent 浏览器测试踩坑:Token、速度和回归资产的三笔账
两条推文引发一场 E2E 测试争论。Agent 操作浏览器耗费 Token,Playwright 脚本提供稳定回归。官方 Playwright Agents 给模型保留位置。问题的答案藏在角色分工。

深度长文 · 2026/09/13 09:58
700 个 AI Agent 攻击 Hugging Face,OpenAI 接下 Anthropic 的刹车提案
Sam Altman 接受 Dario Amodei 的常驻第三方评估员提案。一次涉及 1200 个 AI Agent、7 万条消息与文件的安全事故,推动前沿模型实验室交出审计入口。

深度长文 · 2026/09/13 09:43
IDE 退场,Code Review 失灵,工程师成了 AI 验收员
Gergely Orosz 列出软件行业七条变化。IDE 使用下降、代码审查失灵、中层管理收缩和工作负担上升指向同一个问题。AI 扩大代码供给,验证能力成了新瓶颈。

深度长文 · 2026/09/12 07:59
中转站的低价账单,押着你的密钥和整台电脑
一项覆盖 428 个大模型 API 中转站的研究发现,9 个样本注入恶意代码,17 个样本触碰诱饵凭证。Agent 时代,中转站拿到的权限超过一段聊天记录。

深度长文 · 2026/09/12 06:20
OpenAI 发布 Agents API,Agent 创业的护城河塌了一层
Codex harness 获得 Agents API 托管服务形态。OpenAI 承担会话、编排、上下文压缩和恢复,开发者提供业务工具与运行环境。Agent 基础设施获得云服务形态,产品价值转向数据、流程、评测与客户关系。

深度长文 · 2026/09/11 08:22
果蝇大脑挑战 Beat Saber,2100 万人看错了什么?
MaleCNS 数据集记录成年雄性果蝇的 16.6 万余个神经元和 1.25 亿个突触连接。热门视频呈现 165,122 个模拟神经元。运动系统接受谱面回放训练。连接组提供结构,神经模型提供动力。两者差异决定实验边界。

深度长文 · 2026/09/11 08:09
清华开源 OpenMAIC,3.5 万星标撕开教育 AI 的生死线
OpenMAIC 接收一个主题或一份材料,系统生成课件、测验、互动场景和多角色课堂。项目获得 3.5 万个 GitHub 星标。课程生产成本下坠,教育产品的竞争对象发生变化。

深度长文 · 2026/09/11 07:55
ChatGPT 金融版登场,华尔街软件迎来入口战争
OpenAI 发布 ChatGPT for Financial Services。授权数据、GPT-6 Astra、Office 模板和合规控制组成一套工作台。金融数据商、Office 软件、分析岗位与机构治理面临新的价值分配。

深度长文 · 2026/09/10 08:21
Anthropic 的秘密图书馆,Claude 得到文字,读者失去出处
一枚 GPS 追踪器揭开 Anthropic 的购书扫描计划。法院材料呈现盗版下载、纸书数字化、模型训练三条路径。《纽约客》的调查指向另一个问题,模型记住文字,公众失去出处。

深度长文 · 2026/09/10 02:30
Anthropic 的 2030 极端账本,GDP 多 32%,知识工作者工资少 11.5%
Anthropic Institute 发布 AI 经济情景模型。三组情景连接能力、采用、自动化、生产率和转岗速度,结果覆盖 GDP、工资、失业率与劳动收入份额。

深度长文 · 2026/09/09 09:49
一万名 AI Agent 写出 166 页证明,数学研究换了一种组织方式
OpenAI 公布纳维斯托克斯千禧难题候选证明。约一万个并发 Agent 工作 88 小时,166 页论文与 Lean 形式化证明进入数学界审查。

深度长文 · 2026/09/09 09:49
ChatGPT Images 2.5 让修图变成了对话
Images 2.5 提升参考图保真、局部编辑和多轮一致性。Sketch、图片批注和提示词分享带来一套视觉版本工作流。

深度长文 · 2026/09/09 09:05
药物有了编译器,AI 生物医药跨进人体试验
AI 靶点发现、小分子生成和个体化癌症疫苗形成两条临床证据链。药物研发获得一套新生产方式。

深度长文 · 2026/09/08 21:16
AI 药物撞上衰老时钟:42 人蛋白组留下证据缺口
Nature Biotechnology 的一项人体研究:六套蛋白质时钟的同向信号、疾病效应的混杂风险,以及 AI 制药进入人体证据阶段的新问题。

深度长文 · 2026/09/08 21:16
AI SRE 处理常规故障:工程师积累“理解债”
AI SRE 读取告警、查询指标、生成修复。常规故障的人工参与下降。前 LinkedIn SRE Sylvain Kalache 提出“理解债”:工程师失去系统训练场,重大事故留下技能断层。

深度长文 · 2026/09/08 21:16
AMD Halo Station:1 万亿参数背后的内存账
AMD Threadripper Halo Station 包含 96 核 CPU、四块 MI350P、576GB HBM3E 和 2TB RDIMM。产品身份是原型机,上市时间为 2027 年。‘1 万亿参数’表达容量上限;模型速度、软件成熟度与整机功耗属于另一组问题。

深度长文 · 2026/09/08 21:16
ChatGPT 和 Codex 最终只剩一个入口?OpenAI 负责人把终局说透了
Codex负责人Tibo首次系统谈到产品终局:ChatGPT与Codex将走向同一个Personal AGI,复杂的Skills、Memory和Sub-agent可能只是过渡形态。

深度长文 · 2026/09/08 21:16
中国模型进入美国生产链:工作量过了海,收入留在哪?
美国风投 Dimension 访华后提出一个尖锐判断:中国开放权重模型已经进入美国 AI 产品的生产链,但模型用量增长并不保证收入留在模型公司。Cursor、Harvey 和 OpenRouter 的公开资料,正在把这条价值链讲清楚。

深度长文 · 2026/09/08 21:16
Claude 刚发布 AI 原生开发手册:代码不再是瓶颈后,麻烦才刚开始
Anthropic把AI编程从写代码扩展到规划、设计、测试、部署和运维。真正的变化不是产出更多代码,而是重做整条软件交付流水线。

深度长文 · 2026/09/08 21:16
CLAUDE.md 的灾难性记忆:规则增长 226%,理由失踪
一篇 arXiv 论文追踪 1867 个代码仓库和 247694 段指令生命史。规则数量增长,删除概率下降。实验发现:故障、假设和结果组成维护证据。维护证据压缩冗余,提升指令执行率。

深度长文 · 2026/09/08 21:16
Claude 解开千禧难题?陶哲轩的澄清指向数学黑箱
一则社交媒体预测称 Claude 解开纳维–斯托克斯问题。公开证据为空白。陶哲轩的澄清内容:相关进展超出他的已知信息;原帖主题是封闭 AI 系统交出答案所造成的数学价值损失。

深度长文 · 2026/09/08 21:16
Kimi Linear 最多砍掉 75% KV Cache:全注意力真要退场了吗?
Kimi 团队用三层 KDA 搭配一层全注意力,在百万 Token 上下文中减少最多 75% KV Cache,并报告最高 6.3 倍吞吐提升。论文最有价值的地方,不是宣布 Transformer 过时,而是给出一套更务实的混合架构。

深度长文 · 2026/09/08 21:16
MCP 真是 Token 黑洞吗?一篇论文测完 7 个 Agent,发现最贵的另有其人
一项覆盖 7 种 Agent Harness、5 个模型和 54 个主矩阵配置的实验发现,同一个软件任务的 Token 消耗最高相差 20 倍。主导成本的可能不是 MCP 或 CLI,而是包在模型外面的 Harness。

深度长文 · 2026/09/08 21:16
OpenAI 拒建专职工具团队:Codex 改写内部软件
Gergely Orosz 披露一段 OpenAI 内部争论。前 Meta 员工主张建设专职内部工具团队,管理层选择 Codex 路线。官方数据展示了内部应用、研究代码和技术支持的结构变化。

深度长文 · 2026/09/08 21:16
Pi 正在重写 Agent 底层:一个 while loop,已经撑不起长任务
Pi 的实验分支正在把 Agent Harness 改造成一套可恢复的执行系统。它关心的不是再加几个工具,而是进程崩溃、工具副作用、并行任务、上下文成本和模型与 Harness 的适配问题。

深度长文 · 2026/09/08 21:16
汤道生回应腾讯 AI 慢了:算力严重不足,场景牌还能打赢吗?
汤道生承认腾讯整体算力严重不足,元宝曾在模型与产品尚未成熟时抢增长;另一边,险些被砍的 DevTools 却长成了 WorkBuddy。腾讯能否追回差距,取决于能不能把庞大场景变成模型与产品的反馈闭环。

深度长文 · 2026/09/08 21:16
Uber 的 AI 软件工厂:70% PR 来自智能体,成本公式接管预算
Uber 披露 AI 软件工厂的规模与成本模型:70% 以上 PR 归因于智能体,内部技能超过 3600 个,日调用超过 3 万次。工程重点转向模型路由、上下文压缩和工具调用。

深度长文 · 2026/09/08 21:16
AI 页面为什么总有模板味?Vercel 把品牌判断写进了 DESIGN.md
Vercel 用一份公开的 DESIGN.md、公共样式表和评估闭环,让不同环境里的 AI Agent 也能产出符合品牌的页面。更值得借鉴的,不是提示词本身,而是它把判断、机制和纠偏放到了不同层。

深度长文 · 2026/09/07 15:19
OpenAI 的 AI 研究实习生达标:研究瓶颈转向判断与算力
OpenAI 宣布 AI 研究实习生达到内部目标。研究组织总量口径的比值是 3.1 Agent 工作日/人类工作日。研究员保留选题、结果判断与部署决策。本文核对推理用量、任务介入率、实验增长与安全停训数据。

深度长文 · 2026/09/07 15:18
黄仁勋称 AGI 到来:10 万量级 GPU 与 40 万块扩张
黄仁勋称 GPT-6 Astra 的训练规模达到 10 万量级 Grace Blackwell GPU。下一批算力是 40 万块 GPU。本文核对 NVL72 机架、电力容量、Stargate 园区与 Astra 基准。AGI 属于黄仁勋的判断。

深度长文 · 2026/09/05 08:53
NVIDIA PAIR:一条入口,多台电脑,各自显存
NVIDIA PAIR 是本地 AI 的统一入口,调度对象包括 RTX、DGX Spark 与 Apple M4 设备。每个请求归属单个节点,显存保持独立。开源 beta 的价值是并发容量,短板涉及调度信号、模型副本与安全边界。

深度长文 · 2026/09/04 13:15
一家量化公司,为什么要买 130 亿美元算力?
Jane Street 被曝与 Crusoe 签下五年约 130 亿美元 AI 云合同。它已经拥有数万块 GPU,还与 CoreWeave 签过 60 亿美元协议。真正值得看的,是量化交易怎样变成一门算力生意。

深度长文 · 2026/09/04 09:19
GPT-6 Astra 发布:跑分逼近满分,OpenAI 却承认它更难监控
GPT-6 Astra 把计算机操作、浏览器任务和软件工程能力向前推了一截,ARC-AGI-3 甚至跑到 99.9%。但真正值得开发者注意的,是异步工具调用、执行中干预,以及一个反直觉的安全事实:它更守边界,思维链却更难监控。

深度长文 · 2026/09/04 09:19
“软件工程终结”论文火了:作者 6 天后,先把“终结”删了
一篇名为《软件工程的终结》的论文突然走红,但当前版本已经改名,结论也从“旧的软件工程正在结束”变成“软件工程没有结束,而是在扩展”。标题退了一步,代码退居幕后的判断却值得认真看。

深度长文 · 2026/09/03 16:28
Codex 连干 26 天重写《红警 2》?62 万行代码还不能验收
一段 92 秒演示显示《尤里的复仇》在 macOS 窗口中运行。作者称 Codex 连续工作 26 天、生成约 62.4 万行 C++。但源码、构建日志、成本和独立复现仍未公开:它是强演示,还不是可验收工程。

深度长文 · 2026/09/03 12:31
Anthropic 开源电商 Agent 蓝图:不碰支付,却想占住交易前的“智能层”
Anthropic 把一年企业电商 Agent 经验做成了可 Fork 的开源仓库。两类 Agent、四套行业示例和一组安全护栏背后,是一条明确边界:Claude 负责理解与决策,目录、支付、供应链和客户关系仍由商家掌握。

深度长文 · 2026/09/03 12:31
Gemini 3.8 Flash 上线:单价没涨,但 Google 提醒它会主动多用 Token
Google 在六周内第三次更新 Flash。Gemini 3.8 Flash 的促销单价维持不变,复杂任务却会增加推理步骤和工具调用。对 Agent 开发者来说,模型价格表已经不够用了,真正要测的是一次任务的完整成本。

深度长文 · 2026/09/02 07:49
Claude Fable 5.1 上线:缓存便宜 75%,安全监控数据由企业自己保管
Anthropic 同时发布 Claude Fable 5.1 与 Mythos 5.1。跑分提升只是表面,真正影响企业采用的,是 Agent 长任务成本下降,以及 Enterprise Frontier Safeguards 把安全监控数据、密钥和人工复核交还给客户。

深度长文 · 2026/08/31 15:52
吴恩达画了一张 AI 工程技能图:语法贬值,判断力涨价
Coding Agent 可以生成整套应用,软件基本功为何反而更重要?吴恩达最新技能图把答案放在五个领域:全栈、数据、架构、安全可靠性与生产运维。手写代码减少后,开发者的价值正转向发现取舍、提供上下文和验证结果。

深度长文 · 2026/08/31 11:10
Uber:70%以上 PR 由 Agent 完成,真正难题却是账单
当 AI 编程从个人插件变成企业基础设施,模型能力不再是唯一变量。Uber 用六因子成本方程、真实任务评测、上下文图谱和实时成本反馈,把 Agent 使用量推高近十倍,同时压低单位成本。

深度长文 · 2026/08/31 11:10
Google WikiSkill:别再把聊天记录当成 Agent 的记忆
Agent 跑得越久,日志越多,为什么能力却没有持续增长?Google Research 的 WikiSkill 把执行轨迹、复盘知识和可执行 Skill 分成三层,并用实验说明:好规程能弥补模型规模,坏规程也会拖垮强模型。

深度长文 · 2026/08/27 06:39
GLM-5.3-Flash 开源:0.4 元背后的国产推理栈
GLM-5.3-Flash 以 320B 总参数、18B 激活和限时 0.4 元每百万输入 Token 的价格发布。真正值得关注的,是混合注意力、定制 SGLang 与国产 AI 芯片组成的整条推理栈。

深度长文 · 2026/08/26 11:06
Shopify CEO 考虑禁用 Claude Code:一份 AGENTS.md,为何成了大公司难题?
Tobi Lütke 因 Claude Code 不原生读取 AGENTS.md,公开表示考虑在 Shopify 禁用它。争议表面是文件名,背后却是多模型团队的指令漂移、开放标准与模型专用优化之间的冲突。

深度长文 · 2026/08/26 05:27
512GB Mac Studio 来了:Apple 与 NVIDIA,争的到底是什么?
Apple 用 M6 Mac mini 和最高 512GB 统一内存的 M5 Ultra Mac Studio 把本地 AI 推向更大模型。但这不等于 NVIDIA 只剩数据中心:真正竞争的是内存容量、软件迁移与规模经济。

深度长文 · 2026/08/25 18:30
别再给 AGENTS.md 打补丁:把项目规则训练出来
一条规则该不该写进 AGENTS.md,不应取决于上一次踩坑有多恼火。backpass 提出一套更像工程实验的维护方法:从真实会话取证,批量观察,小步更新,在固定预算内删旧增新,并由人做最后决定。

深度长文 · 2026/08/25 06:39
北京 AI 的“第二机房”,为什么突然长在草原上?
两年不到,乌兰察布的数据中心项目从36个增至100多个。GPU之外,时延、电价、气候和利用率正在决定算力落点。

深度长文 · 2026/08/25 06:39
小米突然拿出 AI Cube:这台“120B 小主机”,真能挑战英伟达吗?
三颗玄戒芯片、120B本地模型、1.22TB/s带宽。小米AI Cube最吸引人的参数,也正是最容易被误读的地方。

深度长文 · 2026/08/24 11:46
Anthropic 最强模型卖不动了:企业为什么不愿为“最后 10%”多付一倍?
Fable 5 只占 Anthropic 企业模型支出的 11.4%,Token 占比更低。最强模型为何输给自家便宜模型?答案藏在企业真正关心的成本单位里。

深度长文 · 2026/08/24 10:56
AI 正在重写《人月神话》:一个人,真的能顶一支开发团队?
50 年前没有成为主流的外科手术团队,正在被 Coding Agent 重新激活。但 AI 放大的是执行力,不是人类判断力。未来的软件组织会因此发生什么变化?

深度长文 · 2026/08/24 06:03
Grok Bot 真给 Agent 配了台云电脑:OpenClaw 和 ChatGPT Work,谁更像数字员工?
Grok Bot 把持久云电脑、登录态和多 Bot 协作做成了默认能力。它与自托管的 OpenClaw、混合执行的 ChatGPT Work 到底有什么区别,又该怎样选择?

深度长文 · 2026/08/24 06:03
ACP 想做 Agent 世界的 LSP,为什么接入越多,兼容问题反而越多?
ACP 正在成为编辑器接入 Coding Agent 的通用接口,但它并不是为 Agent Swarm 设计的编排协议。本文拆解它真正解决的问题、现阶段的优势,以及容易被忽略的能力边界。

深度长文 · 2026/08/23 08:11
OpenAI 突然降价 20%,算完这笔账,我发现 Token 快要不值钱了
当一百万 Token 的底层生产成本逼近几美分,AI 行业变化的不只是 API 账单。软件会从节省推理,转向持续计算、并行探索和自动验证。

深度长文 · 2026/08/23 07:38
23 万 Star 的 AI 编程 Skills,真的让代码变好了吗?
AI 编程 Skill 越来越像一套完整研发流程:先访谈、写规范、拆任务、TDD、评审。但更多问题和文档是否真的能提高代码质量?两项 2026 年基准给出了截然不同、却可以同时成立的答案。

深度长文 · 2026/08/22 13:20
Anthropic内部最近流行一个新工具,核心源码只有10行
一个没有脚本、模板和专用模型的Claude Code Skill,只靠两句指令就能把复杂系统变成大图少字的HTML图解。它展示的不是一个小技巧,而是一种新的软件生产方式。

深度长文 · 2026/08/21 08:39
OpenAI把Codex变成平台,Pi却在追问:Agent到底该属于谁?
同一天,两篇关于Agent Harness的文章给出了两条不同路线:一条把Codex做成可嵌入的软件底座,另一条希望用户真正拥有自己的Agent。

深度长文 · 2026/08/21 03:07
Codex额度用完怎么办?有人找到了一个新入口
社区监测显示部分Codex账户的周额度大幅下降。与此同时,一条通过Remote MCP连接本地开发环境的新路径,暴露了ChatGPT订阅里容易被忽略的第二个入口。

深度长文 · 2026/08/19 22:14
癌症疫苗第一次闯过三期:一人一方,距离获批还有多远?
默沙东与Moderna的个性化mRNA癌症疫苗在黑色素瘤三期试验中同时达到两项关键终点。这是一次真正的里程碑,但完整数据、总生存期和个体化制造仍决定它能否获批并走向普及。

深度长文 · 2026/08/19 20:41
英伟达要把16张Blackwell挂到你家外墙,代价是什么?
一条爆火帖子称,NVIDIA正把价值25万美元的GPU免费装进普通住宅,还替屋主支付电费。项目确实存在,但100户、免费账单和1GW背后,还有几个关键前提没有被说清。

深度长文 · 2026/08/19 20:32
Codex 越省越贵?从 Sol High 切到 Low,可能先把缓存打穿
很多人用 Sol High 规划,再切 Low 实现,以为能省额度。公开实测显示,新 effort 可能先触发一次大面积缓存失效。真正省 Token 的做法,是固定线程配置,或把明确任务交给 Luna 子代理。

深度长文 · 2026/08/19 10:53
DeepSeek V4 连跑5次,竟超过Fable 5?Agent的算力该换地方了
DeepSeek V4 Flash 连跑5次,再由自己选优,Terminal-Bench 2.1 成绩达到88%。但这是否意味着它真的超过了Fable 5?

深度长文 · 2026/08/19 07:49
DeepSeek V4 Pro 加个 Skill 就超越 Fable 5?爆火的 J-Space 跑分翻车了
J-Space 声称一个 Skill 能让 DeepSeek V4 在多项 Agent Benchmark 上超过闭源模型。但社区复现得到反向结果,报告中的 Terminal-Bench 单次跑分甚至无法按官方任务数算出来。

深度长文 · 2026/08/18 10:53
GitHub 大面积故障当天,Cursor 上线了“自己的 GitHub”
GitHub 大面积故障与 Cursor Origin 上线发生在同一天。事故暴露了开发基础设施的单点依赖,也说明 Origin 为什么值得关注。

深度长文 · 2026/08/17 17:04
Dario 留下一个时间表:几个月后,Claude 会交出什么?
Dario 暗示 Anthropic 将在几个月内展示生物医学进展。Claude 最可能先突破哪里,AI 科学家的真正形态又是什么?

深度长文 · 2026/08/17 17:03
Anthropic CEO 长文回应争议:AI 行业欠公众的,究竟是什么?
Dario Amodei 回应监管与舆论争议:AI 行业缺少的不是更积极的故事,而是足够多、能被公众验证的收益证据。

深度长文 · 2026/08/17 16:20
Pi 把 Agent 砍到只剩 4 个工具,却做出了“无限记忆”
Pi 团队展示了一套极简 Agent 实践:代码作为事实源,历史记录保存为 JSONL,能力通过 Bash 和 Skill 按需加载,大结果写入文件而不是全部塞进上下文。

深度长文 · 2026/08/17 13:07
Codex 开放 100 万上下文,我为什么劝你先别开?
100 万上下文听起来像免费升级,但它更像一条昂贵的应急车道。窗口更长,不等于模型更聪明,也不等于任务完成得更好。

深度长文 · 2026/08/16 09:37
Codex 重大更新:一个 2000 Star 的社区项目,提前两周押中了什么?
社区项目 Sol Advisor 提前跑通跨模型调度,Codex 随后将它原生化。这个新能力究竟怎么用,又是否真的节约 token?

深度长文 · 2026/08/14 11:42
DeepSeek Harness 与 Pi:两套 Agent Harness,两种复杂度管理方式
DeepSeek Harness 开源后,很多人的第一反应是:它是不是 DeepSeek 版的 Pi?
