AI 日报 | 2026年09月08日
今日焦点:OpenAI 首次披露内部数据,重度研究员日均 AI token 消耗价值超 7000 美元,研究部门每 1 个人类工作日对应 3.1 个 Agent 工作日;GitSpawn 漏洞曝光,打开恶意仓库即可在 7 款主流 Coding Agent 上静默执行代码。具身智能侧,世界机器人大会余温未散,"三道坎"拷问规模化落地,广州则发布全球首个可微粒子世界模型与系统级具身智能大脑。
OpenAI 首度披露内部数据:重度研究员日耗 AI token 超 7000 美元
OpenAI 于 9 月 6 日发布博文,首次公开其研究团队使用 AI 编程智能体的规模与成本:截至 8 月中旬,按 API 价格折算,普通研究员的日推理消耗中位数已超 600 美元(7 月仅为 162 美元),前 10% 的重度用户日消耗超过 7000 美元。更关键的一组数据是,研究部门每投入 1 个人类研究员工作日,就对应约 3.1 个"Agent 工作日",且同时运行 4 个以上 Agent 的研究员比例从年初的三成涨至七成以上。OpenAI 同时宣布已达成"自动化研究实习生"里程碑——可在人工指导下独立完成原本需数天的研究任务,并计划在 2028 年 3 月前打造完全自动化的 AI 研究员。
值得关注: 这是前沿实验室罕见的内部第一方数据,量化了 Agent 化研发的真实强度:过去三个月用量爆发式增长、内部技术支持频道发帖量下降一半以上,说明 AI 编程智能体已从"辅助工具"变为研发组织的生产力基础设施。但需注意成本按 API 公开价估算而非实际支出,且 OpenAI 强调人类仍掌握优先级与部署决策权——对评估 Agent 落地的团队,核心启示是"用结果而非用量衡量收益"。
来源:IT之家
GitSpawn 漏洞曝光:打开恶意仓库即可在 7 款 Coding Agent 上执行代码
Manifold Security 披露了一类名为 GitSpawn 的漏洞:攻击者可在仓库自带的 .git/config 中写入 core.fsmonitor 等配置字段,指向恶意辅助程序。当 Coding Agent 在后台执行 git status、git diff 等常规命令收集上下文时,Git 会自动调用该程序,实现静默的任意代码执行——无需用户输入任何提示词、不经过授权弹窗,甚至发生在信任确认之前,且以用户完整权限运行在沙箱之外。受影响工具覆盖 Claude Code、OpenAI Codex、Cursor、Goose、Qwen Code、Grok Build 及 Hermes Agent 共 7 款。截至 9 月 1 日复测,Codex、Cursor 及 Claude Code 主路径(v2.1.196)、Goose(v1.44.0,CVE-2026-72718)已修复,而 Hermes Agent(CVE-2026-71963)、Qwen Code、Grok Build 及 Claude Code 的 ultrareview 变体仍未修复。
值得关注: 该漏洞的传播途径值得警惕——正常的 git clone 不会带入远端 .git/config,真正的风险来自以压缩包、共享目录、U 盘等形式传输的"带 .git 的仓库文件夹",这正是团队协作中常见的交付方式。它揭示了一个结构性事实:Agent 后台的上下文收集本身就是攻击面,"批准弹窗"并不等于安全边界。开发者应做到"先审后开"——在让 Agent 打开外部仓库前检查其 .git/config,并及时更新工具版本。
来源:IntelFusions
Claude Code 新增 /skill-doctor 诊断命令与 128K 输出上限
Anthropic 近期密集更新 Claude Code:v2.1.261 引入 /skill-doctor 命令,用于检查已加载但未使用的 Skill 及其上下文成本,并将命令与后台任务的内联输出上限提升至 128K 字符,缓解长日志被过早截断的问题;随后的 v2.1.263 则聚焦错误修复与可靠性改进。此前版本还包含嵌套子 Agent 与会话恢复的稳健性修复。
值得关注: 这一更新直指 Coding Agent 规模化使用后的两个真实痛点:Skill 数量膨胀带来的隐性上下文开销,以及长任务日志截断导致的调试困难。/skill-doctor 将"哪些 Skill 值得保留"从经验判断变为可量化决策,对重度使用 Agent + 大量自定义 Skill 的开发者有直接价值——定期清理高成本低用量的 Skill,是控制上下文预算的实用手段。
来源:AIGC开放社区/腾讯新闻
新华网:具身智能走向规模化落地,仍需闯过"三道坎"
2026 世界机器人大会与第二届世界人形机器人运动会落幕,机器人演示从"能跑会跳"转向快递分拣、煮面打包等作业场景。热闹之下,产业距离规模化商用仍有差距:今年中国人形机器人累计交付整机约 1.5 万台、市场规模 20 余亿元,而传统工业机器人出口额早已突破百亿元。中关村智友研究院院长王田苗指出三大现实门槛:其一,"大脑"可靠性不足——99% 的任务成功率意味着机器人出去 100 次仍有 1 次"掉链子",且具身大模型技术路线尚未收敛;其二,硬件拖后腿——自重受限下需兼顾负重、高低温适配与持续工作时长;其三,大规模生产难度大。宇树科技创始人王兴兴预测,具身智能的"ChatGPT 时刻"(在 80% 陌生场景中通过自然指令完成 80% 任务)快则 2-3 年、慢则 5-10 年。
值得关注: 这是对具身智能产业现状难得的冷静审视:2026 被行业公认为"规模化应用元年",但 1.5 万台交付量对比百亿级工业机器人市场,说明行业仍处"从演示到实景"的关键拐点。对关注产业链机会的人而言,"大脑可靠性、硬件指标、量产能力"三道坎恰恰划出了数据采集与评测、核心零部件、产线工艺等环节的潜在价值洼地。
来源:新华网/中国工业新闻网
广州发布全球首个可微粒子世界模型与系统级具身智能大脑
在 9 月 3-6 日于广州举行的 XAIR Expo 2026 具身智能博览会上,两家具身智能企业发布"全球首个"新品:智动未来发布全球首个面向通用具身的可微粒子世界模型并展出 AUTOLIFE S3 智能人形机器人,该模型可对真实物理场景自主理解、趋势预判与动态规划,自主推演操作角度、发力力度及环境连锁变化,降低真机试错损耗;云蝶科技联合新加坡南洋理工大学发布世界首个系统级具身智能大脑 RoboForge,其 Harness 模块可完整记录任务证据链,失败时自动诊断问题来源并将失败样本转化为迭代素材,形成自我演化闭环。
值得关注: 两条技术路线都瞄准了具身智能"泛化性"这一核心痛点:世界模型试图解决仿真与现实脱节的问题,让机器人在执行前先"在脑中推演";RoboForge 则把失败样本变成可复用的训练资产,直击数据稀缺的行业难题。今年我国已将具身智能纳入"十五五"重点未来产业,此类系统级创新开始从单点算法走向完整平台,值得持续跟踪其真实场景落地效果。
来源:科技日报