今日 AI coding 一侧出现两条"降温"信号:四大编码 Agent 集体暴露供应链零点击漏洞,最强组合在真实客户模拟中只过 23.9%,而专家方案是 82.2%。具身智能一侧则是规模化的另一面——全国训练场与数据采集中心已破百家,智元与长隆把 300 多台机器人一次性推进千万人次客流的高交互公开场景。能力天花板与落地密度,是今天这组新闻的共同主题。
四大编码 Agent 曝 Plugin4Shell 零点击供应链漏洞
企业 AI 安全公司 Air 披露名为 Plugin4Shell 的漏洞:攻击者可绕过主流编码 Agent 的插件 SHA pinning 机制,在插件后台自动更新时注入恶意代码,全程无需用户交互即可实现远程代码执行。受影响产品包括 Claude Code、OpenAI Codex、Google Gemini CLI 以及微软 GitHub Copilot。Air 于今年 6 月向四家厂商通报,Anthropic 与 OpenAI 已在 Claude Code 2.1.179、Codex 0.146.0 中修复;Google 选择弃用 Gemini CLI 而非修补,建议用户迁移至 Antigravity;微软未回应也未修复,Copilot 仍处于暴露状态。微软数据显示近九成财富 500 强企业在使用 Copilot,影响面不容低估。
值得关注: 这是首例针对"可信插件市场"而非模型或 Agent 本体的 AI 供应链攻击。SHA pinning 本是用于锁定已审计提交哈希的防线,漏洞在于 Agent 检出提交后从不校验落点——攻击者控制仓库即可让 pin 表面上仍然生效。对企业而言,"Agent 能触达的资产"就是攻击者的可达边界,插件市场审核不再是充分信任依据;对个人开发者,唯一完整缓解手段是把 Agent 升级到已修补版本。
来源:AI and Tech News
ττ-bench:最强编码智能体只过 23.9%,专家方案 82.2%
新基准 ττ-bench 把"搭建智能体"包装成一份真实客户外包工单:模型拿到零散的公司记录、一位客户、一个 API、一份已有代码和一笔预算,需交付能应对未见客户请求的智能体。表现最好的组合(Claude Opus 5 搭配 Claude Code)在 53 项任务的留出客户模拟中通过率仅 23.9%,而专家手工撰写的参考方案在同一批任务上达到 82.2%。失败集中在编码之外:搜索记录而非理解记录、几乎不向客户提问、复用自己熟悉的设计、写的测试经常漏掉自身错误。
值得关注: 最具启发性的是提问的量化价值——允许提问的任务中,提问数为 0 的方案平均得分 0.16,提问 4 次以上的方案升至 0.50。瓶颈已从"能不能写出代码"迁移到"能不能搞懂要写什么",即需求工程与验证流程。这与近月多份企业调查中"瓶颈转向代码验证"的结论相互印证,也提示 Agent 产品的差异化方向:强化澄清式对话与自检测试,比单纯堆模型参数更能拉高交付率。
来源:网易 · 算力游侠
微软用 Agent 把 Copilot 运行时从 TypeScript 迁到 Rust
支撑 GitHub Copilot(CLI、桌面端、SDK 与云端 Agent,内嵌于 VS Code、Excel、Outlook 等)的运行时已被整体从 TypeScript/Node.js 重写为 Rust,其中大部分移植工作由编码 Agent 完成。据 The Register 报道,约 43 万行 TypeScript 转为约 80 万行生产级 Rust,历时 14.5 周、135 个发布版本(约每天 1.3 个移植 PR),AI token 成本约 12 万美元,外加约三周人力。成果是 1000 会话基准下吞吐 7.55 → 120 生命周期/秒(15.9 倍),10 客户端 Agent 批处理的内存从 1383 MB 降至 126 MB。微软的 Stephen Toub 也坦承存在数十处回归,且"这绝非主张所有大型 TypeScript 项目都该变成 Rust"。
值得关注: 这是迄今公开的最完整的大规模 Agentic 工程实证——不是 demo,而是 135 个可审查的小步发布组成的传送带式交付,成本与收益都可核算。它同时划出了边界:Agent 已在长周期、可机械验证的迁移类任务上具备工程可用性,但对 Rust 语义的深层理解仍有缺口。对团队决策的参考价值在于,可把"大范围重写"从不敢碰的债务转为可预算的工程项目。
来源:The Register(经 Evy's Nook 日报转述)
具身智能训练场破百家,数据采集价格带首次成形
中国信通院《具身智能训练场研究报告(2026年)》显示,截至今年 6 月底全国已建成启用超 70 家训练场,另有 40 余家在建或规划中,形成长三角、京津冀、珠三角三大集群(浙江 14 个居首,江苏、北京、广东、山东各 8 个),并开始向三四五线城市延伸。第三方统计进一步给出:截至 2026 年 8 月全国累计建成集中式具身智能数据采集中心 106 座、在运营 84 座,披露部署量的 52 座合计约 3972 台,全国在采集中心运行的机器人估计超 5000 台;55.8% 的中心部署不超过 50 台,最大的两座各 300 台。遥操仍是主流采集方式(83 座,79.05%)。价格带首次成形:真机数据约 500–1000 元/小时,UMI 数据 300–400 元/小时,仿真/合成数据 200–500 元/小时。
值得关注: 具身智能的瓶颈正从硬件能力转向训练数据质量,"机器人学校"成为公共底座型新型基础设施。价格带的意义在于数据开始被当作可计价的标准化商品,这对做具身数据基础设施(采集、清洗、标注、评估)的人是明确的信号:竞争维度将从"有没有数据"转为"单位成本与数据有效性"。同时也需留意争议——近期已有厂商公开质疑部分采集中心通过关联交易虚增营收,数据资产的真实需求仍需时间验证。
来源:中国经济网 | FutureX · Physical AI Daily Issue 126
智元 × 长隆:全球首个具身智能主题乐园 9 月 24 日启幕
智元(AGIBOT)与长隆集团联合打造的具身智能主题乐园将于 9 月 24 日在横琴长隆飞船乐园启幕,开园当日超 300 台智元全系机器人集体"上岗",园区设超 100 个机器人交互体验点,覆盖文娱商演、科普研学、导览导购、服务零售、智能伴游、酒店场景、体育竞技七类场景,数百个拥有独立姓名与性格设定的机器人角色参与互动。开园当天双方共建的具身智能文旅联合研究院揭牌,全球首个文旅场景大规模 5G-A 具身智能应用等成果同步亮相。智元 2026 年上半年人形机器人出货量达 8400 台,约占全球市场 44%。
值得关注: 与展会短时演示不同,主题乐园具备客流密集、运行时间长、游客需求多样的特征,是一次覆盖多机协同、连续运维、异常处理与真实数据闭环的大规模压力测试。判断其价值的关键不在开园爆点,而在三个指标:单机日均有效服务时长、故障与人工接管率、以及复购带来的体验差异化。若跑通,这将是具身智能从封闭工业场景走向公共服务场景的可复制模板。
来源:上海证券报(经网易转载) | 新华财经
本页的评论功能已关闭