今天的主线是「验收的稀缺性」:三条 AI coding 新闻指向同一个结论——生成端的产能已经不再稀缺,稀缺的是把生成物变成可信交付物的能力;两条具身新闻则分别给出技术与商业两端的进展。一份覆盖 700 多家公司的实证研究首次量化了「代码变多、软件没变多」的落差,一家 DevOps 公司用收购来补上代码与交付之间的断层,Linux 内核社区在用「AI 审查的洪水对抗 AI 补丁的洪水」。
哈佛与 Jellyfish:AI 编码智能体让代码变多,但没有让软件变多
哈佛大学研究者 Fiona Chen 与 James Stratton 利用工程效能平台 Jellyfish 的聚合数据,覆盖 700 多家软件公司、70 万余名员工、3 亿条「工作事件」(提交、拉取请求、问题跟踪记录),时间跨度为 2021 年至 2026 年 3 月。他们用双重差分法比较各家公司引入 AI 编码助手与编码智能体前后的变化。结果是:代码产出显著上升——总代码行数 +30%、提交数 +20%、拉取请求数 +23%;但以 Jira 中 Issue 与 Epic 的完成率衡量的「软件产出」没有出现统计上显著的变化,任务本身的规模与复杂度也没有发生结构性偏移。原因出在下游:拉取请求从提交到合入的平均时间增加了 49%,需要修改的拉取请求占比接近翻倍,每条拉取请求的评论数增加 35%,参与评审的人员比例上升 14%。截至 2026 年 3 月的观察窗口,80% 的样本公司已在使用某种 AI 代码评审,但 AI 只贡献了 23.3% 的评审评论和 10.8% 的拉取请求,绝大部分评审工作仍由人承担。研究者同时表示,无法把显著的就业变化归因于 AI。
值得关注: 这是目前少见的、用行为遥测而非开发者自评问卷做出的大样本研究,结论与近期行业内的体感高度一致——10 月以来多份工程报告都指向「瓶颈从生成转向验证」。对企业来说,这意味着按「代码生成量」评估 AI 编码工具投资回报的口径是失效的;对工具厂商来说,评审、验证与可回放的变更证据才是下一个竞争点。需要注意边界:数据截至于 2026 年 3 月,此后模型与智能体能力已有明显升级,作者本人也提示这是工作论文而非已发表成果。
来源:Ars Technica
Harness 收购 Augment Code 资产,把「代码上下文」接到「交付上下文」上
软件交付平台公司 Harness 于 10 月 8 日宣布收购 Augment Code 的部分资产,包括其智能体工厂产品 Cosmos、命令行工具 Auggie CLI、Code Context Engine 及相关技术,原团队一并加入,交易金额未披露,且并非收购整家公司。Cosmos 将更名为 Harness Cosmos Software Factory Agent,定位是「从想法到代码」这一段:当需求被指派、缺陷被报告、拉取请求被打开或告警触发时,由一组智能体在各自独立的虚拟机中规划改动、写码与测试、开拉取请求,并在收到评审意见、检查失败或合并冲突后继续在同一条拉取请求上修补,产出的是一个已过评审、可进入合并决策的变更。Harness 原有的四类智能体(软件交付、安全测试、运行时保护、成本管理)负责把这段代码送进生产环境。关键的一步是把 Augment 的 Code Context Engine(代码库实时关系图)与 Harness 的 Software Delivery Knowledge Graph(构建、部署、基础设施、安全与成本信息)打通:写码之前就能拿到测试用例、安全要求与历史故障及其修复记录,出问题之后下游发现也能带着证据回到工程环节。官方称 Harness Cosmos 现已可用。
值得关注: 收购方 CEO Jyoti Bansal 的原话几乎是对上一条研究的直接回应——「AI 对软件的影响,不会以生成了多少代码来衡量,而会以多少有价值的软件抵达客户来衡量」。这也是「智能体身份与权限」议题的又一块拼图:Harness 表示会把 Cosmos 纳入已有的身份与策略控制之下,但两个系统的权限如何贯通尚未给出细节。值得注意的是,这次收购只买资产不买公司,Augment Code 的其余业务走向并不明确。
来源:Harness 官方博客 | PR Newswire | SiliconANGLE
Linus Torvalds:AI 是编程的「入门毒品」,内核社区正用 AI 审查对抗 AI 补丁
在布拉格举行的 Open Source Summit Europe 上,Linux 与 Git 的创造者 Linus Torvalds 与 Ericsson Software Technology 负责人 Dirk Hohndel 对谈时表示「我其实真的很喜欢用 AI」,并给出一个具体用法:他的吉他效果器业余项目里,固件和 C 语言界面是他熟悉的,但界面「看起来像 80 年代的东西」,而他「不写 Java,只写内核」,于是把这部分交给 AI——第一次结果「糟透了」,但他的判断依据是自己已经用 C 正确实现过一遍。他由此总结「我用 AI 做我不擅长的事」。他把 vibe coding 称为「一种找到编程乐趣的美妙方式」,认为当下软件工程的门槛太高,新手很容易觉得自己的小作品一文不值,而 AI 能把入门台阶降下来;但他强调,做「真正重要的事」时必须非常小心,使用者得清楚知道想要什么、以及结果应该长什么样。
另一面是内核社区的真实压力。Torvalds 说,AI 生成的漏洞报告和补丁源源不断,「有时指向非常重要、非常真实的安全问题,有时指向二十年没人碰过的代码」,因为模型不在乎这个驱动还有没有人用。他重申了 5 月的判断——大量重复报告让安全邮件列表「几乎完全无法管理」。应对方式不是减少 AI,而是增加:被问到智能体式内核评审系统 Sashiko 时,他说其公开评审已经出现在 Linux 内核邮件列表上,部分子系统维护者已要求补丁先过一遍 AI 评审才接受,且这一要求很可能扩展到全部维护者。「我们在某种程度上是用我们自己的补丁评审洪水,去对抗补丁洪水」,他说,「大家开玩笑说现在有机器人跟机器人对话,而这是真的在发生」。他还提到,前一天的内核维护者峰会上约四分之三的讨论都围绕着如何让 AI 的生成与评审工具「不那么有压力、更有用」。他的总体判断是:AI 整体上在改善代码库,但也在「把维护者逼到成为问题的程度」。
值得关注: 这是「验收稀缺」最极端的一个样本——连全球最大的开源协作工程都出现了「机器人跟机器人对话」的现象。Torvalds 的用法值得单独记住:把 AI 用在自己有能力判断结果的领域之外(他不会 Java,但看得懂结果好不好),这与把不熟悉的系统整个交给模型是两种完全不同的工作流。对普通开发者的可操作建议也来自他本人:先用玩具项目练手,再考虑用到严肃场合。
来源:ZDNet(经 Ranzware 转载) | TechRadar
Odyssey-3:一个世界模型同时控机械臂、人形、汽车、无人机
位于帕洛阿尔托的 Odyssey 于 10 月 8 日发布第三版基础世界模型 Odyssey-3,研究预览现已开放。所谓世界模型,是指从海量视觉观测中学习物理、动力学、因果关系与人类行为的表示,从而预测「下一步会发生什么」以及「某个动作会如何改变环境」;Odyssey 的赌注是,先建立一个通用的世界先验,再让具体的机器在这个先验之上用很少的新数据去适配,而不是每个任务从头学。公司在六个领域做了展示:机械臂方面用数十小时的示教数据完成任务,并表现出示教中没有出现过的恢复行为(例如抓取失败后的补救);人形方面,人形机器人公司 Flexion 基于 Odyssey-3 构建实时控制策略,Odyssey 称其能扛住让对照基线失败的关照变化;车辆方面,用约 20 小时仿真驾驶数据训练的策略在印度真实道路上完成了自动驾驶;此外还有室内无人机导航、为训练 AI 智能体生成可交互环境、以及玩《GTA V》并展现出向其他游戏迁移的早期迹象。官方给出的量化结果是:Odyssey-3 Pro 在 Physics-IQ Verified 的 video-to-video 测试上得 66.1 分(best-of-8),为该榜单已报告的最高分;在 WorldMark 的四个类别中有三个排名第一,但这一结果来自公司自评。Odyssey 由自动驾驶背景的团队创立,6 月完成 3.1 亿美元融资、估值 14.5 亿美元,投资方包括 Amazon 与 AMD Ventures,研究团队成员来自 DeepMind、Tesla、Waymo、Meta、Apple 与 Wayve。
值得关注: 世界模型赛道正在密集成形——同月 AMD 以 82 亿美元股票收购李飞飞的 World Labs,9 月有消息称前 DeepMind 世界模型研究者创办的 Emulate 正在洽谈 7 亿美元融资,NVIDIA 也提供开源的 Cosmos 世界模型。Odyssey-3 的特殊之处在于它真的把同一个模型放到了机械臂、人形、汽车、无人机四类本体上,而不只是做视频生成。需要保留的判断是:除 Physics-IQ 分数外,绝大多数能力描述(尤其是「比基线泛化更好」)都是公司自述,没有第三方复现;研究预览也不等于可交付产品。
来源:World Programming | RoboticFirms | Brief
100 台人形机器人进 100 家门店卖锅:具身智能的零售账本
智元机器人与炊具品牌爱仕达的合作给出了一组少见的真实商业数据:自 9 月 28 日起,100 台智元灵犀 X2 陆续进驻爱仕达全国 100 家门店、覆盖 60 多个城市,以「门店促销员」身份上岗,三天试营业期间累计运行 2460 小时、接待顾客 9.54 万人次、互动 28.93 万次、促成扫码 4.84 万次,带动销售额约 223 万元,百家门店平均业绩增长 39%。分工是清晰的:机器人负责迎宾、需求询问、商品讲解与初步推荐(在温岭门店的案例中,它询问家庭人数、烹饪习惯与预算后 30 秒内完成锅具选型),涉及优惠政策、结账与最终成交的环节转交真人导购;爱仕达董事长陈合林将其概括为机器人「做广度」(引流、导览、互动)、人「做深度」(挖掘需求、建立信任、促成成交)。灵犀 X2 采用约 1.3 米的半尺寸人形形态以适配货架与收银台之间的狭窄空间。智元灵犀产品线副总裁吕苏荷坦言,当前能力「大约相当于刚入职的新人导购」,与金牌导购仍有差距,且门店环境嘈杂是首要挑战,团队为此升级了麦克风硬件并采集不同门店噪声做优化。这次合作始于今年 3 月,经过半年多的单店测试才扩展到百家门店。同期,清宝机器人批量进入国内多个景区承担导览与伴游工作。
政策层面,中共中央、国务院于 10 月 9 日印发《关于发展新质生产力的意见》,围绕五个方面提出 19 项重点举措,其中明确「全面实施『人工智能+』行动」,并点名推进人形机器人等新一代智能终端的场景应用。国家发展改革委在答记者问中直指实践中已出现的「脱离实际盲目布局和投资、一哄而上发展新兴产业和未来产业」等问题,要求「确保新质生产力发展不走偏、不冒进、不泡沫化」,并强调对一哄而上、盲目投资造成重大损失的严肃追责。
值得关注: 39% 的业绩增长与 223 万元销售额值得认真对待,但也必须看清口径——这是三天促销期、企业自报、且机器人承担的是引流与初筛环节,成交额归因于机器人多少并无独立核算;机器人「做广度、人做深度」的分工本身,恰恰说明当前具身智能在开放环境下的能力半径。与政策端的「防止泡沫化」放在一起读,信号很清楚:国家鼓励落地场景,但不鼓励用展示样机和科研采购堆出来的出货量。IDC 此前披露的 2026 年上半年全球人形机器人出货近 2.5 万台、同比增长 432.1% 的数据中,仍包含科研采购与展示样机,纯商业化付费订单占比有待提升。
来源:人民网(转《证券日报》) | 中时新闻网(综合《证券时报》《中国经营报》) | 香港经济日报 | 中国经济网(《关于发展新质生产力的意见》)
本页的评论功能已关闭