今天的主线是「组织」与「成本」:斯坦福与 Together AI 证明多智能体的增益来自学会分工而非投票表决,微软把编码与常驻智能体塞进 Copilot 并首次给出用量成本可见性;具身侧,Feather 用 3 万美元的模块化本体冲击软硬捆绑的旧范式,而小米汽车工厂披露的一组现场效率数据,给出了当下人形机器人最诚实的产能坐标。
斯坦福与 Together AI 提出自组织智能体团队,平均 66.7% 反超「完美路由」
斯坦福大学、Together AI 与埃默里大学联合发布论文《Self-Organizing Agent Teams Learn to Reason Together》(arXiv 2609.22682),提出 SAT(Self-Organizing Agent Teams)框架。与主流「多个模型辩论后投票」的套路不同,SAT 让一个模型回顾团队过往的协作记录,重写团队的 playbook——谁复核谁、谁唱反调、信息如何流动——然后固定团队按这份策略反复演练。策略的学习成本极低:仅用 15 道数学题与 25 道研究生级知识题,学到的分工协议就能原样迁移到未见过的基准。
结果上,三模型团队在五项数学与物理基准上平均准确率 66.7%,而最强单成员为 48.8%、算力匹配下的最强个体为 58.7%、对成员独立答案做「完美路由」的理论上限也只有 59.0%。在 AIME 2026 上,SAT 比这个路由上限还高出 13.4 个百分点——意味着部分正确答案是在交互中「长出来」的,而不是从成员既有答案里挑出来的。论文还给出了适用边界:在八个基准上,组织心理学中的「可论证性(demonstrability)」与团队增益强相关(Spearman ρ=0.90,p=0.005)。
值得关注: 这是对当前 agent 编排范式的一次直接证伪实验。过去一年大量产品把多智能体做成固定的 DAG 与手写角色,而这篇论文说明手写拓扑存在明确天花板——真正的增量来自让团队学会「如何组织推理」这一元能力。同时它也给出了清醒的失效条件:当一个问题正确与否无法被团队自行辨认时(可论证性低),自组织协作的收益会显著收窄。对做 agent 工作流的人来说,判断任务是否「可验证」,比堆更多 agent 更重要。
来源:https://arxiv.org/html/2609.22682v1
微软重构 Copilot:内置 Code 工具与常驻智能体 Autopilot,并把成本账本交给员工
微软在 9 月 25 日发布 Copilot 的一系列新能力,其中最关键的是两项:一是名为 Code 的编码工具,用户用自然语言即可构建应用、仪表盘等软件,底层技术与 GitHub Copilot 同源,本月底面向早期体验客户开放,365 Premium 与 Pro 订阅者可在今年晚些时候预览;二是 Autopilot,即 6 月发布的 Scout 智能体的重制版,将于本月底进入私有预览。Autopilot 被定位为「数字同事」,在公司目录里拥有独立身份与可由用户控制的权限。
同时,微软把 Word、Excel、PowerPoint 直接嵌入 Copilot 界面,用户无需跳出即可协作编辑;并新增成本管理能力,让员工直接看到自己 AI 使用所对应的花费。Copilot 产品企业副总裁 Annie Pearl 明确指出,安全、合规与治理是组织引入智能体的最大障碍,这次的设计正是为了让它「能在企业里真正被用起来」。
值得关注: 编码能力从 GitHub Copilot 反向注入通用办公助手,说明「写代码」正在褪去专业开发者专属的边界,变成一种通用的生产力原语。更值得留意的是两个企业级信号:智能体获得目录身份与可控权限,意味着治理模型从「人使用工具」转向「管理一个数字员工」;而把用量成本直接暴露给员工,则是对过去两年企业被 AI 账单反噬的直接回应——成本可见性正在成为企业智能体的标配能力,而非可选项。
来源:https://www.aol.com/articles/microsoft-revamps-copilot-code-generation-120114000.html
Prime Sandboxes 正式开放:全虚拟化 MicroVM 把「执行环境」变成训练变量
Prime Intellect 于 9 月 23 日将 Prime Sandboxes 转为通用可用(GA)。与行业默认采用的 gVisor 容器不同,每个 Prime Sandbox 是一台具备独立 guest kernel 的硬件虚拟化 MicroVM,隔离边界位于工作负载之外而非系统调用层。这带来几个实质差异:沙箱内原生支持 Docker Compose、后台任务与依赖内核的系统级负载,可直接沿用 Docker 镜像而无需新的打包格式。官方称内部已创建约 3000 万个沙箱,弹性可支撑数万并发,默认账户上限 1024 个并发,并提供 36.5 万以上预置环境,与 verifiers、prime-rl、Prime Tunnels 集成。定价上采用无订阅、无最低消费的模式,宣称在 12 月 22 日前比主流供应商便宜约 3 倍(vCPU 约 $0.02/小时,内存 $0.0125/GiB/小时)。
Prime 给出的核心论证是:对训练中的 agent 而言,与生产环境的「静默差异」比硬失败更危险——硬失败会被标记并终止 rollout,静默差异却会奖励那些只在沙箱里成立、无法迁移到现实的行为。同一时间维度上,DeepSeek 公开的 DSec 论文称其沙箱平台可支撑 38 万个并发 agent 环境、每秒创建约 5000 个(该数字为论文自述,尚未经同行评议)。
值得关注: 沙箱正在从「安全配件」升级为 agent 训练链路中的一等公民变量。这一判断对做数据基础设施的人尤其重要:当 rollout 环境本身会影响策略学到的东西,环境保真度就成了与数据质量同级的指标。此外 DSec 论文中「不假设单一机制能防住所有 agent 越界、转而强化可观测性」的思路,与近期多起 agent 逃逸沙箱事件形成呼应——默认 agent 执行是敌意的、分层设防、把策略执行放在沙箱之外,是可以直接落到日常编码 agent 配置上的三条实践。
来源:https://www.primeintellect.ai/blog/prime-vm-sandbox
Feather Robotics 走出隐身:3 万美元模块化人形,本体与大脑解绑
总部位于旧金山的 Feather Robotics 于 9 月 25 日宣布走出隐身状态,完成 760 万美元 pre-seed 轮融资(部分报道称种子轮),由 Gradient 领投,Builder VC、Geometry、SEED Innovations、Virgo VC 等参投。公司推出一款通用机器人,促销价 29,990 美元(常规价 32,990 美元),配置双臂各 7 自由度、1 米臂展、360° 全向移动底盘(最高 1.3 m/s)、600 毫米垂直躯干行程、10 小时续航(双电池热插拔),内置遥操作、逆运动学与碰撞检测,并提供 Python 与 ROS 2 的开放 SDK。
其商业模式的关键在于解绑:本体不捆绑任何模型,开发者可在同一台硬件上运行来自 NVIDIA、Skild AI、Physical Intelligence、Generalist AI 的策略。创始人 Hoa Mai 此前创办的人形机器人公司被 1X 收购,联合创始人 Parsa Bakhtiari 是前特斯拉 Model 3 硬件工程师。公司称营收已超过 100 万美元,设备已在餐厅后厨与科学实验室清洁场景部署,价格约为宇树 H2 Edu 的一半。需要说明的是,「美国唯一模块化人形平台」的说法来自其领投方,百万营收亦为公司自报、未经审计——按单价折算约为三十余台,尚不构成产线规模。
值得关注: 这是具身智能产业链上「Android 时刻」叙事最清晰的一次实践:硬件与模型的解绑,本质是拒绝让五年折旧周期的资产与单一供应商的路线图焊死。对下游开发者而言,本体可换、大脑可换意味着试错成本从「重买一台机器人」降到「换一个策略权重」。但也要看到其局限——目前落地的仍是餐厅备餐、实验室清洁这类边界清晰、低方差的窄任务,与通用作业能力无关;且在美国市场对中国本体受限的背景下,其价格优势部分是政策产物而非成本优势,能否长期成立取决于规模量产后的真实 BOM。
来源:https://www.convergence-now.com/startup/feather-robotics-raises-7-6m-to-build-the-android-of-robotics-for-developers
澎湃披露车厂与手机厂造机器人的现场数据:任务一长,效率断崖
澎湃新闻梳理了造车、造手机与造机器人三条供应链的交汇。小米方面,2026 年 3 月雷军宣布人形机器人进入汽车工厂实习,在自攻螺母上件工站完成双侧作业,连续自主运行 3 小时、安装成功率 90.2%,同步满足 76 秒产线节拍;到 7 月成功率提升至 98%。但小米机器人团队负责人向迪昀给出两个更关键的数字:同一工位人工成功率约 99%,还差一个百分点;以及按任务时长划分的效率曲线——3 至 5 秒短任务可达人工的 70%–80%,30 至 60 秒中等任务降至 60%–70%,1 分钟以上长任务仅约 30%。
东风汽车智能化技术首席总工程师张振林透露,人形机器人「小东」将于 10 月进入工厂试生产,承担总装、分拣、搬运、上下料、质检等任务,年底进行小批量小点位试制,目标明年底能力拉到与真人持平;他还给出成本侧判断——复用整车供应链后,同类传感器、芯片与控制器的采购成本可能仅为科技公司外采的五分之一甚至更低。华为则选择第四条路:不造本体做平台,CloudRobo 于 6 月 30 日启动公测。
值得关注: 这组数据的价值在于它拒绝用单一成功率讲故事。90.2% 到 98% 用了四个月,98% 到 99% 需要多久无人知晓——这就是工业场景里「最后一公里」的真实代价。更值得注意的是效率随时长断崖式下跌:机器人不是不会做,是干不完整,长程任务的误差累积与恢复能力仍是瓶颈。这也解释了为什么当前可落地的都是短周期、边界清晰的工位而非通用作业。另外需要提醒,张振林所说的降本是采购与 BOM 层面的复用优势,不等于车规级安全、可靠性与耐久验证流程可以直接平移到机器人——验证周期是另一套独立约束。
来源:https://www.thepaper.cn/newsDetail_forward_34139583
本页的评论功能已关闭