AI 日报 | 2026年10月01日
Google 在 DevDay 次日亮出 Gemini 4 Argon,编码基准登顶但只向经审查的安全伙伴开放;中国开放权重模型 Kimi K3 与 GLM-5.3-Flash 首次进入 OpenAI Codex 的企业采购结算主通道;Meta 联合 UW、MIT 提出把上下文当"可编辑文件"的 CLM,在 24 小时多仓库智能体集群任务上同等算力提升 65%。产业侧,IDC 上半年人形机器人出货数据出炉,全球同比增长 432%,中国厂商占据 95% 以上份额;IROS 2026 上,触觉感知与数据采集硬件成为新的竞争焦点。
Google 发布 Gemini 4 Argon:编码登顶,输出上限拉到 100 万 Token
Google 于 9 月 30 日(美西时间)发布 Gemini 4 系列首款旗舰模型 Gemini 4 Argon,距今年 2 月的 Gemini 3.1 Pro 约七个月,期间 Google 曾因编码能力不达标多次推迟 Pro 版本、并砍掉 Gemini 3.5 Pro。官方称其在 DeepSWE v1.1、VibeCode Bench 等编码基准上超过 OpenAI 与 Anthropic 的竞品,在 CWE-Bench v1 网络安全评测中与 GPT-6 Astra 并列第一;输出 Token 上限从 64,000 提升至 100 万,为行业最高,Google 内部已用它做大规模代码库迁移。但 Artificial Analysis 综合智能指数给 Argon 打 53 分,与 Claude Fable 5.1、GPT-6 Astra 并列第三。
值得关注: 这是"能力越强、开放越谨慎"路线的又一次公开实践。Google 通过 Fairwind 计划先向经审查的网络安全专家开放,同时参与美国政府的模型发布前自愿审查流程,理由是防范滥用、提示注入与失准行为。对开发者的现实影响有两层:一是 100 万输出 Token 让"几百页代码一次改完"成为可能,长任务智能体的工程形态会变化;二是这些基准成绩目前无法被外部独立复现——模型只对少数伙伴开放,社区此前还因疑似泄露的基准数据在 X 上争论过一轮。Alphabet 股价在消息后出现 3% 以上的拉升,随后回落至约 348 美元、涨 1.2%。
来源:The Verge https://on.theverge.com/tech/1002980/google-gemini-4-argon | Chosun Biz https://biz.chosun.com/en/en-it/2026/10/01/KVT7QG4B7FB45L4FTXBGJAJGNU/ | Firstpost https://www.firstpost.com/tech/google-launches-gemini-4-argon-with-focus-on-cybersecurity-14049570.html
Kimi K3、GLM-5.3-Flash 进入 OpenAI Codex 企业采购结算体系
9 月 30 日,美国 AI 基础设施公司 Baseten 宣布,其企业用户可在 OpenAI 编程工具 Codex 中直接调用月之暗面 Kimi K3、智谱 GLM-5.3-Flash 等开放权重模型,调用费用计入企业已与 OpenAI 签订的年度采购承诺额度,无需新增供应商或另走采购流程。Baseten 是 OpenAI 首批 32 家生态伙伴之一(名单还包括 Adobe、Figma、Salesforce、ServiceNow、CrowdStrike),Codex 提供开发者入口,Baseten 负责开放权重模型推理。OpenAI 核心产品与平台负责人、Codex 核心开发者 Tibo Sottiaux 转发并评价"开放才是出路"。
值得关注: 关键不在"多了一个可选模型",而在结算通道。企业引入新模型的隐性成本通常是供应商审批与单独结算,而非模型本身的价格或能力——进入既有采购承诺额度,等于绕开了这道门槛。这是中国开放权重模型首次进入海外主流 AI 企业的既有客户采购与结算体系,路径也比之前更进一步:9 月 18 日 Kimi K3 上线 Amazon Bedrock 还只是"云市场分发 + 收入分成",现在已走进开发工具与企业采购主流程。对国内模型厂商来说,出海的竞争维度正从"模型能力"转向"能否被低成本采购"。
来源:观察者网 https://www.guancha.cn/CaiJing/2026_10_01_902915.shtml | 腾讯新闻 https://news.qq.com/rain/a/20261001A09JNC00 | 36氪 https://www.36kr.com/p/4005282062864518
Meta 联合 UW、MIT 提出 CLM:把上下文当成模型可自由改写的文件
Meta Superintelligence Labs、华盛顿大学、MIT 与 Trillium Labs 联合发布 Context Language Models(CLMs,arXiv:2609.37725)。核心思路极其简单:把模型的实时上下文镜像成一个文件,模型可以用普通 Bash 命令任意改写,下一轮再把文件同步回上下文;不改写时就照常追加。这让模型自己学会保留什么,也天然扩展到多智能体——每个智能体的上下文各是一个文件。零样本条件下,CLM 在 BrowseComp-Plus 上准确率提升 11.4%、FLOPs 反而减少 21.5%;在 12 小时 EdgeBench 上得分提升 5%、FLOPs 减少 59%;在 24 小时多仓库智能体集群任务上同等算力得分提升 65%。配合在线强化学习后,Qwen3.5-9B 在 BrowseComp-Plus 上提升 47.6%(28.8%→42.5%)且 FLOPs 降低 12%。
值得关注: 这是"苦涩的教训"在上下文管理上的一次直接应用——不再手工设计压缩阈值、卸载策略和检索控制器,而是撤掉动作空间限制让模型自己搜索。论文还观察到无人硬编码的涌现行为:自发写"记分板"编排子智能体、自创 notes 角色、复用 compact_turns 辅助函数。代价是安全面变大:一个模型可写的上下文,是提示注入跨轮持久化的新位置,生产环境必须配编辑审计与回滚。同期两组数据可以给这条研究加注脚——npm 联合创始人、Arize AI 开发者关系负责人 Laurie Voss 给出的数据显示,自主智能体用户代码量增加 741%,软件交付量只增加 30%,因为瓶颈已从生成转向人工评审,而评审有效性在约 400 行后急剧下降,智能体却已能开出数千行的 PR。基础设施侧,Cloudflare 也为智能体的即时启停模式重构了容器,中位启动时间从 4 秒以上降到 648 毫秒。
来源:Meta CLM 项目页 / arXiv:2609.37725 https://arxiv.org/abs/2609.37725 | AGI Hunt https://agihunt.info/en/p/1a0f0fc182fbcacda5aec20167d | Flowtivity 解读 https://flowtivity.ai/blog/meta-context-language-models
IDC:上半年全球人形机器人出货近 2.5 万台,中国厂商占 95% 以上
IDC 最新报告显示,2026 年上半年全球人形机器人出货量接近 2.5 万台,同比增长 432.1%,市场规模超过 7.4 亿美元、同比增长 322.7%。中国市场出货超 1.9 万台、同比增长 426.3%,占全球约 77.9%,而中国厂商合计占全球出货的 95% 以上。厂商排名出现更替:智元(AGIBOT)以超 8,600 台、约 35% 的全球份额和 45% 以上的中国份额在出货与营收上双双登顶,宇树第二、加速进化第三,优必选增速接近 2,000%。IDC 同时把 2030 年全球出货预测上调至 75 万台,比此前高出约 50%。
值得关注: 比总量更值得看的是买家结构的变化。研发教育、表演展示、政府资助的数据采集中心在 2025 全年占出货的 83.8%,到 2026 上半年降至 69%——意味着接近三分之一的机器人在流向真正的商业与工业客户,"能演示"正在变成"能干活"。需要提醒的是口径差异很大:Counterpoint 统计上半年超 2.2 万台(智元约 9,700 台、份额 43%+,宇树超 7,000 台),Smart Analytics Global 统计约 1.91 万台、同比增长 272%,三家都认可智元领先,但绝对值与中小厂商数字分歧明显,单一厂商数字应按估算对待。对中国厂商而言,95% 的出货份额意味着 95% 的真实抓取、行走与失败数据,这才是喂给机器人基础模型的长期壁垒。
来源:Instadatanews(IDC 数据转述)https://instadatanews.com/articles/2026-10-01-idc-humanoid-shipments-surge-432-percent-china.html | 上观新闻 https://www.toutiao.com/article/7691613905348575770 | 环球网 https://www.toutiao.com/article/7691488582657131027/
IROS 2026:触觉感知与数据采集硬件成为具身智能新战场
在匹兹堡举行的 IROS 2026 上(9 月 28 日发布,展期至 9 月 30 日),由三位禾赛科技联创创办的上海公司 Sharpa 一次性推出三款产品,覆盖物理 AI 硬件栈的三个环节:D01 是一体化触觉操作机器人,双臂各 7 自由度、含手部共 66 自由度、约 40 公斤(不含底盘)、搭载 Jetson Thor,单臂负载 5 公斤、末端速度超 10.5 m/s、重复定位精度 0.2 毫米,全身电子皮肤以 100 Hz 采样、0.2 牛力分辨率感知任意部位接触;W02 灵巧手在 750 克以内塞进 21 个主动自由度,指尖视觉触觉传感器量程 5 毫牛至 30 牛、空间分辨率 1 毫米,可零间隙抓取筷子与细绳,防护等级 IP54;AE01 外骨骼数据手套以 22 个编码器采集人手动作用于遥操作与数据采集,指尖提供 256 级振动触觉反馈。
值得关注: 三件套真正的产品逻辑是一个闭环——人用手套演示,机器人以接近人手的尺寸复现动作,触觉传感器记录接触,数据回流训练。过去这个闭环要靠多家供应商、定制接口和研究设备拼装,现在被打包成同一供应体系。Sharpa 已获阿里、美团、腾讯、京东及红杉、启明投资,累计融资超 45 亿元、估值约 220 亿元,其 Sharpa Wave 手被 NVIDIA 选为 Isaac GR00T 参考人形的标准灵巧手,并已在上海与 DQ 合作落地 55 步冰激凌制作流程。需要说明的是,D01 的定价、交付时间、产能与独立基准均未披露,现场演示(接住掉落的接力棒、调酒)展示的是速度与接触响应,不能等同于安全认证或耐久性测试。市场侧数据可作参照:2025 年中国灵巧手销量约 1.92 万只,预计 2026 年达 7.02 万只,2030 年有望突破 43 万只。
来源:Pandaily https://pandaily.com/sharpa-d01-tactile-robot-w02-dexterous-hand-ae01-haptic-glove-iros-2026 | PR Newswire https://pr.connectiredell.net/article/Sharpa-Unveils-Three-Flagship-Products-D01-Robot-W02-Dexterous-Hand-and-AE01-Data-Glove-at-IROS-2026/6abb1571fb7acafcb4abefa2 | 财联社/环球网 https://www.toutiao.com/article/7691488582657131027/