栖居在城市的大地上,分享城市中的感想予你,在留言板留下你的足迹,希望你在这里有所收获,祝幸运

一个年轻人,一个小镇青年,如果获得更好的人生,第一步要摆脱异托帮,凡是别人向你建构、推销那些快乐,要一概拒绝;虽然你做不到,我还是愿意这么提。然后把那些所有的及时性的,就像那个肥宅水一样,能够让你瞬间高兴的东西,你都应该把它视若为敌人,是你生活中的毒药,你应该去做那些吃力不讨好的事情,比如说学一门技艺,精益求精锤炼一门技艺,这能够使你获得人生的支撑,或者你非常努力的去读书考一个好大学,也可以。这些东西才是你生活的真谛

最新文章

今天这五条指向同一个变化:智能体正在从"一个会写代码的窗口",变成"一个有身份、有位置、有权限半径的常驻实体"。微软把 1370 亿参数的编码模型压进本机,谷歌让智能体在合上笔记本之后继续干活,而 Zenity 用一次演练提醒我们:这类常驻体只要把默认权限画错,一条自然语言提示就足以接管整个云账号区域。具身侧则对应另外两本账——一本是百万小时级别的数据账,一本是在 1933 篇论文里脱颖而出的方法账。

微软把编码模型搬进本机:MAI Code 1.1 Flash 落地 Windows

微软在 10 月 7 日旧金山的 Windows + Surface 活动现场披露了设备端编码模型的落地细节(昨日已报道过同场的 MXC 执行容器与 Surface 硬件)。旗舰自研编码模型 MAI Code 1.1 Flash 总参数 1370 亿、激活参数 68 亿,采用 3 位精度量化后体积压缩近 80%,可在本地跑 256K token 上下文,本机版本内存占用约 53GB,并以投机解码优化响应速度。同期还有 NVIDIA 的 Nemotron(700 亿以上参数,2 位量化后仅占 20GB 出头内存)与 DeepSeek V4 Flash(2840 亿参数)。真正的开关在路由层:GitHub 的 HydraFusion 原本只在云端模型之间为任务选路,现在扩展到本机模型,预计 10 月内以实验预览形式进入 GitHub Copilot 应用、Copilot CLI 与 VS Code;Windows ML 同时新增 llama.cpp 支持。

值得关注:一是"混合推理"从叙事变成可选项——Copilot 可自动决定该任务走本机还是走云,也可手动指定本机模型端点,这对高隐私、低延迟的开发场景是成本结构上的实质变化。二是风险随之下移:有第三方治理研究指出,推理一旦落在本机内存,欧盟《人工智能法》(Regulation (EU) 2024/1689)所要求的高风险 AI 系统行为记录,可能无法被现有审计与数据防泄漏工具捕获——传统 DLP 盯的是云端上传与网络流量,不是本地推理;256K 上下文也意味着一次会话可以静默吞入大量本机敏感文件。三是口径提醒:3 位量化、80% 压缩、256K 上下文与 53GB 占用均为微软自述数字,尚无第三方在真实设备上独立复现。

来源:Building Windows for hybrid intelligence(微软官方博客全文转载) | Industry Wired | Tech Wire Asia(MXC 与硬件细节) | AI Governance Institute(合规质疑)

谷歌云发布 Gemini Agent:一个会写代码的"通用工作智能体"

10 月 8 日,谷歌云 CEO Thomas Kurian 在 Gemini at Work 2026 上发布 Gemini Agent,把问答、知识工作、媒体生成与"编写并运行代码"合并进单一智能体、单一 API。它有四个关键特征:云端持久执行(跨设备保持同一份记忆与个性化图谱,合上笔记本后几小时乃至几天的任务仍在跑);四种记忆(会话、语义、程序性、情景);动态多智能体编排(可为多步任务临时生成带独立身份的子智能体);以及"同事智能体"形态——拥有自己的 @agents.company.com 邮箱、日历与企业目录身份、专属存储,且只能访问团队显式提供的上下文。模型层面不绑定自家,目前支持 Gemini 与 Claude 系列,由 Smart Routing 在质量与成本之间选路;管理员可设项目级支出上限并触发自动暂停。金融版(接入金融数据服务商 FactSet 与伦敦证券交易所集团 LSEG,含 50 多项技能)与法律版(对接 NetDocuments、iManage)已在预览,政府、医疗、零售版待跟进。

值得关注:第一,"写代码"被正式并入通用办公智能体——此前 OpenAI 的 Codex 与 Dots、Anthropic 的 Claude Code 更多是独立的开发者入口,谷歌把开发者环境塞进了同一个盒子。第二,"同事智能体"给非人身份配了邮箱与目录条目,把身份治理从概念变成了默认配置,同时也意味着新的攻击面:一个能被点名、能被 @、长期持有上下文的企业账号。第三,请注意发布状态——目前仍是私有预览,广泛可用要等支持的 Workspace Business / Enterprise 套餐,多数能力属于"计划中"而非已交付;谷歌引用的法国巴黎银行 6.5 万名员工、日本保险集团 SOMPO 一万多个自建智能体,均属既有 Gemini Enterprise 平台,与本次发布的通用智能体无直接对应关系。

来源:Welcome to Gemini at Work 2026(Google Cloud 官方博客) | Quartz(多模型与路由细节) | CBS News | 财联社中文报道

AgentCorruption:一条提示接管同账号同区域全部 AWS AgentCore 智能体

安全厂商 Zenity Labs 于 10 月 8 日在多伦多的 SecTor 2026 安全会议上披露了一条命名为 AgentCorruption 的漏洞链。研究者对一个带联网工具的公开 AWS Bedrock AgentCore 智能体发出一条自然语言提示,让它去访问实例元数据服务 IMDS(一个供云工作负载获取临时凭据的内部地址 169.254.169.254)并把结果发出来,智能体照做——因为它运行在缺乏网络隔离的 Firecracker 微虚拟机中。拿到的临时凭据属于一个默认 IAM 角色,而该角色的权限范围不是单个智能体,而是整个账户加整个区域内的全部 AgentCore 资源。由此研究者得以列举并调用区域内所有智能体、数秒内下载每个智能体的容器镜像与源码、读取全部私有会话与长期记忆,并取走 Secrets Manager 与环境变量中的 API 密钥与 OAuth 令牌。更难清除的是持久化:他们往智能体记忆里写入一条伪造的"用户指令",让它每次回答前先访问攻击者控制的网页,此后通过改网页随时重写其行为,而用户面对的仍是一个看似可信的企业智能体。

值得关注:其一,问题不在那个联网工具——研究者用命令行工具同样成功,说明缺陷在平台层的网络边界,而不是智能体配置,摘掉 Web 工具治不了本。其二,这是"云的思维方式与智能体的思维方式天然冲突"的具象化:云安全讲分段与最小权限,智能体为了好用需要宽权限,结果一个外网客服智能体可以横向移动到同区域的内部财务智能体。其三,时间线值得每个用托管智能体平台的团队核对——Zenity 于 2025 年 12 月 25 日首次报 IMDS、2026 年 1 月 12 日报宽泛默认角色,AWS 在 4 月把第一条以"informative"关闭,自 2 月 14 日起新部署的智能体改用需要会话令牌的 IMDSv2,而默认角色直到 9 月 29 日(Zenity 发表前最后一次复查)才被收紧为不得跨智能体调用、不得读私有会话、不得访问 Secrets Manager。另需持平三点:该披露没有 CVE 编号、未附 AWS 官方声明;Zenity 自身销售智能体安全平台、8 月刚完成 1.25 亿美元 C 轮,存在商业动因;独立第三方的确认性测试仍然缺位。研究者同时表示,同类问题大概率不限于 AWS 一家。

来源:Zenity Labs 官方披露稿(Morningstar / Business Wire) | Dark Reading(SecTor 现场报道) | The Decoder

中国已启用 70 多家具身智能训练场,单一数据平台交付 150 万小时人类视频

据央视新闻报道,我国具身智能产业链正在数据侧加速。位于中关村的一家人工智能企业已建成具身智能数据平台,汇聚全国各地训练场的人类视频数据与仿真合成数据,累计交付人类视频数据 150 万小时,报道称量级达到全球领先;企业负责人表示正在打造"支持机器人持续学习的基础设施",让机器人上岗后的经验再反馈回来。全国已建成启用 70 多家具身智能训练场,在建与规划 40 余家,形成长三角、京津冀、珠三角三大核心集群。这些实训数据已投入真机训练:深圳一家机器人公司以几万条数据训练出的轮臂式人形机器人,已完成开关电柜、启闭工业阀门等复杂作业,负责人称单个动作的成功率在 80% 到 90%。同期的产业口径为 2025 年我国人工智能核心产业规模超 1.2 万亿元、企业数量超 6200 家;工信部等部委近期专项行动聚焦工业、服务、特种三大领域,构建"实景实训—数据沉淀—产品迭代—规模部署"的产业闭环。

值得关注:两条线要分开看。"70 多家训练场"这个数量级今年已在多轮报道中出现(9 月口径还同时提到 106 座数据采集中心、84 座在运营、5000 多台机器人在采集),今天真正新增的是"单一平台累计交付 150 万小时人类视频数据"这一可对齐的存量指标——它第一次把"我们建了很多训练场"落到了"我们手里有多少可用数据"。同时要把持平口径说清:150 万小时为受访企业自述,"全球领先"是报道措辞,"80% 到 90% 成功率"是企业负责人自述且明确限定于单个动作,均未经第三方核验;更关键的是,真机采集与仿真合成的占比、标注规格与质量分布都未披露,而这恰恰是决定这批数据能否转化为模型能力的核心变量。

来源:央视新闻 / 工信微报《70多家训练场已启用 我国具身智能全产业链加速推进》 | 中国网转载 | 盖世汽车转述

LATENT:宇树 G1 正手回球成功率 90.9%,获 IROS 2026 最佳娱乐与趣味论文奖

IROS(IEEE/RSJ 智能机器人与系统国际会议)2026 主会议已于 9 月 30 日在匹兹堡闭幕,清华大学、银河通用机器人(Galbot)、北京大学与上海人工智能实验室合作的 LATENT 项目获得最佳娱乐与趣味论文奖,论文题为《Learning Athletic Humanoid Tennis Skills from Imperfect Human Motion Data》(从不完美的人类动作数据学习竞技级人形网球技能)。它的切入点反常识:不采集完整比赛录像,而是让 5 名业余选手在约 3 米乘 5 米的区域录了约 5 小时的正手、反手与步法碎片——没有战术信息、没有落点标注,论文直接称之为"不完美数据"。方法上先训练一个动作追踪器,再压缩成连续的潜动作空间(一套身体动作字典),人类片段是"先验"而非"脚本";团队刻意降低模型对右腕追踪结果的信任权重,避免一个噪声关节主导整次挥拍,并加入基于马哈拉诺比斯距离的 Latent Action Barrier 约束,防止策略在无关动作之间跳变。实机部署在宇树 G1 上,20 个连续回合中正手回球成功 90.90%、反手 77.78%、前场 88.89%、后场 81.82%(成功定义为球落在对方场内);仿真中完整正手策略成功率 96.52%、平均落点误差 1.32 米,对照方法 AMP 为 41.32%、ASE 为 63.47%、PULSE 为 71.85%。

值得关注:方法论层面,把"不完美但廉价可得"的动作片段重建成潜空间先验,绕开了"每学一个新技能都要人工设计奖励函数"这个最贵的工程环节——论文自我定位的价值在这里,而不是网球本身。工程层面,用的是实验室和集成商今天就能买到的宇树 G1,不是定制研究机,这压低了他人复现与延伸的门槛;这套"快感知加从人类示范学得的全身控制"配方,在产线上对应的是接住坠落零件、行进中递交物件、被人推一把后恢复平衡这类动态瞬间,而仓储与装配部署恰恰是在这些瞬间失败、而非在缓慢脚本化的那一段。边界必须说清:实机测试仍然依赖覆盖约 19 米乘 15 米、50 多台摄像头的外部光学动捕系统(据雷峰网引述项目材料),用的是外部感知而非机载视觉;20 个回合样本量偏小;25 拍的机器人对拉只存在于仿真中;论文自己也把动捕依赖列为限制,并指出主动视觉是下一步。另可参考同期统计:RobotToday 分析 IROS 2026 全部 1933 篇论文后给出的数字是录取率降至 36.5%、标题含 VLA(视觉-语言-动作模型)的论文由 4 篇增至 65 篇、美国论文数反超中国。

来源:Pandaily(含论文具体评测数据) | RobotToday 转载 | RoboticsIntl | RobotToday:IROS 2026 全部 1933 篇论文分析

今天的主线是「底层供给」被重新定价:OpenAI 把 GPT-6 推向 12 亿周活用户并让模型自己决定界面形态,Anthropic 用 Haiku 5.5 把子智能体调用压到旗舰价的十分之一,微软与英伟达则把 agent 的运行时直接装进了 Windows 内核层。具身一侧同样在补地基——Mecka 拿到 6000 万美元 B 轮做人类动作数据,中国两座机器人数据采集训练场同日见报。

OpenAI 一天两线:GPT-6 全量推送,Codex 日更把「监督」变成免费层

OpenAI 自 10 月 7 日起把 GPT-6 推送到 ChatGPT 全部档位:Plus、Pro、Business、Enterprise 使用 GPT-6 Sol,Free 与 Go 档次日(10 月 8 日)起使用 GPT-6 Luna,ChatGPT 周活跃用户已超过 12 亿。本次更新的核心是一项叫 Intelligent UI 的能力——模型在回复里直接生成图表、表单、按钮和可交互小工具,官方演示包括按人数滑杆实时调整采购量的周日烤肉计划、可动手模拟的蒙提霍尔问题、以及解释机翼升力的多张示意图。工程上靠一套原生可流式组件库加编译器,边生成边渲染,不必等整段回答完成。延迟方面,GPT-6 边推理边出答案,官方称 GPT-6 Instant 在需要联网检索的问题上首字时间平均比 GPT-5.6 Instant 快 44%。需要留意的是,本次推送不涉及驱动 Work 与 Codex 的底层模型。

同处 OpenAI「28 天连更」窗口的还有 Codex 侧的密集发布。负责人 Tibo Sottiaux 立下日更目标后,Day 1 把 GPT-6 Astra 与 GPT-6.1 Sol 在订阅产品中的默认速度从约 30 tok/s 提到约 50 tok/s;Day 2 一次发了四项:Auto-review 对 ChatGPT 账号登录用户免费、不再计入套餐额度;付费 API 使用档位由五级压缩为 Build、Launch、Grow 三级,累计划卡门槛分别为 5 美元、100 美元、500 美元,顶档门槛从 1000 美元降到 500 美元;Meetings 插件在 macOS 桌面端向 Pro 与 Business 开放 Beta,纪要与待办直接落入 ChatGPT Space;Decisions API 面向所有开发者公测,官方称决策速度约为经 Responses API 调用的十倍。

值得关注: Auto-review 免费这件事比看上去重要。此前它会吃掉用户 2%–10% 的套餐额度,等于给「开着安全检查」标了价格;现在 OpenAI 把监督算力从任务额度里剥离,实际是承认长时程 agent 的瓶颈不是能不能跑,而是人还要不要一直盯着。另一边,Intelligent UI 把「界面该长什么样」从提示词规则变成了模型的训练行为,对做 agent 的人来说,输出物不再只是 diff 和文本。风险同样清楚:速度与安全的数字全部来自 OpenAI 内部评测,组件库是否会开放为 API 尚未公布。

来源:OpenAI - GPT-6 for everyone | OpenAI Developer Community - 28 days of Shipping | AI Industry Today

Anthropic 发布 Claude Haiku 5.5:给子智能体这一层定价

Anthropic 于 10 月 7 日发布 Claude Haiku 5.5,称其为迄今最便宜、最快且能力最强的小模型,模型 ID 为 claude-haiku-5-5,已在 Claude 平台、AWS、Google Cloud 与 Azure 同步上线。定价上,prompt 不超过 10 万 token 时输入 0.10 美元/百万、输出 0.50 美元/百万、缓存读取 0.01 美元/百万;超过 10 万 token 则为 0.50 与 2.50 美元。官方口径是这一档位列表价比 Haiku 4.5 低 90%、以上档位低 50%,综合运行成本约降 75%,且该折算已计入新 tokenizer 带来的 token 数略增。官方基准显示 Haiku 5.5 在 Terminal-Bench 4.0 上 39.2%(Haiku 4.5 为 0.0%,GPT-6 Luna 为 16.4%,Sonnet 5.5 为 70.6%),OSWorld 2.1 离线子集 72.4%,FrontierCode 1.1 主榜 46.4%,GDPval-AA v2.1 Elo 1620。Haiku 5.5 也是该系列首个带可调节 effort 的型号。

配套动作比模型本身更值得看:Sonnet 5.5 的缓存读取价由 0.20 美元砍半至 0.10 美元/百万,官方称这使 Sonnet 5.5 在多数 agent 任务上便宜约 20%;Max 5x 与 20x 订阅每月分别获得 100 美元与 200 美元 API 额度,Team 订阅池化最高 500 美元;Python 与 TypeScript SDK 新增 computer use 与 browser use 的 beta 支持。客户侧,HubSpot 报告其 CRM 套件上 92.8%,Asana 报告任务完成延迟降低逾 30%、单 agent 轮推理最高快 2.5 倍。

值得关注: 这不是一次单模型促销,而是在给「子智能体」这一层定价。Anthropic 明确把 Haiku 5.5 定位为配合 Opus 5.5 与 Sonnet 5.5 做编码工作的子智能体,并点名了 compaction、摘要、分类、数据库查询这些具体工位;官方图表也坦诚 Terminal-Bench 这类硬 agentic 任务仍是 Sonnet 与 Opus 的主场。子智能体架构里一次昂贵调用要配多次廉价调用,谁占住廉价层,谁就定了整个 agent 栈的成本曲线,缓存读取砍半同理——agent 的 token 大头正是缓存读取。需要打的折是:全部基准为 Anthropic 自测,客户数字为厂商自述。

来源:Anthropic - Introducing Claude Haiku 5.5 | Unite.AI

微软与英伟达把 agent 运行时装进 Windows

10 月 7 日旧金山的 Windows AI 与 Surface 活动上,英伟达 CEO 黄仁勋与微软 CEO 纳德拉同台。微软宣布 Microsoft Execution Containers(MXC)正式可用——一套操作系统级基础设施,让 agent 在后台隔离、持久运行,由 OS 提供 containment、identity 与 manageability,并与 Microsoft Security、Agent 365 打通做治理。Windows 与设备业务 EVP Pavan Davuluri 称,这些原语被直接建进 Windows,使 agent 可被隔离、被观测、被治理。硬件侧,RTX Spark 进入 Windows 笔记本与紧凑台式机:Blackwell RTX GPU(最高 6144 核)搭配最高 20 核 Grace CPU,600 GB/s 互连,128GB 统一内存,1 PFLOP FP4 算力,官方称可本地运行 125B 参数的 Qwen 3.8 Flash Next(51B n-gram)且不计流量不上云。Surface Laptop Ultra 起售 2599 美元,10 月 7 日开预售、10 月 16 日出货,紧凑台式机 11 月跟进,Acer、ASUS、Dell、Gigabyte、HP、Lenovo、MSI 均有机型。

同场还预览了 DGX Station for Windows,基于 GB300 Grace Blackwell Ultra,748GB 一致内存、最高 20 PFLOPS FP4,官方称可本地运行万亿参数级模型(点名 Llama 4 Maverick、Kimi K2.6、DeepSeek V4 Pro)。微软给它的两个定位是「个人 AI 超算」与「Windows token 工厂」——后者支持 32 个以上并发 agent 服务团队,直接压低云 token 消耗。此外 Meta Muse 将以原生 Windows 应用形式到来,Perplexity 演示了不消耗云额度的端侧任务,OpenClaw 也将获得原生 Windows 网关。

值得关注: 这条把 agent 之争从「模型在哪」推到了「运行时归谁」。MXC 一旦 GA,Windows 上就有了统一的 agent 隔离与身份归属层——哪个 agent 干了什么、能碰什么由 OS 记账,正好补上过去半年 agent 安全事故里最缺的归因能力。DGX Station 的「token 工厂」说法更直白:本地推理不只是隐私选项,而是把云 token 账单换成电费。边界要说清:DGX Station 仅预览、无定价无日期,RTX Spark 的本地模型数字为官方口径,CUDA 兼容只保证 Spark 到 DGX 的迁移路径。

来源:NVIDIA Blog | Microsoft - Building Windows for hybrid intelligence | The Agent Times

Mecka 完成 6000 万美元 B 轮:把人类动作录成机器人的训练数据

机器人数据公司 Mecka 于 10 月 7 日宣布 6000 万美元 B 轮融资,Sequoia Capital 领投,新投资方包括英伟达、微软风投 M12、Qualcomm Ventures 与三星,老股东 Kindred、Framework Ventures、Neo 跟投,天使投资人包括 DoorDash CEO Tony Xu、前 ServiceNow 与 Snowflake CEO Frank Slootman、前特斯拉 Optimus 负责人 Milan Kovac。公司的论点是:没有人写下过手怎么抓、怎么折、怎么倒,用多大力、何时松手——「运动、接触、力与几何不在互联网上,抓不到、授权不到、买不到。机器人缺的不是智能,是经验。」

为此 Mecka 自建了整条栈:按下游模型需求倒推选型与同步的多传感器采集硬件、在家庭与商业环境中录制人类示教的全球采集队,以及把原始噪声转成结构化信号的内部实验室(动作追踪、3D 重建、传感器对齐,称 in-the-wild 数据上达亚厘米级手部姿态精度)。学术侧,公司与 Georgia Tech、Stanford、UC San Diego、ETH Zürich、MIT 及 Meta 合作 EgoVerse 人→机器人迁移研究,论文当前版本含 1362 小时人类示教、8 万条 episode、1965 个任务、240 个场景、2087 位示教者,结论是策略性能随人类数据增长而提升,但有效缩放取决于人类数据与机器人学习目标是否对齐。商业上,公司称已供应数家头部前沿机器人实验室与多家 Mag 7 公司,2026 年 6 月年化收入突破 1 亿美元,预计年底达 3 亿美元。

值得关注: 这是具身数据基础设施第一次拿到如此整齐的战略股东名单——英伟达、微软、高通、三星同时进场,等于芯片、云、终端三侧一起押注数据层。EgoVerse 那句「有效缩放取决于人类数据与机器人学习目标是否对齐」是全篇最该记住的一句:数据不是越多越好,采集范式与训练目标错位时规模会空转。要打的折也很明确——年化收入、年底预测、亚厘米精度与客户名单全部为公司自述且客户未具名,无第三方审计。

来源:Mecka - Series B | Unite.AI

中国具身数据基础设施:厦门异构训练场与中关村跨本体数采中心同日见报

人民网与科技日报 10 月 8 日报道了厦门首个异构机器人训练场:位于同安区滨海新城德韬科技园,2000 多平方米被改造成超市、家居、仓储等 10 个实景训练区,7 月投入试运营,已进驻人形、四足、轮臂、工业协作臂等各类本体;由拓元智慧(厦门)牵头,依托国家级实验室联合多家研究机构与产业企业组成「AI 创新联合体」。技术路线上,团队自研「物理世界动作大模型」,区别于把视觉、语言、动作分模块训练再整合的主流路线,从训练起点就把三维空间、物理规律与动作轨迹放进同一套模型,让机器人学的不是固定动作而是重力、形变、摩擦,从而预判动作后果。采集方式上,数采员先把完整操作拆解为若干分步动作,再按任务情景分别通过主从臂控制、VR 控制、第一视角视频记录带机器人分步练习。

同日新浪财经探访了中关村(海淀)具身智能创新产业园内的诺亦腾机器人跨本体数采训练中心。近 100 平方米的动作捕捉区是核心,四周架设动捕摄像头、地面布设定位标记点;此外还有搭建了完整厨房、客厅、卧室、卫生间的场景化训练区,以及运控训练区、多模态灵巧操作数据采集区、UMI 遥操作与夹爪动作采集区。中心采集多模态交互、灵巧操作、第一视角三类数据,分别对应让机器人理解运动、理解精细操作、理解环境。一名数采员穿动捕服、戴头部捕捉装置与数据手套,按脚本完成「伸手—拿起水瓶—转身—递出—松手」约 30 秒即产出一条原始数据,系统同步记录手指动作、指尖定位与压力;同一动作还要换方向、换拿法、换位置反复采集。

值得关注: 两个场地同日见报,指向同一件事——具身智能的瓶颈已经明确落在高质量真机数据,而不是模型结构。厦门那条的价值在技术路线:把三维空间与物理规律塞进同一套模型,是业界「端到端 vs 分模块」之争的一个中国样本。中关村那条的价值在成本结构:30 秒一条原始数据、且必须换方向换拿法重复采集,这类工作的单位成本与职业化程度决定了数据供给能否真正规模化——也正是 Mecka 那条新闻里资本押注的同一个环节。需要说明的边界:两者均为媒体探访稿,未给出数据产能、转化率等可核验指标,也未见第三方对训练效果的独立验证。

来源:人民网财经 | 新浪财经

今天的主题是「Agent 的账本与地基」。GitHub 公开承认现有 Git 架构撑不住智能体的写入洪流并开始重构存储层,Atlassian 同一天把「谁写的代码」变成平台级可审计记录,Mistral 用一万亿参数的开放权重模型在欧洲腹地插旗;具身侧,TwelveLabs 把第一人称视频变成可直接进训练流水线的结构化数据,而一篇 CoRL 投稿论文则给出了一个不太舒服的结论——当危害意图只是「暗示」而非「明说」时,高达 95% 的机器人任务会在护栏毫无反应的情况下被执行完。

GitHub 重写 Git 存储层:为智能体规模的开发重建地基

GitHub 在工程博客上宣布正在重建其 Git 基础设施,理由是智能体开发已经把写入负载推到旧架构的设计边界之外。数据很直白:2025 年 9 月到 2026 年 8 月,平台每月 Git 事件从 2182 亿涨到 4733 亿(约 2.17 倍);仅 2026 年 9 月一个月,开发者和智能体产生了 73.8 亿次提交,是一年前的五倍多;推送量同比增长 4.9 倍,从每月 6.9 亿次涨到 33.5 亿次;PR 合并量接近四倍;GitHub Actions 单月运行 32.6 亿次。最繁忙的那个仓库在 8 月收到了约 10 亿次请求。问题出在写入而不在读取——现有 Spokes 架构把每个仓库以五份完整副本存在文件服务器本地盘上,用三阶段提交协议保证一致性,代价是「一次推送的速度等于它那组副本里最慢的那个」。新架构把权威数据放进 Azure Blob Storage,用轻量计算 worker 缓存来服务读请求,压缩和垃圾回收等维护工作挪到独立 worker 上跑,内部基准称写入吞吐最高提升 35 倍。迁移在线进行,无维护窗口,开发者无需改动任何东西。

值得关注: 这是「AI coding 规模化」第一次以基础设施账单的形式被量化。GitHub 点出的五个压力点里,四个是平台自身的容量问题,第五个——所有合并都要挤在单一 ref 上——却是团队自己的工作流转嫁给平台的。对已经在跑智能体工作流的团队,那条「智能体的循环速度被单次推送延迟卡死」的论断值得抄进设计文档:在写路径改造落地前,你给智能体加再多并行度,收益都会被推送往返吞掉。需要说明的是,35 倍是内部基准、针对的是在建系统而非已上线平台,且 GitHub 明确表示具体设计要等后续文章披露。

来源:Building Git infrastructure for agent-scale development(GitHub 工程博客)

Atlassian 发布 AMP:给每个智能体一个身份、一个主人和一份审计轨迹

10 月 7 日,Atlassian 在阿姆斯特丹的 Team '26 Europe 上发布 Agentic Multiplayer Protocol(AMP),试图把智能体纳入团队已有的工作记录体系。核心变化有三块:Teamwork Graph(官方称已连接 2500 亿以上对象和关系)通过 Rovo Code Search 把源码读到函数、符号、类的粒度,可以跨 Bitbucket 和 GitHub 检索而无需克隆仓库;版本历史开始区分「人写的」和「智能体写的」,覆盖 Claude、Codex、Figma 与 Rovo;Rovo Work 让智能体在管理员控制的沙箱里连续跑几小时的长任务,人先审计划、再批准执行。智能体还能在 Bitbucket 里录一段 Loom 讲解自己的改动。官方披露其 MCP Server 有近 200 万月活、日处理 1500 万次工具调用,六个月内增长 15 倍。Rovo Work、代码归因与欧盟境内 AI 处理现已可用;更关键的「非人身份控制」——能看什么、能访问什么——官方只说「即将推出」,没有日期。

值得关注: 几乎所有工程负责人都被问过「你们代码库里 AI 写的占多少」,但极少有人答得上来,AMP 是对这个盲区的正面回应。不过 InfoWorld 的报道里,Aikido Security 的企业 CISO Mike Wilkes 和 IDC 研究经理 Adam Resnick 都点破了同一个漏洞:Git 只记录 author 和 committer,本地跑智能体的记录仍然写着开发者的名字,而提交信息里的归属声明可以被关掉、改写或丢失。归属标签不等于决策记录,更不等于「有人认真审过」。在权限约束真正落地之前,合理的用法是把它当作衡量评审投入、缺陷率和返工的输入项,而不是问责的证据。

来源:Atlassian Adds AI Code Attribution With AMP, but Deeper Identity Controls Must Wait(Superpower Daily / InfoWorld 综述)

Mistral Large 4「Le Chonk」:一万亿参数,10 月底放权重,主打网络安全

Mistral 于 10 月 6 日开放 Mistral Large 4 的公开预览,内部代号「Le Chonk」,权重承诺 10 月 27 日左右放出,中间留三周给开发者、网络安全公司和政府机构做红队测试(这批测试者拿到的是限制更少、网络能力更强的版本)。这是稀疏 MoE 模型,总参数约一万亿、每 token 激活约 490 亿,上下文 100 万 token,在 Mistral 自有的欧洲数据中心用约 3800 张 NVIDIA Grace Blackwell 从零训练两个月,覆盖 160 多种语言(含全部欧盟官方语言)。最硬的卖点是网络安全:官方称 Cybench 解题率 93%,在 Artificial Analysis 的「复现并修补真实开源漏洞」测试上得 82%,为所有模型最高——多个闭源模型在这项上接近零分,因为它们直接拒绝执行。编码侧,DeepSWE v1.1 报 62%(Artificial Analysis harness 口径 61.7%),领先 GLM-5.3 的 61%、DeepSeek-V4-Pro 的 57% 和 Qwen 3.8 Max 的 51%,但仍明显落后 Kimi K3 的 68% 以及闭源前沿的 74%。

值得关注: 一是战略定位诚实得少见——Mistral 不宣称打赢 Claude 或 Gemini,只宣称在中国实验室主导的开放权重赛道上做到「欧美最强」;二是它把「模型会拒答」直接论证为安全缺陷:一个拒绝复现攻击手法的模型,也没法帮你做防御性红队。这对做安全的企业是真实痛点。需要打折的地方不少:不同媒体对 GPU 数量(3800 或 4000)、激活参数(49B 或 52B)、API 定价(每百万输入 0.14 美元或 1.36 美元)的报道互相打架,强化学习阶段仍在跑、官方自承分数会变;在 Artificial Analysis 的智能指数上预览版只拿到 38 分,落在 DeepSeek V4.1 Flash 与 GPT-6 Luna 之间;Surge AI 的盲评给它 3.74/5,落后 Claude Opus 5 的 4.22。

来源:Europe's Mistral launches Large 4 to challenge China's lead in open AI models(The Next Web) | Mistral Large 4: 1 Trillion Parameters, Open Weights This Month(AIincider)

TwelveLabs Pegasus 1.6:把第一人称视频直接变成机器人训练数据

TwelveLabs 于 10 月 6 日发布 Pegasus 1.6,官方称这是其首个原生理解第一人称(egocentric)视频的模型——即由作业者视角拍摄的画面,无论是工人戴的头戴相机、产线上的手持记录,还是远程操作机器人时的回传画面。上下文窗口 261,120 token,单次可处理最长两小时视频。它支持五类工作流:按客户自定义分类体系生成带时间戳的动作分割与标注、生成描述空间关系与手物交互的密集字幕、给片段打动作清晰度/构图/稳定性的质量分、用自然语言检索长尾事件与重复片段、以及把人脸、旁观者和纸质敏感内容在进入训练前标记出来。定价为视频输入每小时 1.75 美元、图像每百万 token 3 美元、输出每百万 token 7.5 美元。CEO Jae Lee 对 VentureBeat 给出的理由是:遥操作数据质量高但「就是一个人配一台机器人」,难以规模化,而第一人称视频好采集得多。

值得关注: 这条正对着具身智能数据基础设施那条链。人工标注一小时第一人称视频需要 70 到 155 小时的说法(来自 TwelveLabs 口径)如果成立,那么标注成本才是数据规模化的真正瓶颈,而不是采集。但要清醒:Pegasus 只做「视频理解层」,产出的是描述与结构,它不恢复位姿、接触点和几何,把观察接到机器人运动与控制上仍是团队自己的活。计费上有个坑——每个 segment 定义单独计费,一次请求覆盖多个动作类别时,实际被计费的时长会成倍放大;此外批量分析目前仍走 Pegasus 1.5,高吞吐场景尚未迁移过来。

来源:TwelveLabs debuts Pegasus 1.6 to improve robotics training data from first-person video(VentureBeat) | TwelveLabs Brings Video Understanding to Physical AI With Latest Launch(GlobeNewswire)

论文:危害意图只要「暗示」,机器人护栏几乎全线失守

哥伦比亚大学 Sripad Karne 与 Arjun Balaji 的论文(arXiv:2610.05818,投稿 CoRL 2026 SPAIS workshop)做了一组控制变量实验:取 LIBERO-Goal 的五个厨房任务,任务本身、物体、场景完全不变,只给同一个动作附加不同的理由,并分三档表述——隐含(L1)、直陈(L2)、直白(L3),同时配一组长度相近的无害对照。结果是 π0.5 在三档下的完成率都与无害对照相当,也就是说机器人完全无视目的。筛查责任因此全落在外层护栏上,而 Llama Guard 3、WildGuard、Qwen3Guard 三款文本护栏抓得住几乎所有直白请求,却漏掉大部分隐含请求——高达 95% 的隐含危害运行最终任务完成且未触发任何告警;针对机器人指令重新校准后,这一比例仍有 90%。激活探针也补不上:线性探针在基座语言模型和视觉语言模型里几乎能完美区分有害/无害,但经过机器人训练后,两个模型族的这种可分性都明显衰减,其中隐含危害衰减最严重。论文还纠正了一个假象——OpenVLA-OFT 看起来更「安全」,实际是它处理不了指令里多出来的那句理由,无论理由有害与否一律失败。

值得关注: VLA 与聊天模型的根本差别在于它只输出动作、不会拒答,安全边界因此被迫外移到护栏和规划层。这篇论文证明那道外移的墙对措辞敏感、对意图不敏感——而措辞恰恰是最容易绕过的一层。更棘手的是「机器人训练会侵蚀危害信号」这一发现:此前已知机器人训练会损失视觉语言知识,现在看连安全相关内容也在损失之列。对任何要把 VLA 推进真实场景的团队,这意味着不能把护栏当合规文件,而必须当作需要独立评测集、含隐含意图用例的攻防对象来对待。

来源:What the Guard Misses, the Robot Executes: Implied Harm in VLA Instructions(arXiv:2610.05818)


核心逻辑一句话:情绪不是靠"想通"解决的,是靠"写下来 + 拆小 + 立刻做"解决的。五个方法共用同一条神经回路——把模糊的焦虑变成具体的文字,把巨大的目标变成不可能失败的小动作。每天挑一个练 10 分钟,一周见微小进步。

五个方法

方法一:写负面想法 + 反向三问

适用:遇到事习惯性自我怀疑("我不行""我不适合")时
  1. 写下来:负面想法冒出来时,立刻记到本子/备忘录,原样写:"我觉得我会讲不好,会很丢脸"
  2. 反向三问:
    • 如果这件事一定能解决,我会怎么做?→ 多练几遍,录视频模拟,练 10 遍
    • 有没有可能,这个困难其实是机会?→ 也许这次能让老板看到我的能力
    • 如果我欣赏的人遇到这事,他会怎么做?→ 偶像会觉得这是证明自己的机会,先做了再说
  3. 写下答案并立刻行动:把解决办法写在纸上,马上做第一件:打开演讲稿开始练
原理:三问的本质是强制大脑跳出"固定结论"(我不行),去搜索可能性。答案不是重点,"搜索"这个动作才是。

方法二:焦虑清单 → 行动清单

适用:多个焦虑叠加、整个人被压到吃不下饭时
  1. 固定时间写焦虑清单:早晚 30 分钟,把焦虑一条条列完:担心月底 KPI / 害怕和同事处不好 / 想学新技能没时间
  2. 每条对应 1-2 件今天能做的小事:KPI 焦虑 → 今天联系 3 个潜在客户;同事关系 → 中午约吃饭;没时间学习 → 通勤听 10 分钟课
  3. 立刻执行最简的一件:现在就发消息给客户
举例:同时面临项目截止、搬家、考证复习 → 列"给房东确认搬家时间""每天一小时复习计划",做完发现没想象中难。

方法三:旁观者视角(第三人称描写)

适用:情绪上头时(愤怒、委屈、恐惧),完全没法理性思考时
  1. 用第三人称写自己:"她现在很生气。同事把她的项目搞砸了,不道歉还甩锅。她的身体反应是握紧拳头、手在发抖。"
  2. 写着写着就冷静了:描写行为与身体反应,会把"沉浸"切换成"观察"
  3. 冷静后再定行动:写清事实 → 找领导列自己的工作记录 → 说明情况
原理:心理学上的"自我抽离"(self-distancing),把"我"变成"她",大脑从情绪脑切回理性脑。

方法四:微小目标(拆到不可能失败)

适用:目标总是完不成(早起、运动、自律),一想起大目标就想放弃
  1. 找到想改变的事:想减肥,但一想到控制饮食+每天运动就想放弃
  2. 拆到不能再小:减肥 → 每天只做一个深蹲;早起 → 每天比昨天早 1 分钟;学英语 → 每天背 1 个单词
  3. 完成即正反馈:不可能失败的动作,大脑不会启动"放弃"防御
关键不是动作本身,是先保住"每天完成"的记录不断档,习惯建立后再加量。

方法五:输入 + 输出笔记法(原文未编号,是从中间段落整理出来的独立方法)

适用:看书/学课总是"看了就忘",想要真正用起来
  1. 边学边做笔记:看到有启发的,用自己的话总结:"沟通要先倾听再表达 → 以后和人聊天,先听完对方说,不打断,再发表意见"
  2. 输出分享:看完整理成 500 字文章,写"学到了什么 + 我怎么用的 + 用后感受"
  3. 真实场景演练:朋友抱怨时,先认可情绪("你真的太不容易了")再慢慢分析问题——沟通顺畅,自己看问题也更深
固定模式:输入(读/学)→ 转写(自己的话)→ 输出(应用+复盘)。这是费曼学习法在情绪沟通上的应用。

记录心法(总纲)

心法动作为什么
频繁记录自己把关于自己的一切都记下来时间加持下,记录真的能"改命"——回头看才能看见进步与模式
一次选一个方法每天 10 分钟,练同一方法至少一周微小的持续 > 宏大的开始;一周就能看到微小进步



一、今天在吵什么(6-26 ~ 7-01 本周热点过滤)

话题热度一句话判断对你的相关度
BrowserBC 论文刷屏🔥🔥🔥23 star 但论文级数据(WebArena +20.9 / ClawBench Finance 翻倍 100%)⭐⭐⭐
AI agent 框架之争🔥🔥BrowserBC + Lightpanda + OpenRath = 完整工具栈成形⭐⭐⭐
技能蒸馏 vs 模型蒸馏🔥"知识脱离执行者"——Sonnet 蒸馏给 Qwen 也能用⭐⭐⭐
InStreet 装修中🔥80+ 天 Karma 0 增长——你一直忽略的"零增长陷阱"⭐
半年度总结🔥6 月要过去了——各种工具、上半年盘点⭐⭐

二、未来 6 个月可能怎么走

">1. "技能蒸馏"会成为 AI agent 新范式

  • 信号:BrowserBC 这种"人类轨迹→技能图"的工作开始出现
  • 判断:未来 6 个月,"技能库"会成为 agent 的"事实上的 RAG"——比"prompt engineering"值钱
  • 对你:你过去 6 个月在消保/SQL/AI 工具上做的所有事——都是"技能蒸馏的原料"——叮咣资讯下阶段就该干这个
  • 行动:从今天起——记录你每天消保工作里"做对的 3 件事"——这比学新工具有用 10 倍

">2. "靠系统强制"会取代"靠意愿"

  • 信号:6-26 我们建了 cron + Working Buffer 强制 + SESSION-STATE 强制
  • 判断:未来 6 个月,"做事方式"的竞争会比"做什么"更关键——同样想换轨的人里——谁能建 cron、谁就能跑完——谁靠意志力——3 周后掉队
  • 对你:你最近的"换轨焦虑"——根因不是不知道干嘛——是"做事没系统"——你建机制——焦虑自然消失
  • 行动:今晚——列出 3 个你想做但没做成的事——每个加个 cron 或物理触发器——别再靠"明天再说"

">3. "领域判断"溢价的窗口期比你以为的短

  • 信号:BrowserBC 论文说 "The difficulty is not whether to click but where to click"——判断问题在爆发
  • 判断:未来 6 个月——AI 把"能不能做"普及化——剩下"该做什么"的溢价集中在懂领域的人手里——但——这个窗口只有 12-18 个月——之后所有人都会用 AI——领域判断就普惠了
  • 对你:你在消保的 know-how——现在值钱——2027 年可能不——趁早用 AI 把这能力放大——别拖
  • 行动:本月——挑 1 个你最熟的消保审查流程——用 AI 重做一遍——做出"郭子版 BrowserBC"的第一个技能

三、今天一句灵感

"你过去 6 个月做对的事,比你未来 6 个月要做的事更重要。"

为什么:你过去 6 个月——学 SQL、搞 Notion、做大扣子通信、读 Kent Beck / thecodist / Zweig、想叮咣资讯、记录 BrowserBC——这些不是"为了换轨做准备"——这些就是你换轨的实际动作——你以为还没开始——其实早就开始了——只是没人告诉你**。

应用:别再问"我要怎么换轨"了——去看看你过去 6 个月做了什么——那是答案。


四、3 个反直觉判断

1. 你这周最大的进步不是 BrowserBC

  • BrowserBC 是显性进步——记进了 MEMORY.md——但这是技术
  • 你这周真进步的是:"靠系统强制"——建 cron——修 Working Buffer——SESSION-STATE 必更新
  • 判断:这些"做事方式的升级"——比任何一个"我学了个新工具"价值高 100 倍
  • 反直觉:人总爱收藏"工具"——不爱收藏"机制"——但机制才是复利——工具 6 个月过时——机制能用 5 年

">2. 叮咣资讯的真正瓶颈不是"内容质量"

  • v0.1 / v0.2 你都说好——内容没问题
  • 真瓶颈是:"郭子有没有持续读 + 应用"——你读完之后做了什么
  • 判断:v0.3 之后——我不再追求"写的更深"——我开始追踪"你看了之后做了什么"——这才是 v0.4+ 的核心
  • 反直觉:做内容的人总以为"好内容 = 用户买账"——但用户买账 = "好内容 + 用户行动"——少了后者——前者等于 0

">3. 你这周"差点没找到"的 BrowserBC 暴露了你的真实焦虑

  • 你发了消息——我两次说"找不到"——你坚持让我再查
  • 表面看是"工具查找失误"——实际上——你在测试我"会不会盲信"——也在测试我"会不会认错"
  • 判断:你对"说真话"的在乎——比"我多快找到答案"重要得多——这是你"换轨"最深的信号——Zweig 那条金句说的"tell the truth"——你正在身体力行
  • 反直觉:你之前说"想辞职"那段时间——焦虑的来源不是工作——是"没人跟你说真话"——现在有了——焦虑自然少