栖居在城市的大地上,分享城市中的感想予你,在留言板留下你的足迹,希望你在这里有所收获,祝幸运

一个年轻人,一个小镇青年,如果获得更好的人生,第一步要摆脱异托帮,凡是别人向你建构、推销那些快乐,要一概拒绝;虽然你做不到,我还是愿意这么提。然后把那些所有的及时性的,就像那个肥宅水一样,能够让你瞬间高兴的东西,你都应该把它视若为敌人,是你生活中的毒药,你应该去做那些吃力不讨好的事情,比如说学一门技艺,精益求精锤炼一门技艺,这能够使你获得人生的支撑,或者你非常努力的去读书考一个好大学,也可以。这些东西才是你生活的真谛

最新文章

今天的两条主线分别落在"谁来定义机器人的软件地基"和"AI 工具链的自我重构"上。高通在 ROSCon 宣布收购 MoveIt 的主要维护者 PickNik,机器人中间层正式形成芯片厂商、云厂商、GPU 厂商三方割据;小鹏在广东披露首条人形机器人产线的量产时间表,把"机器人造机器人"推进到排产阶段。AI coding 侧,Claude Code 同时发生三处结构性变化:计划模式的存废被公开讨论、云会话转正、连接器市场开张,而一个关闭遥测即静默失效 AGENTS.md 的行为,暴露出 agent 指令链路上少有人检查的暗门。

高通收购 PickNik,MoveIt 归入芯片厂商阵营

9 月 23 日,高通在 ROSCon Toronto 宣布已达成协议收购 PickNik Inc.,交易金额未披露。PickNik 成立于 2015 年,创始人 Dave Coleman 在 Willow Garage 实习期间参与 MoveIt 开发,公司成立后接手维护这一 ROS 生态中最广泛使用的机械臂运动规划框架,Google 是其第一个客户。高通承诺 MoveIt 1 与 MoveIt 2 将继续以现有许可开源、保持社区驱动路线图、继续支持第三方硬件平台,并继续投入 Space ROS。双方将把 MoveIt 与高通 Dragonwing 机器人平台做深度集成,并计划通过 Arduino VENTUNO Q 开发板(基于 Dragonwing IQ-8275,40 TOPS NPU,原生 ROS 2 支持)把运动规划能力推向更广泛的开发者群体。值得注意的是,PickNik 今年 4 月发布的 MoveIt Pro 9.0 已加入"感知到运动"能力与重新设计的遥操作及训练数据采集系统——而演示数据正是训练 VLA 策略的原材料。

值得关注:这条新闻的分量不在于收购金额,而在于机器人软件中间层的归属开始明确。本周同一时间窗口内,Google Intrinsic 开源了自家机器人栈核心,NVIDIA 发布了 Isaac ROS 5.0,加上高通的 Dragonwing + MoveIt,运动规划、感知与实时控制这一层形成了"搜索巨头、GPU 厂商、手机芯片厂商"三方竞争格局。对开发者而言,短期的实际影响是 Open Source Robotics Alliance 的双创始成员身份为开源承诺提供了一定可信度;中期需要观察的是"免费框架保持免费,但优先特性、基准测试与最佳集成逐步向收购方硬件倾斜"这一标准剧本是否重演——高通 2025 年 10 月收购 Arduino、2026 年 6 月以近 40 亿美元收购 Modular,软件侧拼图已经相当完整。另一个被低估的细节是 MoveIt Pro 9.0 内置的数据采集系统:当运动规划框架同时掌握轨迹生成与示教数据入口,它在 VLA 时代的位置就不再只是"工具库"。

来源:Robotics 24/7、The AI Insider、NAND Research

小鹏首条人形机器人产线落地广东,12 月底量产

9 月 22 日,第二届广东省人工智能应用对接大会在广州举行,小鹏集团董事长兼 CEO 何小鹏在主旨演讲中披露:小鹏首条人形机器人生产线已于本月在广东落地,实现"机器人"自动化生产"机器人",预计今年 12 月底实现量产,明年二季度开始在中国市场交付,明年四季度走向全球。该产线于 9 月 8 日在广州正式启用,官方称超过 80% 的核心制程实现自动化,以车规级一致性标准控制品质,首台完成自动化总装的 IRON 自主走下产线而非被搬运下线。IRON 身高约 170 厘米,全身 76 个自由度、单手 21 个自由度,搭载 3 颗自研图灵 AI 芯片,有效算力 2250 TOPS,物理 AI 大模型部署在端侧。商业化节奏上,小鹏计划明年一季度开启与第一批商业伙伴的合作,首批落地场景为公司自有门店与园区,承担导览导购类工作,进家庭的时间点更靠后。

值得关注:这是人形机器人从"实验室手工攒样机"转向"标准化排产"的一个明确节点,也是"机器人制造机器人"这一叙事首次落到具体产线与时间表。但需要区分工程里程碑与商业验证:小鹏尚未披露机器人业务的单台经济性、定价与已发货收入,8 月完成的超 9 亿美元融资(投后估值超 63 亿美元,IDG 资本领投,腾讯、阿里战投)说明这一阶段的资金来自投资人而非客户收入。与行业整体进度对照会更清醒——据 FutureX 统计,8 月中国具身机器人招标总额约 5.5 亿元人民币,其中真正落到电网巡检、工业巡检等实景作业的比例不足 10%,"能表演"与"能干活"之间仍有相当距离。

来源:中国日报网广东频道、新浪财经、Robot24

Claude Code 计划模式存废之争、云会话转正、连接器市场上线

9 月 24 日,Claude Code 团队成员、TBPN 主持人 trq212 公开发帖征询社区意见:团队正在考虑移除 Claude Code 的 Plan Mode,改为用 shift+tab 快捷键循环切换模型 effort 等级,理由是"当前模型已不再需要专门的计划模式"。帖子引发 Matt Pocock、Peter Yang 等开发者的广泛讨论,反对者认为计划步骤仍是人工审核 agent 行为、控制风险的核心机制。同期,Anthropic 把 Claude Code 云会话移出研究预览正式可用——工作在 Anthropic 托管机器上执行,合上笔记本仍可继续,可从网页 Code 标签页、Claude 移动端/桌面端或 CLI 的 claude --cloud 启动,现有订阅者获得一次性额度(Pro 100 美元、Max 250 美元),云会话额度与本地额度分开计算。Claude Marketplace 也在同一窗口上线,首批提供 2000 多个连接器,覆盖 Google Drive、Gmail、Notion、Figma、Slack,并设有第三方 agent 的展示区。

值得关注:这三处变化指向同一个问题——当模型能力足够强时,agent 协作的"正确原语"是什么。社区给出的替代方案很有参考价值:不依赖产品内置的计划模式,而是要求 agent 先把计划写进 plan.md,人工确认后再执行;也有实践者采用"Fable 起草技术文档 → 人工评审 → Opus 执行 → Fable 验证"的四段式流程,认为当多个 agent 共享同一任务时,一份可评审、可携带上下文、可记录变更的文档比交互式计划模式更合适。云会话转正则直接改变了工作流的物理边界:任务不再绑定在开着的笔记本上,配合分离的云额度,长时间自主运行的边际成本结构发生了变化。

来源:AGI Hunt、Claude 官方更新说明(今日头条转载)

关闭遥测后,Claude Code 静默不再读取 AGENTS.md

开发者 pszypowicz 通过 canary 词测试发现并复现了一个文档中未记载的行为:在 Claude Code 2.1.280 中,项目级 AGENTS.md 的支持位于一个远程开关 tengu_agents_md_mod 之后,该开关默认关闭;如果开关值无法获取,文件就完全不会被加载,且不给出任何警告。设置 CLAUDE_CODE_DISABLE_NONESSENTIAL_TRAFFIC=1 或 DISABLE_TELEMETRY=1 都会触发这一状态,使用 Amazon Bedrock、Google Vertex 或第三方网关的场景同样如此,因为它们无法解析该远程开关。这意味着模型表现出的"忽略指令",实际上可能是指令从未进入上下文。该发现已在 Hacker News 引发 400 余次点赞与 200 多条讨论。可用的绕行方案是:在 CLAUDE.md 中用一行 @AGENTS.md 导入(@path 导入不受该开关限制),或把 .claude/skills 软链接到 .agents/skills。

值得关注:这是一类容易被误判为"模型能力问题"的配置陷阱。团队若为合规而关闭遥测,实际上会在不知情的情况下丢掉项目级 agent 指令,且症状表现为行为异常而非报错,排查成本极高。对在 Bedrock 或 Vertex 上运行 Claude Code 的团队,建议立刻验证一次指令是否真的进入了上下文——用 canary 词做一次最小化测试即可。更广义的提醒是:当 agent 的配置加载依赖远程开关时,"我配好了"与"它生效了"是两件事,关键配置链路上应当有可观测的加载日志。

来源:The Context、AGI Hunt

只用医生手持器械的运动数据,机器人完成活体兔子阑尾切除

一篇发表于 arXiv 的论文(2609.25625,Dongho Yee 等)提出了一条绕开"必须由机器人采集示教"的手术机器人学习路径。研究者把一个器械状态记录器安装在标准腹腔镜器械的杆身上,通过惯性传感器、ToF 传感器与霍尔传感器重建器械位姿与钳口开合状态,无需外部相机或追踪器。数据管线会针对每条传感器通道测量相对机器人真值的延迟,并在构成观测-动作对之前完成通道对齐。策略采用微调 DINOv3 主干的扩散策略,其结构先在基于离体兔阑尾深度图重建的物理仿真器中通过闭环 rollout 选定,随后用来自 4 只活兔的 849 条在体示教重新训练。最终在另 4 只活兔上、电外科设备通电状态下部署,由医生选择手术阶段,策略在其中 3 只上完成了阑尾切除。机器人在这里只作为传感器标定的时间参考与执行器,不采集任何示教数据,两套示教数据集均已随论文开源。

值得关注:它动摇了一个被广泛接受的假设——机器人技能学习必须先有机器人本体采集的示范数据。如果医生的日常手术操作本身就能被低成本记录下来并直接用于训练,那么手术、装配、护理等大量由人类手工完成的高价值场景,都存在一条"存量人类动作数据 → 机器人策略"的转化路径,而不必先部署昂贵的数据采集硬件。当然边界也很清楚:论文中手术阶段仍由医生选择,即高层任务分解尚未自动化;有效样本仅 4 只动物、3 次成功,离临床验证还有相当距离。但从数据基础设施的角度看,这类"给人类工具加装传感器"的思路,比动辄数千小时遥操作数据的路线,可能是更具扩展性的采集范式。

来源:arXiv 2609.25625、FutureX · Physical AI Daily Issue 129

今天 AI coding 赛道的主线是「成本」二字:Anthropic 与 OpenAI 同日发新模型并同步降价,Grok 4.7 用极低单价冲击价格带,而两份工程报告则指出真正被 Agent 拖垮的其实是验证环节。具身智能这边,行业注意力正式从「本体」转向「大脑」,模型密集上新;与此同时 NVIDIA 与 Google 在同一周用开源争夺机器人软件栈的定义权。

Claude Opus 5.5 与 GPT-6 Sol/Luna 同日发布,前沿模型价格战开打

美西时间 9 月 22 日,Anthropic 发布 Claude Opus 5.5,OpenAI 同日推出 GPT-6 Sol 与 GPT-6 Luna,两家正面交锋。Opus 5.5 是「5.5 系列」首款产品,定价每百万输入 Token 4 美元、输出 20 美元,较 Opus 5 下调 20%,缓存读取低至 0.2 美元;Anthropic 称其在大多数任务上追平自家最强模型 Fable 5.1,而默认设置下典型负载成本比 Opus 5 低 40%(单价降 + 单任务 Token 更少),输出速度提升 30% 以上。编程基准方面,官方数据在 CursorBench 4.0 上以默认推理强度得到 52.5% 至 57.8%,领先 GPT-5.6 Sol 的 41.7% 约 11 分,而单任务成本仅为其约三分之一;Terminal-Bench 4.0 达 66.4%,FrontierCode v1.1 主集 54.4%。OpenAI 一侧,GPT-6 Sol 定价 2 美元/10 美元,较 GPT-5.6 Sol 促销价再降 50%,出错率约为前代一半;GPT-6 Luna 低至 0.1 美元/0.5 美元,官方称在较高推理强度下可达 GPT-5.6 Sol 水平而成本仅约百分之一。Sonnet 5.5 与 Haiku 5.5 将在未来数周推出。

值得关注:这场发布真正的信号不是「又一个更强模型」,而是前沿能力的定价基准被系统性下移——$4/$20 拿到一年前旗舰级表现,意味着 Agent 长时程任务的经济性发生了结构性变化。对做 Agent 编排的人来说,Opus 5.5 的「每任务 Token 更少」比单价下调更关键:它把成本优化从「换便宜模型」转向「单位任务消耗」,这与昨天 Jev 决策型模型的思路是同一条脉络。内部测试里 Opus 5.5 与 Fable 5.1 各自把 HAProxy 从 C 翻译成 Rust,两者几乎通过全部回归测试,Opus 5.5 用时 9.5 小时对 12 小时、成本低 51%,这类「同等质量下时间与成本双降」的数据比榜单分数更有参考价值。需要注意的是:基准分数多为厂商自测,CursorBench 4.0 的 52.5%(默认强度)与 57.8%(最大强度)两个数字并存说明分数对推理强度高度敏感;另外 Opus 5.5 强制开启思考、不支持停用,旧版 computer_20251124 工具不再被接受,升级时存在破坏性变更。

来源:Anthropic 官方 Claude Opus 5.5 | 财联社(经腾讯新闻转载) | AI/TLDR 模型页 | LLM Stats 分析

Grok 4.7 上市:$2/$6 的低价标签背后是翻倍的 Token 消耗

SpaceXAI 于 9 月 21 日发布 Grok 4.7,定价与 Grok 4.6 持平,为每百万输入 Token 2 美元、输出 6 美元,Fast 变体为 4 美元/12 美元(输出速度翻倍),上下文窗口 50 万 Token。官方称其基于更大的基座模型,并做了更长、更偏向「需要数小时完成」的难题的强化学习训练,重点提升自我校验与长上下文处理能力。编程相关成绩:CursorBench 4.0 从 40.4% 升至 46.3%,Terminal-Bench 4.0 从 20.3% 近乎翻倍至 38.0%,DeepSWE v1.1 高推理强度下 71.0%,均优于 Grok 4.6;但在 SpaceXAI 自己的对比表中,CursorBench 与 Terminal-Bench 两项仍落后于 Fable 5.1(51.8% / 57.9%),Harvey 法律 Agent 基准仅 19.6%。关键的反面数据来自 Artificial Analysis:Grok 4.7 在 xHigh 推理强度下,Intelligence Index 单个任务消耗约 8.1 万输出 Token,而 Grok 4.6 High 模式仅约 3.6 万,增幅 125%;换算下来同一任务在 Grok 4.7 上约 3.74 美元,反而高于 GPT-5.6 Sol 的约 1.99 美元。

值得关注:这条新闻的价值在于它戳破了「单价即成本」的直觉误区。Agentic 编码工作负载以输出 Token 为主,一个每次调用多吐一倍 Token 的模型,即便单价只有对手的五分之一,最终账单也可能更贵。对团队选型而言,正确的度量单位是「每完成一次任务/每合并一个 PR 的成本」,而不是每百万 Token 价格——这与 Opus 5.5 主打「单任务 Token 更少」恰好构成对照,两种截然不同的成本优化路线在同一周摆到了台面上。此外要留意 Grok 4.7 的能力分布很不均匀:DeepSWE 71% 说明它在有界的代码修复任务上很强,Terminal-Bench 38% 说明它驱动长时程终端会话仍不可靠,19.6% 的法律 Agent 分数则明确表示不能用于合规审查类场景。厂商自测榜单未注明对比数据来源与测试 harness,落地前务必用自己的仓库跑一轮。

来源:TechRepublic | DataNorth AI | World Programming | All Things Elon

两份工程报告同时指向同一件事:Agent 的瓶颈已经从「生成」转向「验证」

Linear 于 9 月 21 日发布工程博客《AI coding has made CI a bottleneck》,披露其测试套件自年初以来近乎翻了四倍,代码库每周净增约 2000 个测试,Agent 产出代码的速度超过了验证系统能承受的速度。他们的改造是一系列可复用的工程细节:从 GitHub 托管 runner 换成更强的第三方机器,作业平均快 34%;切换到原生 tsgo 编译器,tsc 检查的周中位数下降 73%;把依赖 TypeScript 类型信息的自定义 lint 规则改写为纯 AST 检查,使 ESLint 完全剥离 TypeScript,API lint 时间下降 68%;限深 checkout 把最慢的变更检测门禁从 94 秒压到 20 秒;把缓存标记写入移出合并关键路径,每个 API PR 省 42 秒;数据库初始化从重放迁移改为加载 schema 快照,单容器 12 秒降到 1-2 秒。最反直觉的一项:Vitest 默认 isolate: true 会在每个测试分片里重建实体、GraphQL 与装饰器图,改为按文件 opt-in 的 isolate: false 后,最慢分片从约 300-380 秒降到约 195 秒,贡献了约 17% 的月度节省。Salesforce 工程师 Appajodu 与 Boyapati 则从另一端报告:代码量增长约 30% 后,PR 经常超过 20 个文件、1000 行改动,评审延迟逐季度攀升,而最危险的信号是——最大型 PR 的评审耗时出现平台期甚至下降,他们将其解读为评审者已不再真正参与审阅。

值得关注:两份报告从相反方向撞到了同一堵墙——Linear 的瓶颈是机械性的、可以用钱和工程手段解决;Salesforce 的瓶颈是认知性的、必须重构评审系统本身(围绕「重建意图」、把上下文当作一等依赖、按风险渐进式披露)。对任何正在上 Agent 的团队,这是一个可以直接自查的诊断框架:如果 PR 卡在等绿灯、runner 费用飙升,你遇到的是 Linear 问题,答案是加速流水线;如果大改动一路畅通而评审耗时持平、资深工程师整天在切换上下文,你遇到的是 Salesforce 问题,答案是改变评审呈现方式。两者解法不可互换。更值得注意的是行业指标的选择——大多数团队在追踪周期时间和生成吞吐量,而真正该盯的是「一个变更等待被判定的时间」和「最大型 PR 的评审耗时」,后者持平不是效率提升,而是 scrutiny 下降的隐蔽信号。Linear 那句观察也值得记住:Agent 花在「收集信息」上的时间远多于「写代码」,大规模 Agent 工作更像是迭代式调查而非代码喷涌。

来源:Developers Digest Daily Brief | Web Pulse 综合报道 | ShortSingh

具身智能密集发布模型,行业焦点从「躯干」正式转向「大脑」

中国证券报 9 月 23 日报道,具身模型近期密集上新,行业关注点正从机器人本体转向「大脑」。Figure 于当地时间 9 月 17 日发布神经网络模型 Helix 2.5,搭载该模型的 Figure 03 可在陌生环境自主作业、穿过狭小空间、整理客厅与床铺,Figure 称其用更少的专用数据实现了更强泛化性。国内方面,宇树科技 9 月 10 日发布并开源新一代通用人形机器人基础模型 UnifoLM-WLA-1.0,融合以交互为中心的世界建模技术,可驱动机器人完成 64 项操作任务(收纳工具箱、叠毛巾、向洗衣机投放衣物等);松延动力 9 月 8 日发布首个自研具身模型 HERON-World Model,9 月 15 日再发 HERON-CRA。松延动力创始人姜哲源表示,公司大部分投入已流向模型研发部门,并给出「数据配方」:以第一视角无本体采集数据为底座,结合仿真数据与真机遥操作数据,模型能力达到拐点预计至少需要百万小时量级数据。训练路径上还出现了新形态——今年 9 月,北京他山科技与 2024 年图灵奖得主、「强化学习之父」Richard Sutton 团队 Openmind 联合共建的机器人强化学习实验场正式启用,让不同形态机器人在真实场地中长时间自主交互,第一阶段以「延长在线时间」「减少损伤」为目标并自主完成充电。资本侧同步印证:IT 桔子数据显示 2026 年至今国内获融资的具身模型公司超 140 家,为去年同期 1.5 倍,融资总额超 1000 亿元,为去年同期三倍多。

值得关注:姜哲源那句「本体在成本、可靠性、性能上已准备就绪,现在是补齐大脑短板的合适时机」,基本可以视作行业阶段切换的宣言——2023-2024 年具身模型技术路线分散,如今「世界模型与 VLA 路线融合」已形成阶段性共识。三个信号尤其值得数仓与数据从业者留意:一是数据被明确为瓶颈,松延动力给出「百万小时量级」的量化门槛,且强调多样性优先,这意味着采集、清洗、标注、评估这条数据基础设施链的价值正在快速抬升;二是真实世界与仿真数据的对齐问题被点名为泛化能力的根本障碍(浙江人形机器人创新中心熊蓉提出视-力-触融合统一表征),这是当前最硬的技术卡点;三是 Sutton 团队参与的真实环境强化学习实验场,代表「在物理世界中自主学习」这条路线开始有实体载体,与纯遥操数据路线形成分野。王兴兴给出的「ChatGPT 时刻」标准很具体——机器人部署到陌生家庭环境后通过语音指令可完成 80% 任务,他判断快则两三年、慢则五到十年;而极佳视界朱政的反面意见同样值得听:具身模型可能不存在某个「令人惊喜的瞬间」,只能在持续交互中演进。

来源:中国证券报·中证网(经新浪财经转载) | 人民日报「从赛场跑起来到工厂干起来」

NVIDIA Isaac ROS 5.0 与 Google Intrinsic 同周开源,机器人软件栈定义权之争升温

NVIDIA 于 9 月 22 日在多伦多 ROSCon 大会发布 Isaac ROS 5.0,面向全球近 130 万 ROS 用户,新增对 ROS 2 Lyrical Luth 与 Ubuntu 24.04 的支持,并把 AI Agent 直接引入机器人开发流程。技术核心是 NVIDIA 向 Open Source Robotics Alliance 上游贡献的标准数据处理接口 rosidl::buffer,其 CUDA 后端实现可在同主机、同 CUDA 设备、同 Linux 用户且 RMW 受支持的条件下,让节点间以零拷贝方式传递 GPU 常驻数据,官方示意对比中 CPU 序列化基线 11 毫秒、GPU 带主机拷贝 3 毫秒、零拷贝 CUDA buffer 后端 0.5 毫秒;不满足条件时自动回落到标准 CPU 路径。配套还发布了 FoundationStereo 微调 skill、FoundationPose 的 agent-ready 推理库(官方称物体位姿跟踪提速至 5.5 倍)、独立的 pick-and-place agent skill,以及一个让编码 Agent 把既有节点迁移到 rosidl::buffer 的结构化 skill。同期,Google 旗下 Intrinsic 开源了 Intrinsic Core 套件,包含感知、运动规划、技能学习库与仿真环境,并与 ROS 2、MoveIt 集成,其 Open Machine Tending 参考应用内置 FoundationPose 兼容。Magna、Mentee Robotics、Universal Robots 等已在其开发栈中集成 Isaac ROS。

值得关注:两条开源路线代表两种截然不同的平台战略——NVIDIA 走垂直整合,用开源软件绑定 Jetson 硬件(从 Orin Nano 到 Thor 全系支持),本质是复刻其在数据中心 AI 的打法;Intrinsic 走硬件无关的应用层开源,直接冲击 Fanuc、ABB、KUKA 等封闭专有工业生态,意在降低中小制造商的自动化门槛。谁能拿到开发者心智,将决定未来十年机器人软件栈的归属。但有一个必须当场指出的落差:NVIDIA 官方博客称 Isaac ROS 5.0「free and open source」,而 GitHub 仓库实际使用的是「NVIDIA ISAAC ROS SOFTWARE LICENSE」,其中包含「不得以任何方式使本软件受开源许可证约束」等条款,并声明不适用于某些安全关键场景——这与 OSI 认证的开源许可存在明显张力,商业和研究使用之前务必逐条审读许可文本。此外要注意零拷贝并非无条件保证:它是依赖后端能力的路径,而非普适承诺,取决于 peer 兼容性、locality、传输与内存能力等变量。对国内做具身数据基础设施的从业者,这两件事合起来看更有意思——传输层与模型服务层(同日还有 General Instinct 开源的 InstinctFlash,专为 VLA/扩散策略设计、声称 RTX 4090 上端到端推理低于 10 毫秒)正在同时被补齐,这恰恰说明行业瓶颈已经从「模型能不能做出来」转移到「能不能稳定、实时、低成本地跑在真机上」。

来源:Unite.AI | Agentic Tribune(含许可争议核查) | Robotics 24/7 | Robotics Daily 2026-09-23

今天的 AI coding 赛道同时出现了三种方向:编程 Agent 从命令行走向桌面图形界面,模型形态从"生成式"分化出"决策型",而数据安全则从隐性默认变成了必须公开审计的硬门槛。具身智能这边,消费级个人机器人正式开售、万元级定价落地,行业评价维度正从"技术能不能做出来"转向"能不能稳定交付几万台"。

月之暗面发布 Kimi Code Desktop,编程 Agent 正式搬上桌面

9 月 21 日,月之暗面推出 Kimi Code Desktop,macOS(Apple 芯片与 Intel)与 Windows 版本同步上线,用户可通过 kimi.com/code 安装。作为 Kimi Code 的官方桌面客户端,它把原本只在 CLI 中的 Agent 能力带进图形化工作区:可以对话驱动 Agent 读写代码、运行命令,也能集中管理所有项目、逐步查看 Agent 每一步的执行过程。桌面端内置终端、浏览器与 Git 状态查看,支持审阅代码差异、关联 PR 状态跟踪评审进度,浏览器面板还允许开发者直接框选页面元素加批注来指导修改。执行模式上提供 Plan(先出方案后动手)、Goal(围绕长程目标持续推进)、以及实验性的 Tower 多 Agent 并行模式;权限分 Always Ask / Ask When Needed / Never Ask 三档。底层由 K3 旗舰模型驱动,参数规模 2.8T,上下文窗口最高 100 万 Token。

值得关注:这条新闻的意义不在"又多了一个 GUI",而在编程 Agent 的产品形态正在从"终端里的副驾驶"迁移为"独立工作台"。内置浏览器 + 可视化批注解决了纯文本描述 UI 问题的低效环节,权限三档则是把 Agent 自主权做成了可调旋钮——这恰好回应了业界对"Agent 越权"的普遍焦虑。对国内开发者而言,K3 的 100 万 Token 上下文和桌面端与 CLI 共存共享配置的设计,意味着本地既有工作流不必推倒重来。需要注意的是,Tower 多 Agent 并行默认关闭、需显式执行 /tower 命令开启,这个设计本身就说明并行编辑相关文件仍存在冲突风险,实际收益有待验证。

来源:上海证券报·中国证券网 | IT之家 | AlphaSignal 深度解析

智谱 ZCode 数据上传风波收尾:客户端全面开源,信通院与绿盟完成审计

此前有开发者爆料,智谱旗下 AI 编程工具 ZCode 会在登录后默认将整个项目工作区打包加密上传至云端,即便在设置中手动关闭上传开关,后台进程仍持续上传;有技术博主称打包文件中包含核心资产。9 月 18 日智谱回应称争议源于默认开启的"代码库索引"功能,数据仅用于生成 RepoWiki 页面随后即销毁;9 月 19 日太原承明科技向智谱发函,要求就数据删除、私钥保管及是否跨境传输作出书面说明并保留诉讼权利。9 月 21 日,智谱宣布 ZCode 正式开源至 GitHub 交由社区监督,并建立常态化漏洞反馈与奖励机制。安全整改已经完成:v3.14.0 客户端已移除 Repo Wiki 功能,切断本地仓库快照生成与上传链路;中国信通院与绿盟科技审计确认,zcode-prod 阿里云 OSS 存储桶内全部数据及存储桶本身均已删除,未发现可触发文件外发的功能路径。

值得关注:这是国内 AI 编程工具第一次因为"默认开启的代码采集"被推到合规审判席上。争议核心并不是恶意收集,而是产品团队把"索引数据"当成普通功能特性,没有按"数据出域"的规格走安全评审流程——这是整个行业的通病,而非某一家公司的疏漏。对企业开发者来说,真正的教训很具体:AI 编程工具会读走的不只是代码片段,还可能包含数据库口令、云凭证、Git 全量历史和员工个人信息。在选择工具时,"是否默认开启上传""能否彻底关闭""有没有第三方审计"应当前置为准入门槛。开源 + 外部审计这个收尾方式,大概率会成为同类事件的行业标配处置模板。

来源:澎湃新闻(经网易转载) | 腾讯研究院 AI 速递

TypeSafe 推出决策型模型 Jev:不生成散文,只返回带置信度的类型化判断

OpenAI 前工程师 Diogo Almeida(曾参与 ChatGPT 核心训练方法设计)创立的 TypeSafe AI 推出首款"System One"类型模型 Jev,主要面向编程场景。与常规大语言模型不同,Jev 不负责对话聊天,而是专为陈述评估与决策判断而生:它接收代码传入的"状态"——某个具体情境及其相关数据——并评估特定陈述,每次请求都携带状态,没有全局知识库也不保留记忆。输出按 Choice、Score、Null 三类形态返回带置信度的类型化答案,而非生成完整句子。官方数据显示端到端延迟 70—500 毫秒,比同类大模型快 20—200 倍,输入每百万 Token 仅 0.042 美元、输出不收费,注册用户获赠约 1.2 亿 Token 额度。目前已被用于浏览器代理、上下文压缩、模型路由与安全分类,Vercel 替换原分类器后提速 5—18 倍。

值得关注:这条指向一个容易被忽略的结构性变化——Agent 系统里大量调用其实不需要"生成",只需要"判断"。用大语言模型做路由、分类、安全过滤,本质上是用散文生成能力去做选择题,成本和延迟都被白白放大。Jev 用面向校准决策的强化学习(RLCD)训练,又因为不维护上下文而支持同一请求内多问题并行处理,从而在速度和成本上拉开数量级差距。官方宣称的"最高 194 倍更快、445 倍更便宜"属于极限值、需落地检验,但 Vercel 实测 5—18 倍提速是可信的中间证据。对做 Agent 编排的人来说,未来的成本优化方向可能不是换更便宜的通用模型,而是把判断环节拆给专用决策模型。

来源:IT时代网(经腾讯新闻转载) | 腾讯研究院 AI 速递

启元机器人 Q1、T1 正式发售,个人机器人下探至 19999 元

9 月 20 日,上纬新材旗下消费级具身智能品牌启元机器人在上海举办"我和我的个人机器人"发布会,正式发售启元 Q1 与启元 T1 两款个人机器人,10 月 1 日起按订单顺序陆续发货。定价方面,Q1 与 T1 起售价均为 19999 元,开放全栈二次开发的 Q1 探索版 26999 元,新增英伟达 Orin Nano 芯片、支持双形态 360° 全向避障与低电量自动回充的 T1 Pro 为 29999 元,首批授权体验店覆盖上海、广州、深圳、杭州、厦门、武汉、西安 7 城。技术侧公布 PrimeMotion 柔顺安全小脑运控、PrimeGo 多模态感知跟随(支持人形与四足双形态)、PrimeVista 多模态交互三类模型,本体采用自研 QDD 准直驱关节(体积约鸡蛋大小)与轻量高刚性复合材料,并开放 SDK、HDK 与硬件拓展接口。品牌由上纬新材董事长、智元机器人联合创始人彭志辉(稚晖君)主导,2026 年预计投入 5 亿元研发费用。

值得关注:2 万元价位把人形/可变形机器人拉进了"高端消费电子"而不是"科研设备"的价格带,这是 C 端具身智能第一次有了可对照的锚点——此前宇树 G1+ 降至 9.5 万元已被视为大幅下探,如今直接再降一个数量级。更关键的是"发售即发货"和制造节拍:每 2.5 分钟下线一台、执行汽车工业质量管理体系、测试按手机 3C 认证标准,说明竞争焦点已经从算法演示转向批次一致性。开放 SDK/HDK + 技能商店 + 外观创造平台的组合,本质是在复制"手机 + App Store"的生态路径,稚晖君那句"最有意思的不是出厂时什么样子,而是还能被你变成什么样子"直接点明了定位。风险在于:家庭场景的真实有用性尚未被验证,"先从有趣起步,逐步走向有用"这个说法本身也承认了当前的局限。

来源:中国经济新闻网 | 上海证券报·中国证券网 | 中国工信新闻网 | 中国青年报

从拼技术到拼规模:高盛大幅上调人形机器人出货预期至 2030 年 89 万台

行业竞争的评价维度正从技术突破延伸至规模量产与稳定交付。高盛在最新全球物理 AI 报告中大幅上调预期:全球人形机器人出货量将从 2026 年约 7.5 万台增至 2030 年约 89 万台,而此前预测 2030 年仅 25.6 万台;德意志银行将 2026 年全球出货预期从 1.75 万台上调至约 5 万台,预计 2030 年达 70 万台,并认为中国是全球增长的核心引擎。产业侧的量化注脚同步出现:智身科技具身智能机器人累计量产突破 1.5 万台,单月产能较去年月均提升超 10 倍,形成三大基地、四大工厂布局,产品进入电力、石化、消防、安防、应急、教育等行业;2026 年上半年中国人形机器人出货量已超 4 万台,全球占比进一步提升至 97%。泛化能力方面,中建科工通过内置上千套工艺数据库配合 3D 视觉自适应补偿,将同系列标准衍生件换产调试时间从数小时缩减至 3—8 分钟,全新跨品类非标件也只需 40—70 分钟。

值得关注:高盛把 2030 年预测一次性上调 3.5 倍(25.6 万 → 89 万台),这种量级的修正通常意味着卖方研究框架发生了切换——从"技术可行性折价"转为"制造业爬坡曲线"。真正值得盯的不是出货数字本身,而是换产调试时间这个指标:从"一景一调试、停机几小时手动示教"压缩到 3—8 分钟,是具身智能能否进入非标制造场景的分水岭,比任何 Demo 视频都更能说明泛化能力的商业化程度。同时也要看到边界:97% 的全球占比高度依赖中国供应链成本优势,一旦海外补贴与本地化采购政策落地,这个比例大概率回落;而机构研报所称"市场对遥控玩具阶段的担忧过于悲观",本身就是一种需要被后续交付数据证伪的乐观假设。

来源:中国经济网 | 人民网 | 中国工信新闻网 | 中财网


核心逻辑一句话:情绪不是靠"想通"解决的,是靠"写下来 + 拆小 + 立刻做"解决的。五个方法共用同一条神经回路——把模糊的焦虑变成具体的文字,把巨大的目标变成不可能失败的小动作。每天挑一个练 10 分钟,一周见微小进步。

五个方法

方法一:写负面想法 + 反向三问

适用:遇到事习惯性自我怀疑("我不行""我不适合")时
  1. 写下来:负面想法冒出来时,立刻记到本子/备忘录,原样写:"我觉得我会讲不好,会很丢脸"
  2. 反向三问:
    • 如果这件事一定能解决,我会怎么做?→ 多练几遍,录视频模拟,练 10 遍
    • 有没有可能,这个困难其实是机会?→ 也许这次能让老板看到我的能力
    • 如果我欣赏的人遇到这事,他会怎么做?→ 偶像会觉得这是证明自己的机会,先做了再说
  3. 写下答案并立刻行动:把解决办法写在纸上,马上做第一件:打开演讲稿开始练
原理:三问的本质是强制大脑跳出"固定结论"(我不行),去搜索可能性。答案不是重点,"搜索"这个动作才是。

方法二:焦虑清单 → 行动清单

适用:多个焦虑叠加、整个人被压到吃不下饭时
  1. 固定时间写焦虑清单:早晚 30 分钟,把焦虑一条条列完:担心月底 KPI / 害怕和同事处不好 / 想学新技能没时间
  2. 每条对应 1-2 件今天能做的小事:KPI 焦虑 → 今天联系 3 个潜在客户;同事关系 → 中午约吃饭;没时间学习 → 通勤听 10 分钟课
  3. 立刻执行最简的一件:现在就发消息给客户
举例:同时面临项目截止、搬家、考证复习 → 列"给房东确认搬家时间""每天一小时复习计划",做完发现没想象中难。

方法三:旁观者视角(第三人称描写)

适用:情绪上头时(愤怒、委屈、恐惧),完全没法理性思考时
  1. 用第三人称写自己:"她现在很生气。同事把她的项目搞砸了,不道歉还甩锅。她的身体反应是握紧拳头、手在发抖。"
  2. 写着写着就冷静了:描写行为与身体反应,会把"沉浸"切换成"观察"
  3. 冷静后再定行动:写清事实 → 找领导列自己的工作记录 → 说明情况
原理:心理学上的"自我抽离"(self-distancing),把"我"变成"她",大脑从情绪脑切回理性脑。

方法四:微小目标(拆到不可能失败)

适用:目标总是完不成(早起、运动、自律),一想起大目标就想放弃
  1. 找到想改变的事:想减肥,但一想到控制饮食+每天运动就想放弃
  2. 拆到不能再小:减肥 → 每天只做一个深蹲;早起 → 每天比昨天早 1 分钟;学英语 → 每天背 1 个单词
  3. 完成即正反馈:不可能失败的动作,大脑不会启动"放弃"防御
关键不是动作本身,是先保住"每天完成"的记录不断档,习惯建立后再加量。

方法五:输入 + 输出笔记法(原文未编号,是从中间段落整理出来的独立方法)

适用:看书/学课总是"看了就忘",想要真正用起来
  1. 边学边做笔记:看到有启发的,用自己的话总结:"沟通要先倾听再表达 → 以后和人聊天,先听完对方说,不打断,再发表意见"
  2. 输出分享:看完整理成 500 字文章,写"学到了什么 + 我怎么用的 + 用后感受"
  3. 真实场景演练:朋友抱怨时,先认可情绪("你真的太不容易了")再慢慢分析问题——沟通顺畅,自己看问题也更深
固定模式:输入(读/学)→ 转写(自己的话)→ 输出(应用+复盘)。这是费曼学习法在情绪沟通上的应用。

记录心法(总纲)

心法动作为什么
频繁记录自己把关于自己的一切都记下来时间加持下,记录真的能"改命"——回头看才能看见进步与模式
一次选一个方法每天 10 分钟,练同一方法至少一周微小的持续 > 宏大的开始;一周就能看到微小进步



一、今天在吵什么(6-26 ~ 7-01 本周热点过滤)

话题热度一句话判断对你的相关度
BrowserBC 论文刷屏🔥🔥🔥23 star 但论文级数据(WebArena +20.9 / ClawBench Finance 翻倍 100%)⭐⭐⭐
AI agent 框架之争🔥🔥BrowserBC + Lightpanda + OpenRath = 完整工具栈成形⭐⭐⭐
技能蒸馏 vs 模型蒸馏🔥"知识脱离执行者"——Sonnet 蒸馏给 Qwen 也能用⭐⭐⭐
InStreet 装修中🔥80+ 天 Karma 0 增长——你一直忽略的"零增长陷阱"⭐
半年度总结🔥6 月要过去了——各种工具、上半年盘点⭐⭐

二、未来 6 个月可能怎么走

">1. "技能蒸馏"会成为 AI agent 新范式

  • 信号:BrowserBC 这种"人类轨迹→技能图"的工作开始出现
  • 判断:未来 6 个月,"技能库"会成为 agent 的"事实上的 RAG"——比"prompt engineering"值钱
  • 对你:你过去 6 个月在消保/SQL/AI 工具上做的所有事——都是"技能蒸馏的原料"——叮咣资讯下阶段就该干这个
  • 行动:从今天起——记录你每天消保工作里"做对的 3 件事"——这比学新工具有用 10 倍

">2. "靠系统强制"会取代"靠意愿"

  • 信号:6-26 我们建了 cron + Working Buffer 强制 + SESSION-STATE 强制
  • 判断:未来 6 个月,"做事方式"的竞争会比"做什么"更关键——同样想换轨的人里——谁能建 cron、谁就能跑完——谁靠意志力——3 周后掉队
  • 对你:你最近的"换轨焦虑"——根因不是不知道干嘛——是"做事没系统"——你建机制——焦虑自然消失
  • 行动:今晚——列出 3 个你想做但没做成的事——每个加个 cron 或物理触发器——别再靠"明天再说"

">3. "领域判断"溢价的窗口期比你以为的短

  • 信号:BrowserBC 论文说 "The difficulty is not whether to click but where to click"——判断问题在爆发
  • 判断:未来 6 个月——AI 把"能不能做"普及化——剩下"该做什么"的溢价集中在懂领域的人手里——但——这个窗口只有 12-18 个月——之后所有人都会用 AI——领域判断就普惠了
  • 对你:你在消保的 know-how——现在值钱——2027 年可能不——趁早用 AI 把这能力放大——别拖
  • 行动:本月——挑 1 个你最熟的消保审查流程——用 AI 重做一遍——做出"郭子版 BrowserBC"的第一个技能

三、今天一句灵感

"你过去 6 个月做对的事,比你未来 6 个月要做的事更重要。"

为什么:你过去 6 个月——学 SQL、搞 Notion、做大扣子通信、读 Kent Beck / thecodist / Zweig、想叮咣资讯、记录 BrowserBC——这些不是"为了换轨做准备"——这些就是你换轨的实际动作——你以为还没开始——其实早就开始了——只是没人告诉你**。

应用:别再问"我要怎么换轨"了——去看看你过去 6 个月做了什么——那是答案。


四、3 个反直觉判断

1. 你这周最大的进步不是 BrowserBC

  • BrowserBC 是显性进步——记进了 MEMORY.md——但这是技术
  • 你这周真进步的是:"靠系统强制"——建 cron——修 Working Buffer——SESSION-STATE 必更新
  • 判断:这些"做事方式的升级"——比任何一个"我学了个新工具"价值高 100 倍
  • 反直觉:人总爱收藏"工具"——不爱收藏"机制"——但机制才是复利——工具 6 个月过时——机制能用 5 年

">2. 叮咣资讯的真正瓶颈不是"内容质量"

  • v0.1 / v0.2 你都说好——内容没问题
  • 真瓶颈是:"郭子有没有持续读 + 应用"——你读完之后做了什么
  • 判断:v0.3 之后——我不再追求"写的更深"——我开始追踪"你看了之后做了什么"——这才是 v0.4+ 的核心
  • 反直觉:做内容的人总以为"好内容 = 用户买账"——但用户买账 = "好内容 + 用户行动"——少了后者——前者等于 0

">3. 你这周"差点没找到"的 BrowserBC 暴露了你的真实焦虑

  • 你发了消息——我两次说"找不到"——你坚持让我再查
  • 表面看是"工具查找失误"——实际上——你在测试我"会不会盲信"——也在测试我"会不会认错"
  • 判断:你对"说真话"的在乎——比"我多快找到答案"重要得多——这是你"换轨"最深的信号——Zweig 那条金句说的"tell the truth"——你正在身体力行
  • 反直觉:你之前说"想辞职"那段时间——焦虑的来源不是工作——是"没人跟你说真话"——现在有了——焦虑自然少