栖居在城市的大地上,分享城市中的感想予你,在留言板留下你的足迹,希望你在这里有所收获,祝幸运

AI Coding

今日 AI 编码方向出现两个值得关注的信号:智能体编码行为研究显示 60.5% 读取量来自指令文件而非技术文档,AI 智能体首次自主编写并运行量子计算代码;具身智能侧 2026 世界机器人大会在北京闭幕,北京经开区重磅发布"北京机域"产业蓝图,蚂蚁灵波、千寻智能等行业头部公司展示了通用大脑与长程任务方向的最新进展。

智能体编码会话六成读取量来自指令文件,技术文档仅占一成

一项针对智能体编码行为的研究追踪了 557 次 AI 编程会话中的 94K 个开发事件,以及 33K 个智能体 PR 涉及的 690K 条文件变更记录。结果显示,指令文件与工作笔记占智能体读取内容的 60.5%,而技术文档仅占 10.6%,API 参考更是只有 1.3%。研究还发现,智能体发起的咨询中有 70.2% 属于主动规划驱动,而非因失败或报错才被动求助,读取文档的行为与即时测试减少存在相关性(调整后比值比 0.39)。换句话说,AI 智能体更依赖明确的指令指引和工作上下文,而主动查阅技术资料的频率显著低于人们的直觉预期。

值得关注的原因:这一数据颠覆了"AI 写代码靠检索技术文档"的朴素想象,揭示出指令工程(Instruction Engineering)正在成为智能体编码时代的关键能力——清晰、结构化的项目级指令文件(如 CLAUDE.md、AGENTS.md)可能比 API 文档更能提升 Agent 的产出质量。对于正在构建 AI Coding 工作流的团队来说,这是一条比堆叠 RAG 检索更值得投入的工程方向。

信息来源:https://www.163.com/dy/article/L535LM1605561FZM.html

AI 智能体首次自主编写并运行量子计算代码

据《科技日报》转引英国《自然》杂志报道,法国量子计算初创公司 Pasqal 的研究人员开发出一种 AI 智能体,可根据英文自然语言指令生成量子计算代码,并在真实量子计算机上自动运行。研究团队将硬件技术规格(量子比特、门操作与测量约束)喂给大语言模型,使其能针对真实硬件生成可运行代码,并在量子模拟方向完成三项基于物理现象论文的代码生成与执行验证。原本需要专家团队数日完成的转换工作,AI 智能体可大幅提速。值得注意的是,在涉及实验物理准确性的关键环节,人类研究者仍不可或缺,AI 更像是量子研究的"副驾驶"而非"司机"。

值得关注的原因:这是 AI 编程 Agent 从传统软件开发跨入量子计算这一高门槛科研领域的标志性事件。当自然语言能调度量子硬件时,科学探索的瓶颈将从"实现能力"转向"提出好问题的能力",对科研范式的影响是结构性的。同时也提示我们:当 AI 进入对正确性极度严苛的领域(医疗、金融、航控等),人机协作中"翻译成本趋零、决策责任不变"的设计原则将成为关键。

信息来源:https://www.toutiao.com/article/7677391098788069915/

蚂蚁灵波"全栈大脑 2.0"实现一脑多机驱动智慧药房落地

在 2026 世界机器人大会上,蚂蚁集团旗下具身智能公司蚂蚁灵波展示了基于自研具身基座模型 LingBot-VLA 2.0 的"一脑多机"能力:同一通用智能大脑可驱动宇树、智元、银河通用、乐聚等 17 家厂商的 20 余种构型机器人,覆盖单臂、双臂、双足、轮式等多种形态,支持头部、腰部、末端执行器及底盘等全身自由度协同。搭载 LingBot-VLA 2.0 的多台机器人已在上海国大药房门店投入实际夜班作业,并在钛虎机器人上完成工业上下料、在乐聚机器人上完成仓储分拣。LingBot-VLA 2.0 预训练阶段融入 6 万小时高质量真实数据,灵波全系列开源模型 GitHub Star 数已突破 3 万,位列国内具身智能项目首位。

值得关注的原因:"一脑多机"正成为具身智能下半场的关键赛点,它打破了"一机一脑"模式带来的高成本重复训练瓶颈。具身智能行业的竞争重心正从"造好本体"转向"谁的通用大脑更通用",谁先打通数据—基座—本体的闭环,谁就更可能在零售、工业、商服等多场景实现规模化复制。

信息来源:https://app.xinhuanet.com/news/article.html?articleId=202607171b0f027e70f342f7ad1a912a51136a9c

千寻智能 Moz1 客厅整理长程任务 30 天综合效率提升 15%

千寻智能在 2026 世界机器人大会上再次演示了 30 天前在 WAIC 首发的"客厅整理"长程复合任务,搭载 Spirit v1.6 具身模型的 Moz1 接到"整理客厅"指令后,可自主识别可乐、碗、垃圾、玩具等物品并拆解出"可乐入冰箱、碗入洗碗机、垃圾入桶、玩具归位"等子任务。根据千寻公布的数据,迭代后可乐入冰箱、碗入洗碗机等子任务的成功率均提升至 99% 以上,导航目标确认耗时降低近 50%,长程任务综合效率较此前提升 15%。现场演示中,工作人员临时挪动脏衣篓位置、观众往桌面放空包装、冰箱门未一次关严等意外场景,Moz1 均能自主调整动作完成目标。

值得关注的原因:30 天内把一个长程复合任务从"可行"推到"工程级可靠",背后是"时间密度"——即系统的进化迭代速度。这是衡量具身智能公司工程能力的关键指标,比单次演示峰值更具长期价值。千寻提出的"先工业、再商服、后家庭"路径,是务实派从演示走向商业化交付的典型选择。

信息来源:https://new.qq.com/rain/a/20260822A08KR000

2026 世界机器人大会闭幕,北京经开区发布"北京机域"产业蓝图

2026 世界机器人大会 8 月 23 日在北京亦庄闭幕,五天会期内发布 44 项新技术、新方案,现场参会达 55.7 万人次,超 3000 件机器人创新展品集中亮相。大会主题从过往的"炫技"全面转向"能干活、能交付、能成交"的实际部署态:珞石 43 自由度轮式双臂完成装电池、拧螺丝等精密装配;优必选 Cruzr 系列在汽车零部件上下料场景长时间无人自主作业;跨维动力与蓝思科技联合打造的 1:1 复刻 3C 产线由人形机器人协同完成手机装拆盒。作为大会举办地,北京经开区同日重磅发布"北京机域"——人机共融具身智能新社会建设构想,规划打造 100 款可落地机器人产品、推动在 1000 种细分领域应用、实现 10 万台套级规模量产、形成 100 万套关键核心零部件产能,依托 12 平方公里"具身智能制造引领区"作为核心承载。

值得关注的原因:大会释放的产业信号非常清晰——具身智能正在从"秀场时代"全面切换到"实干时代",整机成本从百万级降至 20 万–30 万元区间,进入商用普及区间。中国厂商上半年占全球人形机器人出货量 97%,已确立无可争议的核心增长极地位。从政策端到产业端的协同推进,意味着具身智能正进入"城市级基础设施化"的新阶段。

信息来源:https://m.weibo.cn/status/5335360986940966

今日 AI 领域两大主线并行:AI Coding 工具正从"提示工程"加速迈入"技能经济"时代,编码 Agent 的框架与基础设施之争日趋激烈;与此同时,具身智能在北京世界机器人大会上完成从舞台炫技到上岗打工的拐点跨越。以下是今日重点动态。

Superpowers 框架单日狂揽 27.6 万星,AI Coding 进入"技能经济"时代

obra/superpowers 仓库于 8 月 22 日上线,短短一天内获得 27.6 万 GitHub Stars,成为当季最受开发者追捧的 Agentic 技能框架。该框架由 Jesse Vincent 创建,并非简单的 Claude Code 或 Codex 包装层,而是一套完整的软件工程方法论——将代码审查、架构决策记录、需求分析等开发环节封装为可复用、可测试、可审计的模块化"技能单元"。技能以 Markdown + YAML frontmatter 定义,支持跨工具兼容(Claude Code、Codex、Cursor 等),并通过 .agents 目录约定实现标准化配置。其核心创新在于将 Agent 从"即兴发挥"升级为"遵循显式、可审计流程"的团队成员,直接回应了业界长期诟病的"AI 代码 impressive but unreliable"问题。

值得关注的原因: 这是开发者社区从"模型能力崇拜"转向"工程方法论沉淀"的标志性事件。Superpowers 的跨工具兼容性意味着编码 Agent 的 Runtime 层正在被开源社区"商品化"——闭源工具的竞争壁垒从"锁定效应"转向"模型质量与成本",这对于降低开发者的 Agent 工具切换成本具有深远意义。对工程团队而言,建议立即评估其方法论组件,其中"Agent 应拥有显式、可审计流程而非仅靠提示词"的理念,极可能在 12 个月内成为行业标准。

信息来源: Smartotics AI Daily Report

神秘模型 Ox Alpha 编码基准超越 Claude Fable 5,取证指向智谱 GLM-5.3

8 月 20 日,一个名为 Ox Alpha 的无品牌模型悄然出现在 OpenRouter 和 OpenCode 平台,运行免费预览。开发者 Ben Davis 在 DeepSWE 编码 Agent 基准测试中测得 Ox Alpha 通过 8/10 项任务(80%),显著高于 Claude Fable 5(65%)和 GPT-5.6 Sol(52%)。尽管该成绩尚未被官方 leaderboard 确认,但开源社区通过服务器级取证(Java 堆栈跟踪中的 com.wd.paas.api.domain.v4.chat.ChatCompletionRequest 路径、错误代码 1214 的指纹匹配、以及 30 项跨语言/代码/SQL 的探针一致性)已基本锁定其来源为智谱 AI 的未发布旗舰 GLM-5.3。智谱官方至今未置评。

值得关注的原因: 这一事件折射出中国前沿模型实验室在编码任务上的追赶速度已超出预期。Zhipu、DeepSeek、Qwen 团队 2026 年以来在编码领域持续缩小与 OpenAI/Anthropic 的差距,而"匿名预览→社区取证→正式官宣"的剧本(此前 OpenAI 的 gpt2-chatbot 事件已有先例)正成为中国模型厂商的常规打法。它同时暴露出现有评测体系的滞后性——社区亟需更实时、多维度的基准测试,以便在官方发布前识别模型的真实能力与边界。对从业者而言,不应仅凭单一 10 任务样本判定模型优劣,但"头部闭源模型 vs 免费匿名模型"在编码基准上被反超的事实,已经足够说明竞争格局的剧烈变化。

信息来源: Startup Fortune

OpenAI Codex 周活突破 2000 万,增速约为 Claude Code 的 4 倍

OpenAI Codex 负责人于 8 月 22 日确认,Codex 本周活跃用户已突破 2000 万。截至 8 月 10 日的四周数据显示,Codex 增速为 20.8%,约为 Claude Code 同期增速(5.2%)的 4 倍。这一数据意味着 AI 编码工具的"双雄格局"正在发生结构性变化:Codex 凭借终端原生集成和 OpenAI 的品牌势能,正在快速拉开与 Anthropic Claude Code 的用户规模差距。与此同时,Anthropic 的应对策略也在同步推进:开源了内部"赛博值班员"系统(oncall-kit),展示 Claude 常驻 Slack 接 Grafana/Datadog 等工具、最快 4 分钟锁定故障的运维实战方法论;并聘请谷歌 TPU 业务创始人 Amir Salek 组建自研芯片团队,与 Fractile 签署 2.5 亿美元采购协议,推进"去英伟达化"的硬件自主路线。

值得关注的原因: Codex 的增速数据并非孤立事件,而是 AI 编码工具市场从"技术尝鲜"进入"规模化渗透"的缩影。OpenAI 在终端层(ChatGPT、桌面端)的渠道优势正在转化为编码工具的用户基数优势;而 Anthropic 选择在运维方法论和硬件自主两个方向深度布局,本质上是在寻找差异化竞争路径而非正面拼用户增长。对于开发者团队,需要关注两个信号:一是"AI 编码工具 burnout"风险(The Art of CTO 专题提出"防止 AI 编码工具让开发者 burnout"的问题),二是 Anthropic 的"去英伟达"路线是否会在 12-18 个月内带来成本结构的重塑。

信息来源: vibe coding 日报

2026 世界机器人大会闭幕:具身智能从"舞台炫技"迈向"上岗打工"拐点

8 月 19 日至 23 日,2026 世界机器人大会(WRC)在北京举行。本届博览会面积达 5 万平方米,参展企业 300 余家(同比增长 36%),展品超 2000 件(增长 27%),首发新品 150 余件(增长 21%)。与往年侧重舞台表演不同,今年的展区设置了洗衣房、卧室、物流分拣车间、饮料零售店等真实场景,机器人正在执行叠毯子、收拾桌面、衣物分拣、药房配药等实际任务。中国电子学会理事长徐晓兰在主旨报告中明确指出,具身智能产品正处于从"小批量试用"转向"大规模落地"的关键拐点。工信部数据显示,2026 年上半年我国机器人产业规模达 1655 亿元,同比增长 24.5%;近 10 家主流汽车生产商已在实际产线开展具身智能部署验证,涵盖物料搬运、上下料等通用场景。

值得关注的原因: 这是具身智能行业从"Demo 经济"进入"交付经济"的关键信号。参展数据(企业+36%、展品+27%、首发+21%)反映出产业热度持续升温;而"场景真实化"(从舞台到卧室/车间/药房)意味着技术成熟度已跨过实验室门槛。更值得关注的是"工业场景作为主战场"的产业共识——星海图发布轮臂人形机器人 Nexo(30 自由度、双臂最高 20kg 负载),银河通用展示 Galbot 系列在家庭/工业/零售场景中的长程复杂任务,优必选将客户真实产线 1:1 复刻进展台并实现近 1100 件/小时的抓取节拍。这些信号表明,具身智能的规模化商用路径正在从"人形优先"转向"场景优先",人形不再是唯一答案,而是多种形态(轮臂、四足、半人马)根据场景需求协同作业。

信息来源: 中国新闻网中国青年报/网易

人形机器人首次登上网球赛场,动态环境长程交互成为新测试基准

8 月 22 日,第二届世界人形机器人运动会在北京国家速滑馆开幕。开幕式上,银河通用(Galaxy General Robotics)开发的 Galbot ET1 人形机器人与真人运动员进行了网球比赛。比赛中机器人需实时追踪高速移动的球体、预测轨迹、调整步伐保持平衡,并完成精确的挥拍击球;在双打环节,机器人还能与人类队友协作,根据场上态势动态调整策略。据银河通用介绍,该系统采用"大脑+小脑"双层架构:大脑负责分析比赛态势和高层决策,小脑协调全身运动(行走、平衡、球拍控制)。训练数据结合了人类动作捕捉与虚拟仿真环境,其中多个机器人智能体在虚拟环境中相互对打,以提升连续回合、站位和击球选择等技能。

值得关注的原因: 网球作为动态开放环境的物理交互任务,比棋盘类游戏(如 AlphaGo)对具身智能提出了更高维度的挑战——系统必须同时完成感知、决策、实时运动控制三个层面的闭环,且每一拍都面对不可预测的环境变化。这标志着具身智能的评测基准正在从"实验室固定流程"向"真实动态场景"迁移。CGTN 报道将其描述为"AI 的下一片前沿"(next frontier),这一判断与当前业界"场景越多、任务越复杂、能力需求越广"的共识高度一致。对于具身智能从业者,这一事件提示:机器人的"长程任务执行能力"和"动态环境适应能力"正成为技术竞争的核心分水岭,而仿真到现实的迁移效率(sim-to-real)仍是关键瓶颈。

信息来源: CGTN

今日 AI 行业最重要的信号是"开放权重"全面进入产品阶段:OpenAI 发布自 GPT-2 以来首个开源大模型 GPT-OSS、阿里千问首次开源 Max 级权重、英伟达与 Meta 同周加码开放模型。与此同时,AI 编程头部公司 Cognition 估值跃升至 400 亿美元,具身智能方向出现"触觉感知"原生基座模型公司 LatentVerse 的高额融资,机器人产业链持续扩容。

OpenAI 首次发布开源大模型 GPT-OSS-120B 与 20B

OpenAI 于 8 月 12 日发布两款采用 Apache 2.0 许可的开源语言模型 GPT-OSS-120B 和 GPT-OSS-20B,这是公司自 2019 年 GPT-2 以来首次重大开源战略转向。两款模型均采用混合专家(MoE)架构:120B 版本总参数 1170 亿(激活 51 亿),可在单张 H100(80GB)上运行,在 Codeforces 编程竞赛、MMLU 通用知识及 HealthBench 医疗问答中表现突出;20B 版本总参数 210 亿(激活 36 亿),仅需 16GB 显存即可部署,性能接近闭源 o3-mini。两款模型均支持 128K 上下文窗口。

值得关注的原因:这是 OpenAI 在 GPT-2 闭源后首次开放旗舰级架构权重,且采用最宽松的 Apache 2.0 协议——意味着企业可无限制商用、微调、蒸馏。结合 GPT-OSS-20B 仅需 16GB 显存即可部署,AI Coding 本地化方案的成本曲线被进一步压低;对 Cursor、Devin、Claude Code 等闭源编程 Agent 形成实质竞争压力。

信息来源:OpenAI 官方博客

阿里千问 Qwen3.8-Max 多项基准超 GPT-5.6,Max 级权重首次开源

阿里 Qwen3.8-Max 于 8 月 6 日-10 日发布,总参数 2.4 万亿(激活 950 亿),采用稀疏 MoE+混合注意力架构,支持 1M 上下文窗口和原生多模态。基准测试表现:PaperBench 93.0 分(超过 Fable 5 的 88.8 与 GPT-5.6 Sol 的 90.5)、OSWorld-Verified 86.1 分(主流模型第一)、GPQA Diamond 92.6 分、SWE-bench Pro 67.7 分、BabyVision 视觉推理 82.0 分。千问同时宣布首次开源 Max 级模型权重。

值得关注的原因:千问首次将"Max 级"超大模型权重开源,使 1M 上下文+2.4 万亿参数模型可直接私有化部署,对 AI Coding Agent 处理大型代码库重构、OS 级自动化操作(OSWorld)、视觉化调试等任务具有里程碑意义;同时 PaperBench 与 OSWorld 双榜登顶,表明国产模型在编程与桌面 Agent 维度已进入第一梯队。

信息来源:阿里云官方

Cognition AI 目标估值 400 亿美元,年化营收近 10 亿

AI 编程工具 Devin 开发商 Cognition AI 于 8 月 12 日与投资者展开新一轮融资早期磋商,估值有望较上轮提升 50% 以上、至少 400 亿美元,年化营收流水接近 10 亿美元(约为上轮公开数据的两倍),拟募资超 10 亿美元。公司仍可能最终决定不融资。

值得关注的原因:Devin 作为 AI 编程领域的标志性产品,400 亿美元估值意味着 AI Coding 赛道头部公司正快速向"平台级"估值演进;10 亿美元年化营收是 AI 编程 Agent 从"演示"迈向"规模化付费"的关键门槛,验证了"AI 程序员替代人类开发者"叙事的市场买单能力。对国内 Cursor 替代品、CodeGeeX、通义灵码等国产 AI Coding 产品是直接参照系。

信息来源:财联社

具身基座模型公司 LatentVerse 完成数亿元种子轮融资

北京潜界科技(LatentVerse)于 8 月 11 日宣布完成数亿元种子轮融资,投资方包括高瓴创投、清流资本、英诺天使基金,以及智元和星动纪元两家具身智能头部企业。公司定位原生具身基座模型,核心差异化路线是将触觉感知纳入统一基座,推出 UTAM(统一触觉动作模型),在视觉和语言之外增加触觉反馈维度。创始人胡钰承为清华大学交叉信息研究院博士在读(2001 年出生),本轮融资从启动到交割不到两个月。

值得关注的原因:触觉信号是具身智能从"看图操作"迈向"精细作业"的关键缺失维度——灵巧手抓取鸡蛋、装配零件、织布缝纫等任务必须依赖触觉反馈。LatentVerse 同时获得智元与星动纪元两家头部具身公司投资,意味着产业方对"触觉基座"路线形成共识;2001 年出生的清华博士主导且两个月完成数亿元融资,反映具身智能领域"少壮派 + 高密度资本"的典型样本。

信息来源:界面新闻

埃斯顿 iER 系列工业机器人亮相央视首届机器人大展

埃斯顿于 8 月 7 日携新一代 iER 系列工业机器人登上央视"智竞未来——首届智能机器人应用技能大展"。核心展品 iER130-3200 大负载六轴工业机器人最大负载达 130kg、最大臂展 3200mm、重复定位精度 ±0.06mm、本体重量 1120kg、防护等级手腕 IP67/主体 IP54。该机型搭载自研 iER.OS 智能操作系统与 Juliet 高级编程语言,配备新一代集成控制柜并具备 AI 功能扩展能力。埃斯顿已形成覆盖 3-1200kg 全负载范围的 90 余款产品矩阵。

值得关注的原因:埃斯顿 iER130-3200 的 130kg 大负载 + 3200mm 长臂展组合,瞄准了汽车制造、新能源电池、集装箱搬运等重型工业场景;自研 iER.OS 与 AI 扩展能力意味着工业机器人正在从"PLC+示教器"传统模式向"AI Agent+本地化推理"模式过渡。这是国产工业机器人头部厂商在大负载赛道的标志性突破,对人形机器人+双臂轮式机器人进入制造业产线也具有间接参照价值。

信息来源:埃斯顿官方