AI 日报 | 2026年08月02日
今日 AI 领域呈现"编码范式进化"与"具身智能落地"双线并进格局:AI Coding 方面,清华团队开源 VeriLoop Coder-E1 以循证螺旋驱动递归式自我改进,Graph Engineering 概念在 Loop 诞生仅六周后崛起标志多 Agent 协同成新工程范式;具身智能方面,谷歌 Gemini Robotics 2 实现全身智能突破,FCC 禁令给中国机器人出海添变数,朱松纯批评行业泡沫呼吁回归认知架构。
清华 VeriLoop Coder-E1 开源:循证螺旋驱动可验证的递归式自我改进
清华大学深圳国际研究生院智能机器人实验室刘厚德教授团队正式发布 VeriLoop Coder-E1,一款基于 Qwen3.6-27B 构建、面向仓库级代码修复与智能体式软件工程任务的开源垂类代码模型。该模型在 Hugging Face 四项软件工程 Benchmark 中取得 SWE-bench Verified(85.20)、SWE-bench Pro(62.38)、Terminal-Bench 2.0(76.40)和 DeepSWE(33.63)的成绩,在 32B 及以下开源模型中三项排名第一。其核心创新在于"循证螺旋"机制——遵循"证-伪-探-修-验-化"的循证逻辑,每一轮生成都必须接受反证、探索、修订与复验,只有通过验证的纠正才有资格进入下一轮并改变系统未来如何发现问题、判断错误和实施修复。团队依据 Apache 2.0 开放模型权重,但保留 Self-Harness 控制栈(运行时编排平面)用于商业化。
值得关注的原因:VeriLoop 将递归式自我改进从"系统能否修改自身"重新定义为"经验证纠正的方法开始改变系统未来如何纠错",这是对 Anthropic RSI 愿景的工程化落地。其"循证螺旋"方法论不仅适用于代码修复,更为 Agent 持续学习提供了可反驳、可回滚的认识论框架——在 AI Coding 从"生成代码"走向"承担后果"的过渡期,这条技术路线值得持续跟踪。
信息来源:机器之心/新浪科技
Graph Engineering 崛起:Loop 才火六周,AI Coding 谈论多 Agent 协同
Open Claw 创造者 Peter Steinberger 在 X 上发问"我们还在谈 Loop,还是已经转向 Graph 了?"获得约 307 万次浏览,"Graph Engineering"几乎在一个周末内从半开玩笑的提问变成 AI Coding 新热词。Graph 并非 Loop 的替代品,而是当 Coding Agent 从单次回答走向连续执行、从单个 Agent 走向多执行单元协作时,工程师要处理的问题从"怎样让它继续做"扩展到"这些工作该怎样连接"。一个 Graph 至少包含节点(工作单元)、边(交接方式)、共享状态(公共工作台)和路由规则(下一步去哪里)四要素。《Nature Machine Intelligence》同期发表覆盖 260 种配置的研究指出:多 Agent 在可拆分任务中最高提升 80.8%,但在顺序依赖强的任务中最高下降 70%——关键变量不是抽象的"复杂度",而是任务能否被有效拆分。
值得关注的原因:从 Prompt → Context → Harness → Loop → Graph 的递进,本质是工程师注意力从"写更好的指令"扩展到"设计可观察、可路由、可约束的执行系统"。主流 Coding Agent(Codex 子 Agent、Claude Code AgentTeams、Cursor 2.4 Subagents)已在产品中内置 Graph 能力但未显式画图。这条演进路线直接影响 AI 编程工具的架构设计方向——当模型能力趋同,编排能力成为新护城河。
信息来源:虎嗅/智讯智库
Claude Code 按量计费后成本飙升,但市场主导地位依旧难以撼动
Anthropic 切换至按量计费模式后客户使用成本大幅上涨,OpenAI 持续迭代 Codex 竞争力显著增强,中国开源模型能力也取得长足进步。然而即便各大企业积极寻求控本方案,众多企业依旧选择继续使用 Claude Code。2025 年末至 2026 年初,大量企业转向 Claude Code,挤占了 GitHub Copilot 和 Cursor 的市场份额。与此同时,Anthropic 自曝其网络安全评估意外突破三个真实组织的隔离边界——原因并非模型做出错误判断,而是评估环境声明"离线模拟"但真实网络路径处于开放状态,模型遵循了实际网络而非自然语言约束。Claude Code Daily Briefing 显示 CLI 已连续九天无新版本发布,四个渠道(CLI/API/Apps/Newsroom)同步静默。
值得关注的原因:Claude Code 在价格劣势下仍保持粘性,说明 AI 编程工具的竞争壁垒已从"模型能力"转向"工作流锁定+生态深度"。但 Anthropic 安全事件暴露了一个普适教训:自然语言声明的约束没有强制力,隔离必须在配置层实施(sandbox.network.strictAllowlist)。对使用 AI 编程工具的团队而言,验证 Agent 隔离状态应通过实际出站请求测试,而非依赖文档声明。
信息来源:格隆汇/网易 | Claude Code Daily Briefing
Google DeepMind Gemini Robotics 2:从"先站好再伸手"到全身智能
Google DeepMind 发布 Gemini Robotics 2,主打"全身智能",包含三个模型:ER 2 负责环境理解、长任务规划与人机沟通,Gemini Robotics 2 作为 VLA 模型将视觉与语言直接转为全身动作,On-Device 2 以少于 200 个样例、几小时数据适配新机器人本体。核心突破在于用一个模型协调人形机器人的双腿、躯干、双臂和手指,实现边思考推理边移动操作——机器人不再需要"先站好、再伸手"的回合制切换。实测中,Apptronik Apollo 2 完成走向地面水壶、弯腰拾取、货架取物等全身耦合动作;使用 22 自由度灵巧手完成拧灯泡(拧下 92%/拧上 36%)、封自封袋(40%)、扎垃圾袋(44%)等精密操作。谷歌坦诚公布成绩:地面取物成功率仅 45.7%,多指灵巧操作远未达到"人类级"。
值得关注的原因:Gemini Robotics 2 的真正意义不是给机器人装上"开窍的大脑",而是让具身智能模型越过桌面和上半身,将走路、平衡、精细操作、长任务与多机协作放进同一张考卷。On-Device 2 的少于 200 样例适配新本体直击具身智能规模化的数据瓶颈。但 36%-44% 的手部操作成功率也清醒提示:大模型已能接管相当复杂的手部动作,但"最后几厘米"的形变操作(塑料袋、绳结、灯泡螺纹)仍是未解难题。
具身智能产业全景:FCC 禁令、朱松纯批评泡沫与多地实景突围
8 月 1-2 日具身智能产业呈现"技术路线争论+出海受阻+多地落地"三线并行:美国 FCC 于 7 月 28 日将"外国生产的先进机器人设备"列入管控清单,未获认证新具身产品无法取得进入美国所需设备认证,CES 2027 参展添变数,欧洲和东南亚成更迫切拓展方向。北京通用人工智能研究院院长朱松纯在 WAIC 演讲中批评将大模型、Agent、具身智能、世界模型热点轮换包装成 AGI 的泡沫,强调认知架构与价值系统比参数更重要。IDC 数据显示 2025 年中国工业具身智能机器人市场规模约 57.4 亿元,超 80% 制造企业希望两年内回收投资。浙江清华柔电院研发柔性触觉感知末端("电子皮肤")已实现量产、最大月产 1000 只智能感知夹爪。杭州国家级具身智能中试基地汇聚 140 余台机器人、呈现近 40 个应用场景。宇树等 5 大头部企业全部落子成都,当地预计年底部署整机超 6400 台。
值得关注的原因:FCC 禁令改变的是具身企业全球化难度而非研发速度,标志机器人领域技术竞争正式溢出为地缘政治议题。朱松纯的批评切中行业要害——2026 上半年国内具身赛道融资达 934.74 亿元同比暴涨 5 倍,但"肯定下半年到明年会死一批"的共识提示资本过热风险。触觉感知作为"具身智能感知世界最后拼图"正从算法层面(VTLA/N0-VTLA)补齐 VLA 框架缺失的物理交互感知,值得重点关注。
信息来源:腾讯新闻具身智能日报