
一、AI Coding1. xAI 把 Grok Bot 做成平台Marketplace 自托管 Grok 4.7 全量上线事件xAI 正将 Grok Bot 从单一工具升级为平台——据 Polymarket 信息Grok Bot Marketplace 已允许用户挂载工程、研究、销售、营销等专属 agent上架机制与定价未公开一场内部分享显示 xAI 已用自家 Grok Bot 造 Grok Bot 本身一张线框图自动展开完整 Figma 流程、项目自动拆给 4 个工程师 bot并行、X 上的重复 bug 自动转修复提案。同日 Grok 4.7 从 Grok Build/Grok Bot 专属扩展到全平台Fast/Expert/Build/Heavy 全模式Grok Build 连发两个点版本修复模型切换 UI 同步、Goal 面板打不开、大工作区性能等问题。值得关注这是agent 自我增殖第一次进入产品化叙事——工具商开始用 agent 生产自己的下一代工具。Marketplace 化也意味着 coding agent 的竞争从谁的模型强切到谁的生态/专业人士多。对国内同类Manus Cue、智谱 ZCode、阿里 Qoder是明确的平台化参照。2. DeepSeek Harness v0.2 Preview桌面 App 插件管理器国产开源 harness 成 API 用户主流事件DeepSeek 发布 Harness v0.2 预览新增 macOS/Windows 原生桌面端、免终端的插件管理器聊天即可创建插件、以及 Automation Task 定时任务插件。DeepSeek 称 Harness 已成为官方 API 用户中使用最广泛的 coding agent。值得关注国产开源 harness 在自托管 插件生态 定时自动化三层补齐正在从调用模型升级为开发者的常驻工作台。与 9 月卷 harness 而非卷模型的叙事一致——价值继续从底层模型向运行时/编排层转移。3. Google 安全与长程评测三连击Android Bench 2.0 / Stitch CLI / Mantis 安全审查包事件Google 三箭齐发——① Android 团队发布Android Bench 2.0从修 bug 小任务升级为约 30 个多天级长程工程任务从零建 app、迁移依赖与设计并跨平台移植专门测长程编码能力② Stitch 团队放出google/stitchCLI本地 coding agent 可直接把 dev-server 快照推入 Stitch③ 开源Mantis安全审查技能包威胁建模、漏洞扫描、误报过滤、PoC 生成、补丁验证 6 条命令。Google Cloud 同步启动 Advent of Agents Season 331 期免费、免登录的 agent 安全实战视频含 prompt injection 防御、沙箱、kill switch。值得关注大厂把安全 长程评测当成 coding agent 的基建来铺——前者是 agent 进入企业的准入门槛后者是到底有没有真干活的标尺。Mantis 开源直接把安全审查做进 agent 工作流对标 NVIDIA Open Agent Safety Platform 的安全成产业红线趋势。4. 并行编码 长任务治理ParallelPilot 实测 63% 吞吐Claude Code 上线体面收尾事件① 论文ParallelPilot从 14 人开发者研究里提炼出 5 条多 agent 并行监督实践报告并行编码带来63% 吞吐提升微软另发CASD——把 agent 历史运行日志交给普通 coding agent 写分析代码定位系统性失败3/4 基准上以约 $1.60/提示 跑赢 GEPA 优化器。② Anthropic 给 Claude Code 加了Wrap-Up Allowance撞上 5 小时上限时不再硬切改到一半直接 429而是从周额度划一小段收尾额度把当前这一步做完再停Pro 每周 1 次、Max/Team Premium 每次命中可用。值得关注长任务工程化进入并行 优雅收尾阶段。但注意 Wrap-Up 只解决停在哪、不解决记忆留什么——会话状态仍需显式序列化Stop hook 写 checkpoint。对实际跑 overnight /loop 的团队这是 9 月长程 agent 可靠性议题的落地补丁。5. Benzi编译器驱动的 coding agent78.2% SWE-bench Verified、单次修复 10¢事件开发者发布Benzi用编译器 静态分析替代读源码。核心思路编辑前先让编译器报告改动爆破半径并跑全量静态检查模型几乎不用问谁调了这个函数。数据同任务 Sonnet 只读了 9,125 行 vs Claude Code 20,704 行、DeepSeek harness 43,598 行、OpenCode 65KSWE-bench Verified 78.2%单次修复成本 10¢用 V4flash。支持 Python/JS/TS/Java/C#/C/C/Go/Rust/Ruby。值得关注直接挑战上下文窗口军备竞赛——主张索引仓库 读原文更经济。若被验证可泛化将动摇长上下文 强 agent的默认假设也给自托管/低成本 coding agent 一条新路径。需观察基准是否过拟合及多语言真实工程表现。二、具身智能6. Boston Dynamics Atlas 换新四指手13 DOF、砍掉小指、为量产可制造事件现代汽车旗下 Boston Dynamics 发布 Atlas 新一代手——四指、13 自由度拇指 4 DOF、其余三指各 3 DOF、直接驱动、指腹手掌压触觉传感支持 in-hand 重定位、滑落自恢复、握钻/扳手/焊枪并扣扳机。设计上刻意去掉小指团队让工程师把小指和无名指绑一天结论是省下的复杂度/功耗/故障点不值。配套 Georgia 的 RMAC 训练中心已开张现代起亚计划2028 年起部署 Atlas先零件排序、2030 扩到装配远期2.5 万台进全球工厂部分零件成本已降 60–80%。值得关注这是人形从炫技手到量产可制造手的设计哲学转折——不追求拟人而追求可靠、便宜、好修。现代起亚的 2.5 万台订单把上量从 PPT 变成供应链计划直接牵动执行器/减速器/触觉传感上游A股相关标的的订单能见度提升。7. Agility × FORT Robotics 签 Digit 5 安全 MOU离机安全桥成标准件事件Agility Robotics 与 FORT Robotics10/1签 MOU围绕下一代Digit 5共建三层安全架构安全吊坠 本体通信 Offboard Safety Bridge 离机安全接口把协作安全从机器人本体延伸到外部环境系统。FORT 此前已为 Digit 提供吊坠载板急停使能装置。Digit 5 主打无物理围栏、贴近人协作前代已累计 6.5 万 小时现场运行GXO/Schaeffler/Amazon/丰田。Digit 5 早期可用 2027 H1、通用可用 2027 年底。值得关注人形机器人安全架构开始标准化、模块化、从本体走向环境——这是进工厂/仓库的硬准入。对 A股来说机器人安全/功能安全从概念变成可采购的子系统利好安全控制器、急停/使能硬件、协作安全软件相关标的。8. CrossBFM跨本体行为基础模型训练从数百 GPU 小时降到 1 小时事件研究提出CrossBFM把多个不同人形本体的共享行为潜空间蒸馏出来用跨本体重定向cross-embodiment retargeting生成统一、可迁移的表征将行为基础模型的训练时间从数百 GPU 小时压缩到 1 小时以内并实现策略在不同机器人间直接迁移解决每款机器人各训各的、潜空间不兼容的瓶颈。值得关注行为基础模型的跨本体瓶颈被突破意味着一个大脑管多种身体的工程成本骤降——直击具身智能最大的数据/训练碎片化痛点。国产 VLA/世界动作模型宇树 WLA、智元 GE-Act、银河 RoboDojo 等需要对照评估自己的跨本体能力否则会被通用底座路线拉开差距。9. 可靠性评测下沉VLA 相机故障物理失效模式 Fiatlux 长程基准事件① 研究分析π0.5 / GR00T等 VLA 在相机故障黑屏 vs 冻结帧下的物理失效差异冻结引发关节剧烈运动、黑屏增加掉落率并验证本体感知proprioception可补偿、相机黑屏训练有效。② 新基准Fiatlux基于 NVIDIA Isaac Lab让宇树 G1 爬梯、换灯泡、丢弃旧灯泡单幕融合垂直移动精细操作易碎品处理12 个子任务、部分给分把评测从桌面/ locomotion 推向真实长程。值得关注具身评测从能不能动升级到坏了怎么办、长程连不连得起来——这是量产验收前必须过的关。VLA 失效模式研究提示视觉故障下动作安全兜底要依赖本体感知对传感器冗余/故障注入测试提出新要求Fiatlux 类长程基准会成为厂商能力宣传的新标尺。三、跨主线信号投资 / 能源视角算力能源锚延续本期 coding 侧安全实战 长程评测密集铺开Advent of Agents S3、Mantis、CASD、ParallelPilot具身侧安全架构标准化Digit 5 Offboard Safety Bridge同步硬化——Agent 安全合规已成 coding 具身共享的硬约束监管与采购都会据此设门槛。A股三条线可跟踪① 具身上游卖铲人——Atlas 2.5 万台订单 Digit 5 安全子系统牵动执行器/减速器/触觉传感/功能安全硬件② 行为基础模型/跨本体——CrossBFM 把通用大脑成本打下来倒逼国产 VLA 证明跨本体能力③ 绿电算力——长程 agent 与机器人训练都吃算力能源储能/供电/绿电仍是底层锚。叙事收口Coding平台化 安全 长程评测 价值向 harness 转移具身可制造手 安全标准化 跨本体大脑 长程可靠性评测。两边都在从能力演示切到能不能规模部署、坏了谁负责。一句话总结今日 AI Coding 与具身智能同频收敛——竞争焦点正从谁模型更强切换到谁能把 agent 安全、可靠地规模部署平台化运行时、离机安全桥与长程评测已取代单纯参数成为压过模型性能的新护城河也直接决定具身估值的兑现与上游订单的能见度。