尧图网站设计 尧图网站设计YAOTU DESIGN
ARTICLE DETAIL

资讯详情

深耕网站设计与一线实操的经验洞察。

一群机器人,如何在谁也看不到全局的情况下,对未来达成共识

一群机器人,如何在谁也看不到全局的情况下,对未来达成共识 想象一下这个场景。十几台无人机在空中组成编队风一吹队形就会晃动。每一台无人机只能看到自己周围几个邻居在干什么谁都看不到整个编队此刻是紧密聚集、还是正在散开、还是已经乱成一团。可是如果每台无人机对我们这个团队接下来会变成什么样子的判断都不一样接下来的动作就会互相拖后腿有的以为大家要收拢猛地往中心挤有的以为大家要散开拼命往外飞。这不是一个感知不准的问题而是一个更麻烦的问题每个人手里的信息都不完整而且没有一个中央大脑能把所有信息汇总起来告诉大家标准答案。这篇来自ITMO大学的论文标题叫《One Future, Every Robot》,《一个未来每个机器人》研究的正是这件事能不能让一群互相看不到全局、也不互相对答案的机器人各自独立地对团队的未来会是什么样形成一致的判断这个问题看起来简单做起来却像一个悖论既要大家想法一致又不能让大家互相抄答案。问题到底难在哪先说清楚这不是什么问题。这不是普通的预测每个机器人自己下一步去哪的轨迹预测问题那种问题里每个机器人只需要关心自己。这也不是训练一个中央控制器去看整个战场的中心化问题因为现实中的机器人群体往往没有这样一个上帝视角的中枢通信带宽有限网络还可能随时断开。真正的困境在于每个机器人只能看到自己的16帧历史观测和邻居传来的一点点压缩信息却被要求对整个团队未来的聚集程度、连通性、任务完成度这些只有站在上帝视角才看得清楚的指标做出准确且彼此吻合的判断。打个比方这就像让十个人在完全不能交谈、只能通过传纸条给最近的邻座人的情况下各自独立猜测这个班级期末的平均分会是多少。如果不能形成某种共同的理解方式十个人猜出十个天差地别的数字一点都不奇怪。以往的研究其实分头解决了这个问题的两半。一半是如何从局部信息拼凑出全局结构,像Deep Sets、图神经网络这类工作证明了局部交换的信息确实能反映出群体的隐藏状态。另一半是如何用预测来提升多智能体的协作能力,比如MASIA用自监督的方式压缩通信内容还有各种世界模型尝试把局部动态和全局聚合结合起来。但这两条线一直没有真正交汇。有没有一种潜在的目标状态能让每个机器人独立预测出来的东西既代表整个群体作为一个集合的未来样子又不需要靠一致性损失函数强行拉齐而且在通信拓扑变了、群体规模变大之后依然管用这正是这篇论文要回答的问题。JEPA预测意义而不是预测像素要理解这篇论文的解法得先说说JEPA这个概念。 JEPA*全称Joint-Embedding Predictive Architecture联合嵌入预测架构。它的核心思想是让模型去预测未来状态在一个抽象特征空间里的表示而不是去逐像素、逐数值地重建原始数据。这个想法最早由Yann LeCun在2022年提出后来被应用到图像、视频等多种自监督学习场景。为什么要用JEPA而不是老老实实地重建原始数据设想你要向朋友描述明天的天气。你可以说明天下午三点气温23.6度风速每秒2.3米云层覆盖率47%,这是一种极度精确但极其啰嗦的描述方式任何一点误差都会显得预测错了。你也可以说明天下午多云转晴微风,这种描述抓住了对生活真正有用的信息忽略了那些没必要精确到小数点的细节。JEPA做的就是后一种事它让网络学会去预测重要的东西而放过那些琐碎的、局部视角本来就没法达成一致的细枝末节。这篇论文给这个架构起了个新名字叫CS-JEPA。 CS-JEPA*Collective-State JEPA集体状态联合嵌入预测架构。它训练每个机器人从自己的历史观测和邻居传来的消息里预测出同一个固定宽度的未来集体状态但完全不使用任何强迫大家答案一致的损失函数。这里有个关键设计,论文里反复强调:整个训练过程里从来没有一个让大家答案趋同的损失项。研究者故意把这个一致性损失的权重设为零。这是一次故意冒险的实验如果这个假设成立,如果让不同的局部视角都去够同一个目标,这些视角本身的含义就会自然对齐,那么在零一致性权重下依然能看到答案趋同就是最有说服力的证据。但如果这个假设是错的那么各个机器人就应该各说各话谁也说服不了谁。一个不会随群体变大而膨胀的目标这里有个很实际的工程问题如果群体里有10个机器人目标应该是10份信息如果群体扩大到100个难道目标也要变成100份这样模型的参数规模就会随群体大小失控增长。论文的解法是设计一种固定宽度的目标表示无论群体有多大输出的维度永远不变。具体做法是先用一个已经训练好、之后会被冻结的目标编码器把未来时刻每个活跃机器人的状态都编码成一个64维向量。然后用一种叫做锚点的机制把这些向量汇总成固定数量的令牌:一个代表整体的全局令牌加上一个4乘4的空间网格每个网格点根据距离远近加权汇总周围机器人的信息。这样无论群体是10个还是108个机器人最终输出的都是17个65维的令牌拼起来正好是1105维宽度雷打不动。这就像给一个班级拍集体照。不管班里是30人还是300人你都可以把照片固定裁剪成一张16宫格的构图,每个格子记录这个区域大概站了多少人、他们朝哪个方向看。哪怕后来班级扩招到三倍这张构图描述的格式依然不变变的只是每个格子里承载的实际内容。如果不这样固定输出宽度模型每次换一个班级规模就要重新设计一遍那所谓的可扩展性就无从谈起。每个机器人接收到的输入信息也有严格限制只能看到自己过去16帧的自身状态,包括位置、速度、任务方向,以及邻居在过去16步里传来的、上一时刻的循环记忆,一个64维的浮点向量相当于每条边每步传输256字节。这个数字被反复强调因为它划定了一条硬边界机器人之间传的不是我认为未来是什么这样的答案而是我现在脑子里在想什么这样的中间过程状态。论文里还专门设计了一个接收方锚点,一个训练时才存在的小模块用来预测该机器人自己未来的局部状态防止模型为了迎合那个宏大的集体目标把每个机器人自身的动态特征给忽略掉。这个模块在真正部署的时候会被整个丢弃只在训练阶段发挥稳定训练的作用。 GRU*门控循环单元一种擅长处理序列信息、能够把历史状态压缩传递下去的神经网络结构。在这篇论文里每个机器人用GRU把自己过去的观测和邻居传来的记忆融合成一个当前的隐藏状态。关键的对照组如果不用JEPA会怎样光讲CS-JEPA自己表现多好是不够有说服力的因为你没法排除任何靠谱的循环神经网络架构都会有这个效果的可能性。于是论文设计了一个几乎和CS-JEPA一模一样的对照组叫Future-Recon,意思是未来重建。这个对照组用了完全相同的冻结编码器、完全相同的通信机制、完全相同的预测器结构、完全相同的1105维输出宽度甚至连接收方锚点这个训练技巧都原封不动地保留。唯一的区别是CS-JEPA预测的是抽象的潜在特征而Future-Recon预测的是原始的位置、速度这些具体数值。两者的参数量也几乎相同CS-JEPA有139137个训练参数Future-Recon因为多了一个原始数据解码器多出9607个参数达到148744个。部署时两者用的参数量完全一致都是123713个。这个设计的用意很清楚把所有可能造成差异的因素都控制住只留下预测目标是抽象特征还是原始数值这一个变量。如果不做这样严格的对照即使CS-JEPA表现更好你也说不清这是预测目标选对了带来的好处还是恰好这套架构更适合的巧合。结果一致性和准确率同时提升论文最核心的实验结果用一句话概括就是CS-JEPA训练出来的各个机器人独立做出的预测彼此之间变得更加一致了,同时这些预测本身也变得更准了。这个同时非常重要。因为如果只看到一致性提升你完全可以怀疑会不会是所有机器人都学会了输出同一个恒定的、没有信息量的答案毕竟如果十个人永远都回答不知道他们之间当然是完全一致的但这种一致毫无意义。真正有说服力的证据必须是一致性提高的同时预测这个未来状态的准确度也在提高。这就排除了集体摆烂这种可能。论文做了一次全新的、独立的复现实验训练了12个全新的随机种子,相当于把整个训练过程重新做了12遍每次用不同的随机初始化,结果显示在ID测试集、拓扑结构变化的测试集、群体规模扩大的测试集上全部12个种子都毫无例外地显示CS-JEPA比Future-Recon更一致也更准确。用统计学的语言说这个结果的p值是0.000488几乎不可能是偶然。具体数字上相对于Future-ReconCS-JEPA的集体状态预测误差在分布内测试集上降低了28.4%而在拓扑结构或群体规模发生变化的场景下降低幅度达到64.4%到75.6%。这里拓扑结构变化和群体规模变化是两种不同的挑战。前者指的是训练时用的通信网络长得像小世界网络,这是一种既有局部聚簇又有少量远距离连接的网络结构,而测试时换成了环形网络或互相k近邻网络形状完全不同。后者指的是训练时群体规模只有10到18个机器人测试时却要应付36、72甚至108个机器人是训练规模的六倍。这就好比你训练一个团队协作直觉的时候团队一直是十来个人的小组等真正上场比赛的时候团队突然膨胀成六十人的大部队,而且原本熟悉的沟通结构也全变了从小圈子互通消息变成了随机连线。如果这套预测方式只是死记硬背了训练时的场景遇到这种巨变肯定会崩溃。但结果显示CS-JEPA不仅没崩溃反而在这种剧变场景下优势更明显了。这说明它学到的不是某个具体拓扑或规模下的表面规律而是某种更本质的、可以迁移的东西。下面这张表格是论文里的核心证据展示的是重建方法误差减去JEPA方法误差正数越大代表CS-JEPA优势越明显| 测试场景 | 准确率提升幅度 | 一致性提升幅度 ||---|---|---|| 分布内测试 | 0.001568 | 0.000981 || 环形拓扑(分布外) | **0.048385** | **0.076685** || 互相k近邻拓扑(分布外) | 0.034180 | 0.045911 || 群体规模扩大(分布外) | 0.037714 | 0.061672 |而且所有这些数字在12个独立训练的种子里全部是正数没有一个例外。论文还专门画了一条标签效率曲线来展示另一个维度的证据。因为要让机器人预测出的抽象特征真正对应到聚集程度连通性任务完成分数这些人能理解的物理量需要用一小部分带标签的数据训练一个轻量级的探针,一个简单的岭回归模型。 岭回归探针*一种带正则化项的简单线性模型这里用来把冻结的抽象特征翻译成人类能理解的十个具体指标比如群体的对齐程度、连通性、碰撞比例等。用探针这个词是因为它只是用来检验特征里是否含有某种信息本身不参与主体模型的训练。在只给6、12、24个带标签的完整回合数据的情况下,注意这个数字非常小相当于用极少量标注数据去校准CS-JEPA的等权重四场景平均误差分别是0.0175、0.0121、0.0103而Future-Recon则是0.0626、0.0413、0.0287。差距在标签最稀缺的时候反而最大,这正是标签效率这个词想表达的意思好的表示应该能用很少的标注数据就把有用的信息提取出来。排除简单答案不是靠坐标抄近道这里有个值得警惕的陷阱。如果所有机器人共享同一套绝对坐标系,比如大家都知道东边是正方向那么预测一致很可能只是因为大家用了相同的参照系作弊而不是真的学到了什么深层规律。论文专门设计了一个平移不变性的对照实验把绝对位置换成相对于自己的相对位置把目标场也改成以群体中心为原点的坐标同时把任务方向这个通道直接清零。这样一来唯一还共享的只有朝向和度量尺度绝对位置这个作弊工具被拿掉了。结果显示即便去掉了这个坐标抄近道的可能CS-JEPA的优势依然存在准确率误差从0.008852降到0.007248下降18.1%一致性误差从0.005735降到0.002729下降52.4%。而且依然是12个种子全部支持这个结论。这就好比原本怀疑两支球队默契十足是因为他们提前对过暗号于是把暗号拿掉重新比一次结果发现默契程度基本没变。这说明默契的来源不是暗号而是某种更本质的东西,可能是对场上局势的共同理解方式。论文还做了一个更狠的交叉验证实验把CS-JEPA依赖的那个目标编码器,也就是提前训练好用来生成潜在特征的模块换成一个用原始数据重建方式训练出来的编码器。目的是排除CS-JEPA表现好只是因为它站在了一个JEPA风格编码器的肩膀上这种可能性。结果是即使把底层编码器换成重建风格训练出来的CS-JEPA式的预测目标依然比Future-Recon式的预测目标表现更好而且优势不减反增。8个独立训练的种子全部支持这一点p值是0.0078125。这个结果相当有力地说明真正起作用的不是编码器本身的训练方式而是预测抽象特征而不是原始数值这个选择本身。光预测得准还不够得对决策有用一个预测哪怕再准确如果不能帮机器人做出更好的决定那它的价值也要打个问号。论文接下来测试了这个抽象特征表示能不能帮机器人评估如果我做这个动作会有什么后果。他们训练了一个动作条件版本的模型让每个机器人给自己设想的四步行动方案打分衡量的指标包括任务完成度、连通性维持情况、碰撞风险。结果显示CS-JEPA在预测这些行动方案的实际价值上误差比Future-Recon低了45.46%而且在没见过的、规模是32个机器人的场景下依然保持50.62%的误差降低。这说明这个抽象特征不只是看起来像是对的它里面真的编码了对决策有用的信息。最后一步测试是真正意义上的闭环实验让机器人真正拿着这套预测系统去控制真实的四旋翼无人机物理模拟,用的是Crazyflie这款真实存在的微型无人机的刚体动力学模型包含空气阻力等因素在240赫兹的物理仿真频率下运行。每个机器人独立地在一个5乘5的聚合程度-巡航速度网格上打分选出未来0.8秒的最佳方案执行四步之后重新规划,整个过程中依然没有任何预测、打分或方案被汇总到一起。在通信完全正常、20%丢包、单步延迟带抖动、以及丢包延迟抖动叠加异步更新这几种严苛条件下测试CS-JEPA相对Future-Recon把综合效用提升了5.3%在16个种子里有12个种子支持这个结论相对完全不用学习预测、只靠固定规则飞行的基准方法则是16个种子全部、毫无例外地支持CS-JEPA更优p值小到0.000031。而且整个测试过程中没有一次碰撞或者近距离碰撞事故发生。这项研究留下的边界论文自己也很坦诚地列出了目前的局限。所有实验都在仿真环境里完成还没有真正搬到硬件上跑过。共享朝向和度量尺度这个假设依然保留着还没有测试过完全独立局部坐标系的情况。用来训练动作价值评估的穷举分支监督,也就是让模型看遍所有可能的行动方案组合这种做法只在训练阶段用得起实际部署时不可能穷举所有可能性。改善了价值评估的准确度并不直接等同于降低了选错方案的遗憾程度这两者是有区别的。这些限制意味着这篇论文证明的是这个思路在受控条件下是成立的而不是这个思路已经可以直接装到真实机器人上使用。写在后面读这篇论文时最让我意外的一点是研究者对一致性损失权重为零这件事的执着。很多做多智能体系统的工作第一反应都是设计一个显式的惩罚项去逼迫智能体的输出趋同,毕竟直接优化目标最省事。但这篇论文反其道而行之故意不这么做把一致性会不会自然出现当成检验假设的核心手段。这种故意不给捷径看看结果会不会自己长出来的实验设计思路其实挺值得在别的领域借鉴的与其强行拉齐结果不如去问问如果给对了共同的目标一致性是不是本来就该自然涌现。论文里那个直接监督对比的诊断实验也挺有意思。用带标注数据直接监督训练出来的模型一致性反而比CS-JEPA更好但准确率明显更差。这说明更一致和更准确其实是可以拆开来分别优化的两件事CS-JEPA选择了在两者之间找一个更有实际价值的平衡点而不是单纯追求某一个指标好看。这提醒人一件事评价一个系统好不好不能只看一个数字得看这个数字背后牺牲了什么。如果一个抽象的、谁也没见过的共同未来真的能让分散各处、互不通气的个体在行动上更协调那这件事的应用边界恐怕远不止无人机编队。QAQ1CS-JEPA是什么ACS-JEPA全称Collective-State JEPA,集体状态联合嵌入预测架构是一种让分布式机器人群体在没有中心节点、也不互相核对答案的情况下各自独立预测同一个集体未来状态的训练方法训练过程中完全不使用强迫结果一致的损失函数。Q2CS-JEPA和普通的重建式预测方法相比优势体现在哪里A相对于同等参数规模、只是把预测目标换成原始数值重建的Future-Recon方法CS-JEPA在分布内测试集上误差降低28.4%在通信拓扑或群体规模发生较大变化的场景下误差降低64.4%到75.6%同时预测结果之间的一致性也显著提升12个独立训练种子全部支持这一结论。Q3CS-JEPA的效果会不会只是因为大家共享了绝对坐标系这种简单技巧A不会。论文专门做了去掉绝对坐标信息、只保留相对位置的对照实验结果显示CS-JEPA的优势依然存在准确率误差降低18.1%一致性误差降低52.4%说明优势来源不是坐标系抄近道而是预测抽象潜在特征这个设计本身。
返回列表