尧图网站设计 尧图网站设计YAOTU DESIGN
ARTICLE DETAIL

资讯详情

深耕网站设计与一线实操的经验洞察。

一种用于FANET中基于LLM的GPSR优化的参数特定检索与知识引导推理框架

一种用于FANET中基于LLM的GPSR优化的参数特定检索与知识引导推理框架 大家读完觉得有帮助记得关注和点赞摘要现有的基于贪婪周边无状态路由GPSR的飞行自组网FANET协议难以在高度动态的环境下自适应调整路由参数例如Hello间隔、多路径数量和贪婪转发权重。作为一种新兴的人工智能技术大语言模型LLM显示出在智能决策方面的潜力为自适应调整GPSR参数以提升网络性能提供了新的机遇。然而由于不相关的经验检索和缺乏协议约束将LLM应用于GPSR仍然充满挑战。为解决这些问题我们提出了一种用于自适应GPSR优化的参数特定多索引检索与知识引导推理框架PMKR-GPSR这是一个基于LLM的框架能够实现符合协议规范的路由参数自适应。我们设计了一种参数特定的多索引检索机制为LLM提供与参数相关的经验同时减少不相关信息的干扰。我们进一步构建了一个知识引导的约束图以确保路由参数满足依赖规则和优化约束。仿真结果表明在高动态FANET环境下PMKR-GPSR实现了更高的分组投递率和更低的端到端延迟。索引术语​ 飞行自组网贪婪周边无状态路由大语言模型参数特定检索知识引导推理。I. 引言飞行自组网FANET因其快速部署能力和灵活拓扑结构而备受关注。与传统移动自组网相比FANET的特点是拓扑结构快速变化和无线链路不稳定这极大地增加了路由决策的复杂性[8]。因此设计能够维持可靠通信的自适应路由机制仍然是一个关键挑战。在现有的地理路由协议中贪婪周边无状态路由GPSR因其低计算复杂度和本地化转发策略而被广泛采用。然而传统的GPSR采用固定的转发策略。在高度动态的FANET中固定的路由参数难以适应多样的通信场景导致次优的转发决策、不稳定的路由以及降级的分组投递性能[3]。为了提高GPSR的适应性人们提出了许多优化方法。一些研究通过考虑多个路由度量来增强贪婪转发从而实现对转发节点的更全面评估提高转发可靠性[9]。其他方法采用强化学习RL通过与网络环境的持续交互来学习自适应路由策略[7]。然而基于RL的方法通常需要大量的探索和精心设计的奖励函数才能实现稳定收敛[6]。随着网络拓扑的演变先前学习到的策略可能变得次优需要在高度动态的场景中进行额外的适应以维持路由性能。最近大语言模型LLM因其知识利用和推理能力在无线通信的智能决策方面展现出潜力[10]。然而现有研究表明缺乏显式知识约束和相关经验的LLM可能会产生幻觉或不切实际的输出[11]。因此直接将LLM应用于GPSR优化仍然具有挑战性。首先不同的路由参数如Hello间隔、多路径数量和贪婪转发权重对不同网络特征具有异质性依赖关系导致不相关信息干扰LLM的推理。其次缺乏协议知识约束使得LLM无法理解网络状况、路由参数和性能目标之间的关系这可能导致不合理的参数调整违反GPSR原则并恶化路由性能。为了应对这些挑战我们提出了一种用于自适应GPSR优化的参数特定多索引检索与知识引导推理框架PMKR-GPSR。首先为了解决不同路由参数的异质性特征依赖以及统一经验检索带来的干扰问题我们设计了一种参数特定的多索引检索机制。提取网络特征以查询相应的参数特定索引为LLM提供用于路由参数生成的相关经验。其次为了解决缺乏协议知识约束的问题我们构建了一个知识引导的约束图。该图包含了用于LLM推理的参数依赖规则和优化约束指导路由参数的生成。仿真结果表明在高动态FANET场景下PMKR-GPSR实现了更高的分组投递率PDR和更低的端到端E2E延迟验证了其在动态网络环境中增强路由适应性和鲁棒性的有效性。图1提出的PMKR-GPSR框架架构II. 问题建模II-A UAV网络模型我们考虑一个高度动态的无人机自组网建模为一个无向图 G(U,L)其中 U{ui​∣1≤i≤N} 表示 N 架无人机的集合L⊆U×U 表示在传输范围内相邻无人机之间建立的通信链路。II-B GPSR路由协议所提出的框架建立在GPSR协议之上[5]。每个节点定期广播Hello报文并通过接收一跳邻居的Hello报文来更新其邻居表。基于邻居表转发节点选择距离目的节点最近的邻居进行分组转发。借鉴现有关于GPSR优化的研究本工作采用自适应Hello策略和多路径转发策略来提高分组传输过程中的传输可靠性[8]。此外采用多参数贪婪转发策略以提高下一跳选择的准确性[3]。邻居节点 uj​ 的转发优先级计算如下其中 D^j​, L^j​, V^j​ 和 N^j​ 分别表示候选节点 uj​ 到目的地的归一化距离、链路生存时间、相对速度和邻居度数其对应的权重 wd​, wl​, wv​ 和 wn​ 满足 wi​≥0,∑i​wi​1。表 I自适应GPSR优化的参数依赖规则路由参数场景特征关键指标理由Hello间隔相对移动性vself​, μ(vrel​), σ(vrel​)高移动性导致的拓扑变化需要更短的Hello间隔。能量状况e低能量节点应减少Hello开销以延长网络寿命。路径数量转发候选cc​充足的转发候选节点可以实现更多不相交路径。链路稳定性th∗​, μ(th​), σ(th​)频繁的链路故障需要更多路径来提高可靠性。网络拥塞qself​, qmin​, μ(q)拥塞节点应限制路径数量以减少开销。转发权重地理位置进展rp∗​, μ(rp​)最大化朝向目的地的地理进展。相对移动性μ(vrel​), σ(vrel​)在高移动性下关注相对速度和链路生存时间。邻居连通性nc​, μ(nc​)邻居集合可减轻稀疏区域出现的路由空洞风险。III. 提出的PMKR-GPSR框架图1展示了PMKR-GPSR的整体框架。在离线阶段路由经验被组织成参数特定的检索索引领域知识被编码成一个知识引导的约束图。在在线优化过程中该框架检索相关经验执行知识引导的推理生成自适应路由参数并通过反馈更新经验。所提出的框架增强了LLM的推理过程而不是微调其模型参数。这种设计避免了对大规模路由特定训练的需求同时使其能够适应未见过的网络场景。此外PMKR-GPSR将协议知识显式地融入推理过程从而提高了生成的路由决策的可靠性和可解释性。III-A 离线知识构建III-A1 领域专家知识领域专家知识表示为 K(KD​,KC​)其中 KD​ 表示参数依赖规则KC​ 表示优化约束。参数依赖规则指定了与每个路由参数相关的场景特征。形式上KD​{(pk​,Fk​)∣pk​∈P}其中 P{H,M,w} 表示路由参数的集合H 代表Hello间隔M 代表路径数量w[wd​,wl​,wv​,wn​] 表示公式(1)中多参数贪婪转发策略的权重向量。Fk​ 表示与路由参数 pk​ 优化相关的场景特征子集根据表I总结的参数依赖规则确定。表I总结了路由参数优化的参数依赖规则。Hello间隔由相对移动性和能量状况决定以平衡邻居新鲜度和通信开销[1]。转发路径的数量与转发候选、链路稳定性和网络拥塞相关联以提高路由可靠性同时限制不必要的传输[2]。转发权重主要取决于地理位置进展、相对移动性和邻居连通性使协议能够在不同网络条件下平衡转发效率、链路稳定性和鲁棒性[4]。优化约束规定了可行的参数自适应规则。它们表示为 KC​{ψj​}j1Nc​​其中 Nc​ 表示约束规则的数量。每个约束被公式化为 ψj​:Γj​→Δj​其中 Γj​ 表示基于场景特征定义的网络状态条件Δj​ 表示可执行的参数自适应约束包括允许范围和调整方向。约束知识用于在线优化过程中的知识引导推理。III-A2 离线经验表示本文从仿真记录中构建了一个离线经验数据库 DD{Ei​}i1N​其中 N 表示经验的总数i 是经验索引。每个经验表示为 E(F,P,Y)其中 F[Fs​,Fn​]⊤ 表示场景特征表示。Fs​ 表示自身节点信息包括节点速度 vself​、候选计数 cc​、队列长度 qself​ 和能量 e。这里候选节点指的是在地理位置上比当前节点更靠近目的节点的邻居节点。Fn​ 描述了邻居节点信息包括邻居数量 nc​、地理进展比 rp​、相对速度 vrel​、链路生存时间 th​ 和邻居队列长度 q。地理进展比 rp​ 表示候选转发节点朝向目的地取得的地理进展的相对百分比。为了解决邻居节点数量可变的问题并获得邻居节点信息的固定维度表示每个邻居属性都使用统计描述符进行汇总。根据属性特征采用最佳候选(*)、最小值(min)、均值(μ)和标准差(σ)的不同组合。性能向量定义为 Y{y1​,y2​,y3​,y4​}包括分组投递率、平均端到端延迟、控制开销和能量消耗。由于 F 具有异质尺度我们在索引构建之前应用Z-score归一化。归一化统计量 {μlnorm​,σlnorm​} 是从离线数据集中计算得出的并在在线推理期间保持不变。每个特征维度归一化为其中 xl​ 表示第 l 个特征的原始值μlnorm​ 和 σlnorm​ 分别表示第 l 个特征的离线均值和标准差。归一化后的特征记为 F^。III-B 参数特定多索引检索由于路由参数和网络状态之间存在异质性依赖关系统一检索可能会引入不相关的干扰并降低经验匹配度。因此基于参数依赖规则 KD​ 构建参数特定的检索索引以提高检索相关性。具体来说应用特征映射函数 Φk​(⋅) 从场景特征向量中提取参数特定的特征表示Φk​(F^i​)F^i,Fk​​其中 F^i,Fk​​ 表示根据 KD​ 选择的特征子集。提取的表示与相应的经验 Ei​ 一起存储以构建参数特定的检索索引其中 Sk​ 表示参数 pk​ 的检索索引。在在线优化过程中观测模块在时间 t 监控当前的网络状态 Et​ 并构建场景表示 Ft​。经过公式(2)的归一化后F^t​ 通过 Φk​(⋅) 投影以获得查询表示 Qk​Φk​(F^t​)。查询表示 Qk​ 与相应参数特定检索索引 Sk​ 中每个投影特征表示之间的相似度计算如下其中 dk​(⋅,⋅) 表示相似度函数。检索到的经验集定义为具有最高相似度分数的 Top-M 个经验其中 Ak​⊆D 包含用于优化参数 pk​ 的 Top-M 个最相似的历史经验。这里TopM​(Sk​,dk​(Qk​,⋅)) 选择 Sk​ 中通过公式(4)计算的相似度分数最高的 M 个检索条目。检索到的经验集为推理和路由参数优化提供了参数特定的知识。III-C 知识引导的约束推理尽管多索引检索提供了与参数相关的经验但它缺乏显式的协议约束。因此将领域专家知识 K 编码成一个知识引导的约束图以指导LLM的推理。约束图被建模为一个有向异构图形式化表示为 G(V,E,R)。节点集 VVs​∪Vpr​∪Vp​∪Vm​ 包含网络状态、路由原理、路由参数和性能度量实体。KD​ 中的依赖规则和 KC​ 中的约束被映射为两种语义关系类型影响 (rI​) 和约束 (rC​)定义了关系集 R{rI​,rC​}。相应地边集表示为 EEI​∪EC​其中 EI​ 和 EC​ 分别表示由影响关系和约束关系实例化的边的集合。每条语义边被公式化为一个关系三元组 e(vi​,r,vj​)其中 e∈Evi​,vj​∈V且 r∈R。在约束图中每种关系类型由一个邻接矩阵表示A(r)∈{0,1}∣V∣×∣V∣其中 Aij(r)​1 表示从 vi​ 到 vj​ 存在关系 r。在在线优化过程中通过从目标参数实体 vpk​​ 遍历约束图来提取参数特定的子图。对于每种关系类型 r相邻实体获取如下参数特定子图的节点集为相应的边集定义为 Ek​{(vi​,r,vj​)∈E∣vi​,vj​∈Vk​}。因此检索到的子图表示为 Gk​(Vk​,Ek​)。LLM基于一个集成的推理上下文执行路由优化C{Et​,Ak​,Gk​}。将集成的推理上下文提供给LLMLLM执行约束推理以生成路由参数P(0)LLM(C)其中 P(0) 表示生成初始路由参数。在迭代细化过程中P(l) 表示第 l 次迭代时的路由参数集。激活的约束集获取如下一致性得分定义为其中 I(⋅) 指示生成的配置是否满足相应的约束。其定义为如果 Ω(P(l),KCact​)1则将违反的约束汇总到一个违规集 Kvio​{ψj​∈KCact​∣P(l)⊨ψj​}。Kvio​ 被纳入交互历史并作为额外的推理上下文提供给LLM进行迭代细化直到所有激活的约束得到满足或达到最大迭代次数 Lmax​。最终的路由参数获取为Pt⋆​P(l)。因此推理过程被约束为符合协议规范的路由配置提高了自适应路由决策的可靠性。III-D 自适应行动与经验更新在知识引导的约束推理之后优化的路由参数 Pt∗​ 被采纳为自适应行动。监控随后的网络响应以形成新的经验Et1​。为了在经验数据库 D 中保持高质量的经验基于随后的路由性能 Yt1​ 评估新优化的路由参数。如果性能有所提升则保留由先前归一化的场景表示 F^t​、优化配置 Pt∗​ 和性能 Yt1​ 生成的经验具体来说使用投影算子 Φk​(⋅) 提取参数特定的特征并使用新经验更新相应的检索索引否则如果没有观察到性能提升则丢弃新配置或者系统回滚到先前的路由参数。最新的状态、行动和性能存储在交互历史中以为未来的优化决策提供时序上下文而不是作为一个额外的推理循环。IV. 性能评估所提出的框架使用NS-3.34网络模拟器进行评估。一个包含200架无人机的三维FANET部署在 2000×2000×200 m3 的区域通信范围设置为250米。无人机移动性遵循高斯-马尔可夫移动模型节点速度在10到80米/秒之间变化。每次仿真持续600秒。业务模型为恒定比特率模型CBR比特率等于2 Mbps每个数据包大小为1024字节。所提出的优化框架每10秒在源节点和转发节点上触发一次。离线经验数据库包含 N16,800 条路由经验其中 M5 条检索经验最大LLM细化迭代次数 Lmax​3。将所提出的框架与GPSR原始地理协议[5]、CF-GPSR多度量地理协议[9]和QLGR基于强化学习的协议[7]进行比较。为了评估各组件的贡献评估了完整模型和四个消融变体w/o Multi-Index、w/o KG、w/o Multi-Index KG 和 LLM-only。具体来说w/o Multi-Index 用统一索引替换了参数特定的检索索引w/o KG 移除了知识引导的约束图w/o Multi-Index KG 从单索引检索中移除了知识引导的约束LLM-only 直接使用LLM生成路由参数无需检索或知识约束。表II评估了在无人机速度为40米/秒的情况下不同Qwen2.5-Instruct模型规模的推理延迟和路由性能。结果表明较小的模型0.5B和1.5B在分析路由参数依赖关系和协议约束方面表现出有限的推理能力导致优化效果不足性能接近原始的GPSR。尽管3B和7B模型实现了更好的路由性能但7B模型引入了明显更高的推理延迟而性能提升有限。考虑到推理能力和计算开销之间的权衡选择Qwen2.5-3B-Instruct作为仿真模型。表 II不同模型规模的性能评估模型规模0.5B1.5B3B7BPDR (%)35.610137.443567.892568.4435延迟 (ms)326.8720277.3431232.1994238.2675推理延迟 (ms)1838.7702126.0632661.4673664.793图2PDR基线。图3延迟基线。图4PDR消融。图5延迟消融。图5说明随着移动性的增加所有协议的PDR都下降了。特别是当速度达到80米/秒时基线协议的PDR经历了显著的下降。相比之下PMKR-GPSR保持了相对稳定的PDR。这种改进得益于参数特定的检索机制和知识引导的推理策略它们使路由参数适应网络状态并减少了快速拓扑变化的影响。CF-GPSR通过整合多个转发度量以实现更全面的邻居评估从而获得了比GPSR更好的稳定性。QLGR通过强化学习改进了路由决策但其性能受到交互和策略收敛要求的制约。GPSR表现出最显著的性能下降因为它主要依赖地理距离而没有考虑动态链路特性。如图5所示所有协议的E2E延迟都随着移动性的增加而增加。由于环境复杂性的增加和频繁的拓扑变化其他协议遭受了更显著的性能下降。PMKR-GPSR通过利用知识引导的推理和参数特定的检索在高移动性场景下实现了最低的延迟。PMKR-GPSR能够识别出更能匹配当前网络状态的路由策略并避免不当的转发决策。因此它在动态条件下减少了路由失败、重传和低效的转发操作。图5和图5分别展示了不同消融变体的PDR和E2E延迟性能。与LLM-only相比w/o Multi-Index KG实现了改进的性能这表明检索到的路由经验提供了超越单纯LLM推理的有用指导。w/o Multi-Index和PMKR-GPSR之间的比较表明参数特定的检索为每个路由参数提供了更相关的经验减少了不相关信息的干扰并提高了优化精度。与w/o KG相比PMKR-GPSR实现了更好的性能这表明知识引导的推理将路由约束纳入了优化过程并防止了不合理的参数配置。这些结果验证了所提出框架的必要性该框架集成了参数特定的检索和知识引导的推理以实现在高度动态网络条件下的自适应路由优化。V. 结论本文提出了PMKR-GPSR一个基于LLM的GPSR优化框架。开发了一种参数特定的多索引检索机制以提高检索到的路由经验的相关性并引入了一个知识引导的约束图来规范路由参数的优化。仿真结果表明在高移动性场景下PMKR-GPSR比现有方法实现了更高的PDR和更低的E2E延迟。这些结果表明所提出的框架能够有效地感知动态网络变化并及时调整路由策略在高度动态的FANET环境中选择更合适的转发方案。
返回列表