尧图网站设计 尧图网站设计YAOTU DESIGN
ARTICLE DETAIL

资讯详情

深耕网站设计与一线实操的经验洞察。

ProPlay:构建程序化世界模型,实现LLM智能体的自我演化与自主决策

ProPlay:构建程序化世界模型,实现LLM智能体的自我演化与自主决策 1. 项目概述当LLM智能体学会“自己动手丰衣足食”最近在AI智能体领域一个概念正从实验室走向更广泛的讨论让大型语言模型LLM驱动的智能体不再仅仅依赖预设的脚本或有限的API调用而是能够在一个动态、开放、甚至未知的世界里通过自我探索和迭代来学习和进化。这正是“ProPlay: Procedural World Models for Self-Evolving LLM Agents”这个项目标题所指向的核心愿景。简单来说它探讨的是如何为LLM智能体构建一个“程序化世界模型”让智能体能够在这个模型中进行“自我演化”。听起来有点抽象让我用一个更生活化的类比来解释。想象一下你是一个刚出生的婴儿被丢进一个完全陌生的房间。你不知道重力是什么不知道桌子是硬的也不知道火是烫的。传统的AI训练方式就像是有一个全知全能的“上帝”手把手教你“这是桌子不能撞那是火不能摸。” 而“ProPlay”的思路则是给你一个可以安全“做梦”或“模拟”的沙盒。在这个沙盒里你可以无数次地尝试去撞虚拟的桌子、摸虚拟的火通过自己“想象”中的交互结果比如撞上去会疼摸上去会烫来构建起对这个房间物理规则和物体属性的内部认知模型。这个你自己构建的、关于世界如何运作的认知模型就是“世界模型”。而“程序化”意味着这个世界不是静态的、有限的几个场景而是可以根据规则无限生成新的、复杂的挑战和情境供你持续学习和适应。所以这个项目本质上是在解决当前LLM智能体发展的一个核心瓶颈缺乏对物理和社会世界动态、因果关系的深层理解与内部表征。LLM虽然拥有海量的知识但这些知识多是静态的、符号化的关联。它知道“玻璃杯掉在地上会碎”但这更多是基于文本统计规律而非基于对重力、材质脆性、动量等物理法则的内在模拟。当面临一个全新的、需要多步推理和物理交互的复杂任务时比如“用房间里的材料做一个简易捕鼠器”仅凭文本知识的LLM智能体很容易“纸上谈兵”行动方案漏洞百出。“ProPlay”提出的路径就是为智能体配备一个可学习、可进化的“程序化世界模型”。这个模型就像一个内部的、简化的模拟器智能体可以在其中进行“思想实验”或“规划推演”预测自己行动的可能后果从而在真实行动前就筛选出更可行的方案。更重要的是这个模型本身会随着智能体与真实或模拟环境的交互经验而不断更新和演化使得智能体越来越“老练”。这不仅仅是让智能体“更聪明”而是赋予其一种元认知和自适应能力使其能在非结构化、开放式的环境中如复杂的游戏、机器人操作、科学研究探索实现长期、自主的目标追求。接下来我将深入拆解这个项目的核心思路、技术实现的关键难点、一个可行的实操框架以及在实际探索中必然会遇到的“坑”和解决技巧。无论你是AI研究员、算法工程师还是对智能体未来充满好奇的开发者相信这篇深度解析都能为你提供扎实的参考。2. 核心架构解析程序化世界模型如何运转要理解ProPlay我们必须先拆解其两大支柱“程序化世界模型”和“自我演化智能体”。它们并非独立存在而是构成了一个紧密耦合、相互驱动的闭环系统。2.1 程序化世界模型不只是环境模拟器世界模型的概念在强化学习和控制论中由来已久其核心是学习环境的状态转移动力学给定当前状态和智能体的动作预测下一个状态和奖励。但ProPlay中的“程序化世界模型”有更丰富的内涵。首先它是“程序化”生成的。这意味着世界模型并非学习一个固定的、数据集中呈现的环境而是学习一套生成环境的规则或程序。例如在一个建筑类任务中它学习的不是成千上万张具体的房屋图片而是学习房屋的结构语法如“墙壁支撑屋顶”、“门窗开在墙上”的规则和物理参数材质强度、承重关系。这样模型就能根据任务需求动态“想象”出无数种符合物理和语法规则的新场景用于训练或规划。这极大地提升了数据的多样性和泛化能力避免了在有限场景上的过拟合。其次它是多模态和可抽象的。一个强大的世界模型不应只处理像素或低层状态。对于LLM智能体而言世界模型需要能够处理并关联文本描述、物理属性、空间关系、社会常识等多模态信息。它可能将高维的原始观察如图像、文本指令压缩成一个抽象的、包含关键语义和因果关系的潜空间表示。智能体在这个潜空间中进行规划和推理效率远高于在原始数据层面操作。技术实现上这样一个模型通常是一个深度生成模型如变分自编码器VAE、扩散模型与动力学预测模型如循环神经网络RNN、Transformer的结合体。生成模型负责对世界状态进行压缩和重建而动力学模型则在潜空间中预测状态转移。训练数据来源于智能体与环境的交互历史状态、动作、新状态、奖励序列。注意构建程序化世界模型最大的挑战在于“忠实性”与“抽象性”的权衡。模型需要足够抽象以进行高效推理但又不能过度简化以至于丢失了影响任务成败的关键因果细节。例如在“搭积木”任务中忽略积木间的微小摩擦力可能导致规划出的动作在实际中根本无法实现。2.2 自我演化智能体基于模型的规划与学习拥有了世界模型智能体如何利用它进行“自我演化”这个过程可以概括为“在模型中学习在现实中验证并迭代更新两者”。核心循环如下探索与收集数据智能体在初始阶段或周期性地在真实环境或一个基础模拟器中执行随机或有导向的探索动作收集大量的状态-动作-转移数据。世界模型训练与更新利用收集到的数据训练或微调程序化世界模型使其预测能力越来越接近真实环境动力学。模型内规划当接到一个新任务时智能体不再直接尝试真实动作而是首先在其内部的世界模型中进行“推演”。它可以使用诸如蒙特卡洛树搜索MCTS、基于梯度的轨迹优化或LLM引导的符号规划等方法在世界模型生成的无数虚拟情景中搜索能够达成任务目标的动作序列。由于是在内部模型中进行这种搜索成本极低且可以并行进行大量试错。动作执行与验证将规划出的最优或高概率成功动作序列在真实环境中执行。差异分析与模型修正对比世界模型的预测结果与真实执行结果。如果存在显著差异例如模型预测积木塔能稳住实际却倒了这些差异就是最宝贵的学习信号。智能体需要分析差异原因并用新的数据更新世界模型修正其错误认知。策略提炼与固化将在世界模型中验证有效的成功策略提炼成更直接、更快速的策略网络或价值函数用于后续类似任务的快速响应。这个循环使得智能体能够主动地通过规划发现自身知识世界模型的不足定向地通过真实交互收集数据来修补不足从而实现像生物一样通过经验持续学习和进化的能力。2.3 LLM在其中的角色推理引导与先验知识库那么LLM在这个框架中扮演什么角色它并非被世界模型取代而是与之协同工作发挥其独特优势。高层任务分解与目标设定LLM擅长理解复杂的自然语言指令并将其分解为一系列具体的、可操作的子目标。例如接到指令“为我准备一份健康的早餐”LLM可以将其分解为“检查冰箱食材”、“设计菜谱”、“操作厨具”等子任务并为每个子任务设定成功标准。为世界模型提供语义先验在智能体与某个新环境交互的初期真实数据非常稀少。此时LLM中蕴含的常识如“水是湿的”、“金属导电”可以作为初始化世界模型的强先验加速其学习过程。我们可以将文本常识“编译”或“蒸馏”到世界模型的结构或初始参数中。引导模型内规划在纯数值化的规划搜索如MCTS中搜索空间可能巨大且盲目。LLM可以作为一个“想象力引导器”提出合理的假设性动作“也许可以推一下那个箱子”或者对规划过程中的中间状态进行语义评估“这个状态看起来离目标更近了”从而大幅缩小搜索范围提高规划效率。解释差异与生成修正假设当世界模型的预测与现实出现偏差时LLM可以介入分析。例如真实执行中机器人抓取物体失败。LLM可以结合场景描述生成可能的假设“模型可能高估了夹爪的摩擦力”或者“物体表面可能有油污这是模型未考虑的”。这些文本假设可以指导更有针对性的数据收集和模型修正方向。因此在ProPlay的愿景中LLM、世界模型和强化学习策略共同构成了一个“三位一体”的认知架构LLM提供符号化、常识性的高层指导世界模型提供物理性、因果性的内部模拟强化学习策略负责低层、熟练的动作执行。三者通过紧密耦合实现从语言理解到物理实现的闭环。3. 关键技术点与实现路径拆解将ProPlay的宏伟蓝图落地需要攻克一系列关键技术。这里我们抛开过于前沿的学术构想聚焦于一个相对务实、可逐步实现的路径并深入每个环节的实操细节。3.1 构建轻量级、可微分的程序化世界模型对于许多务实的研究者或工程师来说从头构建一个能模拟复杂物理世界的模型是极其困难的。一个更可行的切入点是从特定、受限但有用的领域开始。领域选择建议2D网格世界游戏如《推箱子》、《扫地雷》。状态空间离散且小规则明确是验证算法原型的绝佳沙盒。桌面操作任务模拟一个机械臂在桌面上抓取、摆放积木、开瓶盖等。物理相对简单但涉及连续控制和多物体交互。文本冒险游戏状态完全由文本描述动作是文本命令。世界模型本质上是一个“故事预测器”给定当前描述和动作预测下一个场景描述。这非常适合LLM与世界模型结合。模型架构选型对于视觉-物理世界一个经典的架构是“视觉前向动力学模型”。编码器Encoder使用卷积神经网络CNN或Vision TransformerViT将当前时刻的观察图像编码为潜向量z_t。动作嵌入Action Embedding将智能体的动作如关节角度、离散命令也编码为一个向量。动力学核心Dynamics Core一个循环网络如LSTM、GRU或Transformer接收[z_t, a_t]预测下一个状态的潜向量z_{t1}。解码器Decoder另一个神经网络通常是反卷积网络或扩散模型将z_{t1}解码为预测的下一帧图像o_{t1}。奖励预测器可选一个小的多层感知机MLP从z_t或z_{t1}中预测预期的奖励r_t。训练目标最小化预测图像o_{t1}与真实下一帧图像之间的重构误差如均方误差MSE或感知损失。同时如果包含奖励预测也最小化奖励预测误差。程序化如何体现关键在于训练数据的构成。我们不是在一个固定场景下收集数据而是通过一个程序化内容生成器随机生成大量在规则内变化的场景如不同布局的房间、不同形状的积木、不同位置的障碍物然后让智能体在其中交互。这样训练出的模型就内化了生成这些场景的“程序”或规则分布从而具备了泛化到新生成场景的能力。实操心得在训练初期世界模型的预测会非常模糊。不要期望它一开始就能预测清晰的未来图像。一个有效的技巧是逐步增加预测跨度。先训练预测下一帧t1稳定后再尝试预测下两帧t2以此类推。同时在潜空间z上施加约束如KL散度项使其接近标准正态分布可以鼓励模型学习到更结构化、更具解释性的状态表示这对后续的规划至关重要。3.2 集成LLM从文本指令到模型参数与规划引导让LLM与世界模型对话是项目成败的关键。这里有两个主要的集成层面层面一利用LLM知识初始化或约束世界模型。假设我们的领域是“厨房物品整理”。在收集任何真实机器人数据之前我们可以利用LLM如GPT-4生成大量的常识关系三元组(杯子 通常放在 橱柜或桌面上) (菜刀 是 锋利的) (冰箱 用于 储存易腐食物) (玻璃制品 属性 易碎)这些三元组可以被转化为一种知识图谱。然后在设计世界模型的动力学核心时我们可以引入一种图神经网络GNN模块让物体节点的表示在状态转移过程中受到这张先验知识图谱的约束。例如模型在预测“杯子”的下一个位置时会倾向于将其预测到“橱柜”或“桌面”附近而不是“地板下”。这相当于把LLM的符号知识“注入”到世界模型的几何与物理推理中。层面二LLM作为规划阶段的推理协处理器。在模型内规划时纯粹的数值搜索如MCTS可能效率低下。我们可以设计一个交替执行循环LLM提出假设性计划将当前世界模型的潜状态z_t解码成一段文本描述这需要训练一个潜向量到文本的映射或者直接用VLM描述图像连同任务指令一起输入LLM。LLM输出一个初步的、分步骤的动作计划草案。例如“步骤1走向冰箱。步骤2打开冰箱门。步骤3取出牛奶。”世界模型进行物理可行性验证将LLM提议的每个步骤转化为具体的动作参数如“走向冰箱”转化为目标坐标和路径点在世界模型中快速推演。世界模型会判断从当前位置到冰箱的路径上是否有障碍打开冰箱门的动作是否会导致门撞到其他物体取牛奶时机械臂的轨迹是否可行反馈与修正将世界模型验证中发现的问题如“路径被椅子阻挡”、“开门空间不足”反馈给LLM。LLM根据反馈修正计划“步骤1先将椅子移开。步骤2走向冰箱...”。迭代优化重复步骤2和3直到世界模型验证通过一个完整的、物理上可行的计划。这个过程结合了LLM的常识性、创造性规划和世界模型的物理真实性检验实现了“思想”与“现实”的碰撞与调和。3.3 实现自我演化的训练循环设计自我演化的核心是建立一个自动化的数据收集-模型更新-策略改进的循环。这里给出一个简化的训练框架伪代码并解释关键参数# 伪代码框架 class SelfEvolvingAgent: def __init__(self, world_model, policy, llm_agent, env): self.wm world_model # 程序化世界模型 self.policy policy # 行动策略网络可初始化为随机 self.llm llm_agent # LLM接口 self.env env # 真实或基础模拟环境 self.replay_buffer [] # 经验回放池 def evolve_cycle(self, task_instruction, num_cycles): for cycle in range(num_cycles): # 阶段1: 在真实环境探索/执行收集数据 real_data self.explore_in_real_env(task_instruction) self.replay_buffer.extend(real_data) # 阶段2: 用新数据更新世界模型 self.update_world_model(self.replay_buffer) # 阶段3: 在世界模型中进行规划优化策略 # 3.1 LLM根据任务和当前状态提出多个候选计划 candidate_plans self.llm.propose_plans(task_instruction, self.wm.current_state_desc) best_plan None best_value -inf for plan in candidate_plans: # 3.2 在世界模型中推演每个计划 simulated_trajectory, total_reward self.wm.rollout(plan) # 3.3 选择预期奖励最高的计划 if total_reward best_value: best_value total_reward best_plan plan # 阶段4: 将最佳计划提炼为策略网络的训练目标 # 即让策略网络学会输出能导致类似成功轨迹的动作 self.improve_policy_via_imitation(best_plan, simulated_trajectory) # 阶段5: 用更新后的策略在真实环境进行验证性执行收集可能的新差异数据 validation_data self.execute_plan_in_real_env(best_plan) # 如果验证结果与模型预测差异大这些数据优先级更高加入回放池 if self.check_prediction_error(validation_data) threshold: self.replay_buffer.append(validation_data)关键参数与设计选择探索策略 (explore_in_real_env):初期应采用高随机性的探索如ε-greedy来广泛收集数据。中后期可以结合基于世界模型的“好奇心驱动”探索即主动去访问模型预测不确定性高的状态区域以快速修正模型认知盲区。世界模型更新频率 (update_world_model):不宜每个周期都从头训练。通常采用在线学习或小批量定期微调的方式。当回放池中新增数据积累到一定量如1000条新转移或预测误差持续较高时触发一次模型更新。规划深度与广度 (wm.rollout):在世界模型中推演的步长horizon和并行模拟的数量num_simulations是效率与效果的关键权衡。初期任务简单可以浅规划、多模拟。后期任务复杂可能需要更深的规划但可以通过LLM提出的计划作为“启发”只对最有希望的少数分支进行深度推演。策略改进方式 (improve_policy_via_imitation):最简单的是行为克隆Behavior Cloning即用成功轨迹中的状态动作对直接监督训练策略网络。更高级的做法是使用逆强化学习IRL或生成对抗模仿学习GAIL从成功轨迹中反推出奖励函数再用强化学习训练策略这样学到的策略更鲁棒。4. 实操挑战与经典问题排查指南在实际动手构建这样一个系统时你会遇到一系列教科书上不会详细提及的挑战。以下是我从类似项目实践中总结出的常见“坑”及其应对策略。4.1 世界模型预测的累积误差与漂移问题这是最经典也最棘手的问题。世界模型在单步预测上可能很准确但当用于多步长序列推演rollout时微小的误差会逐步累积导致推演出的未来状态严重偏离真实情况变得“虚幻”或“失真”。现象在模型内规划出一条完美的抓取轨迹但实际执行时机器人却抓空了。回溯发现模型在推演到第10步时对物体位置的预测已经偏离真实位置几个厘米。排查与解决思路诊断误差来源首先区分是模型偏差系统性预测不准还是模型方差预测不稳定。计算在固定状态-动作对上模型多次预测的方差。如果方差大说明模型训练不稳定或容量不足需要更多数据、更长的训练时间或调整模型正则化。引入不确定性估计让世界模型不仅输出预测的状态还输出预测的不确定性如方差。在规划时倾向于选择那些模型预测不确定性低的路径。对于高不确定性区域则触发真实环境探索。使用短视规划与重规划不要依赖一次长达100步的推演。采用模型预测控制MPC框架每次只规划未来N步如N5的动作序列只执行第一步然后用新的真实观察更新状态并立即基于新状态重新规划。这就像开车你不会规划好全程每一个方向盘角度而是不断看路、不断微调。混合真实数据与合成数据在长序列推演中定期将推演出的状态“锚定”回真实数据。例如每推演K步就用当前预测的状态在真实数据集中寻找最相似的K步之前的状态然后用真实的后继状态来部分纠正后续推演。这有点像在梦境中不时触摸一下现实以保持清醒。正则化潜空间在训练世界模型时对潜向量z施加强烈的正则化如VQ-VAE中的向量量化或β-VAE中较大的β值迫使它学习到更紧凑、更离散化的状态表示。离散化的表示在长程推演中往往更稳定不易发生连续空间中的微小漂移。4.2 LLM规划与物理验证的“语义鸿沟”LLM基于文本常识提出的计划在转化为具体动作参数时常常因为细节缺失或物理不精确而失败。现象LLM提议“把书放到书架上”世界模型验证失败。原因可能是LLM没有指定是哪本书、书架的哪一层、以什么姿态放。转化成的动作参数如机械臂末端的抓取点、放置点是随意或默认的导致在实际物理推演中发生碰撞或放置不稳。解决策略细化提示工程在要求LLM生成计划时必须强制其输出可操作的、具体的步骤。提示词应包含模板请将任务“{任务}”分解为具体步骤。每个步骤必须明确 1. 操作对象如“那本红色的厚书” 2. 操作动作如“抓取”、“放置” 3. 目标位置/状态如“书架从上往下数第二层的空位书脊朝外” 4. 可选关键约束如“避免碰到旁边的花瓶”建立“常识-物理”映射库预先构建一个小型数据库将常见的文本描述映射到近似的物理参数。例如“轻轻地”可能映射为最大抓取力/速度的某个百分比“稳固地”可能映射为需要特定的接触面和支持点。这个映射库可以作为LLM输出到动作参数转换器的补充输入。迭代式询问当世界模型检测到计划不可行时不要简单拒绝。设计一个反馈循环让LLM根据具体的失败原因进行修正。例如世界模型反馈“抓取点计算失败目标物体‘红色的厚书’在当前位置不可见或被遮挡。” LLM可以据此修正计划“步骤1先移动到左侧获得一个能看清书桌的视角。步骤2重新识别‘红色的厚书’的位置。步骤3...”让LLM学习使用“物理API”可以给LLM提供一组简化但关键的物理查询函数描述如check_collision(object_A, object_B),get_stable_placement(object, surface),estimate_force_required(grip_object, target_object)。在生成计划时鼓励LLM在思维链Chain-of-Thought中“调用”这些虚拟API来验证自己的想法从而输出物理上更合理的计划。4.3 训练不稳定与模式崩溃在联合训练世界模型、策略网络以及处理来自LLM的异构信号时整个系统很容易出现训练不稳定、策略退化或世界模型陷入无意义的模式崩溃例如预测出的图像总是模糊一片。经典问题速查表问题现象可能原因排查与解决步骤策略性能突然断崖式下跌1. 世界模型更新后与策略之前学习的“环境”发生剧变。2. 经验回放池中出现了大量导致失败的异常数据。1.冻结策略单独更新世界模型更新世界模型时固定策略网络参数用旧策略收集的数据来更新模型。待模型稳定后再解冻策略进行学习。2.优先级经验回放为数据样本赋予优先级优先使用那些TD误差大即模型预测不准或导致高奖励/高惩罚的数据进行训练。3.策略平滑更新使用软更新如Polyak averaging或信任域方法如PPO来限制策略每次更新的幅度避免剧烈震荡。世界模型预测始终模糊1. 模型容量不足。2. 训练目标过于强调潜空间的连续性牺牲了重建清晰度。3. 数据本身噪声大或差异小。1.增加模型参数/层数或使用更强大的主干网络如ResNet, Transformer。2.调整损失函数权重增加重建损失的权重或引入感知损失、对抗损失如结合GAN来提升生成图像的清晰度。3.数据预处理与增强确保输入数据标准化并可以适当使用数据增强如随机裁剪、颜色抖动来提升模型鲁棒性但需注意增强不应改变物理本质。LLM的引导使智能体行为僵化LLM提供的计划过于具体或单一限制了策略的探索空间导致学到的策略泛化能力差。1.将LLM计划视为“建议”而非“命令”策略网络在学习时不仅学习模仿LLM计划对应的动作还要加上一个鼓励探索的熵正则项。2.多样化LLM输出通过调整温度参数或采样多个计划让LLM为同一任务提供多种不同的解决方案丰富策略的学习数据。3.分层策略高层策略接受LLM的抽象目标底层策略自主决定如何实现该目标的具体动作。4.4 计算资源与效率的平衡构建和运行包含世界模型推演和LLM调用的系统计算开销巨大。优化策略世界模型蒸馏训练一个大型、精确的“教师”世界模型然后将其知识蒸馏到一个小型、快速的“学生”模型中专门用于在线规划。异步并行规划利用GPU的并行能力同时在世界模型中推演数百甚至数千条不同的轨迹以在短时间内评估大量候选计划。LLM调用优化对LLM进行轻量化微调LoRA, QLoRA或使用更小但针对规划任务优化的开源模型如DeepSeek-Coder用于代码生成类任务规划。缓存常见的LLM查询结果。将多次连续的LLM交互整合成一次包含多轮对话历史的提示减少调用次数。课程学习从简单的任务和环境开始训练逐步增加复杂度。这样世界模型和策略在早期就能快速获得正面反馈建立基础能力避免在复杂任务中一开始就陷入茫然浪费大量计算资源在无效探索上。5. 未来展望与进阶思考虽然ProPlay是一个前沿的研究方向距离通用人工智能还有漫长的路但它为我们构建更强大、更自主的AI系统提供了清晰的技术路径。从我个人的实践和观察来看这个领域有几个值得深入探索的方向其一世界模型的“抽象阶梯”问题。当前的世界模型大多学习低层级的感知-动作动力学。但人类思考时会在不同抽象层级间灵活切换。比如规划旅行时我们可能先在高层级想“坐飞机去北京”然后在中间层级规划“打车去机场、办理登机”最后在低层级执行“伸手开车门、系安全带”。如何让智能体的世界模型也具备这种多层级抽象能力并能根据任务需求自动选择合适的层级进行规划是一个关键挑战。或许需要结合符号AI的方法构建一个分层级的、符号与亚符号混合的世界模型。其二社会智能与多智能体世界模型。真实世界充满其他智能体人或其他AI。一个真正“自我演化”的智能体需要能够对其他智能体的行为进行建模和预测。这意味着世界模型需要升级为“多智能体世界模型”能够模拟他者的目标、信念和可能的行为。这涉及到逆强化学习、理论博弈论等更复杂技术的融合。其三从模拟到现实的“零样本”迁移。最终我们希望智能体在程序化生成的世界模型中学到的技能能无缝迁移到真实的物理世界。这要求世界模型不仅学习具体的物理参数更要抓住任务不变的、本质性的因果结构和功能关系。基于物理的模拟PBS与基于学习的世界模型的结合以及域随机化技术的深入应用将是突破这一瓶颈的重点。构建ProPlay这样的系统就像在教一个AI“学徒”如何通过自己的“思考”和“实践”来成长。这个过程充满挑战但也极具魅力。每一次模型预测与现实的偏差每一次LLM天马行空的想法被物理定律驳回都是这个智能体认知边界的一次拓展。这条路没有捷径需要我们在算法、工程和理论上的持续深耕。但可以预见随着这些技术的成熟我们将在游戏NPC、工业自动化、家庭服务机器人乃至科学研究助手等领域看到真正具备自适应和学习能力的AI伙伴出现。
返回列表