尧图网站设计 尧图网站设计YAOTU DESIGN
ARTICLE DETAIL

资讯详情

深耕网站设计与一线实操的经验洞察。

一句话生成3D动作:Kimodo文本到动作(文字驱动)从零上手教程

一句话生成3D动作:Kimodo文本到动作(文字驱动)从零上手教程 一句话生成3D动作Kimodo文本到动作(文字驱动)从零上手教程【免费下载链接】kimodoOfficial implementation of Kimodo, a kinematic motion diffusion model for high-quality human(oid) motion generation.项目地址: https://gitcode.com/gh_mirrors/ki/kimodoKimodo是一款开源的文本到动作生成text-to-motion模型基于运动扩散模型motion diffusion model只需输入一句话——比如一个人向前走——就能生成高质量的3D 人体/机器人动作。它由 NVIDIA 在 700 小时光学校准动捕数据上训练同时支持文字驱动和关键帧、路径等约束控制并提供命令行与 Web 可视化两种使用方式是新手做文字驱动 3D 动作生成的理想入门工具。 什么是 Kimodo为什么值得上手KimodoKinematicMotionDiffusion的核心能力能力说明 文本生成动作一句自然语言描述 → 一段 3D 动作序列️ 约束控制全身关键帧、手脚末端位置、2D 地面路径/路点 三种骨架SOMA默认人体、Unitree G1机器人、SMPL-X️ 两种入口命令行kimodo_gen 浏览器交互式 Demo 多种导出NPZ、BVH、MuJoCo CSV、AMASS NPZ方便接入下游管线它的架构是一个两阶段 Transformer 去噪器先由文本嵌入和约束掩码共同条件化再由 Root Denoiser 预测根节点轨迹Body Denoiser 细化身体姿态 安装 Kimodo 的 3 个快速步骤硬件参考全 GPU 推理约需 17GB 显存显存小于 16GB 时可设置TEXT_ENCODER_DEVICEcpu把文本编码放到 CPU显存占用降到 3GB 以内。步骤 1准备 Hugging Face Token文本编码器依赖 Llama-3-8B 模型需要先在 HF 上获得访问权限然后登录hf auth login步骤 2安装方式 A推荐免克隆代码conda create -n kimodo python3.10 conda activate kimodo pip install kimodo[all] githttps://github.com/nv-tlabs/kimodo.git方式 B克隆源码适合想改代码的开发者git clone https://gitcode.com/gh_mirrors/ki/kimodo cd kimodo详细步骤见 安装文档 和 快速上手指南。步骤 3可选后台启动文本编码器服务kimodo_textencoder多次生成时共享编码器服务能显著提速。模型权重会在首次生成时自动下载无需手动管理。⚡ 一句话生成你的第一个 3D 动作安装完成后一条命令即可出动作kimodo_gen A person walks forward. \ --model Kimodo-SOMA-RP-v1 \ --duration 5.0 \ --output output关键参数完整说明见 CLI 文档源码在 kimodo/scripts/generate.py--model模型名默认Kimodo-SOMA-RP-v1想生成机器人动作就换Kimodo-G1-RP-v1--duration动作时长秒单段最长 10 秒--num_samples一次生成多个不同变体--bvhSOMA 模型可额外导出 BVH 文件--seed固定随机种子结果可复现多句提示词 连续动作用句号分隔时长按空格对应kimodo_gen A person walks forward. A person is walking backwards. \ --duration 5.0 4.0第二句会自动衔接第一句的结尾姿态实现平滑过渡。️ 交互式 Demo像剪视频一样编排动作执行kimodo_demo启动 Web 界面浏览器打开http://127.0.0.1:7860你会看到一个时间轴 3D 视口的编排界面核心玩法选模型SOMA人体/ G1机器人/ SMPL-X写提示词在底部 Prompts 轨道输入一段或多段文字如 A person walks forward and picks something up from the ground加约束在 Full-Body、2D Root、手脚末端等轨道上添加关键帧、路径路点点 Generate生成 1~N 个样本实时 3D 预览、调节播放速度、切换骨架/蒙皮显示还可以直接加载内置示例快速体验例如 完整关键帧示例示例列表与用法见 examples 说明。✍️ 5 个让文字驱动效果更好的提示词技巧官方给出的最佳实践详见 limitations 文档以 A person... 开头——与训练数据风格一致如 A person jumps and waves一个提示词只做 1~2 个动作长序列拆成多句按时间轴生成描述粒度适中A person walks. 太模糊逐关节描述又太长别超出训练分布走路、手势、舞蹈、游戏战斗、日常交互效果最好棒球挥棒这类没训练过的动作会翻车多句生成时每句都要能独立理解第二句不要写 Then the person stops要写完整的 A person walking comes to a stop⚠️ 已知限制单句最长 10 秒每类约束关键帧建议 20 个约束互相冲突时可能出现伪影。 生成的动作能用来干嘛SOMA→ NPZ / BVH导入动画引擎或 BVH 管线G1→ MuJoCo qpos CSV可直接在 MuJoCo 回放仓库自带 mujoco_load.py 示例脚本SMPL-X→ AMASS NPZ无缝接入现有 AMASS 生态格式转换可用kimodo_convert一键完成细节见 输出格式文档 和 motion_convert 文档。生成的运动还能直接喂给物理仿真/强化学习框架如 ProtoMotions、GEAR-SONIC为机器人训练提供动作数据——这正是文本 → 动作 → 策略链路的核心价值。 下一步想做什么去哪里命令行高级用法CFG 权重、约束文件CLI 文档约束格式定义constraints 文档Demo 各面板详解interactive_demo 文档Python API 直接调用kimodo/model/kimodo_model.py对比评测各模型benchmark 文档总结装好环境 → 一句kimodo_gen A person ...→ 拿到 NPZ 文件就是 Kimodo 最精简的三步上手路径。配合交互式 Demo 的可视化编排从一句话到可用的 3D 动作资产只需几分钟 【免费下载链接】kimodoOfficial implementation of Kimodo, a kinematic motion diffusion model for high-quality human(oid) motion generation.项目地址: https://gitcode.com/gh_mirrors/ki/kimodo创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表