尧图网站设计 尧图网站设计YAOTU DESIGN
ARTICLE DETAIL

资讯详情

深耕网站设计与一线实操的经验洞察。

Cosmos 实战:3 条命令生成第一个物理世界视频

Cosmos 实战:3 条命令生成第一个物理世界视频 Cosmos 实战3 条命令生成第一个物理世界视频【免费下载链接】cosmosNVIDIA Cosmos is an open platform of world models, datasets, and tools that enables developers to build Physical AI for robots, autonomous vehicles, smart infrastructure, and more.项目地址: https://gitcode.com/GitHub_Trending/cosmos7/cosmosCosmos 是面向 Physical AI 的物理世界视频生成平台提供 Text2World 与 Video2World 两类扩散世界基础模型一段文字或一张图就能生成 121 帧的仿真视频。给机器人造训练场、给自动驾驶生成 Corner Case 场景靠的就是这条链路。 最小路径5 分钟跑通第一条世界生成命令前提Ubuntu NVIDIA GPU 已装 Docker 与 NVIDIA Container Toolkit模型权重放在 Hugging Face需要一个 Read 权限的访问令牌。克隆仓库并构建环境镜像内置全部依赖构建一次即可 →git clone https://gitcode.com/GitHub_Trending/cosmos7/cosmos cd cosmos docker build -t cosmos . docker run -d --name cosmos_container --gpus all --ipchost -it -v $(pwd):/workspace cosmos docker attach cosmos_container登录并下载 7B 权重huggingface-cli login后跑下载脚本Token、提示上采样器与 Guardrail 一次拉齐Video2World 还需在 Pixtral-12B 模型页点 Agree and access repository→PYTHONPATH$(pwd) python cosmos1/scripts/download_diffusion.py \ --model_sizes 7B \ --model_types Text2World Video2World跑第一条生成命令仓库内置的仓库机器人场景直接出片 →PROMPTA sleek, humanoid robot stands in a vast warehouse filled with neatly stacked cardboard boxes on industrial shelves. PYTHONPATH$(pwd) python cosmos1/models/diffusion/inference/text2world.py \ --checkpoint_dir checkpoints \ --diffusion_transformer_dir Cosmos-1.0-Diffusion-7B-Text2World \ --prompt $PROMPT \ --offload_prompt_upsampler \ --video_save_name my_first_video确认产物输出的 mp4 与同名.log写在当前目录121 帧、默认 16:9生成结束前耐心等几分钟。 能力拆解扩散世界基础模型的三条主链路文本 → 视频Text2World 单条生成把一段场景描述渲染成可播放的世界模拟。PYTHONPATH$(pwd) python cosmos1/models/diffusion/inference/text2world.py \ --checkpoint_dir checkpoints \ --diffusion_transformer_dir Cosmos-1.0-Diffusion-7B-Text2World \ --prompt $PROMPT \ --offload_prompt_upsampler \ --video_save_name Cosmos-1.0-Diffusion-7B-Text2World--prompt场景描述官方建议 120 词左右超过 250 词会自动跳过上采样--offload_prompt_upsampler用完即释放 12B 上采样器80GB 卡跑 14B 必须加--disable_prompt_upsampler禁用自动扩写防止上采样器偏离你的原始意图图/视频 → 续写Video2World 条件生成用一帧图或一段短视频作条件让模型续写后续画面。PYTHONPATH$(pwd) python cosmos1/models/diffusion/inference/video2world.py \ --checkpoint_dir checkpoints \ --diffusion_transformer_dir Cosmos-1.0-Diffusion-7B-Video2World \ --input_image_or_video_path cosmos1/models/diffusion/assets/v1p0/video2world_input0.jpg \ --num_input_frames 1 \ --video_save_name Cosmos-1.0-Diffusion-7B-Video2World \ --offload_prompt_upsampler--num_input_frames只支持 1单帧或 9短视频决定条件强度--prompt上采样器启用时可省略——它由 Pixtral 看图自动写出禁用上采样器后此项必填--input_image_or_video_path仓库自带 3 张公路场景输入可直接复现批量任务JSONL 驱动的世界批量生成一次吃下多条 prompt产出整条数据管线。PYTHONPATH$(pwd) python cosmos1/models/diffusion/inference/text2world.py \ --checkpoint_dir checkpoints \ --diffusion_transformer_dir Cosmos-1.0-Diffusion-7B-Text2World \ --batch_input_path cosmos1/models/diffusion/assets/v1p0/batch_inputs/text2world.jsonl \ --video_save_folder outputs/Cosmos-1.0-Diffusion-7B-Text2World \ --offload_prompt_upsampler--batch_input_pathJSONL每行一个{prompt: ...}Video2World 批量任务每行是{visual_input: path.mp4}--video_save_folder批量输出的目录单条模式则用--video_save_name--diffusion_transformer_dir换Cosmos-1.0-Diffusion-14B-Text2World即可升档其余参数不变⚙️ 硬件适配24GB 到 80GB 的完整 offload 配置GPU显存推荐 offload 组合7B Text2World预期占用H10080GB--offload_prompt_upsampler74.0GB14B 需再加--offload_guardrail_modelsA10080GB--offload_prompt_upsampler --offload_guardrail_models57.1GBA10040GB再加--offload_text_encoder_model --offload_tokenizer38.3GBRTX 3090/409024GB五个 offload 全开24.4GB低配 24GB 卡的完整命令PYTHONPATH$(pwd) python cosmos1/models/diffusion/inference/text2world.py \ --checkpoint_dir checkpoints \ --diffusion_transformer_dir Cosmos-1.0-Diffusion-7B-Text2World \ --prompt $PROMPT \ --offload_tokenizer \ --offload_diffusion_transformer \ --offload_text_encoder_model \ --offload_prompt_upsampler \ --offload_guardrail_models质量与速度旋钮H100 单卡端到端参考7B 约 380 秒14B 约 590 秒--num_steps默认 3530–35 快速度↑45–50 精修质量↑--fps默认 2412–40 可调只改变播放节奏--height/--width支持 960x960、1280x704、704x1280 等宽高比换比例不用改其他参数❓ 高频问题速查Q下载模型脚本直接报 401 / 访问被拒A令牌权限设成了 Fine-grained → 去 Hugging Face 令牌设置把权限改为 Read重新huggingface-cli loginQ生成的人脸全部模糊参数里怎么关都关不掉AGuardrail 强制启用的后处理不可禁用 → 把 prompt 改为无人脸场景机器人、车辆、街道Q想生成更长的视频加--num_video_frames 241报错A当前版本固定 121 帧无其他选项 → 长视频改用 Video2World 拿输出再续写Q竖屏 720x1280 输出模糊变形A只支持 5 种宽高比 → 1:1960x960、4:3960x704、3:4704x960、16:91280x704、9:16704x1280Q批量任务跑起来后部分行被跳过AJSONL 行格式不对 → Text2World 每行必须含prompt字段Video2World 每行含visual_input禁用上采样器时两者都要有Q下载 14B 模型断网中断要重新拉几个 GAHugging Face 客户端支持断点续传 → 重跑download_diffusion.py已下载分片会跳过Q40GB 卡跑 14B 报 CUDA out of memoryA14B 全开 offload 也需约 39GB → 换 7B 全 offload24.4GB或上 80GB 卡 延伸方向后训练、多卡推理与视频 Tokenizer后训练用 NeMo 框架对预训练世界基础模型做下游微调先读 POST_TRAINING.md再看 diffusion 后训练指南。多卡推理Diffusion 系列支持 context parallel把扩散过程切到多卡近乎线性加速见 NeMo 推理指南。自回归分支4B/12B 基础模型支持从单帧或 9 帧输入扩展到 33 帧失败率比扩散模型更低的路径在 autoregressive README。视频 TokenizerCV8x8x8 连续 离散双路线可单独用于压缩与表征见 tokenizer README。建议从 7B Text2World 单条跑通再换 14B 与批量 JSONL最后按硬件表补 offload 组合。提示词先压到 120 词左右扩写跑偏时关掉--disable_prompt_upsampler手动改写。Cosmos 的主场是为机器人和自动驾驶批量生产视觉仿真场景的世界生成管线。完整参数与高级配置见 INSTALL.md、cosmos1/models/diffusion/README.md · 源码入口cosmos1/models/diffusion/inference/【免费下载链接】cosmosNVIDIA Cosmos is an open platform of world models, datasets, and tools that enables developers to build Physical AI for robots, autonomous vehicles, smart infrastructure, and more.项目地址: https://gitcode.com/GitHub_Trending/cosmos7/cosmos创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表