尧图网站设计 尧图网站设计YAOTU DESIGN
ARTICLE DETAIL

资讯详情

深耕网站设计与一线实操的经验洞察。

从零搭建Open-Sora视频生成平台:三步搞定你的第一段AI视频

从零搭建Open-Sora视频生成平台:三步搞定你的第一段AI视频 从零搭建Open-Sora视频生成平台三步搞定你的第一段AI视频【免费下载链接】Open-SoraOpen-Sora: Democratizing Efficient Video Production for All项目地址: https://gitcode.com/GitHub_Trending/op/Open-Sora是不是还在羡慕别人轻松用AI生成大片质感的视频自己却连环境都搭不起来Open-Sora是一个完全开源的视频生成项目主打人人都能高效产出高质量视频它把文生视频、图生视频的完整流程都封装好了你只需要一条命令就能调用。本文会带你在自己的显卡上跑通整个视频生成平台从环境搭建、模型下载到生成第一段视频全程手把手读完你就能拥有自己的AI视频生产能力。一、先看目标我们要做出什么效果在动手之前先明确我们要达成的结果这样每一步都有奔头。Open-Sora当前最新版本是2.0参数量11B一个模型同时支持256px和768px分辨率的文生视频与图生视频。下面这张图就是项目自带的一张参考图稍后我们会用它来生成一段猪在泥潭里打滚的视频作为图生视频的实战案例官方评测显示Open-Sora 2.0在VBench基准上已经把与OpenAI Sora的差距从4.52%缩小到了0.69%也就是说用开源方案也能接近顶级闭源模型的生成质量。我们要走通的路线很清晰搭环境 → 下模型 → 跑生成。本文会采用先看效果、再拆步骤的思路每一步都给你可预期的结果避免盲目踩坑。二、开工前核对一遍你的机器达标了吗动手之前先做个体检避免装到一半才发现硬件不满足要求。Open-Sora基于Python和PyTorch构建需要一台带NVIDIA显卡的Linux机器项目最低要求推荐配置操作系统LinuxUbuntu 20.04Ubuntu 22.04Python3.103.10NVIDIA显卡显存16GB以上24GB以上CUDA12.112.1显卡显存是最关键的一条。16GB显存跑256px分辨率刚好够用如果只有8GB可以加上后面的--offload True参数省显存但速度会慢一些。三、五分钟搭好运行环境环境搭建是整个流程里最容易出错的一步我们把它拆成三个小动作每步都有验证方法。第一步创建独立虚拟环境建议用conda避免和系统里其他Python项目互相污染依赖conda create -n opensora python3.10 conda activate opensora第二步拉取项目代码Open-Sora的官方仓库地址为 https://gitcode.com/GitHub_Trending/op/Open-Sora 执行git clone https://gitcode.com/GitHub_Trending/op/Open-Sora cd Open-Sora第三步安装核心依赖项目依赖在requirements.txt里一条命令装完基础包pip install -v .再补上两个提速神器它们是保证推理速度的关键pip install xformers0.0.27.post2 --index-url https://download.pytorch.org/whl/cu121 pip install flash-attn --no-build-isolation小贴士第二条命令中的cu121对应CUDA 12.1如果你的CUDA版本不同请到PyTorch官网查对应的--index-url。执行后的预期效果pip install -v .输出Successfully installed结尾且能执行以下命令不报错python -c import torch, colossalai, mmengine; print(依赖OK)看到依赖OK就说明环境没问题了我们进入下一步。四、三步完成模型权重下载Open-Sora推理时需要一套模型文件主模型VAE文本编码器统一放在./ckpts目录下。官方推荐用HuggingFace下载pip install huggingface_hub[cli] huggingface-cli download hpcai-tech/Open-Sora-v2 --local-dir ./ckpts如果你在国内下载速度慢强烈建议改用ModelScope速度会快得多pip install modelscope modelscope download hpcai-tech/Open-Sora-v2 --local_dir ./ckpts模型文件比较大下载时可以去泡杯咖啡。下载完成后./ckpts目录下应该能看到Open_Sora_v2.safetensors、hunyuan_vae.safetensors等文件模型的默认读取路径就写在各推理配置里比如configs/diffusion/inference/256px.py中指定的./ckpts/Open_Sora_v2.safetensors。常见报错如果出现No such file or directory: ./ckpts/Open_Sora_v2.safetensors说明模型没下载到位或路径不对检查--local-dir目录和运行命令时所在的目录即可。五、见证奇迹生成你的第一段AI视频环境就绪、模型就位现在进入最激动人心的环节。用一句话生成下雨的大海Open-Sora的推理入口是scripts/diffusion/inference.py配合不同的配置文件切换模式。先来最简单的文生视频一条命令搞定torchrun --nproc_per_node 1 --standalone scripts/diffusion/inference.py configs/diffusion/inference/t2i2v_256px.py --save-dir samples --prompt raining, sea命令解析t2i2v_256px.py是文本生成图片再生成视频的推荐配置它会先用Flux模型把prompt变成一张高质量首帧图再让视频模型动起来生成结果保存在samples目录。执行后的预期效果终端滚动输出进度条约1分钟取决于显卡后在samples目录下出现一段256px的mp4视频画面是下雨的海面。显存紧张的话在命令末尾追加--offload True即可开启内存卸载模式。一张图让猪动起来图生视频实战Open-Sora的杀手锏其实是图生视频。我们拿项目自带的assets/texts/i2v.png这张图做实验——就是文章开头那张猪的图片用一句prompt描述它要做的动作torchrun --nproc_per_node 1 --standalone scripts/diffusion/inference.py configs/diffusion/inference/256px.py --cond_type i2v_head --prompt A plump pig wallows in a muddy pond on a rustic farm, its pink snout poking out as it snorts contentedly --ref assets/texts/i2v.png其中--cond_type i2v_head表示以图片作为视频开头帧的条件模式--ref指定参考图片路径。执行后的预期效果生成一段猪在泥塘里惬意打滚的视频动作连贯自然——这就是图生视频的魅力你给它一张静态图它还你一段动态故事。项目还提供了配套的CSV批量生成方式把prompt和图片路径写进表格就能批量产出。示例文件assets/texts/example.csv文生视频和assets/texts/i2v.csv图生视频可以直接拿来练手torchrun --nproc_per_node 1 --standalone scripts/diffusion/inference.py configs/diffusion/inference/t2i2v_256px.py --save-dir samples --dataset.data-path assets/texts/example.csv六、进阶玩法按需定制你的视频跑通基础流程后你已经能掌控Open-Sora了剩下的就是按需调整参数。调整分辨率、时长与画面比例一行参数即可改变视频规格torchrun --nproc_per_node 1 --standalone scripts/diffusion/inference.py configs/diffusion/inference/t2i2v_256px.py --save-dir samples --prompt raining, sea --aspect_ratio 16:9 --num_frames 65参数说明--aspect_ratio可选16:9、9:16、1:1、2.39:1控制横竖屏--num_frames视频帧数必须是4k1且小于129比如65、97--motion-score控制画面运动强度取值1到7默认4想生成768px高清视频切换到768px配置文件配合同样一条命令torchrun --nproc_per_node 1 --standalone scripts/diffusion/inference.py configs/diffusion/inference/t2i2v_768px.py --save-dir samples --prompt raining, sea768px对单卡压力较大官方给的数据是单卡H100约需27分钟而用8卡并行可以压缩到5分钟内torchrun --nproc_per_node 8 --standalone scripts/diffusion/inference.py configs/diffusion/inference/768px.py --prompt raining, sea多卡模式自动启用ColossalAI的序列并行配置见configs/diffusion/inference/plugins/sp.py无需你手动切分。让结果可复现固定随机种子对做实验、调参的同学来说这个功能很实用torchrun --nproc_per_node 1 --standalone scripts/diffusion/inference.py configs/diffusion/inference/t2i2v_256px.py --save-dir samples --prompt raining, sea --sampling_option.seed 42 --seed 42固定种子后同样prompt每次生成的结果基本一致方便横向对比参数效果。加--num-sample k还能对每个prompt一次生成k个样本。七、常见问题速查现象原因解决办法CUDA out of memory显存不足加--offload True或降低分辨率/帧数ckpts文件找不到模型没下载或目录不对检查./ckpts下是否有safetensors文件模型下载超时网络问题改用ModelScope或设置HF_ENDPOINThttps://hf-mirror.comxformers安装失败CUDA版本不匹配按实际CUDA版本更换--index-url多卡报错NCCL错误多机通信问题确认各卡驱动版本一致改用单卡先验证八、写在最后下一步往哪走到这里你已经拥有了一套完整的本地AI视频生成平台环境一次装好、模型三步下完、两条命令就能生成文生视频或图生视频。再往后可以按自己的兴趣深入想训练自己的模型官方文档docs/train.md提供了从数据集处理到微调的全流程指南支持基于Open-Sora v2继续微调想深挖原理项目附带了docs/report_01.md到report_04.md系列技术报告从VAE到训练策略都有详细解读想加速推理探索configs/diffusion/inference/下的high_compression.py高压缩率配置体验更大的时间与显存收益视频生成的世界刚刚打开Open-Sora给了我们一把完全开源的钥匙。如果你照着本文成功跑出了第一段视频欢迎点赞、收藏把经验分享给更多想上手的伙伴也欢迎关注我们获取更多AI实战教程。【免费下载链接】Open-SoraOpen-Sora: Democratizing Efficient Video Production for All项目地址: https://gitcode.com/GitHub_Trending/op/Open-Sora创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表