尧图网站设计 尧图网站设计YAOTU DESIGN
ARTICLE DETAIL

资讯详情

深耕网站设计与一线实操的经验洞察。

SadTalker 部署指南:一张照片到会说话视频的三步走

SadTalker 部署指南:一张照片到会说话视频的三步走 SadTalker 部署指南一张照片到会说话视频的三步走【免费下载链接】SadTalker[CVPR 2023] SadTalkerLearning Realistic 3D Motion Coefficients for Stylized Audio-Driven Single Image Talking Face Animation项目地址: https://gitcode.com/GitHub_Trending/sa/SadTalker一张照片加一段录音就能产出会张嘴、会转头、会眨眼的说话视频——这就是 SadTalker一个音频驱动的单图说话人脸动画工具CVPR 2023。本指南只围绕一件事先快速拿到第一个成品再搭好本地环境最后用参数把效果调到满意。全文默认你只熟悉基础的 git 操作不涉及深度学习细节。一键镜像跑出第一个说话视频验证效果最快的方式是社区维护的 Docker 镜像不用装 Python、不用装 PyTorch代价是机器需要一块 NVIDIA 显卡。# 拉取社区镜像把音频和照片映射进容器直接出片 docker run --gpus all --rm -v $(pwd):/host_dir wawa9000/sadtalker \ --driven_audio /host_dir/deyu.wav \ --source_image /host_dir/image.jpg \ --expression_scale 1.0 --still \ --result_dir /host_dir命令跑完到/host_dir下找到生成的 mp4 文件人脸口型能跟上音频说明最短路径已经跑通。手边没有 GPU 的话也可以先用官方提供的 Colab 笔记本或 Hugging Face 在线 Demo按项目名检索即可试效果心里有数后再决定本地部署。环境体检与统一安装先对照下面这份清单给机器做体检最低配置能跑推荐配置出片明显更快项目最低推荐系统Windows 10 / macOS 13 / LinuxWindows 11 / Ubuntu 22.04内存8GB16GB显卡无纯 CPU 较慢NVIDIA 独显4GB 以上显存磁盘10GB 空闲20GB SSD三个系统走同一套流程差异用注释分支标出# 三种系统通用克隆代码 git clone https://gitcode.com/GitHub_Trending/sa/SadTalker cd SadTalker # Windows直接双击 webui.bat自动建虚拟环境并装依赖 # Linux / macOS运行脚本自动建 venv 并装依赖 bash webui.sh脚本执行后浏览器会自动打开127.0.0.1:7860的参数面板能看到上传图像、上传音频、选择模式三块区域即安装成功。Windows 上若报找不到 ffmpeg用scoop install ffmpeg补装并确认其在系统 PATH 中。依赖装好后下载模型权重bash scripts/download_models.sh网络受限时可到官方 README 的模型下载一节手动下载提供百度云盘等渠道解压到项目根目录确保出现checkpoints与gfpgan两个文件夹其中checkpoints里应有mapping_00109-model.pth.tar、SadTalker_V0.0.2_256.safetensors等文件详见 docs/install.md。出片实操与参数速查WebUI 路线上传一张照片 → 上传音频或输入文字合成语音→ 选择生成模式 → 点 Generate成品自动下载。命令行路线控制更精细结果保存在results/时间戳.mp4# 全身照片 音频 自然的全程说话视频 python inference.py --driven_audio examples/driven_audio/chinese_news.wav \ --source_image examples/source_image/full_body_1.png \ --preprocess full --still --enhancer gfpgan高频参数对照参数效果适用场景--preprocess full--still整图动画保持原头部姿态全身、半身照--preprocess crop仅人脸裁剪区动画表情最真实正面人像特写--expression_scale表情强度大于 1 更夸张表情偏僵硬时调 1.3--enhancer gfpgan人脸修复增强细节更清晰需要近景画质时--ref_eyeblink从参考视频借用眨眼神态眨眼不自然时--ref_eyeblink接一段真人视频即可视频比音频短会自动循环。人像特写输入可参考仓库自带样例排坑急救站按症状 → 原因 → 一行修复组织逐条对照即可ffmpeg 不是内部或外部命令→ ffmpeg 不在系统 PATH → 安装 ffmpeg 并加入环境变量或conda install ffmpeg。ModuleNotFoundError: No module named ai→epoch_20.pth模型文件不完整 → 删除后重跑 scripts/download_models.sh。FileNotFoundError: checkpoints\BFM_Fitting...→ 手动下载放错了目录 → 解压到项目根目录保留checkpoints与gfpgan结构。RuntimeError: unexpected EOF→ 模型文件损坏 → 重新下载对应文件并核对大小。CUDA out of memory→ 显存不足 → 启动前设PYTORCH_CUDA_ALLOC_CONFmax_split_size_mb:128Windows 用 setLinux 用 export。音频解码报错mp3float→ 只支持 wav 或 mp3 → 先把音频转成 wav 再传入。进阶与延伸全量参数与模式对比docs/best_practice.md3D 人脸可视化docs/face3d.md接入 Stable Diffusion WebUI 插件docs/webui_extension.md批量生成脚本src/generate_batch.py版本更新记录docs/changlelog.md出片慢时可调整 src/config/facerender.yaml 中的渲染分辨率参数分辨率与速度此消彼长遇到问题先看 docs/FAQ.md其中还收录了 M1 芯片需单独pip install dlib等机型相关说明本项目仅供研究与学习使用生成内容请遵守相关法律法规并注意肖像权等权利边界。【免费下载链接】SadTalker[CVPR 2023] SadTalkerLearning Realistic 3D Motion Coefficients for Stylized Audio-Driven Single Image Talking Face Animation项目地址: https://gitcode.com/GitHub_Trending/sa/SadTalker创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表