尧图网站设计 尧图网站设计YAOTU DESIGN
ARTICLE DETAIL

资讯详情

深耕网站设计与一线实操的经验洞察。

SadTalker 数字人视频快速上手:一张图片加一段音频,生成会说话的数字人

SadTalker 数字人视频快速上手:一张图片加一段音频,生成会说话的数字人 SadTalker 数字人视频快速上手一张图片加一段音频生成会说话的数字人【免费下载链接】SadTalker[CVPR 2023] SadTalkerLearning Realistic 3D Motion Coefficients for Stylized Audio-Driven Single Image Talking Face Animation项目地址: https://gitcode.com/GitHub_Trending/sa/SadTalker你手里有一张肖像照和一段录音想让照片里的人开口说话——SadTalker 就是做这件事的工具输入单张图片加一段音频输出口型同步、头部自然摆动的说话视频CVPR 2023 论文方法现已采用 Apache 2.0 许可。能力速览三种预处理模式与核心参数功能 / 模式开关或取值适用场景预处理模式--preprocesscrop默认/resize/fullcrop裁出面部后动画效果最自然resize整图缩放适合证件照类特写不适合全身照full保留完整构图只动面部再贴回原图静止模式--still默认关闭沿用原图头部姿态头部不晃动全身动画建议常开面部增强--enhancer默认关闭可选gfpgan/RestoreFormer生成后对面部做修复提升清晰度眨眼参考--ref_eyeblink默认无从参考视频借眨眼动作表情更自然头部姿态参考--ref_pose默认无从参考视频借头部运动轨迹渲染尺寸--size默认 256可设 512面部渲染分辨率越大越清晰、越慢下图是一张全身人像输入示例用full模式动画后头部与身体的比例保持不变全身人像输入示例full模式只对面部区域做动画再贴回原图注意人物姿态未被改变。最短上手路径安装、下载模型与首次运行前置要求Python 3.8、ffmpeg处理音频视频流的工具必须安装有 CUDA 显卡会明显提速纯 CPU 可运行但很慢。git clone https://gitcode.com/GitHub_Trending/sa/SadTalker cd SadTalker conda create -n sadtalker python3.8 conda activate sadtalker pip install torch1.12.1cu113 torchvision0.13.1cu113 torchaudio0.12.1 --extra-index-url https://download.pytorch.org/whl/cu113 conda install ffmpeg pip install -r requirements.txt bash scripts/download_models.sh # 下载全部预训练模型模型就绪后首次运行只需用仓库自带的示例素材python inference.pyinference.py 的默认参数已指向examples/driven_audio/bus_chinese.wav和examples/source_image/full_body_1.png结果会保存在results/下按时间戳命名的目录里。不想用命令行的话直接运行python app_sadtalker.py打开 Gradio 网页界面上传图片和音频即可。参数调优默认值、改动效果与推荐值参数默认值改动效果推荐值--preprocesscropfull配合--still保留完整构图resize把整图缩到渲染分辨率特写用crop全身图用full证件照用resize--expression_scale1.0越大面部动作越夸张超过 2 容易变形一般 1.0想让表情更生动用 1.2–1.5--still关闭固定头部姿态不产生头部运动和眨眼全身/半身动画强烈建议开启--enhancer无追加面部修复网络增加耗时正式出片用gfpgan预览时关闭--batch_size2越大渲染越快显存占用越高显存吃紧时降到 1参数细节和更多示例见最佳实践文档。场景建议三种常见输入怎么选全身或半身人像--preprocess full --still --enhancer gfpgan保留完整构图面部细节更好。证件照式特写--preprocess resize直接产出整图说话的证件照效果。普通头像但嫌动作呆板默认crop模式加--ref_eyeblink 参考视频借用视频里自然的眨眼。避坑速查五个高频问题Q1运行报ffmpegnot recognized。结论ffmpeg 没装或不在 PATH。Linux/conda 环境conda install ffmpegmacOSbrew install ffmpegWindows装好后确认ffmpeg已加入%PATH%Q2报FileNotFoundError: checkpoints/BFM_Fitting/...。结论模型没下全。重新执行bash scripts/download_models.sh并确认checkpoints/和gfpgan/两个目录都完整存在。Q3报RuntimeError: unexpected EOF。结论模型文件下载损坏。删除后重新下载对应文件核对文件大小。Q4CUDA out of memory。结论显存不够限制 PyTorch 显存分片即可。Linuxexport PYTORCH_CUDA_ALLOC_CONFmax_split_size_mb:128Windowsset PYTORCH_CUDA_ALLOC_CONFmax_split_size_mb:128然后再运行python inference.py ...Q5音频输入报错或口型异常。结论流程目前只支持 wav 或 mp3 音频先把输入转成 wav 再喂给它。另有两个前提要知道Mac M1 报Illegal Hardware Error时在激活环境里重新pip install dlib模型只支持真人肖像动漫或卡通图无法生成官方说明见最佳实践文档。资源导航源码模块与文档定位推理入口inference.py批量推理src/generate_batch.py音频转表情系数src/audio2exp_models/音频转头部姿态src/audio2pose_models/面部渲染核心src/facerender/3D 面部重建可视化可选装src/face3d/音频与预处理工具src/utils/模型配置src/config/安装指南、最佳实践、常见问题、SD-WebUI 插件示例音频examples/driven_audio/示例图片examples/source_image/眨眼/姿态参考视频examples/ref_video/第一次先用默认参数跑通流程确认输出正常后再逐项调优比一开始就堆参数更省时间。full模式记得常配--still这是官方反复强调的组合。遇到问题优先翻FAQ仓库 issues 里也沉淀了不少现成解法。【免费下载链接】SadTalker[CVPR 2023] SadTalkerLearning Realistic 3D Motion Coefficients for Stylized Audio-Driven Single Image Talking Face Animation项目地址: https://gitcode.com/GitHub_Trending/sa/SadTalker创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表