尧图网站设计 尧图网站设计YAOTU DESIGN
ARTICLE DETAIL

资讯详情

深耕网站设计与一线实操的经验洞察。

Duix.Avatar本地部署教程:10秒视频克隆数字人,3步跑通全离线口播视频生成

Duix.Avatar本地部署教程:10秒视频克隆数字人,3步跑通全离线口播视频生成 Duix.Avatar本地部署教程10秒视频克隆数字人3步跑通全离线口播视频生成【免费下载链接】Duix-Avatar Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar你的视频素材和声音数据从此不必离开自己的机房。Duix.Avatar 是一款完全开源的 AI 数字人克隆工具支持本地部署提交一段约 10 秒的视频即可同时克隆人物的外貌和声音之后输入文案就能自动驱动这个数字人口型说话、生成口播视频全程离线、无需联网。对需要长期产出内容、又在意数据合规的教育机构、企业培训团队和个人创作者来说一次部署后续制作几乎零边际成本。一、它替你解决什么三条路摆一起看做数字人视频行业里通常有三条路。把传统外包、云端 API 和 Duix.Avatar 本地部署放在一起比差异一眼可见对比维度传统 3D 数字人外包云端数字人 API 服务Duix.Avatar 本地部署单条内容成本数千元/条按量计费长期累积电费约 0 元制作周期数周分钟级训练约 15~30 分钟/个合成约 2 分钟/分钟视频数据隐私素材交给外包方素材上传云端全程本地处理素材不出内网定制深度受限于供应商只能用对方开放的接口源码可改行为完全可控硬件门槛无无需 NVIDIA 显卡显存决定档位商用授权逐单谈判依服务商条款全球免费商用用户量超 10 万或年营收超 1000 万美元的企业需签署商业许可协议技术栈上它把三件事拼成了一条流水线视觉引擎基于深度学习的脸部重建捕捉五官、轮廓、表情特征构建可驱动的虚拟形象、声音克隆端到端语音合成模型提取声纹特征还原音色和语调、多模态驱动把文本转成自然语音再自动匹配口型和表情。脚本支持中、英、日、韩、法、德、阿拉伯、西八种语言。如果你不需要折腾代码、只想快速集成业务也可以考虑官方提供的云端克隆 API但本文聚焦的是本地私有化方案。二、最低配置要求三档硬件对应三种产出速度显卡决定了你能跑哪一档。下面这套配置同时适用于 Windows 和 Ubuntu核心结论是显存至少 6GB内存至少 16GB且必须有 NVIDIA 显卡。档位CPU内存显卡显存存储预期表现入门级10 代 i5 或同级 AMD16GBRTX 30606GB256GB SSD 1TB HDD训练约30 分钟/模型720p 合成约 5 分钟/分钟视频推荐级13 代 i7-13700F官方推荐 i5-13400F 起步32GBRTX 407012GB512GB SSD 2TB SSD训练约15 分钟/模型1080p 合成约 2 分钟/分钟视频生产级14 代 i9-14900K 或同级 AMD64GBRTX 409024GB1TB SSD 4TB SSD训练约8 分钟/模型4K 合成约 1 分钟/分钟视频系统环境硬性要求WindowsWin1019042.1526或更高版本需安装 WSLWindows 子系统里的 Linux 环境Docker Desktop 靠它跑容器Ubuntu22.04 Desktop内核 6.8.0-52-generic 已验证其他 Linux 版本未做兼容性测试两个平台都要求正确安装 NVIDIA 显卡驱动可用nvidia-smi验证磁盘空间Windows 下D 盘空闲 30GB存模型和作品、C 盘空闲 100GB存镜像Ubuntu 下整盘空闲 100GB。 实操提示预算有限时先保显卡、再保内存。8GB 显存即可跑通模型文件本体约10GB不需要额外预留 100GB 级的专用硬盘空间训练过程中内存不足是卡死的常见原因16GB 是底线。三、部署实战环境准备 → 服务启动 → 功能验证整套服务端由 3 个 Docker 容器Docker 是容器化工具可以把整套运行环境和依赖打包进一个镜像一键运行组成语音合成 TTS端口 18180、语音识别 ASR把语音转成文字端口 10095、视频合成端口 8383。下面按三步走。第 1 步环境准备确认系统版本Windows 执行winverUbuntu 执行lsb_release -aWindows 下检查并更新 WSLwsl --list --verbose wsl --update安装 DockerWindows 从官网安装 Docker Desktop首次启动接受协议并跳过登录即可Ubuntu 执行sudo apt-get update sudo apt-get install docker-ce docker-ce-cli containerd.io sudo systemctl start docker sudo systemctl enable dockerUbuntu 用户还要额外安装NVIDIA Container Toolkit让 Docker 容器能调用 GPU 的桥梁工具装完执行nvidia-ctk runtime configure --runtimedocker并重启 Docker 服务。验证环境docker --version输出版本号、nvidia-smi显示显卡型号两样都正常即可继续克隆代码仓库git clone https://gitcode.com/GitHub_Trending/he/Duix-Avatar cd Duix-Avatar第 2 步启动服务端cd deploy docker-compose up -d首次执行会拉取 3 个镜像共约70GB 流量耗时约30 分钟到 2 小时取决于网速建议连 WiFi 且预留充足磁盘。看到 3 个容器全部创建即代表成功显存较小的机器可改用精简版只保留视频合成一个服务docker-compose -f docker-compose-lite.yml up -dUbuntu 用deploy/docker-compose-linux.ymlNVIDIA 50 系列显卡30/40 系列的 CUDA 12.8 环境也可参考用deploy/docker-compose-5090.yml第 3 步验证服务就绪docker ps预期输出3 个容器状态均为UpLite 版只有 1 个duix-avatar-gen-video容器名分别为duix-avatar-tts、duix-avatar-asr、duix-avatar-gen-video。docker logs -f duix-avatar-tts日志中出现服务监听信息且无 Traceback 报错即代表该服务正常。 实操提示拉镜像阶段约 30 分钟、服务自身初始化约 10 分钟两段时间别混为一谈。其中 ASR 服务冷启动最慢服务端全部起来后再等约 5 分钟再打开客户端做克隆操作否则大概率遇到Connection refused。客户端从项目 release 页下载对应安装包Windows 双击Duix.Avatar-x.x.x-setup.exe安装Ubuntu 双击.AppImage直接运行root 用户下需追加--no-sandbox参数。四、产出第一个成果10 秒视频换一张数字分身客户端启动后你会看到两个大按钮Create Avatar上传视频生成数字人和Create Video用已有数字人生成视频。第一次走通克隆 → 生成最小闭环只需 4 步点击Create Avatar上传一段约10 秒的正面人像视频必须带人声程序要从中提取声音做克隆静音视频会被拒绝等待形象训练完成入门配置约 30 分钟推荐配置约 15 分钟完成后我的数字人列表出现新模型点击Create Video选择刚建好的数字人输入一段简单文案先写两三句话即可等待合成在我的作品里播放检查口型与声音参数建议素材用720p 以上 MP4H.264、光线均匀、包含微笑和点头等自然动作声音采样率44.1kHz训练迭代次数用默认值约 5000 次正对镜头录制面部占比越大重建精度越高。 实操提示第一条测试视频文案控制在 100 字以内入门配置约 5 分钟可出片。先确认声音像、口型对得上再上长文案——长文本出问题后定位成本远高于短句。五、场景落地三类内容各要什么素材教育虚拟教师素材10~15 秒教师正面视频背景简洁、光线均匀表情自然参数语速调到120~150 字/分钟教学舒适区间用标点生成自然停顿技巧同一位老师克隆一个模型不同课程只换文案和背景内容风格天然统一企业数字代言人素材正面 45° 角多段素材用专业麦克风在安静环境录制覆盖正式、亲切、热情三种语气参数声音克隆后逐段试听语调偏差明显就换一段更干净的样本重录技巧把企业介绍、产品宣传、活动通知做成固定模板品牌色和 Logo 位置固化下来后续批量复用自媒体虚拟主播素材10 秒出镜口播固定机位参数单条文案 1~3 分钟批量生成技巧把常用开场白和结尾口播预生成为固定音频每天只更新正文部分产出效率最高六、资源入口代码、接口与资料在哪部署编排文件deploy/4 套 compose标准、精简、Linux、5090服务端 API 调用示例src/main/service/model.js、src/main/service/video.js、src/main/service/voice.js——Docker 启动后本地暴露端口127.0.0.1:18180声音与127.0.0.1:8383视频合成可直接对接自己的业务系统故障排查与提问规范doc/常见问题.md商用授权说明Duix.Avatar model community Licensing Agreement中文对照版同目录问题反馈仓库 Issues 区或联系 jamesduix.com七、避坑手册四种高频故障一次说清现象原因解决docker-compose up -d拉镜像超时报registry-1.docker.io ... request canceledDocker Hub 官方源网络不稳定Docker 设置里配置国内镜像源registry-mirrors或走全局代理后重试新增模特报错提示视频不可用素材没有声音或画面里的人没在说话重新录制一段带清晰人声的视频再上传克隆时报Connection refusedASR 连接失败ASR 服务冷启动慢或内存不足16GB 以下导致容器起不来服务端启动后等约 5 分钟再操作确认docker ps中 3 个容器都在运行视频合成进度缓慢甚至卡死显存/CPU 不足磁盘临时文件堆积关闭其他占用程序清理缓存~/.duix_avatar/cache/*仍慢则降低输出分辨率 实操提示排障按固定顺序来——先查docker ps三个容器是否 Running再nvidia-smi确认驱动最后才怀疑配置问题能省掉 80% 的弯路。日常维护一句话每周清理一次缓存目录每月到 deploy/ 重新执行docker-compose up -d拉取最新镜像Windows 用户盯住 D 盘 30GB / C 盘 100GB 的余量红线。写在最后一次部署素材全程不出内网单条口播视频的成本趋近于零——这就是 Duix.Avatar 本地部署给你的确定收益。代码、部署文件和常见问题都放在仓库里现在就可以执行git clone拉取仓库按第三节的顺序把服务跑起来今晚就能拿到你的第一个数字人。【免费下载链接】Duix-Avatar Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表