
Duix.Avatar 数字人本地部署完整教程10 秒视频克隆数字人本地生成口播视频【免费下载链接】Duix-Avatar Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-AvatarDuix.Avatar 是一款完全开源、可全离线运行的数字人Digital Avatar即你的虚拟分身工具包提供一段 10 秒左右的说话视频它就能克隆你的形象和声音再用文字或音频驱动生成数字人口播视频。如果你要做培训、自媒体或营销类口播视频又不想把素材交给云端服务这个本地部署项目就是为你准备的。它能干什么又干不了什么想象一个场景你在做系列培训课程需要一位固定的出镜人念稿。自己拍错一个音就得重拍用线上数字人服务要付费素材还得上传到云端。Duix.Avatar 把这件事搬到你自己的电脑上拍一段 10 秒说话视频上传系统学会你的长相和音色之后每次制作只要输入文案数字人就会自动念稿口型同步。但边界也要说清楚它是口播型工具数字人只会说话不会走动、不会做肢体动作而且必须有 NVIDIA 独立显卡所有算力都在你本地跑集显机器直接出局。四步跑通本地数字人环境动手前先确认三件事NVIDIA 独显且驱动已装好、内存 32G16G 是底线、硬盘空闲 100G 以上首次拉镜像约消耗 70G 流量建议连 WiFi。第 1 步获取代码git clone https://gitcode.com/GitHub_Trending/he/HeyGem.ai cd HeyGem.ai→ 成功标志当前目录出现 HeyGem.ai 文件夹里面有 src/、deploy/ 等子目录。第 2 步验证显卡驱动nvidia-smi→ 成功标志能看到显卡型号和驱动版本。命令不可用时先装好 NVIDIA 驱动——没有驱动后面三个核心服务根本起不来。第 3 步启动服务端。Windows 用户先在命令提示符执行wsl --install装好 WSL2网络原因可能失败多试几次再安装 Docker Desktop然后在 deploy/ 目录下执行cd deploy docker-compose up -d→ 成功标志等待约半小时镜像下载完毕Docker 容器列表出现 3 个服务且状态为 Running。低配机器可改用精简版docker-compose -f docker-compose-lite.yml up -d只启动 1 个服务。Ubuntu 22.04 用户装好 Docker 和 NVIDIA Container Toolkit 后详见 README 说明执行cd deploy docker-compose -f docker-compose-linux.yml up -d→ 成功标志同样是 3 个服务 Running。点开容器的 Logs 标签页能看到启动日志用这个页面随时确认服务端状态。第 4 步启动客户端。到项目 Releases 页下载官方构建的 Windows 安装包.exe或 Linux 版AppImage双击打开。→ 成功标志主界面出现Create Video和Create Avatar两个入口可以开始创建数字人了。原理扫盲10 秒视频怎么变成数字人把整个过程理解成一张形象照 一份声音样本。你上传的 10 秒视频会被拆成两部分画面留给视频合成模型当底音轨则交给 ASR自动语音识别让机器听写音频内容提取出参考文本TTS语音合成服务从这段音频里学习你的音色之后能把任意新文案念成你的声音视频合成服务再根据新音频逐帧驱动原视频里的人脸让嘴型跟着新音频动。拆开看是这几个能力点形象 声音双克隆一段 10 秒视频得到一个可反复使用的数字人资产文字或音频都能驱动直接输文案或导入自己的录音口型同步合成引擎按音频节奏驱动面部8 种语言文案中、英、日、韩、法、德、阿、西全离线素材和算力都不出内网开放 API模特训练、音频合成、视频合成各有 HTTP 接口局限也坦白说口播型模型没有肢体动作NVIDIA 显卡是硬性要求没有就是跑不起来首次下载镜像体量大、启动慢项目迭代快问题主要靠社区修速度不如商业服务。调优与避坑配置对照表与高频问题配置项推荐值作用NVIDIA 驱动最新版nvidia-smi可查三个服务都依赖它缺它起不来硬盘空间≥100GWindows 的 D 盘 ≥30G镜像约 70G还要存模型和作品内存32G16G 下限ASR 服务启动时内存占用高镜像源Docker 设置里配国内加速地址官方源不稳定拉取容易超时compose 文件按场景选lite 版省资源5090 版适配 RTX 50 系linux 版给 UbuntuWindows 上 Docker 镜像默认存在 C 盘空间紧张的话可以在 Docker Desktop 的 Resources 设置里把磁盘镜像位置改到其他盘。⚠️ 三个高频问题docker-compose up -d报 Docker Hub 连接超时→ 官方源不稳定在 Docker 设置里加上国内 registry 镜像源重跑命令。新增模特时报错→ 你上传的视频必须有声音且是人在说话程序要靠这段音频做声音克隆纯静音视频会失败。服务端刚起就克隆形象报 Connection refused→ ASR 服务启动慢还没加载完等所有服务 Running 后等几分钟再操作内存只有 16G 时服务可能直接起不来。错误定位不了就看服务端日志打开对应容器的 Logs 标签页搜索 ERROR 关键字。更多问题可翻 doc/常见问题.md。进阶玩法用 API 把数字人接进自己的系统不想每次点界面、想批量生产就看服务端暴露的本地端口。启动后它提供三组接口模特训练、音频合成18180 端口、视频合成8383 端口都能通过http://127.0.0.1调用。写个脚本按训练模特 → 合成音频 → 提交合成并轮询进度的顺序跑就能批量产出数字人视频接口参数可直接参考 src/main/service/ 里的实现它和客户端的调用逻辑一一对应。 另一个组合低配机器只起 lite 镜像负责视频合成把吃资源的形象克隆放到另一台机器或 API 服务上做还能避免单服务卡死拖垮整个部署。本地数字人的价值在于你的脸和素材始终不出自己的机器克隆一次资产、之后按需产出。如果你准备动手第一步就是先跑一下nvidia-smi确认显卡驱动正常、硬盘留够 100G再去拉镜像。【免费下载链接】Duix-Avatar Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考