
Duix.Avatar 免费开源数字人克隆教程10 秒视频快速生成 AI 口播视频【免费下载链接】Duix-Avatar Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar假设你想给自己拍一条口播视频录 10 秒左右自己说话的视频喂给 Duix.Avatar它就能把你的形象和声音克隆下来之后你只需输入一段文案它就能生成一支由你对着镜头说话的口播视频——全程在本地跑不联网、不上传素材。Duix.Avatar 是一款支持本地部署 / API 调用的开源数字人工具Electron 客户端 Docker 服务端核心链路就三步上传 10 秒视频完成形象 声音克隆 → 输入文案或上传音频 → 自动生成口型同步的口播视频。它能帮你干什么三个真实场景1. 自媒体口播不想露脸也能露脸录一次 10 秒素材后面所有口播视频都用你的数字分身出镜。文案改十遍视频重出十遍不用反复进棚、补光、录到嗓子哑。2. 企业内部的内容量产培训课件、产品更新播报、每周例会纪要视频……用数字人主播统一出镜制作流程从约人 拍摄 剪辑压缩到贴一段文案。3. 个人 IP 的批量分发同一段内容剪成不同时长、不同文案版本批量生成后分发到多个平台风格还保持一致因为是同一张脸、同一个声音。跑起来之前先核对这张清单所有算力都在本地NVIDIA 显卡 驱动是硬性前提所以硬件不达标的话后面所有步骤都白搭。对照检查检查项要求备注系统Windows 10 19042.1526 及以上或 Ubuntu 22.04 Desktop已验证其他 Linux 版本未做兼容测试内存32GB 及以上必要16GB 可能连服务端都拉不起来显卡NVIDIA 显卡 正确安装的驱动推荐 RTX 4070装完跑nvidia-smi能出显卡信息才算成功显存建议8GB 以上生成阶段最容易吃显存D 盘Windows空闲30GB 以上存数字人模型和生成作品C 盘Windows空闲100GB 以上存 Docker 镜像不足可在 Docker 设置里改镜像位置网络首次拉镜像约70GB 流量建议连 WiFi耗时约半小时取决于网速参考配置i5-13400F / 32GB / RTX 4070。从零到第一支视频部署 → 装客户端 → 训练 → 出片第 1 步部署服务端DockerWindows 上先确认 WSL 状态wsl --list --verbose没装就wsl --install再wsl --update更新然后安装 Docker Desktop 并首次运行、接受协议、跳过登录。然后在仓库的deploy/目录下启动服务端。完整版三个核心服务ASR 识别、TTS 语音、视频生成cd /deploy docker-compose up -d只想要视频生成服务的话用轻量版只起一个Duix.Avatar-gen-video容器cd /deploy docker-compose -f docker-compose-lite.yml up -d50 系显卡以及 30/40 系使用 CUDA 12.8 的机器可以改用docker-compose-5090.ymlUbuntu 用docker-compose-linux.yml。耐心等它下完约 70GB 镜像。在 Docker 里看到三个服务全部 Running就算服务端就绪。第 2 步装客户端Windows下载官方构建包双击Duix.Avatar-x.x.x-setup.exe安装Ubuntu下载 Linux 版双击Duix.Avatar-x.x.x.AppImage启动如果是 root 用户进桌面需要在终端执行./Duix.Avatar-x.x.x.AppImage --no-sandbox第 3 步训练数字人克隆形象和声音在创建数字人入口上传素材视频注意两点时长10 秒左右人正脸对镜头视频必须有声音且是你本人在说话——声音克隆就靠这段音频系统会自动把视频拆成静音视频 音频分别完成形象建模和声音克隆。训练完成后新数字人出现在我的数字人列表里。第 4 步出片两种驱动方式二选一文案驱动输入文字系统转成你的声音再驱动口型音频驱动上传音频文件数字人按音频内容对口型合成任务支持水印开关、超分等参数具体可看 视频合成服务生成完的视频进入我的作品直接播放或导出。出片之后还能怎么玩进阶 / 可选API 调用可选Docker 启动后会在本地http://127.0.0.1暴露端口可以不走界面直接调接口适合做自动化流水线模型训练src/main/service/model.js——视频分离、声音预处理音频合成src/main/service/voice.js——文本转你的克隆声音视频合成src/main/service/video.js——音频 视频合成口播成片带进度查询接口多语言与国际化客户端界面提供中英文切换脚本/语音支持的语言数量会随版本变化以仓库最新文档为准别按旧版本的说法去卡参数。轻量版与 50 系显卡可选显存吃紧、只关心出片就用 lite 部署RTX 50 系显卡已用 5090 验证走docker-compose-5090.yml。卡住了先查这几条1. 服务起不来 / 容器反复重启现象docker-compose up -d后服务起不来或直接崩掉原因绝大多数是 NVIDIA 驱动没装对或内存不足16GB 基本没戏解法nvidia-smi确认驱动确认三个服务目标状态是 Running内存不够只能升级硬件2. 拉镜像慢到怀疑人生现象docker-compose up -d报错registry-1.docker.io ... request canceled或长时间卡在下载原因Docker Hub 官方源连不稳解法给 Docker 配国内镜像加速器镜像源经常失效自行搜最新可用地址在daemon.json里加{ registry-mirrors: [ https://docker.m.daocloud.io, https://docker.1ms.run ] }3. 客户端连不上服务端现象界面操作没反应、报连接失败原因三个服务没全在 Running或端口被防火墙拦了解法先确认服务状态再看客户端日志定位具体报错——日志位置在设置页里4. 视频生成卡在 20%现象进度条走到 20% 不动了任务最终失败原因最常见坑显存/内存不足视频合成阶段资源吃满解法显存确认 8GB 起步加系统虚拟内存降低输出分辨率改用轻量版部署5. 克隆形象时报错现象新增模特直接失败或服务端日志出现Connection refused原因素材视频没有声音、或不是本人在说话另外 ASR 服务冷启动较慢解法换一段有清晰人声的 10 秒视频服务端刚拉起时等几分钟再操作更完整的排查记录在 常见问题。收尾它适合你吗一句话定位Duix.Avatar 是一个在本地免费跑的 AI 数字人口播视频工具——10 秒视频换一张分身脸 一个克隆声音之后文案进、视频出。适合谁有 NVIDIA 显卡显存 8GB、32GB 内存、Windows 10 或 Ubuntu 22.04 的机器需要批量出口播内容的自媒体、企业培训、内容团队想通过 API 把数字人嵌进自己系统的开发者不适合谁没有 NVIDIA 显卡的机器含纯 Apple 芯片 Mac——本地跑不动只想要开箱即用云服务、不想碰 Docker 的用户项目也提供了 API 服务方案见仓库说明授权提醒全球免费商用用户量超 10 万或年营收 1000 万美元以上的企业需签署商业许可协议仓库内附协议 PDF。入口仓库需要 clone 时用git clone https://link.gitcode.com/i/9225b5c2e8fb05091e37d8c1fe189794文档常见问题、README_zh.md含部署、API、授权全文社区仓库内提供技术交流群二维码版本更新频繁遇到问题先看最新文档和 issue【免费下载链接】Duix-Avatar Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考