尧图网站设计 尧图网站设计YAOTU DESIGN
ARTICLE DETAIL

资讯详情

深耕网站设计与一线实操的经验洞察。

Duix.Avatar 本地部署指南:10 秒视频克隆你的数字分身

Duix.Avatar 本地部署指南:10 秒视频克隆你的数字分身 Duix.Avatar 本地部署指南10 秒视频克隆你的数字分身【免费下载链接】Duix-Avatar Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar口播视频不想出镜10 秒视频克隆你的数字分身你要录一条产品讲解视频但自己不想出镜也不想找配音——这就是 Duix.Avatar 的用途上传一段 10 秒左右的说话视频本地部署后克隆出你的数字人输入文案就能自动生成口播视频。全程离线运行画面和声音数据都不离开你的电脑。能力速览它到底能干什么上传 10 秒视频克隆形象与声音输入文案或音频数字人自动对口型传统 3D 数字人制作要数万美元这里 0 成本全程本地离线数据不出你的电脑快速上手Docker 部署 Duix.Avatar 的完整步骤动手前环境和硬件清单系统Windows 10 19042 或 Ubuntu 22.04官方验证版本显卡NVIDIA 显卡 驱动装好。这是硬性要求——它的全部算力都在本地跑没有 N 卡三个服务直接起不来内存32GB 及以上16GB 时 ASR 语音识别服务可能起不了硬盘C 盘 100GB 空闲放 Docker 镜像D 盘 30GB放数字人和作品数据Windows 需要 WSL2 Docker DesktopUbuntu 需要 Docker NVIDIA Container Toolkit先用下面的命令自查环境三条都正常输出再往下走# Windows 下检查 WSL2 是否安装 wsl --list --verbose # 检查 Docker 与 NVIDIA 驱动 docker --version nvidia-smi最小可运行路径三条命令跑通服务端克隆仓库并进入deploy目录执行部署命令耐心等待——首次要下载约 70GB 镜像官方建议连 WiFi耗时半小时左右打开 Docker 看状态完整版要看到 3 个服务 Runningtts、asr、gen-video才算成功安装客户端Windows 下载 exe 双击安装Ubuntu 双击 AppImage 即可启动root 用户需在终端加--no-sandbox参数运行git clone https://gitcode.com/GitHub_Trending/he/Duix-Avatar cd Duix-Avatar/deploy docker-compose up -d # 完整版3 个服务⚠️C 盘不足 100GB 别急着部署先在 Docker Desktop 的 Settings → Resources 里把 Disk image location 改到一块剩余空间大于 100GB 的磁盘再执行部署。图Duix.Avatar 本地部署的环境检查——在 Docker Desktop 设置里把磁盘镜像位置改到空间充足的磁盘⚠️镜像下载卡住或超时多半是 Docker Hub 官方源连不通去 Docker 的 Daemon 设置里配国内镜像源registry-mirrors或开全局网络模式再重新执行docker-compose up -d。原理拆解三个服务如何把视频变成口播客户端只是壳子真正干活的是三个 Docker 服务。整个流程可以拆成输入 → 训练 → 合成 → 输出你交上一段 10 秒视频 一段文案它交还一条口播视频。模块 A模特训练。把你上传的视频切成静音视频 音频两部分——静音视频是数字人的身体模板音频留给声音克隆。客户端对应代码在 src/main/service/model.js。模块 B声音克隆与合成TTS ASR。TTS文本转语音听着你的音频学音色之后任何文案都能用你的声音读出来ASR语音识别基于 FunASR则负责把参考音频里的话听懂并转成文本作为合成的依据。声音相关的调用逻辑在 src/main/service/voice.js。模块 C视频合成face2face。口型引擎根据合成好的音频逐帧驱动嘴部动作和静音视频合起来就是成品客户端再用 ffmpeg 做最后的音视频混流见 src/main/service/video.js 和 src/main/util/ffmpeg.js。三个服务的端口映射和数据目录都写在 deploy/docker-compose.yml客户端连接哪个地址、文件存哪里改 src/main/config/config.js 就行。硬件最低可用官方推荐说明CPUi513 代 i5-13400F单核性能影响训练速度内存16GB32GB16GB 时 ASR 可能启动失败显卡NVIDIA 8GB 显存RTX 407050 系列显卡有专属部署文件硬盘130GB 空闲NVMe SSD镜像 作品数据图数字人客户端主界面——创建视频和创建数字人两个入口跑通服务端后就能开始用排坑指南镜像拉取失败、克隆报错怎么办现象docker-compose up -d报request canceled、context canceled。原因Docker Hub 官方源连接不稳定镜像拉不下来。解法在 Docker 守护进程配置里加国内镜像源registry-mirrors或开全局网络模式然后重跑部署命令。现象创建模特时报Connection refused日志里还有file does not exist。原因ASR 服务冷启动很慢容器刚拉起时内部连接还没就绪另外内存小于 16GB 时 ASR 可能压根起不来。解法服务端启动后等几分钟再操作克隆内存紧张的机器先加内存再部署。现象新增模特上传视频后直接报错。原因用来创建模特的视频必须有真人说话的声音——程序要拿这段音频做声音克隆无声视频等于白传。解法重新录一段 10 秒左右、你正常说话的清晰视频再传。两个调优技巧给你显存小、不想装全套跑docker-compose -f docker-compose-lite.yml up -d只启动视频合成一个服务跳过 TTS 和 ASR代价是克隆功能不可用。NVIDIA 50 系列显卡别用默认配置改用docker-compose -f docker-compose-5090.yml up -d30/40 系列在 CUDA 12.8 下也能用这套。排查问题时客户端日志在设置菜单里能直接看服务端日志点开对应 Docker 容器复制出来方便对照 doc/常见问题.md 里的已知问题。图数字人服务端的 Docker 容器日志页克隆报错时先来这里找到关键报错行还能怎么用从口播视频到实时数字分身自媒体口播一次克隆之后所有短视频脚本交给你的数字人念更新频率不再受档期限制在线教育把课程文稿转成标准录课视频讲师不用反复进棚企业培训与客服批量生成产品演示、操作教程类素材成本趋近于零两个展望方向一是实时互动分身数字人参与会议并实时对话展望当前开源版本定位是离线视频合成二是多模态输入生成描述即创作一句话自动匹配数字人、场景与文案展望社区仍在迭代。别等了把 10 秒视频丢进部署好的服务先克隆一个试试。官方文档README_zh.md 常见问题doc/常见问题.md 部署配置deploy/docker-compose.yml【免费下载链接】Duix-Avatar Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表