尧图网站设计 尧图网站设计YAOTU DESIGN
ARTICLE DETAIL

资讯详情

深耕网站设计与一线实操的经验洞察。

Duix.Avatar 数字人克隆教程:免费开源,10 秒视频在你本地做出会说话的视频

Duix.Avatar 数字人克隆教程:免费开源,10 秒视频在你本地做出会说话的视频 Duix.Avatar 数字人克隆教程免费开源10 秒视频在你本地做出会说话的视频【免费下载链接】Duix-Avatar Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-AvatarDuix.Avatar 是一款免费开源的 AI 数字人工具支持全离线本地部署只需一段 10 秒的讲话视频就能完成外貌与声音克隆输入文案或上传音频即可自动生成口型同步的口播视频。本指南面向自媒体创作者、培训讲师等想在自己电脑上产出数字人视频的用户。️ 动手前先核对你电脑部署前必须确认的硬件条件先说个扎心的事实数字人本地部署失败十有八九不是代码问题而是硬件没达标。这一步判断错了后面 30 分钟的下载和等待全部白费。项目要求说明显卡NVIDIA 显卡 正确安装的驱动硬性条件本项目所有算力都在本地没有英伟达显卡或驱动三个服务根本起不来内存32GB 及以上必要16GB 内存可能导致语音识别服务启动不了系统Windows 1019042.1526或更高或 Ubuntu22.04Desktop其他 Linux 版本官方暂未测试推荐配置i5-13400F、RTX 4070社区反馈 8GB 显存的显卡也可跑磁盘WindowsD 盘空闲30GB存数字人与作品数据C 盘空闲100GB存 Docker 镜像C 盘不足时可改镜像存放位置见下图磁盘Ubuntu空闲空间100GB建议连 WiFi 再开始驱动是否装好装完后执行nvidia-smi验证能打印出显卡信息就是装好了。如果你用的是NVIDIA 50 系列显卡30/40 系列 CUDA 12.8 也可选此方案部署时要用专门的 compose 文件第 2 节会写到。C 盘空间不足 100G 时在 Docker Desktop 的 Resources → Advanced 里把 Disk image location 改到空闲空间更大的磁盘。 30 分钟完成数字人服务端本地部署3 条命令与 70G 流量这一节只有几条命令但背后是约70GB的镜像下载量官方预期耗时半小时左右网速决定了你实际要等多久。先克隆代码以仓库 README 为准目录名为Duix-Avatargit clone https://gitcode.com/GitHub_Trending/he/Duix-Avatar cd Duix-AvatarWindows 用户分两步走先确认 WSLWindows 里的 Linux 子系统Docker Desktop 靠它运行执行wsl --list --verbose没装过就先wsl --install再用wsl --update更新到最新版。从 Docker 官网下载 Windows 版安装包安装首次启动时接受协议、跳过登录即可。然后进入服务端部署。compose 文件都放在 deploy/ 目录标准版执行cd deploy docker-compose up -d两个备选显存紧张、只想体验视频合成功能用 lite 版docker-compose -f docker-compose-lite.yml up -d只启动 1 个服务50 系列显卡执行docker-compose -f docker-compose-5090.yml up -d。Ubuntu 用户则先装 Docker 和显卡运行环境再指定 linux 版 compose 文件sudo apt update sudo apt install docker.io sudo apt install docker-compose之后按 README_zh.md 的指引安装 NVIDIA 驱动与 nvidia-container-toolkit执行sudo nvidia-ctk runtime configure --runtimedocker并重启 Docker再运行docker-compose -f docker-compose-linux.yml up -d。成功的标志打开 Docker看到 3 个服务都是 Running 状态——duix-avatar-tts、duix-avatar-asr、duix-avatar-gen-videolite 版只有最后一个。数据默认存在D:\duix_avatar_data\无需额外配置。 装好客户端 5 分钟产出第一条数字人视频服务端全部 Running 后安装客户端打开它后面就再不用碰命令行了Windows 双击官方安装包Duix.Avatar-x.x.x-setup.exe即可Ubuntu 直接运行Duix.Avatar-x.x.x.AppImage以 root 用户登录桌面时需在终端加--no-sandbox参数启动。打开后整个界面就两条主线对应你接下来的全部操作主界面上方是创建视频和创建数字人两个入口下方My Works我的作品和My Avatars我的数字人用来管理产出。第一步克隆数字人。点击 Create Avatar上传一段10 秒左右建议 10~20 秒的视频。这里有一条硬性要求视频里必须有人正在说话因为程序要从中克隆你的声音另外脸部要清晰、尽量正面、光线充足太短或没人声的视频会直接报错。第二步生成视频。在 My Avatars 里选中刚克隆的数字人进入创建视频页面输入要说的文案脚本支持中、英、日、韩、法、德、阿、西 8 种语言或直接上传现成的音频文件点击生成。系统会自动把文字转成你的克隆音色再驱动口型产出口播视频。生成进度卡住时的排查方法见第 4 节。第三步管理作品。所有成片都进 My Works支持关键词搜索和分页浏览方便翻历史作品、二次使用。右上角的 Setting 菜单里可以打开客户端日志排障要用、查看用户协议、切换界面语言多语言内容创作时直接在这里切语言即可Setting 菜单提供打开日志、用户协议、语言切换三个入口我的作品按时间排列所有已生成的数字人视频。⚠️ 数字人视频生成 3 类高频报错的排查思路社区里出现的报错归归类其实就下面三种占了绝大多数按出现频率从高到低说。1.docker-compose up -d拉镜像失败报request canceled/context canceled。本质是 Docker Hub 官方源连接不稳定。最直接的解法是给 Docker 配镜像加速源Docker Desktop → Settings → Docker Engine在 JSON 配置里加registry-mirrors数组填当前可用的加速地址Apply restart 后重跑部署命令Docker Engine 设置页中的 registry-mirrors 字段即镜像加速源列表。2. 新增模特克隆数字人报错提示音频流不存在如Output file #0 does not contain any stream。原因几乎只有一个上传的克隆视频里没有清晰的人声。声音是声音克隆的原料视频无声、或只有背景音乐程序无米下锅。换一段本人在正常说话的片段重传即可。3. 定制数字人报Connection refused或 TTS 服务反复重启。前者的典型原因是语音识别服务asr启动较慢服务端刚起来就急着操作连接被拒正确做法是等服务全部 Running 后再等几分钟再克隆且内存必须 32GB 起步16GB 可能直接起不来。后者先点开duix-avatar-tts的 Logs 看是不是音频路径报错典型日志如下TTS 服务日志里反复出现file does not exists说明音频文件路径有误重启服务或检查duix_avatar_data\voice\data目录即可。以上都解决不了时按顺序自查三个服务是否都 Running →nvidia-smi是否显示显卡 → 服务端客户端是否都是最新版服务端到 deploy/ 重跑docker-compose up -d。客户端日志在 Setting → Open Log 处获取本地文件长这样客户端日志文件main.log的位置提问或求助时附上它能省掉一半的沟通成本。更多历史问题整理在 doc/常见问题.md提问前建议先翻一遍。 10 秒视频是怎么变成会说话的视频一条流水线上的 3 个服务你可能会好奇一段 10 秒视频凭什么就能造出会说新内容的数字人答案藏在三个各司其职的 Docker 服务里它们串成一条本地流水线duix-avatar-asr基于 FunASR把语音转成文字负责听懂克隆视频里你说了什么。duix-avatar-tts基于 fish-speech文本转语音用你克隆的音色朗读新文案。duix-avatar-gen-video核心合成引擎把你原始视频的画面和新生成的语音对齐逐帧驱动口型输出最终成片。对应到本地 API仅http://127.0.0.1可调全程不经过外网克隆阶段调18180端口的preprocess_and_tran接口视频拆成静音视频 音频、建立声音参考音频合成调18180的invoke接口视频合成调8383的easy/submit提交、easy/query查进度。客户端里这些调用都替你封装好了源码逻辑集中在 src/main/service/ 下的voice.js、model.js、video.js想二次开发可以从这里读起。排障时点开任意服务的 Logs 标签页点右侧复制按钮即可导出完整日志。 开源数字人工具对普通用户最实用的 2 个场景自媒体口播不想露脸、又需要持续日更的创作者用数字人分身代替出镜文案交给 TTS一天批量产出多条口播视频8 种脚本语言意味着同一形象可以直接产出多语种内容铺海外平台不再依赖翻译口播。培训与教学讲师克隆一次形象后课程更新只需改文案无需反复进棚录制形象、音色、节奏全程保持一致。批量、重复、需要同一张脸说新内容的工作都是这套离线数字人方案最省时间的地方。顺带提醒一句授权本项目支持全球免费商用但用户量超 10 万或年营收达 1000 万美元以上的企业需签署商业许可协议商用前看一眼 LICENSE 总没错。部署完成、跑通第一条视频后建议你把 doc/常见问题.md 收藏起来——之后 90% 的报错答案都在里面遇到新问题先按第 4 节的三步自查法收集日志再去找社区效率最高。【免费下载链接】Duix-Avatar Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表