尧图网站设计 尧图网站设计YAOTU DESIGN
ARTICLE DETAIL

资讯详情

深耕网站设计与一线实操的经验洞察。

Duix.Avatar 本地部署实测:10 秒视频,在电脑上做出会说话的 AI 数字人

Duix.Avatar 本地部署实测:10 秒视频,在电脑上做出会说话的 AI 数字人 Duix.Avatar 本地部署实测10 秒视频在电脑上做出会说话的 AI 数字人【免费下载链接】Duix-Avatar Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-AvatarDuix.Avatar 是一款可以完全离线跑在自己电脑上的开源 AI 数字人工具上传一段 10 秒的自拍视频就能克隆你的脸和声音再输入一段文案自动生成口型对得上的口播视频数据全程不上传。本文按硬件检查、装 Docker、启动服务、做出第一支视频的顺序给出实测步骤适合想体验数字人视频但没有技术背景的普通电脑用户。从一个 10 秒的视频开始假设你手边什么都没有一台装了英伟达显卡的电脑、手机、一段自拍。你用手机录一段 10 秒左右的正面视频边走边说话丢进软件。几分钟后你的数字分身建好了——同一张脸、同一个音色。接下来你只要在输入框里敲一段文案它就能对着镜头把这段话说出来嘴型基本对得上最后导出一条可以发出去的 mp4。全程不用联网视频和声音都没离开过你的硬盘。它能不能做先说清楚它能做用 10 秒左右带人声的视频克隆你的外貌和声音输入文字自动生成口播视频文案支持中、英、日、韩、法、德、阿拉伯、西语 8 种语言也可以上传自己的录音让数字人照着这段声音表演全离线运行素材和成片都留在本地一次建好形象后可以反复生成多条视频它暂时做不了实时互动问答开源版做的是离线视频合成不是直播数字人没有英伟达显卡就跑不起来AMD 显卡和核显都不支持客户端目前只适配 Windows 1019042.1526 及以上和 Ubuntu 22.04先确认你的电脑跑不跑得动所有算力都在本地显卡上硬件达标是第一步。官方推荐配置如下项目建议配置说明系统Windows 1019042.1526或 Ubuntu 22.04客户端仅支持这两个平台CPU13 代 i5-13400F 及以上主要吃内存和多任务内存32GB16GB 偏紧语音识别服务可能起不来显卡英伟达独显推荐 RTX 4070显存 8GB 可用精简版服务硬盘系统盘留 100GB、数据盘留 30GBWindows服务镜像约 70GB 流量先做两个检查打开终端输入nvidia-smi能看到显卡型号和驱动版本就说明驱动装好了这一步失败后面全部免谈再用此电脑看一下磁盘剩余空间不够就先清理。从零到服务跑起来1. 装好 DockerWindows在命令提示符依次输入wsl --list --verbose和wsl --update前者确认 WSL 已安装后者把内核升到最新。然后安装 Docker Desktop首次启动接受协议、跳过登录。成功的样子窗口左下角显示 Engine running。如果系统盘剩余空间不足 100GB在设置 → Resources → Advanced 里把镜像存储位置改到空间更大的盘改完点 Apply restartUbuntu 用户跳过这步装好 Docker 和 NVIDIA Container Toolkit 即可。2. 拿到代码并启动服务执行git clone https://gitcode.com/GitHub_Trending/he/Duix-Avatar克隆仓库进入deploy目录执行docker-compose up -d。它会拉取三个容器语音识别ASR、语音合成TTS、视频渲染。首次下载约 70GB 流量耐心等半小时到一小时建议挂 WiFi 或有线。成功的样子打开 Docker看到duix-avatar-asr、duix-avatar-tts、duix-avatar-gen-video三个容器全部显示 Running端口分别是 10095、18180、8383。显存只有 8GB 或硬盘紧张改用docker-compose -f docker-compose-lite.yml up -d精简版只起一个容器也能跑RTX 50 系显卡用docker-compose-5090.yml。3. 装客户端到项目 Releases 下载官方打包的安装包Windows 双击 exe 安装、Ubuntu 直接运行 AppImage 文件。成功的样子打开软件看到上面那张Create Video / Create Avatar主页且我的作品页能正常加载连不上就去检查三个容器是否都在运行。做出你的第一支数字人视频 素材比参数重要先按这个标准录时长 10 秒上下正面机位全程连续说话必须有声音、人在说话这是硬性要求后面会解释光线均匀、面部占满大半个画面。操作顺序点Create Avatar上传刚才的视频系统会自动把音频轨分离出来做声音克隆同时在我的数字人里生成你的形象点Create Video选中刚建好的形象输入文案或直接上传一段录音文案写多少说多少点生成等待渲染一条 1 分钟左右的视频通常要几分钟到我的作品里预览、导出成片两个小建议首条视频先用 50 字以内的短句测通流程别一上来就写长稿语速保持默认即可想更紧凑时把文案写短比调参数更直接。10 秒视频怎么变成你的数字分身打个比方它不是给你的脸贴了个面具而是像学皮影戏。那 10 秒视频是教材——系统把你的脸拆成几百个关键点逐帧记录每个点跟着声音怎么动嘴唇什么时候开、下巴怎么落。这套动作套路连同你的音色一起被记住。合成时它先把文案变成你的声音再逐帧比对声音让脸上的关键点照着套路动起来最后拼回视频。所以素材里你说得越清楚、画面越稳教材质量越高回放起来越像。想批量做的时候三个服务启动后都开了本地接口18180 是语音合成8383 是视频合成10095 是语音识别都可以通过http://127.0.0.1访问。比如用一行curl -X POST http://127.0.0.1:8383/easy/submit提交音频和形象的视频合成任务再用GET http://127.0.0.1:8383/easy/query?code任务码轮询进度。客户端源码里 src/main/service/ 下的 model、video、voice 三个文件就是现成的调用示例照着改就能把自己的批量脚本接上。最容易踩的三个坑新建形象报错声音克隆失败。原因几乎都是上传的视频里没有声音、或者人没在说话——程序靠这段音频做声音克隆静音视频必然失败。处理重录一段 10 秒连续说话的素材。想看具体报错客户端右上角菜单Open Log可打开日志目录执行 docker-compose 时拉镜像超时报 request canceled / Client.Timeout。原因是 Docker Hub 官方源连接不稳定。处理在 Docker 设置 → Docker Engine 里加一段 registry-mirrors 加速镜像配置保存后重启再重新执行拉取服务起不来或建形象时报 Connection refused。要么机器没有英伟达显卡/驱动没装好本项目所有算力在本地 GPU 上缺一个都启动不了要么语音识别服务本身启动慢服务端刚拉起来就急着克隆16GB 内存的机器尤其明显。处理先nvidia-smi确认驱动服务启动后等几分钟再建形象点容器看日志定位卡在哪一步更多自查步骤可以看仓库里的 doc/常见问题.md。现在就可以开始一句话总结一块英伟达显卡 三个容器 一段 10 秒的说话视频你在本地就有一个随叫随到的数字分身。第一步就去做装好 Docker 后进入 deploy/ 目录执行启动命令等三个容器变绿剩下的交给客户端。【免费下载链接】Duix-Avatar Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表