
Open-LLM-VTuber 使用手册让 Live2D 角色对着麦克风开口聊天【免费下载链接】Open-LLM-VTuberTalk to any LLM with hands-free voice interaction, voice interruption, and Live2D avatar running locally across platforms项目地址: https://gitcode.com/GitHub_Trending/op/Open-LLM-VTuberOpen-LLM-VTuber 部署后是一套可完全本地运行的语音交互服务麦克风音频先经 ASR 引擎识别LLM 生成回复文本TTS 引擎合成语音Live2D 模型同步渲染角色表情与口型。 快速跑通前置检查检查项要求Python3.10 且 3.13pyproject.toml硬性约束该版本区间包管理器uv项目自带uv.lock锁文件磁盘余量建议 10GB 以上模型统一下载到项目内models/目录联网需要首次启动初始化frontend子模块并下载 ASR/TTS 模型默认edge_tts音色为在线服务启动命令序列# 克隆仓库 git clone https://gitcode.com/GitHub_Trending/op/Open-LLM-VTuber # 进入项目目录 cd Open-LLM-VTuber # 同步锁文件版本依赖uv 自动创建虚拟环境 uv sync # 把默认配置复制为运行时 conf.yaml cp config_templates/conf.default.yaml conf.yaml # 启动 Uvicorn 服务 uv run run_server.py此时浏览器打开http://localhost:12393端口取system_config.port默认值页面中央渲染默认 Mao 模型mao_pro左侧是聊天记录底部为麦克风按钮。点击麦克风说一句话角色识别内容并出声回复即部署成功。它实际能做什么对着麦克风说话动作点击底部麦克风按钮自由交谈角色说话中途再开口当前语音会被立即打断。 内部音频流先经 VAD 检测人声端点随后送入 ASR默认 sherpa-onnx SenseVoice解析为文本Agent 把文本交给 LLM回复按句切分并流式送入 TTS第一句生成即出声无需等全文。 可调basic_memory_agent.faster_first_response控制是否在第一句首个逗号处提前开口vad_config.silero_vad的prob_threshold、required_misses决定端点灵敏度。共享屏幕让角色看画面动作把输入方式从麦克风切换为摄像头或屏幕共享角色即可看到摄像头画面或桌面窗口。 内部前端把画面帧回传后端与对话上下文合并后交给 LLM 解析视觉内容会改变后续回复。 可调解析能力取决于llm_configs所选模型是否支持多模态输入模型不可用时该功能不生效详见官方文档。把角色放进桌面当桌宠动作切换到客户端的桌宠模式Live2D 角色透明置顶悬浮在屏幕任意位置可拖拽到编辑器或播放器角落。 内部宠物模式支持全局置顶与鼠标点击穿透窗口模式与桌宠模式在前端界面自由切换。 可调模型由conf.yaml的live2d_model_name指定名称必须与model_dict.json中登记的一致。按需定制切换角色与引擎不需要改代码在 characters/ 目录新建 yaml只覆盖需要修改的字段即可从页面角色列表切换人设覆盖机制见 characters/README.md。改一行配置切换 ASR/TTS 引擎场景修改字段生效效果LLM 完全离线运行agent_config.agent_settings.basic_memory_agent.llm_provider默认ollama_llm改为llama_cpp_llm并填写 GGUF 模型路径推理全程不走网络更换语音识别引擎asr_config.asr_model默认sherpa_onnx_asr切到faster_whisper、fun_asr等并补全对应子配置语言与模型规模随之可调换音色 / TTS 离线tts_config.tts_model默认edge_tts在线音色切到piper_tts或sherpa_onnx_tts并指定 onnx 模型路径合成本地完成完整字段说明见 config_templates/conf.default.yaml。 排障速查症状最常见原因处理动作浏览器显示{detail:Not Found}frontend子模块未初始化git 拉取失败检查frontend/index.html是否存在重跑启动脚本或手动执行git submodule update --init --recursiveuv sync安装失败Python 版本不在 3.10、3.13 区间python --version核对换用匹配的 Python 解释器启动后长时间无响应首次运行在从 Hugging Face / ModelScope 下载 ASR/TTS 模型等待下载完成或以--hf_mirror参数启动切换 HF 镜像识别错字多、断句不灵敏ASR 语言设置不符或 VAD 阈值不当在asr_config对应引擎中填写language调整vad_config的prob_threshold、required_misses远程非 localhost访问麦克风不可用浏览器仅在安全上下文中开放麦克风走 localhost 访问或配置 https 反向代理说明见 README.CN.md下一步完整安装流程与系统依赖说明见 README.CN.md 中指向的官方文档 Quick Start 页。社区渠道QQ 用户群 792615362、Zulip 开发者社区、Discord 服务器v2.0 重写讨论在 Zulip 进行。二次开发入口src/open_llm_vtuber/agent/ 的 Agent 接口、src/open_llm_vtuber/asr/ 与 src/open_llm_vtuber/tts/ 引擎工厂、prompts/ 提示词模板。v1 线持续修复 bug 并处理存量 PR部署前核对conf.yaml的conf_version与当前版本一致即可。【免费下载链接】Open-LLM-VTuberTalk to any LLM with hands-free voice interaction, voice interruption, and Live2D avatar running locally across platforms项目地址: https://gitcode.com/GitHub_Trending/op/Open-LLM-VTuber创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考