尧图网站设计 尧图网站设计YAOTU DESIGN
ARTICLE DETAIL

资讯详情

深耕网站设计与一线实操的经验洞察。

用微信聊天记录训练 WeClone 数字分身:从零到上线完整教程

用微信聊天记录训练 WeClone 数字分身:从零到上线完整教程 用微信聊天记录训练 WeClone 数字分身从零到上线完整教程【免费下载链接】WeClone One-stop solution for creating your AI twin from chat history Fine-tune LLMs with your chat logs to capture your unique style, then bind to a chatbot to bring your digital self to life.项目地址: https://gitcode.com/GitHub_Trending/we/WeClone假如你想让 AI 用你的语气在微信里回消息、代你应付闲聊和重复问题WeClone 就是为这个场景做的先导出你的微信聊天记录用它微调一个大语言模型得到一个数字分身再把分身绑定到聊天入口就能持续提供服务。本教程按数据 → 训练 → 上线的完整链路走一遍每步都给出可直接执行的命令。项目速览数字分身搭建的三个阶段WeClone 的核心链路只有一条聊天记录 → 模型微调 → 对话 API三个阶段在仓库里各对应一个位置。数据用 PyWxDump 之类的工具把聊天记录导出为 CSV 放进data/目录make_dataset/ 下的脚本会剔除手机号、身份证号等敏感内容并可按禁用词库整句过滤后转成训练集训练基于 llmtuner 框架对默认底座 ChatGLM3-6B 做 LoRA 微调只训练少量低秩矩阵显存需求远低于全参训练数据量和质量直接决定分身像不像你服务训练完成后由src/api_service.py起一个对话 API微信机器人与终端对话都调用这同一个接口WeClone 环境要求与依赖安装环境搭建 1 小时内可以完成唯一硬性前置是一台带 GPU 的机器因为默认 7B 模型走 LoRA 微调约需 16GB 显存。开始前对照这份清单Python 3.8 以上推荐 3.10内存 ≥8GB要训练的话建议显存 ≥16GB 的显卡已安装 Git然后分三步走。第一步克隆代码git clone https://gitcode.com/GitHub_Trending/we/WeClone cd WeClone第二步装依赖。requirements.txt 锁定了 llmtuner0.5.3微调框架和 itchat-uos微信接口两个核心包外加 pandas、chromadb 等数据处理工具pip install -r requirements.txt第三步启动验证。直接跑终端对话python src/cli_demo.py首次运行会先拉取底座模型问一句能看到流式回复输出就说明链路通了可以先熟悉一下界面里的exit退出和clear清空历史两个命令。WeClone 用法走查入口一共三个终端对话、微信机器人、重新训练各自对应一个入口文件。命令行对话启动方式入口是 src/cli_demo.py运行python src/cli_demo.py即可无需任何参数。终端里输入问题模型流式返回回答建议每聊十几轮执行一次clear把历史清掉、释放显存。微信聊天机器人部署步骤src/wechat_bot/ 里的机器人只是本地 API 的客户端必须先起服务再登录微信两条命令分别在两个终端里执行python src/api_service.py python src/wechat_bot/main.py第二条命令执行后终端会打印二维码扫码登录成功即可私聊或到群里 它 触发回复第一个终端要保持运行。数据转换与模型训练流程把导出的 CSV 放到data/csv运行 make_dataset/ 下脚本生成 JSON 训练数据默认把同一人连续的多句回答用逗号合并。训练分两段src/train_pt.py 是预训练可跳过src/train_sft.py 是微调必做运行python src/train_sft.py即可。学习率、批大小等参数集中在 settings.json 里调整多卡训练用 deepspeed 拉起配置见 ds_config.json。常见坑与处理办法新手卡住的基本是四类问题按现象对号入座即可。显存不足训练中断日志报 OOM 时调小 settings.json 里的per_device_train_batch_size与gradient_accumulation_steps或改用 QLoRA4bit 量化下 7B 微调可压到约 6GB 显存。扫码登录不上或频繁失效itchat-uos 走的是微信网页版接口部分账号受限换一个小号并确保已绑定银行卡主号不要上——README 明确提示有封号风险。回复速度慢机器人默认保留 15 轮对话历史轮次越多生成越慢先确认推理跑在 GPU 上也可以把历史长度调短换速度。聊天数据有隐私泄露风险脚本默认去除手机号、身份证号、邮箱、网址make_dataset/blocked_words.json 可追加自己的禁用词训练前仍建议把导出的 CSV 人工过一眼。下一步很具体把data/csv里示例 CSV 换成你自己导出的聊天记录重跑一遍python src/train_sft.py再启动 API 服务得到的就是一个真正像你说话的 WeClone 数字分身。【免费下载链接】WeClone One-stop solution for creating your AI twin from chat history Fine-tune LLMs with your chat logs to capture your unique style, then bind to a chatbot to bring your digital self to life.项目地址: https://gitcode.com/GitHub_Trending/we/WeClone创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表