
用微信聊天记录微调出你的专属数字分身简单搭建指南实战【免费下载链接】WeClone One-stop solution for creating your AI twin from chat history Fine-tune LLMs with your chat logs to capture your unique style, then bind to a chatbot to bring your digital self to life.项目地址: https://gitcode.com/GitHub_Trending/we/WeCloneWeClone 是一站式数字分身搭建工具用你自己的微信聊天记录微调大语言模型产出一个说话方式和你能上弦的智能对话API。具备一点 Python 基础就能三步跑通。 数字分身最能派上用场的三个场景先不看步骤看三个真实画面。重复消息代回。同类问题扎堆涌来——版本什么时候发文档在哪密码怎么重置你光回复就累。让分身先接住草稿按你的口吻生成你审核后发出或者干脆让它直接回。个人助理。它记得你聊天记录里反复出现的偏好喜欢短句、喜欢反问收尾、很少用感叹号。之后按这个调子回答不用每次提醒它设置。风格模仿。想做一个有你的味儿的线上人设或内容账号喂它一批聊天记录它能产出几条像你说话的初稿。共同点只有一个模型得真的消化过你的聊天风格。WeClone 干的就是这件事。 能力与门槛一览你能干什么、需要什么能力对你意味着什么个性化微调把个人微信聊天记录喂给模型让它按你的语气、你的习惯回答多形态交互一份微调成果CLI 终端、微信机器人、Web 页面三个入口通用快速部署从装环境到起服务只需几条命令配置简单门槛也不高开工前确认三样Python 3.8推荐 3.10内存至少 8GB16GB 以上更稳Git想微调模型还需要一张至少 16GB 显存的显卡 从零跑通三步走完最小路径第一步环境检查。终端执行python --version确认 3.8 以上Git 可用。第二步拿到代码。git clone https://gitcode.com/GitHub_Trending/we/WeClone cd WeClone第三步装依赖。requirements.txt 列了核心依赖其中 llmtuner 是 LLaMA-Factory 微调框架itchat-uos 负责微信接口pip install -r requirements.txt还有一件事推理前需按 README 下载基础模型默认 ChatGLM3体积较大下载要耐心等待。然后试跑命令行入口python src/cli_demo.py输入问题能收到回复说明链路已通。 两种打开方式命令行对话与微信机器人一、命令行对话src/cli_demo.py 是最轻的尝鲜方式用上一步的命令即可启动。输入问题逐条回复内置两个命令exit退出程序clear清空对话历史同时释放内存对话拉长后建议随手敲clear响应会更稳。想要网页版src/web_demo.py 会打开浏览器对话界面二、微信机器人部署这是最有代入感的一种玩法。先启动 API 服务再启动机器人 src/wechat_bot/main.pypython src/api_service.py python src/wechat_bot/main.py终端会显示二维码扫码登录微信即可。私聊直接发消息群聊里 它它都会回。提醒一句账号必须已绑定银行卡封号风险相关的问题留到下面的 FAQ 说。 微调专属模型聊天记录如何变成训练集想让分身真正像你得喂数据。数据准备用 PyWxDump 工具把微信聊天记录导出为 CSV放到./data目录再用 make_dataset/ 下的三个脚本处理。它们对同一个人连续回复多句的处理方式不同csv_to_json.py连续多句用逗号合并成一条回答csv_to_json-单句回答.py只取最长的一句作为最终数据csv_to_json-单句多轮.py多句放进对话历史字段保留多轮结构项目默认会剔除数据里的手机号、身份证号、邮箱、网址blocked_words.json 里还能追加要过滤的词句。训练模式二选一预训练 PTsrc/train_pt.py先用纯文本让模型适应你的表达风格提升幅度有限可做可不做监督微调 SFTsrc/train_sft.py问答对教模型何时该说什么是关键一步训练以 ds_config.json 作为分布式训练基准配置显存不够就调小单卡批量、用梯度累积补偿。❓ 高频问题速答Q聊天记录喂给模型有隐私风险吗项目默认剔除手机号、身份证号、邮箱、网址blocked_words.json 里还能加过滤词句含禁用词的整句会被去掉。数据存在本地进训练流水线的由你决定导出前先自查一遍敏感内容。Q内存 8GB 够吗跑一会儿变慢怎么办8GB 是运行下限对话历史越长占用越高。命令行里可以随手clear长会话后重开进程也行。训练则是另一个量级6B 模型 LoRA 微调至少要 16GB 显存。Q对话历史怎么清理两处内置命令行的clear立即清空微信机器人按人只保留最近 15 轮上下文更早的自动丢弃无需手动管理。Q挂真实微信账号有风险吗有封号风险。建议用专用小号别挂主号。结尾回到开头那个被同类消息包围的瞬间——这次让分身先去顶一阵。路径已经清楚导出聊天记录、备好数据、微调、上线智能对话API。先跑一遍命令行入口确认分身真能接住你的问题再谈部署。【免费下载链接】WeClone One-stop solution for creating your AI twin from chat history Fine-tune LLMs with your chat logs to capture your unique style, then bind to a chatbot to bring your digital self to life.项目地址: https://gitcode.com/GitHub_Trending/we/WeClone创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考