尧图网站设计 尧图网站设计YAOTU DESIGN
ARTICLE DETAIL

资讯详情

深耕网站设计与一线实操的经验洞察。

如何把中文法律大模型跑起来:6个主力法律模型的选型与私有化部署

如何把中文法律大模型跑起来:6个主力法律模型的选型与私有化部署 如何把中文法律大模型跑起来6个主力法律模型的选型与私有化部署【免费下载链接】Awesome-Chinese-LLM整理开源的中文大语言模型以规模较小、可私有化部署、训练成本较低的模型为主包括底座模型垂直领域微调及应用数据集与教程等。项目地址: https://gitcode.com/GitHub_Trending/aw/Awesome-Chinese-LLM想在公司内网跑一个能答法律问题的模型又不把合同发去外部 APIAwesome-Chinese-LLM 收录了一批可私有化部署的开源中文法律大模型单张 24GB 显卡就能起步这里把选型、部署和上线后的坑一次讲清。中文法律大模型能解决什么合同初审与合规咨询很多法务团队的日常卡在同两处合同初审排长队员工咨询回复慢。一份采购合同转给法务得先花几小时通读、标出风险点再逐条回邮件确认员工问一句“试用期能不能休年假”也得等到第二天才有答复。人只有两三个所有请求都在排队。这类重复性强的问答和初审工作正好适合交给模型。Awesome-Chinese-LLM 把开源的中文法律大模型整理成了清单从 6B 到 33B覆盖法律咨询、文书分析、法考问答等场景权重开源、可私有化部署合同和员工数据不用出内网。法律大模型选型先问自己两个问题选型别从名字入手先问两个问题你的显存有多少你的场景要什么问题一显存有多少决定能选多大。按 16-bit 权重估算显存占用大约是参数量的两倍字节6B 约 12GB13B 约 26GB33B 约 66GB再留出推理开销。对到你的分档单张 24GB3090/4090选 6B 档的獬豸(LawGPT_zh) 或 LexiLaw都是 ChatGLM-6B 底座。獬豸用真实律师问答和法条情景数据微调对话自然LexiLaw 是 MIT 协议商用更放心。理由一句话16-bit 直接装得下起步最稳。40~80GB 单卡上 13B 档。Lawyer LLaMA 基于 Chinese-Alpaca-Plus-13B用全国法考数据训练Apache-2.0 协议DISC-LawLLM 基于 Baichuan-13B 微调自带检索增强模块。7B 档的 LaWGPT扩充了法律专有词表和韩非(HanFeiBLOOMZ-7B1 底座多轮对话强)也都够跑。理由一句话专业推理上一个台阶仍然单卡能跑。双卡 40GB 以上ChatLaw-33B基于 Anima-33B或 LaWGPT 这类大规模预训练模型。理由一句话复杂法律研究和多步推理更强代价是必须多卡。问题二场景要什么决定挑哪个。做员工咨询问答优先多轮对话能力强的韩非、獬豸做裁判文书分析选带文书语料的LexiLaw 的训练数据里含 5 万份法律文书做提问与法条的匹配可以看 ChatLaw-Text2Vec 这类相似度模型。另外注意协议LaWGPT 是 GPL-3.0、ChatLaw 是 AGPL-3.0商用前查一遍 doc/Legal.md 里的 License 字段。开源法律大模型私有化部署四步跑起来1️⃣拿清单。克隆仓库对着 doc/Legal.md 逐个看底座、数据和训练算力核对自己的显卡git clone https://gitcode.com/GitHub_Trending/aw/Awesome-Chinese-LLM cd Awesome-Chinese-LLM2️⃣装环境。一台能出网下载的 GPU 服务器即可装好 CUDA、PyTorch 和 transformerspip install torch transformers3️⃣下权重。仓库只整理清单、不托管权重。按你在 doc/Legal.md 里选定的模型到对应项目渠道下载权重文件放到服务器的 ./models 目录。4️⃣本地验证。加载模型问两三个业务里最常碰的问题看法条引用是否靠谱from transformers import AutoModel, AutoTokenizer tokenizer AutoTokenizer.from_pretrained(./models/your-law-model) model AutoModel.from_pretrained(./models/your-law-model).cuda().half()能流畅回答就接上内网入口网页或 IM 机器人让团队试用。落地场景合规咨询机器人的一天拿韩非举例部署到内网接到公司 IM 里。早晨HR 问“员工病假期间合同到期不续签赔偿怎么算”机器人先给结论再列出对应法条把出处一起贴上。上午研发同事问竞业协议的范围答案里引用了相关法条。下午有人问了一个模型没把握的问题回答偏笼统法务同事手动修订后把这条问答存进常见问题库后面再喂给模型。上线前可以先做基线测试韩非的评估集覆盖劳动、婚姻等 9 个板块共 150 道法律问题够用来判断“能不能上”。踩坑与进阶量化压缩和推理加速坑一13B 模型直接 OOM。16-bit 权重装不下时别急着换卡先量化。8-bit 量化显存约减半4-bit 约减到四分之一13B 模型能从 26GB 压到 13GB 甚至 7GB 上下24GB 的卡就有得跑了。仓库里的 YuLan-Chat 量化后一张 RTX 3090 就能部署Baichuan 系列也直接发布了 4bit 量化版质量损失通常在可接受范围。坑二单人能用多人排队。吞吐上不去换推理框架比加卡便宜。仓库收录的 fastllm 针对 ChatGLM-6B 级模型单卡可达 10000 token/s要接多人并发用 vLLM 做批处理推理吞吐再上一个台阶。下一步就三件事确认显卡显存从 6B/7B 档里挑一个模型这周先在内网机器上把 demo 跑通。demo 稳定后攒上千条自己业务的问答用 LoRA 微调出贴合公司业务的版本。【免费下载链接】Awesome-Chinese-LLM整理开源的中文大语言模型以规模较小、可私有化部署、训练成本较低的模型为主包括底座模型垂直领域微调及应用数据集与教程等。项目地址: https://gitcode.com/GitHub_Trending/aw/Awesome-Chinese-LLM创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表