尧图网站设计 尧图网站设计YAOTU DESIGN
ARTICLE DETAIL

资讯详情

深耕网站设计与一线实操的经验洞察。

ChatGLM3-32K/128K长文本模型实战:论文阅读、文档摘要与财报分析效果提升50%的秘密

ChatGLM3-32K/128K长文本模型实战:论文阅读、文档摘要与财报分析效果提升50%的秘密 ChatGLM3-32K/128K长文本模型实战论文阅读、文档摘要与财报分析效果提升50%的秘密【免费下载链接】ChatGLM3ChatGLM3 series: Open Bilingual Chat LLMs | 开源双语对话语言模型项目地址: https://gitcode.com/zai-org/ChatGLM3ChatGLM3 系列中的ChatGLM3-6B-32K与ChatGLM3-6B-128K是智谱AI开源的双语对话大模型的长文本版本支持 32K 和 128K 上下文长度。官方人工评估显示在论文阅读、文档摘要、财报分析等长文本场景中其效果相比上一代模型平均提升了超过 50%。本文将带你快速上手这两个长文本模型并分享三大实战场景的 Prompt 技巧。一、为什么需要长文本模型3 个真实痛点 普通 8K 上下文的模型在处理长文档时经常遇到这些问题场景8K 模型的困境32K/128K 长文本模型 论文阅读一篇 15 页的论文装不进上下文只能截断整篇论文一次性输入精准定位章节 文档摘要长文档被迫分段摘要丢失跨段落关联全文摘要保持逻辑连贯 财报分析几百页年报无法整体理解128K 可处理超长财报横向对比数据核心秘密在于上下文越长模型能看到的信息越完整摘要和推理的质量就越高——这正是官方数据中 50% 提升的来源。二、ChatGLM3-32K/128K 快速上手3 步部署长文本模型1. 克隆仓库并安装依赖git clone https://gitcode.com/zai-org/ChatGLM3 cd ChatGLM3 pip install -r requirements.txt依赖说明详见 requirements.txt建议先按 PyTorch 官方说明安装对应版本的torch。2. 加载 32K / 128K 长文本模型只需把模型名称换成chatglm3-6b-32k或chatglm3-6b-128k用法和基础版完全一致from transformers import AutoTokenizer, AutoModel tokenizer AutoTokenizer.from_pretrained(THUDM/chatglm3-6b-32k, trust_remote_codeTrue) model AutoModel.from_pretrained(THUDM/chatglm3-6b-32k, trust_remote_codeTrue, devicecuda) model model.eval() response, history model.chat(tokenizer, 请总结下面这篇论文的核心贡献……, history[])3. 显存不够用 4-bit 量化或 CPU 推理长文本模型对显存要求更高仓库 DEPLOYMENT.md 给出了完整的低成本部署方案4-bit 量化一行.quantize(4)即可把显存需求降到一半左右生成质量依然流畅CPU 部署.float()加载需要约 32GB 内存适合无 GPU 环境多卡部署安装accelerate后自动切分模型到多张 GPU。三、三大实战场景与 Prompt 技巧 ✍️ChatGLM3 采用了全新的对话格式|user|、|assistant|等角色标记通过 System Prompt 可以精确控制输出风格格式规范见 PROMPT.md。下面是三个高频场景的 Prompt 模板场景 1论文阅读助手推荐 Prompt你将扮演一位论文阅读助手。请阅读下面这篇论文输出① 一句话核心贡献② 方法的关键创新点不超过 3 条③ 实验中最有说服力的数据④ 你认为的局限性。技巧把逐段翻译式提问改为结构化输出提问32K 上下文能覆盖全文模型给出的局限性分析会显著更准确。场景 2长文档摘要推荐 Prompt请为下面的文档写一份 300 字以内的执行摘要要求包含关键结论、核心数据和待办事项用 Markdown 分点输出。技巧明确字数上限 指定输出结构避免长文本摘要越写越长。场景 3财报分析推荐 Prompt作为资深金融分析师请分析下面这份财报① 营收与利润的同比变化② 现金流是否健康③ 给出 3 条风险提示。只基于文本中的数据作答不要编造。技巧128K 模型可以整份输入年报全文不要编造这句约束能明显减少幻觉。四、体验长文本对话网页版与命令行 Demo ️除了代码调用仓库内置了多种开箱即用的 Demo换成长文本模型即可体验完整的长文本对话。网页版 Demo基于 Gradio推荐新手cd basic_demo python web_demo_gradio.py运行 basic_demo/web_demo_gradio.py 后在浏览器打开输出的地址即可对话。此外 basic_demo/web_demo_streamlit.py 提供了更流畅的 Streamlit 版本。命令行 Demo运行 basic_demo/cli_demo.py 即可在终端中交互输入clear清空历史、stop退出综合 Democomposite_demo/main.py 集成了 Chat、Tool、Code Interpreter 三种模式适合想同时体验代码执行与长文本的用户详见 composite_demo/README.md五、常见问题 FAQ ❓Q132K/128K 模型支持工具调用Function Call吗目前只有 ChatGLM3-6B 基础版支持工具调用32K/128K 长文本版本暂不支持详见 tools_using_demo/README.md。做长文本处理时建议纯对话模式。Q2显存不够跑 128K 怎么办优先使用 4-bit 量化 多卡部署组合如果只是想体验可以先用 32K 版本32K 已能覆盖绝大多数论文和报告。Q3如何微调长文本模型适配自己的文档仓库提供了微调套件 finetune_demo/finetune_hf.py支持 LoRA、SFT 等方式配置模板在 finetune_demo/configs/ 中可参考 finetune_demo/README.md。Q4生成速度太慢可尝试 TensorRT-LLM 加速方案 tensorrt_llm_demo/README.md 或 Intel OpenVINO 方案 Intel_device_demo/openvino_demo/README.md。六、总结 选型日常论文/报告用 32K 足够超长年报、全书级别文档选 128K效果官方评测显示长文本场景平均提升超 50%多文档问答Multi-Doc QA从 34.7 提升到 46.1提升最明显上手路径克隆仓库 → 换模型名 → 套用本文三个 Prompt 模板10 分钟即可拥有自己的长文本处理助手。模型下载入口与更多细节请参考 README.md。【免费下载链接】ChatGLM3ChatGLM3 series: Open Bilingual Chat LLMs | 开源双语对话语言模型项目地址: https://gitcode.com/zai-org/ChatGLM3创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表