尧图网站设计 尧图网站设计YAOTU DESIGN
ARTICLE DETAIL

资讯详情

深耕网站设计与一线实操的经验洞察。

Text Generation Web UI 本地大模型聊天界面:从克隆到上手的实用指南

Text Generation Web UI 本地大模型聊天界面:从克隆到上手的实用指南 Text Generation Web UI 本地大模型聊天界面从克隆到上手的实用指南【免费下载链接】textgenOpen-source desktop app for local LLMs. Text, vision, tool-calling, OpenAI/Anthropic-compatible API. 100% private.项目地址: https://gitcode.com/GitHub_Trending/te/textgenText Generation Web UI 是一个运行在你自己电脑上的大模型聊天与文本生成界面基于 Gradio 构建整个对话过程不依赖外网服务。它适合想在本地部署大模型的开发者、研究者也包括只想和模型聊聊天、做点创作验证的普通用户。三步本地部署 Text Generation Web UI整个过程只需要一条命令链git clone https://gitcode.com/GitHub_Trending/te/text-generation-webui cd text-generation-webui ./start_linux.sh克隆仓库macOS 和 Windows 用户把启动脚本换成 start_macos.sh 或 start_windows.bat。启动脚本会替你创建虚拟环境并安装依赖不用手动折腾 pip。服务起来后浏览器访问http://localhost:7860就能进入界面。如果脚本装依赖不理想也可以手动装好 requirements 里对应硬件的依赖文件然后直接执行python server.py启动效果相同。打开界面先看这三块聊天区主界面是 Chat 标签页左侧是对话窗口右侧面板放着生成按钮和各类参数滑条。回复支持代码高亮和 LaTeX 公式渲染Markdown 也能正常排版。模型与后端选择把模型文件放进 user_data/models/ 目录界面会自动识别。多文件模型如 Transformers 格式的 safetensors要单独放一个子文件夹。换模型不用重启程序在 Model 标签页切换即可。主题与设置入口界面右上角可以切换深浅两种主题右侧滑条即参数面板所有生成选项都集中在这里调完点 Apply 生效。按硬件选择模型后端这个项目的核心优势之一是后端可插拔装好后端后在界面上直接切换。常见组合如下硬件条件推荐后端选择理由无独显 / 纯 CPUllama.cppGGUF无需 GPU单文件模型即可运行8GB 及以下显存GPTQ / AWQ 量化模型走 Transformers量化后显存占用明显下降中低端卡也能跑12GB 以上显存、常规 GPUTransformers生态成熟模型覆盖广多文件模型直接加载高端 NVIDIA 显卡、追求速度EXL2 / EXL3推理速度快适合显存宽裕的机器模型下载后放进 models 目录界面自动识别这一步对后端没有差别。温度与最大生成长度怎么设参数面板里最值得先理解的两个值是 temperature温度和生成长度查资料、问事实温度设 0.3–0.7输出更稳定少跑题。写文案、头脑风暴温度提到 0.8–1.2允许更多样的表达。需要完全可复现的结果温度归 0每次输出一致。生成长度按内容定几百字以内的事问答几百 token 就够不要图省事拉满长度越长耗时越明显。注意采样器互斥mirostat 和 dynamic temperature 这类随机性控制手段不要同时开启。把界面玩出花样仓库自带的角色卡示例Example头像与人设描述都放在同一目录里角色卡user_data/characters/ 目录下每个 YAML 文件就是一个角色仓库自带 Assistant 和 Example 两张卡照着格式改人设和开场白聊天区就能切换到对应角色。扩展插件extensions/ 里内置了不少现成插件语音合成silero_tts、coqui_tts、语音转文字、图片生成画廊、Google 翻译都在列装进对应目录即可启用。LoRA 微调Training 标签页支持用多轮对话或纯文本数据集微调 LoRA训练中断也能断点续训产物放回 user_data/loras/ 就能挂在模型上使用。卡住了这样排查显存不够OOM换更低比特量的量化模型或者把后端切到 llama.cpp 并调小上下文长度。生成速度慢先确认服务确实跑在 GPU 上而不是 CPU再看模型是不是明显大于你的显存能舒服承载的量级。模型加载失败多文件模型必须放进 models 下的独立子文件夹GGUF 单文件直接放即可。加载报错时先核对文件是否完整、格式与所选后端是否匹配。从 clone 到访问 localhost:7860 通常只要几分钟。建议先找一个 7B–8B 量级的 GGUF 模型跑通第一轮对话再按上面表格换后端、调温度逐步把它调成自己顺手的样子。【免费下载链接】textgenOpen-source desktop app for local LLMs. Text, vision, tool-calling, OpenAI/Anthropic-compatible API. 100% private.项目地址: https://gitcode.com/GitHub_Trending/te/textgen创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表