尧图网站设计 尧图网站设计YAOTU DESIGN
ARTICLE DETAIL

资讯详情

深耕网站设计与一线实操的经验洞察。

LoRA 和 QLoRA 的核心区别

LoRA 和 QLoRA 的核心区别 1. LoRA 是什么LoRA全称是Low-Rank Adaptation低秩适配微调。正常全参微调是模型所有参数都参与训练比如一个 7B 模型大约有 70 亿参数全部训练显存压力很大。LoRA 的做法是冻结原始大模型参数 只在部分线性层旁边加一小组可训练参数 训练这些新增的小参数也就是说原模型本体不动只训练一个“小外挂”。可以简单画成原始权重 W冻结不训练 输入 x → W x LoRA新增参数部分LoRA 微调完后保存的不是整个模型而是一个很小的adapter文件。例如原始模型7B十几 GB LoRA adapter几十 MB 到几百 MB2. QLoRA 是什么QLoRA 可以理解为Quantized LoRA也就是量化版 LoRA。它比 LoRA 多做了一步先把原始模型从 FP16/BF16 压缩成 4bit 然后再做 LoRA 微调普通 LoRA原模型用 FP16/BF16 加载 LoRA 参数参与训练QLoRA原模型用 4bit 加载 LoRA 参数参与训练所以 QLoRA 的最大优势是显存占用更低比如同样微调 7B 模型微调方式原模型精度是否训练原模型显存占用效果全参微调FP16/BF16是很高上限最高LoRAFP16/BF16否中等很好QLoRA4bit否最低接近 LoRA3. 两者最关键的区别区别一原模型加载精度不同LoRA 一般这样原模型FP16 / BF16 LoRA参数FP16 / BF16QLoRA 一般这样原模型4bit量化 LoRA参数FP16 / BF16所以 QLoRA 更省显存。区别二显存需求不同举个大概例子模型规模LoRA 大概显存QLoRA 大概显存7B16GB 左右6GB–10GB 左右13B/14B32GB 左右12GB–18GB 左右30B/32B60GB24GB–32GB 左右65B/70B120GB48GB–80GB 左右实际显存还和这些因素有关batch size sequence length gradient checkpointing optimizer 是否多卡 是否使用 flash attention区别三训练速度和稳定性不同一般来说LoRA更稳定训练速度可能更快效果略好 QLoRA更省显存但训练和推理时有量化/反量化开销如果你的显存够优先 LoRA。如果你的显存不够就用 QLoRA。4. 效果通常情况下全参微调 LoRA ≈ QLoRA但在很多实际任务中LoRA 和 QLoRA 的效果差距不大。特别是你做这些任务时领域问答 格式转换 标准文件解析 企业年报文本分析 代码风格学习 指令遵循增强QLoRA 完全够用。5.部署如何部署服务器情况推荐单卡 8GBQLoRA小模型单卡 12GBQLoRA3B/7B 级别单卡 16GBQLoRA 为主LoRA 可尝试小模型单卡 24GB例如 RTX 3090/4090QLoRA 微调 7B/14BLoRA 微调 7B单卡 48GBLoRA 7B/14BQLoRA 32BA100 80GBLoRA 32BQLoRA 70B多卡服务器可以考虑 LoRA 大模型或全参微调如果你是常见的RTX 3090/4090 24GB推荐Qwen2.5-7B-Instruct QLoRA Qwen3-4B/8B QLoRA Llama-3.1-8B-Instruct QLoRA
返回列表