您现在的位置是:首页 > 技术资料 > 衍生技术QLoRA
推荐星级:
  • 1
  • 2
  • 3
  • 4
  • 5

衍生技术QLoRA

更新时间:2026-06-30 08:23:52 大小:15K 上传用户:江岚查看TA发布的资源 标签:QLoRA 下载积分:2分 评价赚积分 (如何评价?) 打赏 收藏 评论(0) 举报

资料介绍

一、什么是QLoRA

QLoRA的全称是Quantized Low-Rank Adaptation,即量化低秩适配,是大语言模型参数高效微调领域的衍生技术,它由LoRALow-Rank Adaptation,低秩适配)技术发展而来,结合了4比特量化技术,在保持模型微调效果接近全参数微调的同时,大幅降低了微调过程中的显存占用,让普通消费级硬件也能完成百亿参数甚至千亿参数大模型的微调工作。

LoRA技术的核心思路是冻结预训练大模型的原始权重,只在模型的Transformer块中注入小规模的低秩矩阵,微调过程中仅更新这些低秩矩阵的参数,整体可训练参数量仅为全参数微调的不到10%,大幅降低了显存门槛。但当模型规模达到70B甚至更大时,即使只冻结原始权重,加载完整的半精度原始权重仍然需要十几GB甚至数十GB的显存,普通消费级GPU依然无法承载。QLoRA正是针对这一痛点推出的衍生技术,它将预训练模型的原始权重量化为4比特保存,仅在推理计算时反量化到半精度进行计算,同时保留LoRA的低秩适配思路,进一步将显存需求降低到原来的四分之一左右,让7B参数模型可以在仅需要6GB左右显存的消费级GPU上完成微调,打破了大模型微调的硬件壁垒。

二、QLoRA的核心技术原理

QLoRA的性能提升来自三个核心技术创新:4比特标准化浮点数量化(Normalized Float 4-bit, NF4双量化(Double Quantization以及分页优化器(Paged Optimizer,这三个技术共同作用,在不损失模型精度的前提下实现了显存的极致压缩。

1. 4比特标准化浮点数量化(NF4

传统的均匀量化方法会将浮点数权重均匀映射到低比特空间中,但预训练大模型的权重分布通常是接近标准正态分布的,大部分权重集中在0附近,极端大权重的占比很低,均匀量化会对权重分布密集区域造成较大的量化误差。NF4针对预训练模型权重的正态分布特性做了优化,它首先将预训练模型的权重按照标准正态分布做归一化处理,再根据正态分布的分位数划分量化区间,让权重分布更密集的区域拥有更多量化等级,分布稀疏的极端大权重区域减少量化等级,从而大幅降低整体的量化误差。实验结果显示,NF4量化的精度比传统均匀4比特量化高出约1个百分点,和16-bit全精度模型的精度差距不到0.5个百分点,几乎不会影响模型最终的微调效果。


部分文件列表

文件名 大小
衍生技术QLoRA.docx 15K

全部评论(0)

暂无评论

上传资源 上传优质资源有赏金

  • 打赏
  • 30日榜单

推荐下载