前缀微调
Definition
前缀微调是一种用于预训练变换器的参数高效适应技术。与更新所有模型权重不同,它在输入序列前prepend(前置)一系列可训练的连续向量(即前缀),从而冻结主干网络并仅优化少量参数以 …
Terms tagged with Fine-Tuning
前缀微调是一种用于预训练变换器的参数高效适应技术。与更新所有模型权重不同,它在输入序列前prepend(前置)一系列可训练的连续向量(即前缀),从而冻结主干网络并仅优化少量参数以 …
P-Tuning(提示微调)是一种旨在以最低计算成本将大型预训练语言模型适配到特定下游任务的技术。与微调所有模型参数不同,P-Tuning 仅优化少量可学习的提示向量,同时保持预 …
此条目指代标识符为 ‘Jackrong/Qwen3.5 Reasoning 700X’ 的特定数据集仓库。它通常用于监督微调(SFT)或强化学习等场景,旨 …
监督微调(SFT)涉及采用大型预训练模型(如语言模型),并在较小的高质量、针对特定下游任务标注的数据集上继续训练该模型。
在特定数据集上进一步训练预训练模型,使其 …
QLoRA 将低秩适应(LoRA)与 4 位量化相结合,显著减少了微调大规模模型所需的内存占用。通过将权重存储为 4 位格式并添加训练好的低秩适配器,该方法在保持性能的同时降低了 …
适配器是一种参数高效的微调技术,主要用于大型语言模型和Transformer架构中。与计算成本高昂的更新所有模型权重不同,适配器仅训练少量新增参数,从而保留预训练知识并降低资源消 …
基于人类反馈的强化学习(RLHF)是一种用于微调大型语言模型的方法,使其输出更好地符合人类的价值观和期望。它通常包括三个步骤:收集人类偏好数据、训练奖励模型以及使用强化学习算法( …
LoRA冻结预训练模型的权重,并在Transformer架构的每一层中插入可训练的分解矩阵。通过仅优化这些低秩矩阵,LoRA显著减少
低秩自适应是一种参数高效的微 …