LoRA:低秩自适应大语言模型(论文翻译)
最近更新:2026-07-17   |   字数总计:22.7k   |   阅读估时:96分钟   |   阅读量:
  1. 原文第 1-1 页
  2. 摘要
  3. 1 引言
  4. 原文第 2-2 页
  5. 原文第 3-3 页
    1. 是否现有的解决方案足够好?
    2. 适配器层引入推理延迟
    3. 直接优化提示词困难
  6. 原文第 4-4 页
    1. 4 我们的方法
      1. 4.1 低秩参数化更新矩阵
      2. 全量微调的一种推广
      3. 无额外推理延迟
  7. 原文第 5-5 页
    1. 4.2 将 LoRA 应用于 Transformer
    2. 实用优势与局限性
    3. LoRA 的局限性
    4. 5 实验
    5. 5.1 基线
  8. 原文第 6-6 页
  9. 原文第 7-7 页
    1. 5.2 RoBERTa 基础版 / 大型
  10. 原文第 8-8 页
    1. 5.5 扩展至 GPT-3 175B
    2. 6 相关工作
  11. 原文第 9-9 页
  12. 原文第 10-10 页
    1. 7.1 应该对Transformer中的哪些权重矩阵应用LoRA?
    2. 7.2 LoRA的最佳等级r是多少?
  13. 原文第 11-11 页
  14. 原文第 12-12 页
  15. 8 结论与未来工作
  16. 原文第 13-13 页
  17. 原文第 14-14 页
  18. 原文第 15-15 页
  19. 原文第 16-16 页
  20. 原文第 17-17 页
    1. 表 8:微调 vs 少量样本学习
    2. 适配器层引入的推理延迟
    3. 数据集详情
  21. 原文第 18-18 页
    1. D.1 RoBERTa
  22. 原文第 19-19 页
    1. D.3 GPT-2
    2. D.4 GPT-3
  23. 原文第 20-20 页
    1. WikiSQL (Zhong et al., 2017),MNLI (Williams et al., 2018) 和 SAMSum (Gliwa et al., 2019) 的超参数设置为768、2048。我们对所有方法-数据集组合进行了学习率调整。更多关于使用的超参数细节见第D.4节。对于前缀嵌入调优,我们发现最优的lp和li分别为256和8,总计3.2M可训练参数。使用lp = 8和li = 8进行前缀层调优,共有20.2M可训练参数以获得最佳性能。我们为LoRA提供了两种参数预算:4.7M(rq=rv=1r_q = r_v = 1rq​=rv​=1 或 rv=2r_v = 2rv​=2)和37.7M(rq=rv=8r_q = r_v = 8rq​=rv​=8 或 rq=rk=rv=ro=2r_q = r_k = r_v = r_o = 2rq​=rk​=rv​=ro​=2)。我们从每次运行中报告最佳验证性能。我们的GPT-3实验中的训练超参数见表12。
    2. 结合LoRA与前缀调优
  24. 原文第 21-21 页
  25. 训练周期2
    1. 原文第 22-22 页
      1. 方法 WebNLG
      2. F.2 GPT-3 不同适应方法的附加实验
      3. F.3 低数据域
      4. G 测量子空间之间的相似性
    2. 原文第 23-23 页
    3. 原文第 24-24 页
    4. 原文第 25-25 页
      1. H.4 放大因子
    5. 原文第 26-26 页
      1. 表 18:不同 rrr 选择下 GPT-2 Medium 的验证损失和测试指标