今天看啥  ›  专栏  ›  吃果冻不吐果冻皮

全量指令微调有害!

吃果冻不吐果冻皮  · 公众号  · 互联网安全  · 2024-09-29 19:55
    

主要观点总结

本文介绍了关于使用指令微调预训练模型的相关讨论,特别关注了LoRA指令微调与全量微调的影响。文章指出,在充分预训练的基础上,LoRA指令微调能够帮助模型适应聊天等任务,但并不能让模型学习新知识。而全量微调虽然能让模型学习更多知识,但可能引入与测试场景无关的数据模式,导致模型答非所问。文章通过对比分析LoRA和全量微调在模型概率分布、loss变化、数据集规模扩大等方面的表现,得出了相关结论。

关键观点总结

关键观点1: LoRA指令微调并不能让模型学习新知识,但在预训练基础上能够帮助模型适应任务。

文章指出,LoRA指令微调主要是让模型学会输出的格式,而非具体的知识。在模型充分预训练的情况下,使用LoRA指令微调可以更有效地利用预训练知识。

关键观点2: 全量微调可能引入与测试场景无关的数据模式,导致模型答非所问。

全量微调会让模型学习指令微调数据集中的所有内容,包括与测试场景无关的词语和风格。这可能导致模型在测试场景中误用这些词语,产生幻觉。

关键观点3: 增加数据集规模对LoRA训练无效。

文章指出,即使将下游训练的指令微调数据集扩大到百万级规模,对LoRA训练的效果也没有明显提升。


免责声明:本文内容摘要由平台算法生成,仅为信息导航参考,不代表原文立场或观点。 原文内容版权归原作者所有,如您为原作者并希望删除该摘要或链接,请通过 【版权申诉通道】联系我们处理。

原文地址: 访问原文地址
总结与预览地址:访问文章预览/总结
文章地址: 访问文章快照