专栏名称: 新智元
智能+中国主平台,致力于推动中国从互联网+迈向智能+新纪元。重点关注人工智能、机器人等前沿领域发展,关注人机融合、人工智能和机器人革命对人类社会与文明进化的影响,领航中国新智能时代。
TodayRss-海外RSS稳定源
目录
今天看啥  ›  专栏  ›  新智元

AI失忆术!只需3个注意力头,就能让大模型忘记「狗会叫」

新智元  · 公众号  · AI  · 2025-07-13 12:46
    

主要观点总结

Meta和纽约大学的研究团队提出了一个突破性方法,能在Transformer架构下精准定位并控制AI的认知模块。通过使用SAMD(可扩展注意力模块发现)和SAMI(标量注意力模块干预),研究者能够让AI模型“忘记”特定事实或概念,如“狗会叫”。此方法为AI的可解释性、安全性和能力增强提供了新的思路。研究者在四种典型场景中验证了方法的有效性,并展示了其在语言模型和视觉模型中的应用。

关键观点总结

关键观点1: 研究团队提出了SAMD和SAMI两大技术,实现了概念的定位和权重调整,为AI的认知模块提供了精准控制。

SAMD能够像CT扫描一样定位模型中负责特定概念的注意力模块,而SAMI则能像精密手术一样微调强度,实现精准控制。也就是说,我们不仅可以知道「狗」这个概念在模型里具体「存在于哪些部位」,还可以用一个参数轻松精准放大或抹除它的影响力。

关键观点2: 通过SAMD和SAMI的应用,研究者验证了概念模块的存在性和AI可控记忆的可行性。实验结果显示,一个复杂概念往往只由3-10个注意力头承载,大模型的知识存储高度稀疏、具备极强的可干预性。

此外,这种干预方法还可以用于增强模型的特定能力,如数学推理能力,同时保持其他能力的稳定性。此外,研究团队还探索了AI安全领域的应用,通过定位安全模块并调整其参数,可以有效提高模型的安全性能。

关键观点3: 研究团队的实验验证了方法的有效性,并展示了其在多种场景下的应用,包括概念操控、数学推理能力提升以及安全模块增强等。同时,这一方法的应用也给人们带来了对于个性化微调大模型、提高模型特定维度能力的新思路。

尽管这一研究取得了显著的进展,但人们也开始对AI的“细思恐极”表示担忧。这种技术的潜力引发了对未来AI发展路径的进一步思考。


免责声明:本文内容摘要由平台算法生成,仅为信息导航参考,不代表原文立场或观点。 原文内容版权归原作者所有,如您为原作者并希望删除该摘要或链接,请通过 【版权申诉通道】联系我们处理。

原文地址: 访问原文地址
总结与预览地址:访问文章预览/总结
文章地址: 访问文章快照