首页
产品服务
模型广场
Token工厂
算力市场算力商情行业资讯解决方案
注册

为什么AI会患上"健忘症":解放军报深度解析大模型长对话遗忘难题

发布日期:2026-07-06 来源:解放军报作者:解放军报浏览:1

或许你曾有过这样的经历:为了完成一份复杂的报告或方案,你找来AI大语言模型做助手。输入相关信息和指令要求……一开始,你和大语言模型沟通得非常顺畅。然而,当对话进行了二三十轮之后,这时让大语言模型回忆你最开始提出的那个需求时,它却彻底忘了。其实,这种AI在长对话中出现的“健忘症”,并不是由于技术问题导致,而是AI与生俱来的“天性”。

人们习惯将AI类比人脑,这恰恰是误解的开端。人脑拥有神奇的“神经可塑性”,人与人交谈的过程中,产生的新经验会实时重构人脑神经元之间的连接,进而将转瞬即逝的见闻转化为长久的记忆。这种持续自我重构的能力,正是人类得以积累知识、启迪智慧、预判未来的基础。

而大语言模型获取知识时,走的却是另一条路径——基于海量数据,预测下一个“词元”是什么。一旦大语言模型训练完成,数以千亿计的系统参数便会被固定下来,大语言模型的知识体系也随之固定。

为何不让大语言模型边聊边学?

那么,为何不让大语言模型边聊边学、实时更新参数呢?这背后横亘着神经网络领域一道根深蒂固的难题——“灾难性遗忘”。在大语言模型的神经网络中,所有知识都存储在同一组参数网络里。如果强行让大语言模型学习新任务,参数网络便会剧烈调整,新知识如同潮水般覆盖旧知识,结果往往是学会了新知识,旧知识却荡然无存。

AI的“工作记忆区”

不过,大语言模型有一个临时“工作记忆区”。这个记忆区就是我们常说的“上下文窗口”,它的技术根基是深度学习架构中的“注意力机制”,该机制帮助大语言模型记住一段时间之内的对话。

我们可以把它想象成AI的“桌面”。如今,对于一些比较先进成熟的大语言模型,这个“桌面”已经很大了,“桌面”上能摊开总字数达十几万字的文件。然而,“桌面”的面积是有限的。一旦信息量超过了这个“桌面”的容量,或者为了节省算力,AI就会被迫“清理桌面”。

此外,维持这个“工作记忆区”正常工作,大语言模型需要耗费的成本极高——它需要消耗巨大的算力资源去计算前后文之间的“注意力”。就像人脑在高强度思考时会缺氧,大语言模型在处理超长文本时也会因为算力过载而选择“断舍离”,于是就出现了“幻觉”或遗忘。

军事应用中的记忆挑战

如今,在人工智能技术广泛赋能军事化应用的背景下,解决AI的健忘问题尤为关键——无论是无人集群作战样式要求的协同作战战术,还是指挥员对战场态势的感知,都要求智能系统拥有可靠、可控的持续记忆能力。

治疗“健忘症”的两种路径

从目前的研究及实践发展来看,治疗“健忘症”的方法主要有两种。

其一,为大语言模型外接一套独立的记忆系统是较常用的方法,如目前最主流的检索增强生成(RAG)系统。大语言模型回答问题时,先去记忆系统里检索相关信息,再结合自己的语言能力组织答案。

其二,也有一些研究人员提出了“嵌套学习”的全新范式,该范式力图让大语言模型蜕变为像人脑那般,具有能够自我调整和学习的能力,从而缓解乃至根除大语言模型的“灾难性遗忘”。倘若这类基础研究终成正果,未来的大语言模型或将真正具备持续学习、“过目不忘”的本领。

AI健忘症配图1
AI健忘症配图2
本文转载自解放军报, 作者:解放军报, 原文标题:《 为什么AI会患上"健忘症":解放军报深度解析大模型长对话遗忘难题 》, 原文链接: http://www.81.cn/yw_208727/16470611.html。 本平台仅做分享和推荐,不涉及任何商业用途。文章版权归原作者所有。如涉及作品内容、版权和其它问题,请与我们联系,我们将在第一时间删除内容!
本文相关推荐
暂无相关推荐
点击立即订阅