智算多多
官方邮箱:service@zsdodo.com

公司地址:北京市丰台区南四环西路188号总部基地三区国联股份数字经济总部


京公网安备11010602202532号 或许你曾有过这样的经历:为了完成一份复杂的报告或方案,你找来AI大语言模型做助手。输入相关信息和指令要求……一开始,你和大语言模型沟通得非常顺畅。然而,当对话进行了二三十轮之后,这时让大语言模型回忆你最开始提出的那个需求时,它却彻底忘了。其实,这种AI在长对话中出现的“健忘症”,并不是由于技术问题导致,而是AI与生俱来的“天性”。
人们习惯将AI类比人脑,这恰恰是误解的开端。人脑拥有神奇的“神经可塑性”,人与人交谈的过程中,产生的新经验会实时重构人脑神经元之间的连接,进而将转瞬即逝的见闻转化为长久的记忆。这种持续自我重构的能力,正是人类得以积累知识、启迪智慧、预判未来的基础。
而大语言模型获取知识时,走的却是另一条路径——基于海量数据,预测下一个“词元”是什么。一旦大语言模型训练完成,数以千亿计的系统参数便会被固定下来,大语言模型的知识体系也随之固定。
那么,为何不让大语言模型边聊边学、实时更新参数呢?这背后横亘着神经网络领域一道根深蒂固的难题——“灾难性遗忘”。在大语言模型的神经网络中,所有知识都存储在同一组参数网络里。如果强行让大语言模型学习新任务,参数网络便会剧烈调整,新知识如同潮水般覆盖旧知识,结果往往是学会了新知识,旧知识却荡然无存。
不过,大语言模型有一个临时“工作记忆区”。这个记忆区就是我们常说的“上下文窗口”,它的技术根基是深度学习架构中的“注意力机制”,该机制帮助大语言模型记住一段时间之内的对话。
我们可以把它想象成AI的“桌面”。如今,对于一些比较先进成熟的大语言模型,这个“桌面”已经很大了,“桌面”上能摊开总字数达十几万字的文件。然而,“桌面”的面积是有限的。一旦信息量超过了这个“桌面”的容量,或者为了节省算力,AI就会被迫“清理桌面”。
此外,维持这个“工作记忆区”正常工作,大语言模型需要耗费的成本极高——它需要消耗巨大的算力资源去计算前后文之间的“注意力”。就像人脑在高强度思考时会缺氧,大语言模型在处理超长文本时也会因为算力过载而选择“断舍离”,于是就出现了“幻觉”或遗忘。
如今,在人工智能技术广泛赋能军事化应用的背景下,解决AI的健忘问题尤为关键——无论是无人集群作战样式要求的协同作战战术,还是指挥员对战场态势的感知,都要求智能系统拥有可靠、可控的持续记忆能力。
从目前的研究及实践发展来看,治疗“健忘症”的方法主要有两种。
其一,为大语言模型外接一套独立的记忆系统是较常用的方法,如目前最主流的检索增强生成(RAG)系统。大语言模型回答问题时,先去记忆系统里检索相关信息,再结合自己的语言能力组织答案。
其二,也有一些研究人员提出了“嵌套学习”的全新范式,该范式力图让大语言模型蜕变为像人脑那般,具有能够自我调整和学习的能力,从而缓解乃至根除大语言模型的“灾难性遗忘”。倘若这类基础研究终成正果,未来的大语言模型或将真正具备持续学习、“过目不忘”的本领。


