多轮上下文记忆

发布时间:2026/10/4 5:40:02
多轮上下文记忆 大模型本身是无状态的每次调用都是独立的。所谓的“记忆”本质上是工程侧对输入上下文的动态管理策略。核心目标是在成本、延迟、记忆长度三者之间取得平衡。我通过长期摘要短期滑动窗口实现记忆。前端LocalStorage只存展示数据传给LLM的是‘增量摘要 最近5轮原文’。摘要异步生成避免阻塞关键实体单独抽取防止信息丢失。同时支持云端持久化实现跨会话记忆。这个方案在成本和效果之间取得了平衡已在项目中稳定运行。一、完整标准流程拆解分两层各司其职持久展示层LocalStorage 存全部原始完整对话作用是给用户看 这里不做任何压缩、删减原样存储用户提问 模型完整回复页面刷新、关闭重开完整聊天记录不丢失侧边历史记录、历史对话列表展示完整问答原文永久保存全量对话不会丢失早期聊天细节。LLM 推理层传给 LLM采用增量摘要 滑动窗口双轨制——①最近对话原文按 Token 数量动态截断而非硬编码轮数每次从最新消息开始往前累加 Token直到达到上限如 4000 tokens保证绝不超出模型上下文窗口同时保留最近的交互细节保证上下文连贯 【原想法是截取最近 5~8 轮完整对话---------但是如果一轮对话就有2000字8轮直接撑爆窗口了】② 早期历史摘要采用增量摘要每次只把旧摘要 本轮新增的 N 轮对话压缩成新摘要确保摘要生成的 Token 消耗恒定为 O(1)不随对话总长度线性增长③ 强制抽取关键实体时间、人名、ID、数字、核心决策随摘要一起结构化保存防止纯文本摘要丢失关键细节④ 最终拼接「历史摘要 关键实体清单 最近动态截断的原文 当前用户新问题」作为 Prompt 输入大模型。【为什么把’当前用户新问题’放在最后--------因为大多数LLM对输入末尾的注意力权重更高把当前问题放最后能让模型更聚焦于用户当下的诉求。】二、这么拆分的两大核心好处兼顾用户体验与接口成本用户侧能随时翻阅全部完整聊天记录不会丢失任何原文服务侧传给大模型的文本大幅缩短Token 消耗显著降低不会超出模型上下文窗口推理速度更快、幻觉更少。解耦不冲突本地存储的完整数据和发给模型的精简上下文是两套独立数据互不干扰本地永远有完整版兜底推理只使用轻量化压缩版。

关于本文作者

来自尧图内容编辑团队

尧图内容编辑团队 内容团队

尧图内容编辑团队

本文由尧图网络内容编辑团队执笔。团队由资深项目经理、前端工程师与设计师组成,所有内容均来自亲手交付的真实项目,先讲清问题、再给出可落地的解法。尧图深耕北京网站建设十年,服务过京华建材集团、智造科技等各行业客户,把一线经验沉淀为可复用的行业观察。

  • 十年建站经验,覆盖建材、制造、服务、文创等
  • 项目经理把关选题与事实准确性
  • 工程师与设计师联合撰写专业细节
  • 统一编辑规范,保证文风与排版一致
  • 每月复盘转化数据,迭代选题方向

延伸阅读

相关资讯与近期热门内容

深度阅读推荐

建站决策前值得细读的三篇

网站改版的5个关键决策
2024-08-12

网站改版的5个关键决策

什么时候该改版、改到什么程度、如何避免流量掉光,京华建材集团改版复盘给出答案。

获取专属建站方案

看完文章,把您的行业与预算告诉我们,免费获取一份量身定制的官网建设方案与报价。

立即免费咨询