
1. 从一份论文清单说起为什么我每周都会盯 arXiv 的 cs.LG 更新做机器学习这行的人大概都有过这样的体验早上打开 arXiv发现 cs.LG 又刷出来一两百篇新论文标题扫过去全是熟悉的关键词——强化学习、大语言模型、因果推断、离线策略优化但真要挑出几篇值得精读的光靠标题根本判断不了。我自己的习惯是每周固定花两三个小时把 cs.LG 的当日汇总过一遍先按主题粗筛再挑出跟手头工作相关的细读。2026 年 9 月 25 日这一批更新里强化学习和大语言模型的交叉方向依然是绝对主力同时因果强化学习、离线强化学习、LLM 智能体安全这几个细分方向也有不少值得关注的工作。这篇东西不是论文翻译也不是简单的标题罗列。我想做的是把这一批更新里反复出现的几条技术主线拆开讲清楚它们各自在解决什么问题、用了什么核心机制、对我们这些做工程落地的人有什么实际参考价值。如果你正在做强化学习的策略优化、在本地部署大语言模型、或者在研究怎么把因果推断嵌进决策流程那这篇汇总应该能帮你省下不少筛选时间。哪怕你只是刚入门机器学习想搞清楚强化学习和大语言模型这两个热词到底在讲什么我也会尽量用生活化的类比把底层逻辑说明白。需要先说明一点arXiv 上的论文质量参差不齐很多工作还只是预印本没有经过同行评审。我下面提到的内容一部分是基于论文摘要和方法的合理推断一部分是我结合自己实操经验的补充解读具体细节还是要以原文为准。这一点在阅读任何论文汇总时都要心里有数。2. 这批论文里最值得关注的四条技术主线2.1 强化学习从在线试错到离线学习的范式迁移强化学习这批更新里最明显的一个趋势是离线强化学习Offline RL的持续升温。传统强化学习的基本设定是智能体在环境里不断试错通过与环境交互拿到奖励信号来更新策略。这个思路在游戏、机器人仿真里很有效但放到真实业务场景就麻烦了——你不可能让一个推荐系统在线上随便乱试也不可能让自动驾驶车在真实道路上靠撞车来学习。离线强化学习要解决的就是这个问题只给一批历史交互数据不让智能体再跟环境交互直接从这批固定数据里学出一个好策略。听起来很美好但核心难点在于分布偏移Distribution Shift。举个生活化的例子你只看过别人打篮球的录像从没自己上手过录像里全是投篮命中的片段你就容易高估某些动作的价值真上场时做出录像里没出现过的动作结果可能一塌糊涂。离线 RL 里的 Q 值过高估计问题就是这么来的。这批论文里针对这个问题的思路大致分几类。一类是做保守价值估计也就是故意把没见过的动作的价值估低一点逼着策略待在数据覆盖的范围内IQLImplicit Q-Learning就是这条线的代表它不去显式查询分布外的动作价值而是用 expectile 回归拟合一个上分位数间接避开分布外动作。另一类是基于模型的强化学习先学一个环境动力学模型再在模型里做规划这样既能利用历史数据又能通过模型生成虚拟交互。还有一类是约束策略优化直接在策略更新时加一个约束让新策略不要偏离产生数据的行为策略太远。提示如果你要上手离线 RL别一上来就啃最复杂的算法。我建议先从 IQL 或者 CQL 这类相对成熟、开源实现多的方法入手跑通一个离线数据集比如 D4RL 里的 MuJoCo 任务把数据加载、归一化、训练循环、评估这套流程走一遍再去看更复杂的变体。2.2 大语言模型本地部署与推理优化的现实考量大语言模型这条线这批更新里跟本地部署相关的讨论明显变多了。原因很实际很多团队出于数据隐私、成本控制、响应延迟的考虑不想把所有推理请求都发到云端 API而是希望在自己可控的硬件上跑模型。但本地部署 LLM 不是把权重下载下来就完事中间有一堆工程细节。首先是量化。一个 70B 参数的模型用 FP16 存下来大概要 140GB 显存普通单卡根本放不下。量化就是把权重从高精度压到低精度比如 INT8、INT4显存占用能降到原来的四分之一甚至更低。代价是精度损失但实测下来INT4 量化对大多数对话和生成任务的影响其实很小除非你做的是对数值精度极度敏感的任务。其次是推理框架的选择。现在主流的本地推理方案有 llama.cpp、vLLM、TensorRT-LLM 这几类。llama.cpp 的优势是 CPU 也能跑量化支持好适合个人开发者和小团队vLLM 的强项是 PagedAttention在高并发场景下吞吐量很可观TensorRT-LLM 则是 NVIDIA 生态里性能调优最深的方案但配置门槛也最高。选哪个取决于你的硬件、并发量和团队的技术栈。还有一个容易被忽略的点是上下文长度与显存的关系。很多人只算模型权重的显存忘了 KV Cache 也要占地方。上下文越长、并发请求越多KV Cache 占用越大。一个 7B 模型在 8K 上下文、batch size 为 8 的情况下KV Cache 可能就要吃掉好几 GB。所以做容量规划时一定要把这块算进去。2.3 因果强化学习把因果推断嵌进决策流程因果强化学习Causal RL是这批更新里我觉得最有意思的方向之一。它的核心思路是传统 RL 学的是在什么状态下做什么动作能拿到高奖励的相关性关系但相关性不等于因果性。如果环境里有混淆变量智能体可能学到一个看起来有效、实际上经不起分布变化考验的策略。因果 RL 的做法是把因果推断的工具嵌进强化学习流程。具体来说它会尝试构建状态、动作、奖励之间的因果图区分哪些是真正的因果路径哪些只是虚假相关。这样一来当环境分布发生变化时基于因果关系的策略往往比基于相关性的策略更稳健。举个例子一个推荐系统如果只学到用户点了 A 商品就推 B 商品这种相关性一旦用户群体变了这个策略可能就失效但如果它能识别出用户是因为某个真实需求才点 A那推荐逻辑就能迁移到新群体。这个方向的难点在于因果图的构建和识别。真实环境里你往往不知道完整的因果结构只能从数据里做因果发现而因果发现本身就是一个很难的问题需要很强的假设。所以因果 RL 目前更多还停留在方法论和仿真验证阶段真正落地到大规模工业场景的案例不多。但它的思路值得关注尤其是当你发现自己的 RL 策略在训练环境表现很好、一到线上就拉胯的时候可能就要想想是不是相关性陷阱在作祟。2.4 LLM 智能体安全记忆投毒与红队测试LLM 智能体Agent是这两年的热点但随之而来的安全问题也越来越受重视。这批更新里有一类工作专门研究智能体记忆投毒智能体在运行过程中会往记忆库或知识库里写入信息如果攻击者能往这个记忆库里注入恶意内容智能体后续的决策就可能被带偏。这个攻击面很现实。想象一个基于 LLM 的客服智能体它会把每次对话的结论存进记忆库下次遇到类似问题就调用。如果攻击者通过某种方式让智能体把一条错误信息比如退款不需要审核写进记忆库那后续所有相关请求都可能被错误处理。这类攻击的可怕之处在于它不需要直接攻破模型本身只需要污染模型依赖的外部知识源。对应的防御思路包括对写入记忆库的内容做来源验证和一致性检查、对智能体的关键决策加人工审核环节、定期审计记忆库内容、用红队测试主动发现投毒路径。红队测试Red Teaming在这里的角色是模拟攻击者主动去找智能体的薄弱环节而不是等出了问题再补救。3. 核心机制拆解这些方法到底怎么工作的3.1 离线 RL 中的保守估计为什么悲观反而是好事前面提到离线 RL 的核心难点是分布偏移导致的价值高估。这里展开讲讲保守估计为什么能解决问题。在标准 Q-Learning 里更新公式是让 Q(s,a) 逼近 r γ·max Q(s,a)。问题出在那个 max 上如果某个动作 a 在数据里从没出现过它的 Q 值估计就是随机的而 max 操作会系统性地挑出那些被高估的动作导致价值估计越来越离谱。这就像考试时你蒙答案蒙对的那些会被记住蒙错的被忽略最后你对自己的水平产生了错误的高估。保守估计的思路是对分布外的动作不要相信它的高估值甚至主动把它压低。CQLConservative Q-Learning的做法是在损失函数里加一项惩罚分布外动作的 Q 值同时抬高数据里出现过的动作的 Q 值。这样学出来的 Q 函数在数据覆盖区域内是准确的在区域外则是保守的。IQL 则换了个角度它不去查询分布外动作的价值而是用 expectile 回归学一个状态价值函数再从中反推动作价值从根上避免了分布外查询。注意保守估计不是越保守越好。压得太狠策略会变得过于胆小明明数据里有足够信息支持的好动作也不敢选。实际调参时保守系数是一个需要仔细权衡的超参数通常要在离线评估指标和实际部署效果之间反复试。3.2 LLM 的注意力机制Key、Query、Value 到底在干什么热词里有一条llm 的 token 三个点 key 我是谁、query 我在找什么、value 我能提供什么这个类比其实挺到位我顺着展开一下。Transformer 的注意力机制里每个 token 会生成三个向量Query查询、Key键、Value值。你可以把它想象成一个信息检索系统Query 是我想找什么信息Key 是我这条信息是关于什么的标签Value 是我实际能提供的内容。注意力计算的过程就是用 Query 去和所有 Key 做匹配算出相关性分数再用这些分数对 Value 做加权求和。用生活化的例子你在一个大型图书馆里找书。Query 是你脑子里的需求我想找一本讲强化学习入门的书每本书的 Key 是它的标题和分类标签Value 是书里的实际内容。你先用需求去匹配所有书的标签匹配度高的书权重高最后你把匹配度高的几本书的内容综合起来形成答案。这就是注意力的本质。理解这一点对调优很有帮助。比如为什么长上下文会变慢因为每个 token 的 Query 都要和所有 token 的 Key 做匹配计算量随序列长度平方增长。为什么 KV Cache 能加速因为生成新 token 时之前 token 的 Key 和 Value 不用重算缓存起来直接复用就行。3.3 因果 RL 的识别假设没有假设就没有因果因果推断有一句名言没有假设就没有因果。因果 RL 也一样它要从观测数据里推断因果关系必须依赖一些识别假设。最常用的假设是条件独立性和无混淆性。无混淆性说的是所有同时影响动作和奖励的变量都被观测到了。如果存在一个没观测到的混淆变量那从数据里估计出的因果效应就是有偏的。这在仿真环境里还好控制在真实场景里几乎不可能完全满足。另一个关键假设是稳定性也叫无干扰性一个个体的处理不会影响另一个个体的结果。在推荐系统里这个假设经常被违反因为你的推荐会影响用户行为用户行为又会影响其他用户的体验比如热门商品被抢光。所以因果 RL 的落地很大程度上取决于你对业务场景的理解能不能支撑这些假设。如果假设不成立再精巧的算法也白搭。我的经验是与其追求完全因果正确的策略不如把因果推断当成一个诊断工具用它来检查你的策略是不是在依赖虚假相关从而指导特征工程和实验设计。4. 实操落地从论文到能跑的代码4.1 离线 RL 训练流程以 IQL 为例的完整步骤假设你要在一个离线数据集上训练 IQL下面是我实际跑过的一套流程。第一步是数据准备。离线 RL 数据集通常是 (state, action, reward, next_state, done) 的序列。你需要确认数据里的奖励尺度是否合理、状态是否做了归一化、动作是否连续。如果动作是连续的还要注意动作空间的边界。D4RL 是常用的基准数据集包含 MuJoCo locomotion 任务和 AntMaze 导航任务适合入门练手。第二步是网络结构设计。IQL 需要三个网络Q 网络两个取最小值减少高估、价值网络 V、策略网络。Q 网络和 V 网络通常是 MLP隐藏层 256 维、两层就够了。策略网络在连续动作场景下一般输出高斯分布的均值和方差。第三步是训练循环。IQL 的训练分两个阶段交替进行先用 expectile 回归更新 V 网络再用 V 网络的目标值更新 Q 网络最后用 AWRAdvantage Weighted Regression更新策略。expectile 系数 τ 一般取 0.7 到 0.9 之间这个参数控制 V 网络拟合的是条件期望还是条件上分位数τ 越大越偏向乐观估计。# IQL 核心损失函数示意PyTorch 风格 import torch import torch.nn.functional as F def iql_loss(q1, q2, v, target_q, actions, rewards, dones, gamma0.99, tau0.7): # V 网络用 expectile 回归拟合 Q 的上分位数 q_min torch.min(q1, q2) diff q_min - v weight torch.where(diff 0, tau, 1 - tau) v_loss (weight * diff.pow(2)).mean() # Q 网络用 V 网络的目标值做 TD 更新 with torch.no_grad(): next_v target_q # 来自目标 V 网络 td_target rewards gamma * (1 - dones) * next_v q_loss F.mse_loss(q1, td_target) F.mse_loss(q2, td_target) return v_loss, q_loss第四步是评估。离线 RL 的评估是个老大难问题因为你不能真的让策略上线跑。常用的做法是在仿真环境里跑归一化分数或者用 FQEFitted Q Evaluation做离线策略评估。但要注意离线评估指标高不代表线上一定好分布偏移的风险始终存在。实操心得我踩过的一个坑是数据归一化。MuJoCo 任务里不同维度的状态尺度差异很大如果不做归一化某些维度会主导梯度训练很难收敛。建议对状态做标准化减均值除标准差对奖励做缩放但动作一般不要归一化因为动作空间本身有物理意义。4.2 本地部署 LLM 的显存估算与量化选择本地部署 LLM第一步是算清楚你的硬件能扛多大的模型。显存占用大致分三块模型权重、KV Cache、激活值。模型权重的估算公式是参数量 × 每参数字节数。FP16 是 2 字节INT8 是 1 字节INT4 是 0.5 字节。所以一个 7B 模型FP16 要 14GBINT8 要 7GBINT4 只要 3.5GB 左右。KV Cache 的估算稍微复杂2 × 层数 × 注意力头数 × 头维度 × 序列长度 × batch size × 每元素字节数。以 Llama 2 7B 为例32 层、32 个头、头维度 128序列长度 4096batch size 为 1FP16 存储KV Cache 大约是 2 × 32 × 32 × 128 × 4096 × 1 × 2 字节算下来约 2GB。如果 batch size 提到 8就是 16GB这就很可观了。量化选择上我的建议是如果显存够优先 FP16精度损失最小显存紧张就上 INT8大多数任务几乎无损实在不够再考虑 INT4但要做充分的评测确认你的任务对精度损失不敏感。量化工具方面llama.cpp 自带 GGUF 格式的量化流程GPTQ 和 AWQ 是另外两条常用的后训练量化路线各有优劣。4.3 LLM 智能体记忆系统的安全加固清单如果你在做一个带记忆的 LLM 智能体下面这份加固清单可以直接对照检查。风险点加固措施实施难度记忆写入无验证对写入内容做来源标记和格式校验低恶意内容注入对记忆内容做一致性检查和异常检测中记忆库被污染定期审计保留写入日志和版本中关键决策被带偏高风险操作加人工审核或二次确认高攻击路径未知定期做红队测试模拟投毒场景高这张表里的措施不是全都要上而是根据你的业务风险等级来选。如果智能体只是做内部知识问答风险相对低如果它能触发退款、下单、改配置这类操作那记忆安全就必须认真对待。5. 常见问题与排查技巧实录5.1 离线 RL 训练不收敛先查这几个地方离线 RL 训练不收敛是高频问题我整理了一个排查顺序。先看数据质量。离线数据集里如果奖励稀疏、状态重复度高、或者动作分布极度不均训练很难稳定。可以统计一下奖励的分布、状态的方差、动作的直方图心里有个数。再看超参数。离线 RL 对学习率、保守系数、expectile 系数这些很敏感。学习率太大容易发散太小收敛慢保守系数太大策略过于保守太小又回到高估问题。建议先用论文里的默认参数跑通再逐步调。然后看网络初始化。Q 网络如果初始化不当早期的高估会累积。可以试试用较小的初始化方差或者加一层 LayerNorm。最后看评估方式。有时候训练其实在收敛只是你的评估指标选得不对。离线 RL 的评估指标和在线 RL 不一样别用在线 RL 的直觉去判断。5.2 LLM 本地推理的常见报错与解决本地跑 LLM报错五花八门我挑几个高频的说说。显存不足OOM最常见。解决思路是降量化精度、减 batch size、缩短上下文长度、或者用 CPU offload 把部分层放到内存里。llama.cpp 的-ngl参数控制放多少层到 GPU调小一点就能缓解。推理速度慢先确认是不是在用 CPU 跑。如果 GPU 利用率低可能是 batch size 太小或者模型没完全加载到显存。另外量化格式也影响速度某些格式在特定硬件上解码效率不高。输出乱码或重复通常是采样参数问题。temperature 太高会乱太低会重复。top_p 和 repetition_penalty 也要配合调。如果换了量化格式后出现这个问题可能是量化损失太大换回高精度试试。请求 schema 报错如果你在用 API 方式调用本地模型遇到 provider rejected the request schema or tool payload 这类错误八成是请求格式和模型服务端的预期不匹配。检查一下消息格式、工具调用的 JSON 结构、以及是否有多余字段。5.3 因果 RL 落地前必须问自己的三个问题在决定要不要上因果 RL 之前我建议先问自己三个问题。第一我的场景里真的存在混淆变量吗如果动作和奖励之间的关系很直接没有明显的第三方变量干扰那因果 RL 的收益可能有限。第二我能不能观测到所有关键混淆变量如果关键变量观测不到因果识别假设就不成立硬上因果方法反而可能引入新的偏差。第三我的策略需要跨分布泛化吗如果环境分布很稳定相关性策略就够用了只有当环境会变、需要策略迁移时因果方法的优势才体现得出来。这三个问题没有标准答案但想清楚它们能帮你避免为了用因果而用因果。6. 我个人的一些使用体会盯 arXiv 这么多年我最大的体会是论文的价值不在于它多新而在于它能不能解决你手头的问题。这批 cs.LG 更新里强化学习和 LLM 的交叉工作很多但真正能直接拿来用的往往是那些把机制讲清楚、把实验做扎实的工作而不是标题最花哨的那些。另外离线 RL 和因果 RL 这两个方向我建议做工程的同行保持关注但不要盲目追。它们的理论价值很高但落地门槛也高需要你对业务场景有足够深的理解。相比之下LLM 的本地部署和推理优化是更务实的切入点投入产出比更直接。最后分享一个小习惯我读论文时会在笔记里记三样东西——它解决什么问题、核心机制是什么、我能不能在自己的项目里试一下。第三点最重要因为只有真正动手跑过你才知道论文里没写的那些坑在哪里。