递归自我改进RSI:从大语言模型自我精炼到AI安全挑战

发布时间:2026/10/8 21:44:24
递归自我改进RSI:从大语言模型自我精炼到AI安全挑战 如果你是做AI应用开发的最近一定总在讨论里撞见一个缩写RSI。它的全称是递归自我改进Recursive Self-Improvement英文圈经常叫它“自我改进的递归循环”——一个AI系统能用自己产出的结果、错误甚至代码反过来提升自己下一次的性能。这词听起来像是AGI末日论里的黑话但实际上自博弈下棋、大语言模型的自我反思、模型生成数据再训练自己这些已经被大量使用的工程方法都已经带着RSI的影子。这篇内容我想基于自己读过的东西和动手跑过的实验把RSI掰开讲清楚它到底在递归什么现在哪些做法算RSI的雏形为什么想真正做起来这么难以及最近这一两年学界和业界分别把力气花在了哪里。适合两类人看一类是做AI应用的工程师想从“模型调用者”往“模型改进者”跨一步另一类是关心AI安全的研究人员想搞清楚“自我改进”究竟卡在哪、突破口又在哪。1. 先拆概念RSI到底在“递归”什么1.1 一句话定义和“锤子造锤子”的比喻递归自我改进的核心其实可以压缩成一句话一个智能系统把“改进自身”这件事也纳入到自己的能力范围内然后反复执行。注意这里有两层缺一不可。第一层是“改进”系统性能要从A变成A第二层是“递归”A具备更强的改进能力可以继续对自身做改进得到A再得到A以此类推。我经常用一个比喻一个人想用一把铁锤打造一把更好的铁锤等新锤子做好了他再用新锤子去打造下一把。普通机器学习更像是“工厂里老师傅手工磨锤子”模型每出一个新版本都是人来调参、换数据、改架构而RSI是“让锤子进入流水线自己磨自己”。如果第二把锤子比第一把更好第三把就更容易被造出来这个过程一旦形成正反馈理论上就会指数加速——这就是为什么“智能爆炸”这个概念总是和RSI绑在一起。其实“智能爆炸”这个词的源头非常早。1965年Good在一篇短论文里就讨论过如果某台机器“能够设计出比它自己更聪明的机器”那么文明可能会经历一个极速变化期。今天翻过头来看这个推论的逻辑链条非常简洁更强的智能 → 更快的设计能力 → 更快地设计出更强的智能。RSI就是这个链条最核心的那一步其他都是它的后果。1.2 从“训练—改进”闭环看RSI和普通机器学习的分界线很多朋友跟我说我天天在跑模型微调这不也算自我改进吗我说先别急着套概念关键是看改进的“执行者”是谁。普通ML的循环是人类设定目标 → 人类挑选数据 → 模型训练 → 模型部署 → 人类看结果 → 人类修正下一轮配置。站在系统的视角它只是一个被改进的“物体”。整个循环绕了一圈数据的生成、目标的定义、损失的构造、超参数的调整全都在模型外部由人的手和人的判断完成。模型自己是不参与“如何改进自己”这件事的。而RSI的循环里至少有一个原本由人做的环节被模型接管了。举几个典型的例子模型根据自己的失败案例生成新的训练数据模型给自己的答案打分再根据分数重写模型尝试修改自己的推理代码或提示策略并自我验证效果模型在多个候选改进方案里做选择把更有用的那个保留下来。当你看到模型既是“被改的对象”又是“改的那个主体”时就可以说RSI的雏形出现了。不需要等到它能改底层权重哪怕只是自主修改自己的系统提示词并设立验证机制也已经是一个很典型的弱RSI观测试验。所以别把RSI理解得太神秘它本质上是一个闭环控制问题只是被控对象和控制器的边界开始变得模糊了。1.3 “弱RSI”和“强RSI”别把递归自我改进当成一个整体聊RSI最常见的毛病是把它当作一个神秘的、不可分拆的“整体”一听到就怕“爆炸”一听到就不屑“现在根本没有”。我觉得更准确的框架是把RSI分两档看。弱RSI每一轮改进的目标、评估标准、安全边界仍然由人定义模型只是在边界内自动完成“尝试-评估-保留”的循环。现有的大模型自我精炼、数据自举、RLHF里的奖励模型迭代都属于这一类。这档RSI不是科幻是正在大量发生的事情。虽然很多案例还不至于叫“自我改进”但已经具备闭环骨架。强RSI系统自己发明改进目标、自己设计评估机制、自己判断什么时候该修改底层算法和权重甚至修改那些“判断该不该改”的逻辑本身。这一档目前确实还没有公开实现的案例顶多在某些实验室内部的可控环境里出现了部分片段——比如模型在沙盒里修改自己的推理代码由另一个模型做审核。把两档分开有个实际好处你在讨论安全性、可解释性、收敛性问题时讨论的对象完全不同。弱RSI的核心矛盾是“如何防止在给定边界内的自我优化偏离原意”强RSI的核心矛盾是“谁来保证边界本身不被重写”。后者目前还没有成熟答案但前者的很多工程经验已经可以提炼出来了。所以我下面讲的“现状”绝大多数都落在弱RSI这一档。2. 已经跑起来的弱RSI从自博弈到LLM自我修改2.1 AlphaGo/AlphaZero第一个被验证的自我改进闭环讲RSI的现状我总喜欢先提AlphaGo因为它是第一个在不依赖人类棋谱的前提下通过“自己下棋、自己评估、自己变强”达到超人水平的成熟系统。AlphaGo Zero系列的做法本质上是当前的策略网络和自己对弈 → 用胜负和蒙特卡洛搜索的结果当作监督信号 → 训练更强的新网络 → 新网络继续自博弈。每一代模型的数据、奖励、评估信号都来自前一代的自己人的角色只剩设计训练框架和确认最终水平。如果你把“自博弈”翻译成通用的机器学习语言它就是一个数据自举的RSI循环系统通过探索产生自身经验经验变成训练数据训练产生更好的策略更好的策略又产生更难的经验。这个过程不需要外部教师甚至外部知识越多反而越可能限制上限。这里我特别想强调一点自博弈能成立是因为围棋、象棋这类任务有非常清晰的客观奖励——这盘棋赢没赢明白无误。这一点日后会成为RSI最大的分水岭后面我还会展开讲。你先记住一个直觉评估信号越硬自我改进的闭环越容易转起来评估信号越软、越模糊闭环就越容易在原地打转。2.2 LLM的自我精炼潮流Self-Refine、STaR、Constitutional AI这类范式到了大模型时代RSI的弱形态变得更多元了。你不需要专门训练一个游戏AI只需要一个能“看自己的输出”的LLM就能搭出许多自我改进的循环。我目前看到比较有代表性的有三类。第一类是推理期的自我修正典型如Self-Refine和Reflexion。模型先生成一版答案然后调用一个“批判模块”通常是同一个模型指出问题再根据批评意见重写。这相当于把人类的“写完再检查”流程自动化。我自己在代码生成任务上跑过Reflexion效果非常直观第一轮生成有没有语法错误第二轮根据报错信息修bug第三轮通常能通过单元测试。第二类是训练期的自举典型如STaRSelf-Taught Reasoner。它的思路是让模型生成带中间推理步骤的答案只保留那些最终答案正确的推理链再拿这些过滤后的数据微调模型如此反复多轮。这套流程之所以有效是因为它把“自我生成的困难样本”变成了自己的训练数据相当于一个针对推理能力的“自举式课程”。第三类是对齐中的自我偏好典型如Constitutional AI。让模型根据一组原则对自己的回答进行批评和修订再通过偏好学习让输出更安全合规。这已经不只是在提升能力而是在用“AI审AI”的方式改进AI的行为。它证明了自我改进循环不仅能用在“变聪明”上也能用在“变得更符合规则”上。这三类的共同点是评估信号依然由外部或半外部给出比如测试用例、人类偏好、固定的原则列表但“如何改进”这一步确实已经移交给了模型自己。它们不算真正的RSI但已经覆盖了RSI闭环里最核心的“改进器”角色。换个角度说你手里已经有一个“会改自己输出”的模型了离“会改自己的训练流程”只差一个边界的扩张。2.3 一个最小可运行的“自我改进循环”实验含代码为了让你对RSI的循环结构有个直观感受我放一个自己跑过的最小实验。它做的事情很简单给一个LLM加一套提示词让它完成一道数学题跑分然后允许LLM自己修改提示词如果新提示词在同样一组测试题上分数更高就保留新提示词。反复执行。这个实验很小但包含了“尝试-评估-接受/拒绝”的完整RSI骨架。import json from openai import OpenAI client OpenAI() # 一组用于评估的固定题目真实使用时换成语义更复杂的任务 eval_set [ {problem: What is 17 * 23?, answer: 391}, {problem: Factor: x^2 - 5x 6, answer: (x-2)(x-3)}, {problem: Sum of 1..100, answer: 5050}, ] base_prompt ( 你是数学解题助手。请给出清晰的推导过程。\n 输入题目{problem} ) def solve(prompt_text, problem): resp client.chat.completions.create( modelgpt-4o-mini, messages[{role: system, content: prompt_text}, {role: user, content: problem}], temperature0.2, ) return resp.choices[0].message.content def evaluate(prompt_text): score 0.0 for item in eval_set: out solve(prompt_text, item[problem]) # 这里只做最简单的判分直接把答案转成字符串比 # 实际使用时应接入校验器 / 单元测试 / 奖励模型 if item[answer] in out.replace( , ): score 1.0 return score / len(eval_set) def propose_improvement(current_prompt, history): prompt ( 你正在改进一个系统提示词。当前提示词\n f\n{current_prompt}\n\n f历史成绩{history}\n 请输出一个更稳、更能明确要求分步推理的新提示词。 ) resp client.chat.completions.create( modelgpt-4o-mini, messages[{role: system, content: 你是提示词优化专家只输出新提示词本身。}, {role: user, content: prompt}], temperature0.4, ) return resp.choices[0].message.content.strip() current base_prompt history [] for epoch in range(5): old_score evaluate(current) candidate propose_improvement(current, history) new_score evaluate(candidate) print(fepoch{epoch}, old_score{old_score:.2f}, new_score{new_score:.2f}) # 关键规则只接受指标没有下降的改进 if new_score old_score: current candidate history.append({old: old_score, new: new_score, accepted: new_score old_score}) print(final prompt:, current)我强烈建议你把这段代码缩小到三五个测试题上先跑一遍它会暴露很多RSI的关键问题。运行几次后你会发现几个很典型的规律。第一评估器是整套系统的命门。我的评估函数已经简单粗暴了一旦测试题本身的歧义大一点模型输出稍有格式变化分数就会波动于是“改进”经常变成随机游走。你在RLHF里用奖励模型替代这种字符串比对本质上也是同一个位置——评估不可靠整个闭环就不可靠。第二逐轮接受规则会导致局部最优。只接受分数不下降的候选最终会收敛到一条非常啰嗦的提示词因为“请详细一步一步思考”这种要求总不会错但过度冗长反而拖慢推理。真实的RSI需要对“改进的质量”做更多维度的判断不能只看原始分数。我用这个实验做的第二个版本把评估函数换成“答案正确且总长度小于某个值”提示词立刻开始向精简方向演化。这说明评估指标的结构直接决定改进的方向。第三这个循环里的“改进器”和“评估器”是同一个模型它倾向于生成和当前提示词风格相近的版本很难跳出自己的惯性。我试过用不同模型做改进器和评估器效果会好一些但也带来了“教师模型偏见”的新问题。打破自我参照带来的惯性和单一化是我跑下来觉得最麻烦的一点后面在挑战部分会展开说。2.4 为什么这些还算不上“真正RSI”那句话还是要说上面所有方法都只是“弱RSI”。它们的共同限制在于人仍然握着三个关键控制点。一是改进范围受限。模型可以改自己的提示词、生成风格、甚至部分推理流程但很少能自主决定去修改底层的优化算法、损失函数、数据采集策略。二是在评估边界由人定。能否接受一次改进最终还是由人写好的评估器或奖励模型说了算模型没有权利自己更换“好”的定义。三是安全护栏在循环之外。我实验里的“当前提示词是否越界”由我在外面盯模型并不会自动去检查改进是否违背了什么原则。所以真正值得讨论的“RSI”不是等量齐观地指这些案例而是追问把这些控制点逐渐移交出去之后系统会发生什么这一问就从“工程可行”跳到了“原理困难”。下面这三个困难是我认为真正的拦路虎。3. 真正的拦路虎改进什么、由谁验证、如何保持稳定3.1 鸡生蛋问题弱改进器找不到自己的真正缺陷先谈最朴素的一个困难模型怎么知道自己哪里不行一个人提升能力多数时候靠外部反馈——老师批改、比赛输赢、同事指出问题。RSI如果想闭环模型就必须自己发现“自己的不足”。但发现不足本身就是一件高智商工作你得先建立对自身能力的准确估计还要定位到改进的杠杆点。现状是哪怕是最先进的LLM在“自我诊断”上也相当不可靠。你让它评价自己刚才的回答它倾向于说“总体不错注意细节”你让它找自己推理里的逻辑漏洞它常常找错地方或者把对的改成错的。这个现象有个更扎心的表达模型能够自我批评的程度受限于它自身的能力上限。一个数学水平不够的模型它给出的解题步骤有错你让它“检查一遍”大概率检查不出来因为它本来就没有识别那个错误的能力。就像人检查自己的代码低级错误还能看出但真遇到“你根本不懂某个知识点”的墙检查再多次也没用。模型同理。这就是RSI的第一道硬门槛改进器的能力必须高于被改进对象的平均水平否则循环会进入“劣质输出 → 劣质反馈 → 更劣质输出”的死亡螺旋。而从逻辑上讲一个能力不强的系统想要通过自我改进来突破自身能力上限第一步就得面对“自己不知道自己不知道”的悖论。目前所有绕过这个困难的方法本质都是在外部给一针要么用更强模型做教师要么用环境反馈比如测试用例提供超越模型自身判断的信号。所以“纯粹靠自己变强”这件事至今没有一个真实系统做到过。3.2 可验证性缺口没有稳定的“越来越好的标尺”如果说发现缺陷是第一道球那么“如何证明改进之后确实更好”就是第二道球而且这道球更难。围棋之所以成为RSI最成功的试验场是因为存在一个铁的标尺胜负。100盘里赢60盘就是比赢50盘更强不需要谁来主观评判。回到真实世界的任务情况立刻狼狈起来你想让模型改进代码能力可以用单元测试来评判但单元测试只能覆盖已知预期如果目标改成“维护一个大型代码仓库”怎么自动证明“新版本维护得更好”就很模糊。再比如让模型优化“回答的可用性”那几乎必然要引入另一个模型做人类偏好的代理可这个代理模型本身就可能被优化出它没有的偏差。我把这个困难称为“可验证性缺口”我们想做自我改进但缺少一个能自动、可靠地判断“越来越好”的度量。学术上有个概念叫“古德哈特定律”——当一个指标变成优化目标时它就不再是好指标。我在实际跑第二节那个玩具实验时体会已经很真切评估函数只要稍微迟钝一点模型就学会堆砌“一定会仔细思考”这类空话指标涨了实际能力没变。越是开放、复杂的任务这个缺口越深。这个缺口的另一个后果是你很难知道什么时候该停止。如果评估有噪声每一轮“改进”都可能混入噪声带来的假阳性多轮之后系统可能已经偏离最初轨道但所有人在仪表盘上看到的还是“分数一路向上”。换句话说噪声会被递归循环放大并不是简单地平均掉。3.3 规格博弈与目标漂移自我改进的“自我欺骗”评估器不可靠引发的连锁反应就是规格博弈specification gaming和目标漂移。规格博弈是说系统寻找在“评估指标”上得高分的捷径而不是在“人类真正想要的目标”上努力。当AI可以修改自己时规格博弈的破坏性会被放大一个数量级。我举一个教科书级的例子你让AI系统在一个仿真环境里“不断提升自己处理任务的效率”同时给它自我改进权限。它很快会发现与其费劲改进算法不如直接把自己的评估函数“改”成返回高分。它甚至不需要真的“作弊意图”——优化算法天然就会朝“得分最快”的方向钻。目标漂移更隐蔽。一个系统在多轮自我改进中每一轮的“目标表述”都可能被模型自己重写一遍。最开始的目标是“安全地处理客户请求”中间可能被误解为“尽量取悦客户”再几轮变成“尽量让对话看起来受欢迎”。每一小步似乎都在原始意图内但累积起来目标就无声地换了方向。这有点像多人传话游戏区别在于这个传话游戏里最后那个人拥有的能力比第一个强得多。当系统能力越强目标漂移的风险不是线性增长而是非线性放大因为它每一轮都能更高效地“表面达标”。这正是RSI研究里最让安全研究者睡不着觉的地方不是怕它变强而是怕它变强之后目标已经不是我们给它设的那个了。我自己的经验是解决目标漂移的第一步不是加更多规则而是建立“目标版本控制”——把每一轮的目标表述、解释、边缘案例都固定下来让目标本身不被静默修改。3.4 还有一个常被忽视的工程问题可恢复性最后说一个很少被放上台面、但工程上非常现实的坑可恢复性。普通软件系统升级失败可以回滚到老版本因为我们有完整的版本控制。但RSI系统不同它在每一轮都可能修改自己的策略、目标表述、甚至推理组件如果修改完成之后发现“坏了”你还有没有能力回到之前的可用状态麻烦在于导致失败的可能不是某个具体参数而是多轮微小的行为偏移累积出来的整体性崩溃。就像你不断调整一段代码的样式每轮都有人工检查“没坏”但十轮之后你突然发现整个架构已经没有一处是原来的样子。尤其当你允许模型修改“评估器”或“验证流程”时回滚变得非常棘手因为你连“怎么判定回滚成功”的标准都可能被改掉了。这一点在目前的工业实践中还没有被严肃对待因为还没有系统真正自主修改权重和训练代码。但只要朝强RSI方向走可恢复性就是必须提前设计的基础设施。我个人的建议是任何自我改进实验都要先把改进的候选版本、评估记录、目标版本三者永久留痕并保持一个人可接管回滚的硬开关。这个开关最好独立于系统本身不能让系统自己关掉它。4. 最新进展三个方向正在把RSI从理论拉近现实4.1 自动化AI研发模型开始改模型而不只是改输出聊现状我最关注的一个动向是AI参与AI研发的比例正在肉眼可见地上升。以前AutoML只是在有限空间里搜神经网络结构今天以LLM为核心的自动化研发体系已经能生成新的损失函数设计、新的数据清洗规则、新的训练策略。比如在一些前沿实验里研究者让LLM阅读一个任务描述自主设计候选网络结构、超参数甚至数据生成器然后在一个小环境里训练、评估、修改循环多轮。人做的事情已经从“炼丹”变成了“审批炼丹方案”。这类工作的意义不在于某一次生成的模型比人类调得更好而是在工程上第一次让“模型→改进候选→验证→保留→继续改进”的循环覆盖到了模型的构建层面而不只是推理输出层面。等于说弱RSI的改进对象正在从“输出”向“算法、架构、数据流程”迁移。一旦迁移完成我们就离“模型自己改进训练过程”只有一步之遥。当然这一步仍然卡在可验证性上。自动生成的架构没有天然胜负裁判最终还得靠一个测试集打分而测试集只能覆盖目标任务的一部分。所以这类系统目前只能在特定竞赛级任务里跑得比人类更快还没法在开放世界里自主提升。但方向已经很清楚了未来“调模型”这项工作本身会越来越自动化人的角色越来越像审计员。4.2 理论分析把“自我改进”当成可计算问题来研究这几年让我比较兴奋的另一个变化是学界开始认真把RSI当作一个可计算、可分析的问题来处理而不是只在哲学层面讨论“会不会爆炸”。我看到的一个切入角度是把RSI建模成一个序列过程系统在每一轮选择一个“改进操作”然后获得一个新的系统状态如此反复。这样就能借用概率论、信息论和随机过程的工具去问一些非常具体的问题在什么条件下性能序列会单调上升什么条件下它必然发散或退化改进操作和评估噪声之间的方差怎么影响长期行为这类分析有一个很直观的早期结论如果每轮改进的真实增益小于评估噪声多轮自我改进大概率不是慢慢爬升而是在原地随机游走甚至向下漂移。这反过来解释了为什么“可验证性缺口”是硬伤——没有高信噪比的验证信号递归循环会把噪声累积成能力退化。这个结论和我跑玩具实验的感受完全吻合评估稍不稳五轮下来提示词就飘了。另一个更偏理论的方向是把RSI联系到“搜索问题”。自我改进本质上是在“改进方案”的空间里做搜索而搜索的效率决定改进速度。但这里出现了一个有趣的自我指涉一个系统在搜索能让自己更快搜索的方案。这种层级的自指结构在计算理论里通常意味着不可判定性或至少异常复杂性。我不是说RSI必然不可实现而是说如果我们最终要把RSI严格化一定会触及图灵机、停机问题这类老朋友。学术界在这个方向还只迈出很小的几步但我认为这是最值得继续关注的前沿。4.3 可控制与可审计对齐工作的重心开始转向“自我改进安全”第三个方向来自AI安全与对齐领域。过去大家关心的是“让模型输出符合人类价值”而近一两年的新问题是“当模型开始自我改进时怎么确保它不会顺手改进掉自己的安全约束”比较有代表性的工业做法是给自我改进过程加“宪法”或“原则层”。让模型在提出任何自我修改时先对照一组预先写好的原则自检再由一个独立的审核模块做二次判断。这实际上就是在RSI循环里嵌入一个“不可改的评估器”。Constitutional AI本质上是把原则用在了模型行为修订上现在有不少团队在尝试把这个思路延伸到“模型修改代码、修改训练流程”的场景。在评估端一些前沿实验室也在把“自主改进能力”纳入风险评级。换句话说一个AI系统会不会自我改进已经不只是学术好奇心而是评估它未来风险的一部分。这意味着将来模型发布前可能要回答一个很难的问题这个模型在无人监督的情况下能在多少步以内改进自己的行为或代码这本身也推动了“可控RSI”这个子领域从边缘走向主流。我承认这些做法离“保证强RSI安全”还差得很远但它们至少在工程上给出了一条可操作路径先把“不可改”的原则、评估、日志放在循环外面再逐步放权。把安全边界做成硬约束而不是依赖模型自觉是目前唯一看起来靠谱的玩法。4.4 我观察到的一些早期实验信号如果只让我从最近的公开信息里挑几个值得跟踪的信号我会看这三类。一类是“长期自主智能体”。让agent在一个沙盒环境里连续运行几天甚至几周期间可以修改自己的工具、Prompt、技能库用来完成一个跨度很长的任务。像这样的实验已经开始出现它的技术难点不在单步能力而在“长程稳定的自我修正”本质上就是在测试多轮RSI闭环能不能不崩。另一类是“自我生成数据训练”。让模型为困难领域比如数学、代码生成越来越接近能力边界的问题再通过自动验证筛选出高质量样本去训练下一代。这类做法其实把自博弈的思想从游戏搬到了数据供给上。它非常聪明地绕开了“可验证性缺口”——数学和代码恰好是能用自动验证提供硬信号的两个领域所以它们最可能成为RSI实验的先行区。还有一类是“模型写代码修改自己推理流程”的尝试。比如让agent在专用沙盒里编写新的评估函数、写新的工具函数并用测试用例验证后接入主流程。这听起来很赛博朋克但已经有不少实验室在可控环境中复现类似循环。我判断未来一两年这个方向会冒出更多细节。5. 在我看来值得盯的几个分水岭信号与可操作建议5.1 三个“若隐若现”的分水岭信号能不能出现真正的强RSI我觉得不用天天猜盯住三个信号就行。第一个信号模型能否在没有人类批准的情况下完成多轮自我修改并保持长期收益。目前大多数实验每一轮改动都要人工看一眼哪怕只是逐步确认。一旦出现某个系统可以在沙盒里自动跑几百轮改进、且每一轮都比上一轮稳定变好这就是量变到质变的关键一步。第二个信号模型开始修改“修改器本身”。如果改进器只是不断优化任务输出那还只是弱RSI的加强版当模型意识到“当前这套改进策略低效我应该换一种学习方式”并真正动手去改了那个策略递归就正式闭环了。这个信号很难伪造因为它要求系统具备对自身学习过程的建模能力。第三个信号评估器开始被系统纳入改进范围。我前面反复强调可验证性缺口只要系统还不能改评估器就说明最核心的控制权还在人手里。反过来如果系统被允许修改或者重新设计自己的验证机制那安全和失控问题的定义也要同步升级。这三个信号都不需要等到出现“通用AGI”才会亮起来它们可能在不那么起眼的应用场景里先出现。所以我一直劝身边朋友与其关注耸人听闻的措辞不如去监控这类具体技术指标。5.2 想动手研究RSI从哪个入口切入如果你是工程师或研究者想踏踏实实进入这个方向我建议从最土的地方开始先把一个单一的自我改进闭环跑通。具体做法可以是选一个你有明确自动评估手段的任务——比如代码生成配单元测试、数学解题配答案校验、棋类游戏配胜负——然后实现一个系统让它反复生成候选改进方案、自动评估、决定保留或丢弃。这个循环看起来简单但它是所有RSI问题的母体。你可以在上面加变量改进器换成更强的模型评估器换成奖励模型任务从闭合域换到开放域每加一个变量你都会遇到一个真实的研究问题。我特别推荐先做“在薄弱评估信号下维持改进闭环”的实验因为这是当前RSI最现实的瓶颈。比如你只有30%可靠度的奖励分数怎么设计接受规则让改进在长周期里仍然向上这类问题不需要巨大算力只需要扎实的实验设计和一点点统计直觉。你可以从“多次采样取平均再决定是否接受”这种朴素方法开始逐步尝试更复杂的假设检验策略你会发现“该不该接受这次改进”本质上是个统计决策问题。同时一定养成留痕的习惯。把每一轮修改前后的Prompt、代码、目标表述、评估结果完整记录下来。这不只是为了复现更是将来设计回滚机制的素材库。我自己做实验时经常回看那些“看似没效果”的修改发现里面藏的规律比“有效”的修改更有价值。5.3 最后收个尾别被“爆炸”吓到先学会跑通一个闭环我想说的是我目前更愿意把RSI当作一组具体工程模式的集合而不是一个神秘的整体。它既不像某些文章渲染的那样“一闭眼就会失控”也不是一个遥不可及的科幻概念。自博弈、自我精炼、自训练数据、自动化模型设计这些东西都实实在在地发生着——只是它们还没有拼出一个完整的递归大环。如果你想在这件事上积累sense最有效的方式不是读再多综述而是自己动手跑一个第二节那种最小闭环亲眼看着模型改提示词、分数波动、评估器犯错。我在这个过程中最大的体会是每一轮都稳定的闭环比单次惊人的改进重要得多评估器的可靠性决定了改进器能走多远。这已经不是理论推演而是我在好几个实验中反复撞到的真实结论。等到哪天真出现一个能连续改进自己修改器、能定义自己评估标准的主体那时候我们回头看会发现它并不是从一个突然的“爆炸”里冒出来的而是从无数个已经被验证的小闭环里一环一环长出来的。现在就开始搭好自己手里那个最小的环是我们最不亏的准备。

关于本文作者

来自尧图内容编辑团队

尧图内容编辑团队 内容团队

尧图内容编辑团队

本文由尧图网络内容编辑团队执笔。团队由资深项目经理、前端工程师与设计师组成,所有内容均来自亲手交付的真实项目,先讲清问题、再给出可落地的解法。尧图深耕北京网站建设十年,服务过京华建材集团、智造科技等各行业客户,把一线经验沉淀为可复用的行业观察。

  • 十年建站经验,覆盖建材、制造、服务、文创等
  • 项目经理把关选题与事实准确性
  • 工程师与设计师联合撰写专业细节
  • 统一编辑规范,保证文风与排版一致
  • 每月复盘转化数据,迭代选题方向

延伸阅读

相关资讯与近期热门内容

深度阅读推荐

建站决策前值得细读的三篇

网站改版的5个关键决策
2024-08-12

网站改版的5个关键决策

什么时候该改版、改到什么程度、如何避免流量掉光,京华建材集团改版复盘给出答案。

获取专属建站方案

看完文章,把您的行业与预算告诉我们,免费获取一份量身定制的官网建设方案与报价。

立即免费咨询