
视频大模型这两年的进化速度说实话有点超出我年初的预期。以前处理照片里有个路人这种需求我的第一反应是打开修图软件套索工具圈一圈内容识别填充点一下运气好边缘干净运气不好就是一团糊。后来有了AI修图工具涂抹一下自动补全效率提升不少但遇到视频就彻底歇菜——视频是连续的你没法一帧一帧去涂涂完前后帧对不上画面会像水波纹一样抖。直到我把视频大模型接进工作流才真正体会到什么叫降维打击。原本需要逐帧处理、手动跟踪、反复修补的活儿现在变成了一句提示词加一次生成的事。这篇内容我就把整套去路人的工作流拆开讲清楚包括为什么选视频大模型而不是传统修图、提示词到底该怎么写、本地部署的硬件门槛在哪、以及我在实测中踩过的那些坑。不管你是做短视频的、搞电商素材的还是单纯想给旅游视频清个场这套思路都能直接抄。1. 为什么去路人这件事传统修图思路注定吃力1.1 视频不是照片的简单叠加很多人第一次接触视频去路人会下意识觉得不就是把每一帧当照片处理吗。我一开始也这么想直到我拿一段30秒、每秒30帧的素材试了一遍——900帧就算每帧只花10秒处理那也是两个半小时而且这还没算人工检查的时间。更致命的是逐帧处理的结果是帧与帧之间没有关联第100帧补出来的地面纹理和第101帧补出来的完全不一样播放起来就是闪烁的噪点。视频的本质是时间维度上的连续信号相邻帧之间存在极强的相关性。传统修图工具是空间域的它只看当前这一张图不知道上一帧和下一帧长什么样。而视频大模型是时空域的它在生成时会同时考虑空间上的纹理一致性和时间上的运动连续性这是它和修图工具最根本的区别。打个比方修图工具像是一个只会画单幅画的画师你让他画100张相似的画每张都会有细微差别视频大模型像是一个动画师他脑子里装的是这段画面该怎么动所以补出来的内容天然就是连贯的。1.2 传统方案的三条死路我把市面上常见的去路人方案梳理了一下基本逃不出这三类每一类都有绕不过去的坎。第一类是手动跟踪加修补。用跟踪软件把路人框住让软件跟着他移动然后逐帧用修补工具填。这条路精度最高但工作量随视频长度线性增长一段1分钟的视频够你干一整天而且路人一旦被遮挡或者走出画面跟踪就断了得重新来。第二类是内容识别填充的批处理。有些工具支持把蒙版应用到整个视频序列然后批量填充。听起来很美但实际效果取决于背景复杂度。背景是纯色墙面还行背景是流动的水面、飘动的树叶、走动的人群填充结果基本没法看因为工具不知道这个位置本来应该是什么。第三类是基于光流的补全。利用前后帧的运动信息来推断被遮挡区域的内容。这个思路在学术上很成熟但工程落地时对运动估计的精度要求极高一旦光流算错补出来的内容就会扭曲变形。而且它只能处理短暂遮挡路人停留时间一长就没辙了。1.3 视频大模型带来的范式转变视频大模型的出现把这个问题从修补变成了重新生成。你不再需要告诉工具这里原来是什么你只需要告诉它这里应该是什么。模型基于它对世界的理解结合前后帧的上下文直接生成一段合理的内容填进去。这个转变的意义在于它把对精度的要求转移到了对提示词的要求上。以前你拼的是工具的操作技巧现在你拼的是怎么把需求描述清楚。这也是为什么提示词工程在这个场景里变得如此关键——同样一段素材提示词写得好和写得差出来的结果可能是天壤之别。我实测下来一段10秒、1080P、有2到3个路人的素材用视频大模型处理从写提示词到出结果熟练之后15分钟以内能搞定。同样的素材用传统方法保守估计3小时起步。这个效率差距就是降维打击这四个字的由来。2. 视频大模型去路人的工作流全貌2.1 工作流的五个核心环节整套工作流我拆成了五个环节每个环节都有它存在的必要性缺一个都会影响最终效果。素材预处理是第一步。不是所有视频都适合直接丢给模型你需要先做剪辑把要处理的片段单独切出来控制时长。我一般建议单次处理不超过10秒原因后面会讲。同时要检查分辨率和帧率太高的分辨率会增加显存压力太低的帧率会让模型难以判断运动。区域标注是第二步。你得告诉模型路人在这里。这一步可以用分割工具自动生成蒙版也可以手动框选。自动分割适合路人轮廓清晰的场景手动框选适合路人被部分遮挡或者和背景颜色接近的情况。提示词设计是第三步也是最考验经验的一步。提示词要同时描述三件事要移除什么、要保留什么、移除后那个位置应该是什么。很多人只写了第一件事结果模型把路人和背景一起抹了。模型推理是第四步。这一步主要是等但等待过程中有几个参数需要盯着比如生成步数、引导系数、随机种子。这些参数决定了生成质量和稳定性。后处理与合成是第五步。模型输出的通常是处理后的片段你需要把它和原视频的其他部分拼接起来检查衔接处是否自然必要时做一点色彩校正。2.2 各环节的耗时分布与优化重点我把实际操作的耗时记录了一下做成表格方便你判断该在哪里下功夫。环节平均耗时10秒素材优化空间关键影响因素素材预处理3-5分钟中剪辑熟练度、素材格式区域标注2-8分钟大路人数量、轮廓清晰度提示词设计5-15分钟极大经验、场景复杂度模型推理3-10分钟小硬件、分辨率、时长后处理合成2-5分钟中衔接处数量、色彩差异从表里能看出来提示词设计是耗时波动最大的环节也是优化空间最大的。新手可能写20分钟还写不到点子上老手5分钟就能出一版可用的。这个差距不是靠工具能弥补的只能靠积累。区域标注的优化空间也不小。如果你的素材里路人轮廓清晰、和背景对比明显用自动分割几秒钟就搞定如果路人和背景颜色接近或者被其他物体遮挡手动框选可能要花好几分钟还得反复调整。2.3 什么素材适合这套工作流不是所有素材都适合用视频大模型去路人我总结了几条判断标准。适合的素材路人移动速度适中、背景相对稳定、路人占画面比例不大、光线条件良好。比如旅游景点的固定机位拍摄、街拍中的行人、活动现场的背景人群。不太适合的素材路人快速穿过画面、背景本身在剧烈运动比如手持跟拍、路人占据画面主体、光线剧烈变化。这些情况下模型很难判断什么是背景、什么是前景生成结果容易崩。完全不适合的素材路人长时间停留在画面中央、路人和被摄主体有交互比如握手、遮挡、画面本身画质很差。这些场景下与其用模型去生成不如重新拍一条。提示判断素材是否适合有个简单的办法——把视频暂停在路人出现的某一帧问自己如果我是画师让我把这个人擦掉再补上背景我能补得自然吗。如果连你都觉得难模型大概率也难。3. 提示词才是这套工作流的胜负手3.1 提示词的三层结构我摸索出来的提示词结构是三层移除层、保留层、生成层。这三层缺一不可而且顺序很重要。移除层负责告诉模型要删什么。写法上要具体不能只说移除路人要说移除画面右侧穿红色外套、正在向右行走的男性。越具体模型定位越准。保留层负责告诉模型什么不能动。这一层最容易被忽略但恰恰是最关键的。你要明确列出画面中必须保持原样的元素比如保留背景中的石桥、水面倒影、左侧的树木。如果不写模型可能会把石桥也当成需要重新生成的部分结果桥就变形了。生成层负责告诉模型补什么。这一层要描述移除后那个位置应该呈现的内容比如该位置应呈现连续的石板路面和延伸的水面。描述要符合物理规律不能凭空想象。三层结构写下来一段完整的提示词大概长这样移除画面中正在行走的路人包括穿红色外套的男性和穿蓝色裙子的女性。 保留背景中的石桥、桥下的水面倒影、左侧的柳树以及远处的山峦轮廓。 移除后被遮挡的石板路面应自然延伸水面倒影保持连续整体光线和色调与原画面一致。3.2 描述精度决定生成质量我做过一组对比测试同样一段素材用不同精度的提示词结果差异非常明显。提示词精度示例生成结果返工率模糊去掉路人路人没了但背景出现明显模糊块80%一般去掉画面中的行人保持背景路人基本去掉背景有轻微变形40%精确移除右侧穿红衣行走的男性保留石桥和水面补全石板路面路人干净移除背景自然10%极精确上述精确版加光线方向、色调描述几乎看不出处理痕迹5%从表里能看出来从一般到精确这一步返工率直接砍掉四分之三。这就是为什么我愿意在提示词上多花时间——前期多花5分钟后期少返工半小时。描述精度体现在几个维度上位置要精确画面左侧还是右侧、上方还是下方、特征要精确颜色、服装、动作方向、背景元素要精确具体是什么物体不是笼统的背景、生成内容要精确什么材质、什么纹理、什么光照。3.3 那些让模型翻车的提示词写法踩过的坑多了我总结出几类特别容易让模型翻车的写法你写的时候尽量避开。否定式描述。比如不要生成树木模型对否定词的处理能力很弱它很可能理解成要生成树木。正确的做法是正面描述该位置应呈现空旷的草地。抽象概念。比如让画面更干净什么叫干净模型不知道。要具体到移除所有行人、车辆、杂物保留建筑和道路。矛盾描述。比如移除路人但保留路人的影子这在物理上就不合理模型会陷入混乱生成结果要么影子还在人也在要么人和影子都没了。过度堆砌。有些人喜欢把能想到的词都写上去结果提示词长达几百字模型反而抓不住重点。我的经验是单次提示词控制在100到200字之间重点突出层次清晰。忽略光线。光线方向决定了阴影方向如果提示词里不提光线模型可能按自己的理解打光结果补出来的区域和周围光照不一致一眼就能看出处理痕迹。注意提示词写完后先自己读一遍问自己如果我是第一次看到这段描述我能准确想象出画面吗。如果连你自己都觉得模糊模型更不可能理解。3.4 提示词的迭代策略没有人能一次写出完美提示词迭代是常态。我的迭代策略是小步快跑每次只改一个变量。第一版先写基础的三层结构跑一次看结果。如果路人没去干净就在移除层加细节如果背景变形了就在保留层加约束如果补出来的内容不自然就在生成层改描述。每次只改一层这样你才能知道是哪个改动起了作用。我一般会准备3到5个候选提示词同时跑然后对比结果。这样虽然单次耗时长了点但能快速找到最优解。跑多了之后你会对什么样的描述对应什么样的结果形成直觉迭代次数会明显减少。还有一个技巧是复用成功案例。如果你处理过一段类似的素材提示词效果不错可以把它存下来作为模板下次遇到相似场景直接改几个关键词就行。我现在的提示词库里存了二十多个模板覆盖了街拍、旅游、活动、室内等常见场景效率提升非常明显。4. 本地部署的硬件账与参数调优4.1 显存是硬门槛12G能跑但要看怎么跑关于本地部署问得最多的问题就是我的显卡能不能跑。我拿RTX 3060 12G实测过结论是能跑但有前提。前提一是分辨率。12G显存跑1080P、10秒以内的片段基本没问题。但如果素材是4K或者时长超过15秒显存就会吃紧要么报错要么速度慢到无法接受。解决办法是先降分辨率处理处理完再放大回去虽然会损失一点画质但比跑不动强。前提二是模型版本。不同版本的模型对显存的需求差异很大。原版模型参数多、效果好但显存占用高轻量版模型显存占用低但生成质量会打折扣。我的建议是12G显存优先考虑轻量版或者量化版牺牲一点质量换稳定性。前提三是批处理大小。一次处理一帧和一次处理多帧显存占用完全不同。12G显存建议批处理大小设为1虽然慢但稳。显存容量可处理分辨率建议时长模型版本建议实测速度8G720P5秒以内量化版较慢12G1080P10秒以内轻量版/量化版中等16G1080P15秒以内标准版较快24G4K20秒以内标准版/原版快这张表是我和几个朋友的实际配置汇总出来的仅供参考。实际能跑什么还取决于你的CPU、内存、硬盘速度以及模型的具体实现。4.2 本地部署还是云端调用这是个绕不开的选择。我把两条路线的优缺点列出来你根据自己的情况选。本地部署的优势是数据不出本地、没有调用次数限制、长期成本低。劣势是硬件投入大、环境配置麻烦、模型更新要手动。适合有固定处理需求、对数据隐私敏感、有闲置显卡的用户。云端调用的优势是开箱即用、按量付费、模型自动更新。劣势是数据要上传、有调用成本、高峰期可能排队。适合处理需求不固定、没有合适硬件、想快速验证效果的用户。我的做法是混合使用日常小批量处理用本地遇到复杂场景或者本地跑不动的素材临时调云端。这样既控制了成本又保证了灵活性。4.3 参数调优的实战经验模型跑起来之后有几个参数值得调调好了效果提升很明显。生成步数。步数越多生成质量越高但耗时也越长。我实测下来20到30步是性价比最高的区间低于20步细节不够高于30步提升有限但耗时翻倍。引导系数。这个参数控制模型听提示词的话的程度。系数太低模型自由发挥可能不按你的提示词来系数太高模型过于死板生成结果会显得僵硬。我一般设在7到12之间具体看场景。随机种子。固定种子可以复现结果方便对比不同提示词的效果。但如果你对结果不满意换个种子往往能带来惊喜。我的习惯是先用固定种子调提示词提示词定下来之后再随机种子多跑几次挑最好的。帧间一致性权重。这个参数是视频模型特有的控制相邻帧之间的连贯程度。权重太低画面会抖权重太高运动会被抹平看起来像静止画面。我一般设在0.6到0.8之间。提示调参不要一次调多个每次只动一个记录结果。我见过太多人一次改五个参数结果好了不知道是哪个起的作用坏了也不知道该回退哪个。5. 实测中那些文档不会告诉你的坑5.1 边缘处理最容易露馅的地方路人移除后最容易被看出来的不是被移除区域本身而是边缘。模型生成的区域和原始背景之间如果过渡不自然会形成一圈明显的接缝。我踩过的坑是提示词里只描述了移除路人没描述边缘要自然过渡。结果模型把路人区域生成得很好但和周围背景之间有一条清晰的边界像贴了块补丁。解决办法是在提示词里加上边缘自然过渡与周围纹理融合这类描述。另外后处理时可以用羽化工具把边缘稍微模糊一下能有效掩盖接缝。羽化半径不用太大2到3个像素就够太大了反而会糊。还有一个细节是阴影。路人走了但他的影子可能还在。如果提示词里没提阴影模型可能只移除人不移除影子结果画面里飘着一团没有主人的黑影。所以提示词里要明确移除路人及其产生的阴影。5.2 运动模糊与景深模型的软肋如果原视频里路人处于运动状态会有运动模糊如果背景有景深虚化路人所在位置的虚化程度和背景其他位置可能不一样。这两个因素都会让模型犯难。运动模糊的问题在于模型不知道该按清晰还是模糊来生成。我的经验是在提示词里明确描述该区域应呈现与周围一致的运动模糊程度给模型一个参照。景深的问题更麻烦。如果路人在虚化区域移除后那个位置应该也是虚化的但模型可能生成清晰的内容导致前后景深不一致。解决办法是在提示词里描述该区域应保持与背景一致的景深虚化或者在后处理时手动加一点模糊。5.3 长视频的分段处理与衔接前面我一直强调单次处理不超过10秒原因就在这里。视频大模型处理长视频时显存占用会随时间线性增长而且时间越长模型对前后文的把握越弱容易出现前面处理得好、后面崩了的情况。所以长视频必须分段处理。分段的原则是在画面相对静止的位置切不要在运动剧烈的地方切。比如一段街拍可以在路人走出画面、画面暂时没有明显运动的瞬间切一刀。分段处理完之后衔接处需要特别检查。两段之间的色彩、亮度、运动连续性都可能存在差异。我的做法是在剪辑软件里把两段叠化过渡一下过渡时长0.5到1秒基本能掩盖衔接痕迹。5.4 色彩与亮度的漂移模型生成的内容色彩和亮度往往和原画面有细微差异。单看可能看不出来但和前后片段一对比就能发现色温偏了或者亮度跳了一下。这个问题在室内场景和黄昏场景下尤其明显。解决办法有两个一是在提示词里明确描述光线条件比如暖色调黄昏光线室内冷白光二是在后处理时用色彩匹配工具把生成片段的色彩向原片段对齐。我一般两个方法都用。提示词先保证大方向对后处理再微调。色彩匹配不用追求完全一致人眼对色彩差异的容忍度其实挺高的只要不出现明显的跳变就行。5.5 那些看起来能行其实不行的场景最后说几个我踩过的、看起来简单实际很难的场景帮你提前避坑。水面倒影。路人在水边走过水面有他的倒影。移除路人容易但倒影怎么处理模型往往会把倒影也一起抹掉结果水面出现一块不自然的平静区域。这种场景建议手动处理倒影部分或者干脆换个机位重拍。玻璃反射。路人在玻璃幕墙前走过玻璃上有他的反射。移除路人后反射区域需要补全但模型不知道玻璃后面是什么生成的内容往往和实际环境对不上。密集人群。画面里人太多模型分不清哪个是要移除的路人哪个是要保留的背景人物。这种场景下提示词很难写清楚建议先用人像分割把要保留的人抠出来处理完再合成回去。快速运动。路人在画面里快速跑过运动模糊严重模型很难判断他的准确轮廓。这种场景下与其硬处理不如在剪辑时把这段剪掉或者用其他镜头替代。6. 从单点处理到工作流自动化6.1 把重复劳动交给工作流引擎单次处理熟练之后你会发现大部分操作是重复的切片段、生成蒙版、套提示词模板、调参数、导出。这些步骤完全可以交给工作流引擎自动化。我用工作流引擎把整个流程串了起来输入原视频自动切片、自动生成蒙版、自动套用提示词模板、自动调用模型、自动合成输出。中间只需要人工确认蒙版是否准确、提示词是否需要微调。这样一来处理一段素材的时间从15分钟压缩到了5分钟以内而且质量更稳定因为参数是固定的不会因为手抖调错。6.2 提示词模板库的积累工作流自动化的核心是提示词模板库。我把常见场景的提示词都存成了模板每个模板包含场景描述、移除层、保留层、生成层的标准写法用的时候只需要替换几个关键词。模板库的积累是个长期过程。我的做法是每处理一个新场景就把效果好的提示词存下来标注适用条件。时间长了模板库越来越丰富遇到新素材时先检索有没有相似模板有就直接改没有就新建。场景类型模板关键词适用条件注意事项街拍行人、街道、建筑固定机位、光线稳定注意阴影和倒影旅游游客、景点、自然背景以自然景观为主注意景深一致性活动人群、舞台、灯光室内、光线复杂注意色彩漂移电商模特、产品、背景背景简洁、主体突出注意边缘过渡6.3 批量处理的注意事项工作流自动化之后很容易想既然这么快那就一次多处理几条。但批量处理有几个坑要注意。显存溢出。批量处理时如果同时加载多个任务显存会迅速吃满。我的做法是串行处理一条处理完再处理下一条虽然慢一点但稳。质量抽检。批量处理容易让人放松警惕结果出来一堆才发现有问题。我一般每处理5条抽检1条发现问题及时调整避免批量返工。日志记录。批量处理一定要记日志记录每条素材用了什么提示词、什么参数、结果如何。出了问题能追溯好的经验能沉淀。6.4 和其他AI能力的组合视频大模型去路人只是整个内容生产链条中的一环。把它和其他AI能力组合起来能玩出更多花样。比如先用图像大模型生成一段没有路人的背景视频再用视频大模型把实拍素材里的主体合成进去或者先用分割模型把路人抠出来用视频大模型生成干净的背景再把抠出来的人放到新背景里。这些组合玩法我还在摸索目前跑通了几条效果挺有意思。组合的关键是接口要通。不同模型之间的输入输出格式要能对接中间可能需要写一点转换脚本。这块门槛不高但需要一点耐心。7. 一些关于效率和心态的实话7.1 不要追求100%完美我刚开始用视频大模型去路人的时候总想把每一帧都处理得完美无瑕结果一段10秒的视频反复跑了二十多遍花了两个多小时最后效果也就比第十遍好一点点。后来我想通了观众看视频是连续播放的不是逐帧暂停检查的。只要在正常播放速度下看不出破绽就是合格的结果。那些只有暂停才能发现的细微瑕疵不值得花几倍的时间去消除。这个心态转变之后我的效率提升了至少三倍而且成品质量并没有明显下降。7.2 建立自己的素材分级标准不是所有素材都值得用视频大模型处理。我给自己定了个分级标准A级素材核心内容、会反复使用、对质量要求高。这类素材值得花时间精雕细琢提示词反复迭代参数仔细调优。B级素材一般内容、用一次就过、质量要求中等。这类素材用模板提示词快速处理差不多就行。C级素材边角料、填充内容、质量要求低。这类素材直接剪掉或者用简单工具处理不值得动用大模型。有了分级标准你就不会在C级素材上浪费A级的时间整体效率会高很多。7.3 持续跟进模型迭代视频大模型这个领域三个月就是一代。新版本可能在效果、速度、显存占用上都有明显提升。我的习惯是每个月抽半天时间看看有没有新版本发布有的话跑几个测试用例对比一下。跟进迭代不意味着每次都要升级。如果当前版本满足需求没必要折腾。但如果新版本能解决你一直头疼的问题那就值得升级。最后分享一个我最近的小发现把提示词里的移除换成重构模型的表现会不一样。移除倾向于删除重构倾向于重新生成后者在复杂背景下的效果往往更好。这个技巧不一定通用你可以试试看在你的场景下有没有用。