Wan3.0视频提示词实战:从“描写画面”到“指导拍摄”

发布时间:2026/9/2 5:41:30
Wan3.0视频提示词实战:从“描写画面”到“指导拍摄” Picsart 视频产品负责人最近分享的一组 Wan3.0 提示词技巧核心观点不是“怎么把画面写得漂亮”而是“怎么让模型像摄影师一样听懂拍摄指令”。这个判断我很认同。Wan3.0 是通义万相系列视频生成模型的新版本很多人已经跑过文生视频、图生视频但大部分生成结果不理想问题往往不在模型能力而在提示词写法。这篇文章就把这套思路拆开给出一套可以直接实操的 Wan3.0 提示词框架覆盖人物写实、产品展示、空镜氛围、风格化场景以及从单条测试到批量任务的完整流程。适合两类人看一类是刚接触 Wan3.0、被画面稳定性劝退的新手另一类是想把视频生成接入内容生产流程、需要稳定输出质量的从业者。先说一个容易误解的地方。视频提示词和对话提示词不一样。对话模型会理解你的意图即使表述模糊也能猜。视频生成模型不会“猜”它更像一个执行拍摄指令的团队你写“一个女孩在森林里跑”它可以生成但场面调度、镜头运动、光线氛围、主体动作细节全部要模型自己脑补。脑补的结果就是不可控。所以真正值得花时间的不是堆砌形容词而是把提示词从“描写画面”改成“指导拍摄”。下面按实际落地顺序拆一遍。1. Wan3.0 提示词厉害在哪儿从“描写画面”到“指导拍摄”1.1 这次分享里最值得学的一条Picsart 视频产品负责人的分享反复围绕一个点把提示词当导演指令来写。视频产品团队每天都在跟生成结果打交道他们最难接受的不是生成质量差而是不可控。模型能不能把“主体是谁、在做什么、镜头怎么动、环境什么样”一次说清楚直接决定一条视频能不能用。为什么这个视角重要因为 Wan3.0 本质上不是绘画工具而是拍视频的工具。绘画提示词只需要描述静态画面视频提示词要额外承担时间维度的信息动作怎么发展、镜头怎么运动、情绪怎么变化。同一个画面静止展示和缓慢推进观众感受完全不同。模型需要从文本里读取这些差异。1.2 提示词质量的分水岭信息结构我见过不少提示词写得非常饱满形容词三十个结果生成出来主体穿帮、镜头乱晃、背景闪烁。原因很简单模型不知道哪些词是重点。提示词越长重点越容易丢失。真正高质量的视频提示词信息结构通常是清晰的主体在开头动作紧随其后镜头语言单独交代环境光线放中间最后用约束条件收尾。这里有个判断标准把提示词读一遍如果你能在脑子里直接想象出一个具体的分镜脚本这条提示词大概率有效。如果读完还不知道主体是谁、镜头是固定还是运动、光线是暖是冷模型更不知道。字数多不等于信息量大一条好的提示词应该像一份简短的拍摄需求单每个字段都有明确功能。1.3 新手最常见的三类错误第一类是写小说。把人物的心理活动、背景故事、隐喻全写进去。视频模型不理解“她看起来心事重重”它理解的是“她皱眉、低头、沉默、缓慢转身”。视觉化的动词才有意义。第二类是只说内容不说镜头。写了“一只猫在窗台上睡觉”没有写镜头固定还是缓慢推近。模型自己选运镜方式结果就是每次生成都不一样风格不稳定。第三类是只写正面描述不写负面约束。视频生成里手部变形、多手指、画面闪烁、文字水印都是高发问题。如果提示词里不写“不要出现手指变形、不要出现文字”模型默认情况下不会自动避开。后面会专门讲负面提示词怎么用。2. 写提示词之前先理解 Wan3.0 怎么读文本2.1 模型读的是“指令”不是“文章”Wan3.0 作为文生视频模型输入是一段文本输出是一段视频。它内部会把文本拆解成语义元素再在视频生成过程中把这些元素组合起来。问题在于自然语言天生有歧义。你写“一个男人走进房间然后坐下”模型要自己决定怎么走、怎么坐、镜头拍哪个角度。所以好的做法是主动消歧动作写具体镜头写清楚空间关系写明确。比如“一个穿黑色外套的男人从画面右侧缓步走进房间镜头跟随他的背影他在窗边的椅子上坐下手指轻轻敲桌面”模型需要脑补的部分就少很多。2.2 它关注的信息层级我通常把 Wan3.0 会读取的信息分成六个层级主体谁出现在画面里长什么样穿什么。动作主体在做什么动作幅度大还是小有没有连续运动。镜头镜头固定、推近、拉远、环绕、跟随、俯拍还是仰拍。环境场景在哪里背景是什么空间关系如何。光线和氛围自然光、暖黄灯、冷蓝、傍晚、清晨、雾天、霓虹。风格与约束电影感、纪录片、动漫、写实、低多边形以及不能出现的东西。层级顺序很重要。主体和动作是第一优先级如果这两项写得不清楚后面的光线和风格再漂亮也没用。我见过很多人把光线写在最前面主体反而一笔带过生成结果往往是背景很有氛围人物动作一塌糊涂。2.3 中文提示词还是英文提示词Wan 系列对中文提示词的支持一直做得比较友好。我的实测感受是用中文写主体、动作、环境这些语义明确的内容效果不比英文差反而是中文表达“光线的暖冷”“风的大小”“动作的迟疑”这类细腻语义时更准确。选择原则就一条用你自己表达最准确的语言不要为了追求英文而生硬翻译。如果要用英文建议把关键名词和动作拆成短语不要写成一整段复杂从句。比如“woman, 30 years old, gray coat, standing on rooftop, wind blowing hair, slow push-in”就比一整段嵌套从句更容易被模型解析。中文同理短句、逗号分隔、信息块清晰比长句更稳定。2.4 别用写小说的方式写视频提示词视频提示词里最不值得写的是心理描写、抽象比喻、情绪形容词。比如“她心中充满孤独”模型不知道孤独长什么样。改成“她站在空荡房间的窗前双手垂在身侧望着窗外暗淡的街道镜头缓缓拉远”孤独感反而表达出来了。核心原则所有情绪都要转化成可见的动作、表情、光线和环境。这也是 Picsart 视频产品负责人那套分享里反复强调的方向——用镜头语言替代文字描写让模型通过画面元素来传达情绪。写提示词时多问自己这句话能不能被摄像机拍到拍不到就不要写。3. 一套可复用的 Wan3.0 提示词框架3.1 六要素结构把提示词拆成六个模块每一模块负责一件事。这个结构不是凭空发明的而是从视频制作流程里反推出来的任何一条可执行视频都需要回答“拍谁、他在干什么、镜头怎么动、在哪儿、什么光、什么风格”。主体一个不会产生歧义的对象描述。动作与情绪具体的动作链条按时间顺序排列。镜头语言运镜方式、景别、视点。环境与空间场景、背景、主体与背景的关系。光线与氛围光线来源、色温、天气、时间段。负面约束禁止出现的元素。3.2 一个完整模板下面这个模板可以作为起点实际使用的时候替换掉方括号里的内容[主体描述][服饰/外观细节]站在/坐在/穿行于[环境描述]。 动作先[动作1]然后[动作2]表情[表情描述]。 镜头[镜头运动方式]从[位置]开始画面[景别]浅景深/深景深。 环境背景是[背景描述]主体在[空间位置]画面角落有[辅助元素]。 光线[光线来源]光[冷/暖]色调[时间段/天气]氛围。 风格[电影感/纪录片/动漫/写实/低多边形]画面干净。 负面不要出现[手指变形/多手多脚/文字/水印/闪烁/面部扭曲]。注意这不是一个固定格式而是一个信息清单。模型不会因为你写了“负面”两个字就自动理解真正起作用的是后面的具体内容。3.3 模板拆解每段在控制什么主体描述放在开头作用是锁定视频的主角。这一步写得不清楚后续所有描述都容易跑偏。如果生成人物最好写明性别、年龄段、服装、发型如果是物品写明材质、颜色、形态。不要只写“一个人”。动作部分要按时间顺序写。视频是连续的动作之间的先后关系必须明确。写“先推门然后停顿再走进室内”比写“她推门走进室内”更容易生成连贯动作。动作幅度也要写微微转身还是迅速回头大步走还是缓步走模型需要知道节奏。镜头语言单独一段不跟主体混在一起。我见过很多提示词把“镜头慢慢推进”写在句子里被模型忽略原因就是它被其他长句淹没。把运镜方式单独列出模型更可能响应。固定镜头就写“镜头固定”运动镜头就写“缓慢推近”“跟随主体横移”“从俯拍缓慢下摇”。越具体越容易控制。环境、光线、风格同样各有分工。环境解决“在哪”光线解决“整体感受”风格解决“渲染倾向”。三个模块最好都写只写环境不写光线画面容易平淡只写风格不写环境背景容易乱。3.4 参数补充时长、分辨率、运动幅度提示词之外Wan3.0 的参数也会影响结果。常见需要关注的有生成时长、分辨率和运动幅度。这些参数在不同产品界面里的叫法略有差异但思路一致视频越短越容易控制分辨率越高对显存要求越高运动幅度越大越容易出现形变和闪烁。我的建议是第一次测试不要追求高分辨率先用中低分辨率跑通提示词结构确认主体、动作、镜头都符合预期再拉高分辨率和时长。否则一条长视频跑到一半才发现主体穿帮浪费的时间和资源都更多。如果界面里有“运动幅度”或“画面动态”类似选项先从中等强度开始。运动太强画面容易乱运动太弱视频又像静态图。4. 分场景实测人物、产品、空镜、动漫4.1 人物写实场景人物类视频是最常见的需求也是提示词最难写的一类。难在三点面部一致性、手部稳定性、动作连贯性。一个实测下来比较稳定的人物提示词示例一个三十岁左右的女性穿深灰色风衣中长发站在城市天台上。 动作她站在栏杆边双手扶着栏杆风吹起头发她微微侧头看向远方然后缓缓转头看向镜头眼神平静。 镜头镜头固定在正前方缓慢推近从中景推近到近景浅景深背景略微虚化。 环境背景是傍晚的城市街区远处有暖色灯光逐渐亮起天边是暗蓝色画面左下角有轻微的车灯拖影。 光线傍晚自然光整体偏冷蓝色面部有柔和补光氛围安静克制。 风格电影写实风画面干净细腻。 负面不要出现手指变形、多余肢体、面部扭曲、画面闪烁、任何文字或水印。这条提示词的关键在于动作链条是连续的扶栏杆、风吹头发、转头、看镜头每一步都有明确顺序。镜头固定推近让模型不必同时处理运镜和动作两件事。实测时如果脸部不稳定优先缩短镜头推进距离固定机位比复杂运镜更容易保住人脸一致性。4.2 产品展示场景产品展示视频讲究的是转台节奏、材质质感和环境反光。提示词要重点描写产品形态、表面材质、旋转方式和背景环境。一个透明玻璃瓶装的无标签护肤品瓶内是浅金色液体瓶身有细微的水珠放在浅灰色大理石台面上。 动作瓶子缓慢旋转顺时针转动约九十度台面上出现轻微的光影移动。 镜头镜头固定从产品斜上方四十五度拍摄缓慢推近浅景深。 环境背景是米白色墙面台面边缘有柔和阴影右侧放着一片绿色植物叶子轻微入镜。 光线柔和的棚拍灯光偏暖白产品表面有明显高光玻璃材质通透。 风格商业产品摄影风格画面干净质感细腻。 负面不要出现手指、人物倒影、瓶身文字、水印、反光闪烁。产品视频最容易出的问题就是瓶身文字和品牌标识乱生成。如果做不到精确文字直接写“无标签”“瓶身没有任何文字”比让模型自由发挥要稳得多。另外旋转角度不要写太大九十度以内的缓慢旋转比完整一圈更容易保持形态一致。4.3 空镜氛围场景空镜没有主体人物难度在于氛围统一。这类提示词不需要复杂动作重点写环境、光线和镜头运动。一片雨后的森林薄雾弥漫在树木之间阳光从左上方的树叶缝隙中穿过形成几道细长的光束。 动作雾气缓慢飘动树叶轻微摇晃光束里的微尘浮动没有人物。 镜头镜头固定缓慢向右平移画面从树冠逐渐下摇到地面潮湿的落叶层整体节奏很慢。 环境森林地面被雨水打湿落叶泛着湿润的深褐色远处树木轮廓朦胧。 光线清晨自然光偏冷色调带一点淡青色氛围安静通透。 风格自然纪录片的质感画面干净没有明显颗粒感。 负面不要出现人物、动物、文字、水印、画面闪烁、过度饱和。空镜类提示词我最注意的是“动作”要写环境本身的动态而不是主体动作。薄雾飘动、树叶摇晃、光束变化这些细微运动会让画面活起来。如果你忘写环境运动模型有概率生成一段近乎静止的视频观感会像一张会呼吸的照片而不是视频。4.4 动漫和风格化场景风格化视频的提示词核心是明确“渲染风格”。动漫、水彩、赛博朋克、低多边形不同风格对模型的影响非常大。同时要留意风格描述不要太杂不要同时写“赛博朋克、宫崎骏风、厚涂油画风”模型很难同时满足多个互相冲突的风格。一个穿红色斗篷的少女站在巨大的城市巨像脚下巨像是古铜色机械结构表面有发光纹理。 动作少女仰头望向巨像斗篷被风吹起她向前走几步镜头跟随她移动。 镜头从低角度仰拍开始缓慢上摇然后切到侧面跟拍镜头流畅连贯。 环境城市巨像覆盖整片天空脚下是布满青苔的石板路周围有细小飞行物散发微弱的蓝色光点。 光线黄昏暖光巨像发光纹理呈蓝紫色整体色彩对比强烈。 风格赛博朋克动漫风高细节画面干净。 负面不要出现真人脸、文字、水印、画面模糊、巨像结构扭曲。这类风格的提示词最容易失败的是“风格叠加过多”。我的经验是风格词控制在两个以内并且要兼容。赛博朋克和动漫可以兼容水彩和写实就冲突。遇到生成结果风格跑偏先检查风格词是不是太多。4.5 每个场景的验证标准跑完一次生成不要只看“像不像”要看四个标准主体一致人物身份、服装、发色是否从头到尾保持稳定。动作连贯动作之间是否自然过渡有没有跳变、瞬移、手部扭曲。镜头准确运镜方式是否符合提示词有没有莫名的镜头抖动。画面稳定背景有没有闪烁光线有没有跳变有没有文字或水印。只要某一个标准不达标就算单帧截图再漂亮也不能作为成片使用。这也是 Picsart 视频产品负责人那类分享里最常提到的判断维度视频生成不是看单帧而是看连续片段的稳定性。5. 提示词写完之后怎么判断效果对不对5.1 先跑单条不要直接批量很多人拿到一套模板马上把十个场景塞进去批量生成结果问题一大片还不知道哪条提示词出了问题。正确的顺序是先跑一条。单条测试时用中低分辨率、短时长把提示词里所有要素过一遍。生成后逐帧检查重点看第几秒开始出现崩坏。如果前两秒就崩问题大概率在动作链条或主体描述如果最后几秒才崩可能是长视频累积误差可以适当缩短生成时长。这条单条测试的提示词建议手动写不要直接用模板自动替换。手动写能让你意识到哪些信息没写清楚这一步的思考过程远比批量跑十条有价值。5.2 效果不符合预期时定位是哪一段的问题提示词生成失败时不要整条删掉重来。我一般用固定变量法一次只改一个模块其他模块不动对比两次生成的差异。比如主体描述没问题但镜头很乱那就只改镜头语言把“镜头缓慢推近”改成“镜头固定”其他词一个字都不动。如果画面稳定了说明问题出在镜头描述。如果还是乱那可能是环境描述太丰富导致模型注意力分散把环境简化保留光线即可。这个方法的本质是给模型的注意力做减法。每次改一个变量你能清楚知道哪个词真正生效。不要同时改三个模块否则出了问题你根本不知道是谁的锅。5.3 常见问题排查表下面是我自己常用的排查顺序从出现频率高到低排列现象优先排查项处理方式主体穿帮、换脸主体描述是否清晰、是否用了参考图加面部特征描述固定机位降低运动幅度手部变形动作是否写得太复杂简化动作负面词加“手指变形、多余手指”画面闪烁运动幅度过大、光线变化过强降低运动强度固定光源描述镜头乱晃运镜描述过于复杂改成单一运镜先固定镜头再缓慢推近背景乱入文字没有负面约束负面词加“任何文字、水印、字幕”风格跑偏风格词冲突减少风格词检查风格兼容性动作不连贯动作链条没按时间顺序写用“先……然后……”的句式重写动作画面太静态没有写环境动态加入雾、风、光、粒子等细微运动排查时记住一个原则先看输入再看参数最后才怀疑模型。大部分问题不是模型不行而是提示词里某个模块没有尽到职责。5.4 负面提示词的使用边界负面提示词是很多人容易走极端的地方。有人写二十个负面词结果画面被限制得毫无生气有人完全不写结果手指和文字乱飞。我的建议是负面词控制在五到八个只约束最影响使用的元素。常见的优先约束手指变形、多余肢体、面部扭曲、文字水印、画面闪烁、风格混杂。少写“不要模糊”这类抽象负面词因为“模糊”本身可能是某种风格的一部分。负面提示词应该写具体的、可识别的问题而不是你的审美偏好。6. 从单条到批量提示词模板库和版本管理6.1 为什么要建模板库当你跑通了五到十条满意的提示词一定要把它们存下来而不是放在生成记录里等它过期。视频生成提示词调优的成本不低每一条有效提示词都是积累。我一般用表格维护提示词库字段包括场景类型、提示词原文、负面词、生成长度、分辨率、运动强度、验证结果、适合用途。这样下次要做类似项目直接查库复用而不是从头开始写。模板库的核心价值是积累“已验证的稳定组合”。模型更新后旧模板可能失效但保留原始记录能帮你快速对比哪些部分发生了变化。6.2 变量化提示词模板库里的提示词最好做成变量式而不是一整段复制。比如主体描述做成{subject}环境做成{environment}光线做成{lighting}其他结构保持不变。一个{年龄性别描述}的人穿{服装}在{环境}中{动作}。 镜头{运镜方式}{景别}。 光线{光线描述}{色调}。 风格{风格描述}。 负面{负面词列表}这样做的好处是批量生成时只需要替换变量值。比如同一套产品展示模板把“玻璃瓶”换成“陶瓷杯”把“大理石台面”换成“木质桌面”一分钟能产出多条有差异但结构稳定的提示词。6.3 输出命名和日志批量生成时输出文件命名一定要带变量信息。我建议格式是“场景类型_主体_环境_日期_序号”。这样跑完几十条你扫一眼文件名就知道是哪组参数。不要用生成时间戳做文件名不然排查时根本不知道哪条对应哪个提示词。日志也很重要。每跑一组批量任务把提示词版本、参数设置、输出文件列表、成功失败状态记下来。这一步看起来很麻烦但等你要调整提示词时日志能帮你快速定位“之前那次好的版本用的是哪个模板”。6.4 批量任务的失败重试和一致性批量生成视频和批量生成图片不一样单条视频生成耗时明显更长失败成本更高。启动批量任务之前先确认三件事单条成功率是否够高、输出目录是否有足够空间、失败后会不会自动跳过并记录日志。如果批量任务里某条失败不要简单重试一次就完。先把失败那条的提示词单独跑一遍确认是提示词问题、参数问题还是临时资源问题。如果单条能跑通再回到批量队列里重试。批量任务里连续失败超过三条建议先停掉整个队列排查原因后再继续。盲目重试只会浪费时间和算力。最后说一点经验。Picsart 视频产品负责人那类分享真正有价值的不是某条具体的万能提示词而是一套稳定的工作方法把提示词当成拍摄指令、用结构化模块控制生成、单条验证后再批量生产。Wan3.0 的能力边界也在不断变化你手里的模板库和日志记录才是应对变化最可靠的东西。按照上面的框架跑三到五条你会明显感觉到提示词从“撞运气”变成了“可控制”的技术活。