电商出图自动化:12个Agent Skills从一句话到一套图

发布时间:2026/10/10 8:17:50
电商出图自动化:12个Agent Skills从一句话到一套图 1. 电商出图这件事为什么值得单独做一套Agent Skills做电商视觉的人都有一个共同感受出图这件事单张不难难的是批量、稳定、风格统一。一个店铺动辄几百个SKU每个SKU要主图、场景图、细节图、卖点图如果全靠人工一张张调设计师的精力会被彻底榨干。过去两年我一直在折腾自动化出图链路从最早的模板套图到后来的脚本批处理再到现在的Agent化调度踩过的坑能写一本书。这次想聊的是我把电商出图拆成12个可复用的Agent Skills的完整思路——核心目标只有一个让一句话描述商品到一套能上架的图之间的路径尽可能短短到运营自己就能操作。先解释一下这里说的Agent Skills到底是什么。你可以把它理解成一组被封装好的、有明确输入输出边界的技能单元。每个Skill只干一件事比如生成白底主图生成场景合成图生成卖点标注图批量裁剪成平台规格。它们不依赖某个具体的对话界面而是可以被任意调度器调用——你写个脚本能调搭个工作流能调接进客服系统也能调。这种设计的好处是解耦出图逻辑和调度逻辑分开换模型、换平台、换业务线只需要替换对应Skill不用推倒重来。为什么强调开源和12个这两个数字因为电商出图的真实需求远比想象中碎。我统计过自己经手的项目光图这个字下面就能分出主图、副图、详情页长图、A模块图、短视频封面、直播间贴片、社媒种草图等七八个品类每个品类对构图、比例、文字密度、背景复杂度的要求都不一样。如果只做一个万能出图的大Skill参数会爆炸维护会失控。拆成12个各司其职的小Skill之后每个的提示词模板、参数默认值、后处理逻辑都能独立迭代出问题也好定位。这套东西适合谁三类人最受益。第一类是中小电商团队的运营没有专职设计师需要自己快速产出合规的商品图第二类是独立开发者想做一个垂直的出图工具但不想从零研究提示词工程第三类是设计师想把重复劳动交给自动化自己专注在创意和精修上。哪怕你完全不懂代码只要理解每个Skill的输入输出也能用现成的调度界面把它们串起来用。提示Agent Skills的价值不在于用了多新的模型而在于把不稳定的生成过程拆成了稳定的工程流程。模型会换代流程思维不会。2. 12个Skill的分工逻辑不是越多越好而是边界越清越好很多人一上来就想做一个全能出图Agent结果提示词写到三千字还是顾此失彼。我的经验是Skill的划分要遵循一个原则一个Skill的失败不应该影响另一个Skill的可用性。下面这张表是我最终定下的12个Skill的分工以及每个Skill最核心的输入输出定义。编号Skill名称核心职责关键输入输出规格S01商品主体提取从原始拍摄图中抠出干净主体原图、主体类型透明底PNGS02白底主图生成生成符合平台规范的白底图透明底主体、平台800x800或1000x1000S03场景合成把主体放进真实感场景主体、场景描述带环境光影的合成图S04卖点标注在图上叠加卖点文字图、卖点列表带排版文字的图S05多角度生成基于单图生成侧面/背面视角主图、角度要求多视角图组S06细节特写放大材质、工艺、接口等局部原图、关注区域特写图S07尺寸对比生成带参照物的比例图商品尺寸、参照物对比示意图S08使用场景演示生成人正在使用的画面商品、使用动作演示图S09包装展示生成带包装盒/袋的效果图商品、包装样式包装图S10批量规格裁剪按平台要求裁切和压缩图组、目标规格多尺寸成品S11风格统一化统一一组图的色调和光影图组、风格参考风格一致的图组S12合规检查检查文字、logo、敏感元素成品图检查报告这张表看起来简单但每一条背后都有取舍。比如为什么把主体提取单独做成S01而不是让S02白底图生成时顺便抠图因为抠图的质量直接决定后面所有图的上限如果抠图边缘有毛刺白底图、场景图、特写图全都会带着这个瑕疵。把抠图独立出来我可以用专门的算法反复打磨边缘确认干净了再往下走。这就是边界清晰带来的好处——每一步都可验证。再比如S05多角度生成很多人觉得没必要直接多拍几张不就行了。但现实是很多供应商只给一张正面图或者商品已经下架没法补拍。这时候基于单图生成侧面视角就成了刚需。当然这种生成的角度不能用于需要绝对真实的场景比如珠宝鉴定但用于电商展示、氛围营造是足够的。我在实际使用中会把生成的多角度图标注为示意图避免消费者误解。S12合规检查这个Skill经常被忽略但它可能是最省钱的一个。电商平台对主图的文字占比、logo位置、敏感词都有明确规定一旦违规轻则下架重则扣分。人工检查几百张图几乎不可能不出错用一个Skill自动扫描文字区域占比、识别敏感词、检查logo是否遮挡主体能省下大量返工时间。这个Skill的输出不是图而是一份哪张图哪一项不合格的报告运营拿着报告去改效率比盲改高得多。注意Skill的数量不是固定的。12个是我基于自己业务场景的划分你做母婴类目可能不需要尺寸对比但需要安全认证标识展示。关键是理解划分逻辑然后按自己的品类增删。3. 从一句话到一套图调度层怎么把Skill串起来有了12个Skill接下来的问题是谁来决定先调哪个、后调哪个这就是调度层的活。我见过两种极端做法一种是全手动运营在界面上一个个点Skill按钮另一种是全自动输入商品名就等结果。两种都不好用——全手动太累全自动太黑盒出了问题不知道哪一步错了。我采用的是半自动流水线预设几条常用链路运营选链路、填参数、点运行中间可以暂停检查。最常用的一条链路叫标准主图链路顺序是S01→S02→S10→S12。翻译成人话就是先抠图再做白底图然后按平台规格裁剪最后合规检查。这条链路跑完一个SKU的主图就齐了。整个过程如果全自动大概几十秒如果中间暂停人工确认抠图边缘也就多花一两分钟。对比设计师手动做效率提升是数量级的。第二条链路叫场景图链路顺序是S01→S03→S11→S10→S12。多了场景合成和风格统一两步。这里有个关键细节S03场景合成时我会把S01输出的透明底主体和场景描述一起传给模型而不是把原图直接丢进去。为什么因为原图自带背景模型容易被原背景干扰合成出来的场景会串味。用透明底主体模型只需要考虑把这个东西放进新场景光影和透视反而更自然。这是踩了很多次坑才总结出来的。第三条链路是详情页链路最复杂顺序是S01→S06→S07→S08→S04→S11→S10→S12。这条链路会产出细节图、尺寸对比图、使用演示图、卖点标注图基本覆盖详情页的主要模块。跑这条链路时我强烈建议开启中间暂停因为S08使用场景演示的生成结果变数最大有时候人物手势会很奇怪需要人工筛掉重跑。全自动跑完再发现一堆废图反而更浪费时间。调度层还有一个容易被忽视的功能参数继承。比如我在S02里设定了输出尺寸是1000x1000那么S10批量裁剪时应该默认继承这个尺寸作为基准而不是重新问一遍。同理S11风格统一化时用的风格参考图应该能自动应用到同批次的所有图上。这些继承逻辑看起来是小事但能极大减少运营的重复输入。我在实现时用一个简单的JSON配置对象在Skill之间传递上下文每个Skill读取自己需要的字段写入自己产出的字段调度器只负责按顺序调用和传递这个对象。{ batch_id: 20250101_sku001, platform: 通用电商, base_size: 1000x1000, style_ref: clean_studio, skills: [S01, S02, S10, S12], context: { subject_png: /output/s01/subject.png, main_image: /output/s02/main.png, final_images: [/output/s10/main_800.jpg, /output/s10/main_1000.jpg] } }这个配置对象就是整条链路的记忆。任何一个Skill出问题我都能通过检查这个对象定位到是哪一步的哪个字段不对。相比那种黑盒一键出图这种透明调度在排查问题时优势巨大。4. 提示词模板的工程化别让模型自由发挥Agent Skills能不能稳定出图七成看提示词模板的设计。我早期犯的最大错误就是给模型太自由的空间。比如写生成一张好看的商品场景图模型确实会生成好看的图但每次好看的方向都不一样——这次是暖色调客厅下次是冷色调工作室一组图放在一起像拼凑的。后来我把提示词模板拆成固定结构和可变槽位稳定性立刻上来了。固定结构一般包含五个部分主体描述、场景设定、光影要求、构图约束、负面清单。主体描述来自S01的输出和商品类目场景设定是运营选的预设比如简约白墙木质桌面户外草地光影要求统一写成柔和顶光轻微阴影无强烈反光这类确定性描述构图约束规定主体占画面比例、留白位置负面清单则明确排除文字、水印、多余物体、变形等。这五段拼起来每次生成的差异就被压缩在一个可控范围内。可变槽位是留给运营发挥的地方但也不是随便填。我做了几组预设下拉框比如场景有8种、光影有4种、构图有3种运营只能在这些预设里选不能自由输入。为什么限制因为自由输入意味着不可预测而电商出图最怕的就是不可预测。一个运营如果输入温馨的家模型可能生成卧室、客厅、厨房甚至生成一家人吃饭——这跟商品有什么关系预设下拉框虽然牺牲了一点灵活性但换来了批量出图的一致性这笔账很划算。负面清单的写法也有讲究。很多人写负面提示词就是堆一堆不要这个不要那个但模型对负面词的理解并不精确。我的经验是负面清单要具体到物体级别和属性级别。比如不要写不要难看要写不要出现文字、不要出现人脸、不要出现其他品牌logo、不要出现商品变形、不要出现多余的手指。越具体模型越容易执行。另外负面清单里不要放太多项超过15项之后模型会开始顾此失彼反而增加出错概率。我一般控制在10项以内按优先级排序。还有一个实战技巧把平台规范写进提示词。比如某平台要求主图背景必须是纯白RGB 255,255,255我就在S02的提示词里直接写背景为纯白色色值接近255,255,255无渐变无阴影。这样生成出来的图基本不需要再调色直接过合规检查。如果不写模型可能生成米白灰白虽然肉眼看着差不多但机器检测就是不过。这种细节只有真正被平台打回过的人才会懂。提示提示词模板要版本化管理。每次调整都记录改了什么、为什么改、效果如何。我见过太多人改着改着把好用的版本覆盖了想回退都回不去。5. 批量出图的性能与成本控制别让账单吓到自己电商出图是典型的量大管饱场景一个中型店铺一次上新可能就是几百张图。如果不做性能优化生成成本会高得离谱。我在这个环节踩过的坑主要是两个一是重复生成二是分辨率浪费。重复生成的问题很隐蔽。比如S03场景合成如果同一张主体图要合成到5个不同场景很多人会跑5次完整的抠图合成流程。但实际上抠图只需要做一次把S01的结果缓存下来S03直接读缓存就行。我统计过加上缓存之后整条链路的生成调用次数能减少30%到40%。缓存策略也很简单以原图的哈希值加Skill编号作为key结果存本地或对象存储下次遇到同样的输入直接读缓存。对于同一批商品图主体提取的结果几乎不会变缓存命中率很高。分辨率浪费是另一个大头。很多模型按像素计费生成4000x4000和生成1000x1000的成本差好几倍。但电商主图最终展示尺寸往往只有800x800或1000x1000生成4000再缩小纯属浪费。我的做法是按最终用途决定生成分辨率。主图直接生成1000x1000详情页长图分段生成再拼接特写图生成1500x1500留一点裁剪余量。只有需要印刷或大幅面展示的场景才生成高分辨率。这一条调整下来成本能降一半以上。还有一个省钱技巧是批量合并请求。有些模型接口支持一次传多张图或一次生成多张比单张调用便宜。比如S05多角度生成如果接口支持一次生成4个角度就比调4次单角度便宜。但要注意批量生成时如果其中一张失败可能整批都要重跑所以适合用在成功率高的Skill上。成功率不稳定的Skill比如S08使用场景演示还是单张跑失败了只重跑那一张。成本控制之外还要考虑并发和限流。批量出图时如果无脑并发很容易触发接口限流导致大量请求失败重试反而更慢。我的经验是设置一个合理的并发数比如5到10配合指数退避重试。同时把任务队列化先入先出避免一次性提交几千个任务把系统压垮。对于特别大的批次我会拆成多个小批次跑完一批检查一批确认没问题再跑下一批。这样即使中间出问题损失也可控。优化手段适用场景预期收益注意事项结果缓存同主体多场景减少30%-40%调用注意缓存失效策略按需分辨率所有场景成本降50%以上预留裁剪余量批量合并请求成功率高的Skill单价更低失败重跑成本高并发限流大批量任务避免限流失败配合退避重试分批执行超大批次风险可控增加人工检查点6. 出图质量的人工检查点哪些环节必须停下来看全自动出图听起来很美但实际用下来我坚持在三个环节设置人工检查点。不是不信任自动化而是这三个环节的错误代价太高一旦漏过去后面全白做。第一个检查点是S01主体提取之后。抠图边缘有没有毛刺、有没有把商品的一部分抠掉、透明区域有没有残留原背景色这些必须人眼看。我试过用算法自动检测边缘质量但算法很难判断这个毛刺是商品本身的纹理还是抠图错误。人工看一眼几秒钟的事但能避免后面几十张图全废。检查的时候重点看三个地方商品与背景交界处、细小部件比如线材、挂绳、半透明区域比如玻璃、薄纱。第二个检查点是S03场景合成之后。场景合成是最容易出恐怖谷效果的环节——光影方向不对、透视关系错乱、主体像贴上去的。我一般会快速过一遍把明显不自然的挑出来重跑。判断标准很简单如果一张图让你觉得这个东西好像飘在场景里那就是光影没对上如果主体和场景的清晰度差异太大那就是景深没处理好。这些图如果流到消费者面前对品牌形象的伤害比没有图还大。第三个检查点是S12合规检查之后。虽然S12本身是自动检查但它的报告需要人来看。报告里会列出文字占比超标疑似敏感词logo遮挡主体等问题运营需要判断哪些是真问题、哪些是误报。比如文字占比超标有时候是因为商品本身包装上就有文字这种不算违规但如果是后期叠加的卖点文字超标就必须改。这个判断目前还得靠人因为规则是死的商品是活的。除了这三个固定检查点我还会在新品类第一次出图时增加一个全面检查。比如第一次做某类商品我会把整条链路的所有输出都看一遍确认提示词模板、参数默认值、后处理逻辑都适配这个品类。确认没问题之后后续同品类就可以走快速通道只检查那三个固定点。这种新品类严查、老品类快跑的策略兼顾了质量和效率。注意人工检查点不是越多越好。检查点太多自动化就失去了意义检查点太少废图率会飙升。三个固定点加一个新品类全面检查是我试过比较平衡的方案。7. 风格统一化一组图看起来像一家人的秘诀电商出图最容易被忽视、但最影响转化率的是一组图之间的风格一致性。你肯定见过那种详情页主图是冷色调、场景图是暖色调、细节图又是另一种打光整页翻下来像逛了三个不同的店。这种不一致会让消费者潜意识里觉得不专业进而怀疑商品质量。S11风格统一化这个Skill就是专门解决这个问题的。风格统一化的核心思路是提取风格特征然后应用到全组图。具体怎么做我会先选一张风格基准图可以是设计师精修过的图也可以是S03生成的效果最好的一张。然后从这个基准图里提取几个关键特征色温偏冷还是偏暖、对比度高还是低、饱和度鲜艳还是素雅、光影方向光从哪来、背景复杂度简洁还是丰富。这些特征不需要精确到数值用自然语言描述就行比如柔和暖光低对比中等饱和度光从左上角来背景简洁。提取出风格描述之后S11会把这个描述作为提示词的一部分对组内其他图进行风格迁移。注意这里不是简单地套滤镜而是重新生成或重绘让光影和色调真正融合进去。套滤镜的问题是会损失细节而且不同图套同一个滤镜效果差异很大。重新生成虽然慢一点但效果自然得多。我在实际使用中发现风格统一化之后详情页的整体感提升非常明显消费者停留时间也有可感知的增长。风格统一化还有一个进阶用法跨批次统一。比如一个店铺有多个系列的商品每个系列有自己的风格但整个店铺又要有统一的品牌调性。这时候可以定义两层风格店铺层风格比如简约、明亮、现代和系列层风格比如户外系列偏自然光家居系列偏室内暖光。S11在应用时先满足系列层再向店铺层靠拢。这样既保证了系列内的统一又保证了店铺整体的协调。实现上就是把两层风格描述拼接起来传给模型权重上系列层更高一些。不过风格统一化也有边界。有些图不适合强行统一比如尺寸对比图需要清晰的线条和标注合规检查报告图需要高对比度方便阅读。这些功能性图片如果强行套风格反而会影响信息传达。我的做法是在调度层给每个Skill打一个是否参与风格统一的标签功能性图片默认不参与展示性图片默认参与。这个标签可以在链路配置里覆盖灵活调整。8. 常见翻车场景与排查思路做自动化出图翻车是常态。我把这些年遇到的典型翻车场景整理成一张排查表遇到问题按表索骥能省不少时间。现象可能原因排查方向解决思路主体边缘有白边抠图算法对浅色背景处理差检查S01输入原图背景换抠图算法或先做背景增强场景图主体像贴上去的光影方向不匹配对比主体光影和场景光影在提示词中明确光影方向多角度图比例失调模型对透视理解偏差检查生成角度是否过大限制角度范围分步微调卖点文字被裁切构图约束没留够文字区检查S04的留白参数增大留白或缩小主体批量图色调不一致风格统一化未生效检查S11是否在链路中补跑S11或调整风格描述合规检查误报多负面清单太宽泛检查S12规则配置细化规则增加白名单生成速度突然变慢接口限流或队列积压检查并发数和队列长度降低并发增加重试间隔缓存命中率低输入哈希不稳定检查原图是否被压缩过统一输入格式后再哈希这张表里我想特别说说主体边缘有白边这个坑。它太常见了尤其是商品本身是浅色白色、米色、浅灰的时候抠图算法很容易把背景的一部分当成主体保留下来形成一圈白边。白底主图上不明显但放到深色场景里就特别扎眼。我的解决办法是在S01之后加一个边缘净化步骤用算法检测主体边缘的颜色如果边缘颜色和背景色接近就向内收缩一两个像素。这个步骤很轻量但效果立竿见影。如果收缩之后主体缺了一点再用S06细节特写补一张局部图消费者其实看不出来。另一个高频坑是多角度图比例失调。比如一张正面图生成侧面图模型有时候会把商品拉长或压扁看起来像哈哈镜。这是因为模型对透视的理解不稳定角度越大越容易出错。我的经验是把生成角度限制在正负30度以内超过这个范围就分两步走先生成15度再基于15度生成30度。虽然多了一步但比例稳定性好很多。另外生成多角度图时最好给模型一个参照物提示比如保持与正面图相同的宽高比能进一步减少变形。还有一个坑是批量图色调不一致这个前面提过但值得再强调。有时候S11明明在链路里出来的图还是不一致原因往往是风格描述太模糊。比如写暖色调模型可能理解成偏黄也可能理解成偏红。我的做法是把风格描述量化到可执行的级别比如色温约4500K饱和度中等对比度偏低主光源从左上45度来。这种描述模型执行起来准确得多。如果还是不一致就检查是不是有图在S11之前已经被其他Skill改过色调导致输入基准不统一。9. 把Skill接进现有工作流几种落地方式Skill做出来只是第一步怎么让它融入团队现有的工作流才是关键。我试过三种落地方式各有适用场景。第一种是命令行工具。把每个Skill封装成一个命令运营在终端里敲命令出图。这种方式适合技术背景强的团队灵活度最高可以随意组合Skill和参数。缺点是学习成本高运营得记住命令格式和参数名。我一般会给常用链路写几个封装脚本比如gen_main.sh 商品图路径 平台运营只需要填两个参数就能跑标准主图链路。这种方式在我自己的项目里用得最多因为调试方便出问题能直接看到每一步的输出。第二种是表格驱动。运营在一个表格里填商品信息、选链路、选参数然后一键提交系统读取表格批量执行。这种方式适合运营团队不需要懂技术填表就会用。实现上就是把表格的每一行转换成一个调度配置对象然后批量跑。表格驱动的好处是天然支持批量几百个SKU填在一个表里提交后自动排队执行。缺点是灵活性差一些表格里能选的参数是预设好的运营不能临时改提示词。但对于标准化程度高的店铺这已经足够了。第三种是接口集成。把Skill封装成HTTP接口接入现有的商品管理系统或设计协作平台。比如商品上架时自动触发主图生成生成完自动回传到商品库。这种方式最无感运营甚至不需要知道背后有Agent在跑。但实现成本也最高需要和现有系统做对接还要处理权限、回调、错误重试等问题。适合有一定研发资源的团队。我参与过的一个项目就是把S01到S12全部封装成接口接入了一个内部的设计协作平台设计师在平台上点生成主图几秒钟后图就出现在素材库里体验非常顺滑。三种方式不是互斥的可以组合使用。比如底层用命令行工具做调试和运维中层用表格驱动给运营日常使用上层用接口集成对接业务系统。关键是保持Skill本身的独立性——不管从哪个入口调用Skill的输入输出和行为都是一致的。这样换入口不影响底层逻辑维护成本最低。提示不管用哪种落地方式都要保留手动重跑单个Skill的能力。批量跑的时候总有几张图不理想能单独重跑那几张比整批重跑高效得多。10. 关于模型选型和后续迭代的一些个人体会最后聊聊模型选型。标题里提到的是某个图像生成模型但我想说的是不要把Skill和某个具体模型绑死。我设计这12个Skill时每个Skill的提示词模板和参数都是模型无关的换模型只需要调整模板里的少量措辞核心逻辑不变。这样做的好处是当有新模型出来时我可以快速对比测试哪个Skill用哪个模型效果好用哪个而不是被一个模型锁死。实际使用中不同Skill对模型的要求确实不一样。主体提取S01更依赖分割算法的精度对生成模型的要求反而不高场景合成S03对光影和透视的理解要求高需要生成能力强的模型卖点标注S04其实用传统的图像处理加文字排版就能做不一定非要生成模型。所以我的策略是混合使用能用传统算法稳定解决的就不上生成模型生成模型只在真正需要创造的环节用。这样既控制了成本又提高了稳定性。后续迭代的方向我目前关注三个。一是反馈闭环把运营在检查点标记的废图收集起来分析失败模式自动优化提示词模板。比如发现某个品类的场景图总是光影不对就自动在该品类的提示词里加强光影描述。二是跨Skill的一致性校验比如检查主图和场景图的商品颜色是否一致不一致就报警。三是更细粒度的风格控制让运营能像调音台一样调整色温、对比度、饱和度的具体数值而不是只能选预设。这套东西我陆陆续续打磨了挺久最大的体会是自动化出图的核心不是模型多强而是流程多稳。模型再强如果流程不稳定批量出图时废图率一样高流程稳了哪怕用中等模型也能产出可用的图。12个Skill的划分、调度层的设计、检查点的设置、缓存和成本控制这些工程活才是真正决定成败的地方。如果你也在折腾电商出图自动化希望这些经验能帮你少走点弯路。

关于本文作者

来自尧图内容编辑团队

尧图内容编辑团队 内容团队

尧图内容编辑团队

本文由尧图网络内容编辑团队执笔。团队由资深项目经理、前端工程师与设计师组成,所有内容均来自亲手交付的真实项目,先讲清问题、再给出可落地的解法。尧图深耕北京网站建设十年,服务过京华建材集团、智造科技等各行业客户,把一线经验沉淀为可复用的行业观察。

  • 十年建站经验,覆盖建材、制造、服务、文创等
  • 项目经理把关选题与事实准确性
  • 工程师与设计师联合撰写专业细节
  • 统一编辑规范,保证文风与排版一致
  • 每月复盘转化数据,迭代选题方向

延伸阅读

相关资讯与近期热门内容

深度阅读推荐

建站决策前值得细读的三篇

网站改版的5个关键决策
2024-08-12

网站改版的5个关键决策

什么时候该改版、改到什么程度、如何避免流量掉光,京华建材集团改版复盘给出答案。

获取专属建站方案

看完文章,把您的行业与预算告诉我们,免费获取一份量身定制的官网建设方案与报价。

立即免费咨询