
电商运营这行干久了大家应该都有过这种体验新品上架前手里捏着商品标题、卖点文案、详情页设计稿、价格库存表、SKU清单还有一堆主图细节图少说五六份文件多的时候十几份全靠人工逐条核对。眼睛看花了不说漏掉一两个错别字或者参数不一致轻则被平台下架重写重则直接被判违规扣分。我自己就吃过这个亏之前上架一批露营灯详情页参数写的是“续航12小时”标题里写的却是“超长续航20小时”结果被平台抽检抓到整条链接被降权损失不小。所以当 Qwen3.8-Max 出来之后我第一时间就想试试能不能靠大模型把这套“人肉体检”的流程自动化。折腾了几天搭出来一个电商商品资料包体检助手6 份资料加 1 张商品主图一跑下来直接查出 27 个问题包括文案参数冲突、图片和规格表的文字不一致、标题关键词堆砌、SKU 属性缺失、极限词命中等等。整个过程不需要训练模型不需要写复杂的规则引擎核心就是一套精心设计的提示词加上对输出格式的严格约束。这篇文章我就把自己踩过的坑、调通的流程、还有每一步的思考过程完整写出来给同样被商品上架资料折磨的运营和开发同行做个参考。1. 商品资料体检这个场景到底有多痛1.1 “资料包混乱”是电商运营的隐形杀手很多公司做商品上架资料是分散在不同人手里的。运营写标题和卖点美工做详情页和主图供应链给规格参数表财务或采购定价格库存这些信息最后汇总到一个人手里去发布。问题是每个人手里的数据版本可能不一样运营按老价格写的卖点供应链那边已经调过价了美工根据旧的规格表做的详情图参数改了但图没跟上。这些不一致平时根本看不出来一旦平台抽检或者顾客较真就是妥妥的违规或客诉。更麻烦的是人工核对这种工作特别消耗耐心越往后看越麻木错误就在眼皮底下溜过去。1.2 为什么这个“体检”不适合用传统规则脚本做一开始我想的是写个 Python 脚本把文本都读进来然后用正则去匹配敏感词、比对数字。搞了一半发现行不通。真正的困难在于商品资料里的错误很多不是“非黑即白”的而是“语义层面”的冲突。比如标题写“纯棉”详情页写“棉 95% 聚酯纤维 5%”这算不算虚假宣传极限词检测里“顶级”“极致”“第一”这些词在不同类目下的违规程度不一样一个静态词表根本覆盖不了语境。参数一致性比对也不只是简单的“数字相不相等”还要理解单位换算比如“2.4GHz”和“2400MHz”其实是同一个东西。这些活让大模型来干反而合适。Qwen3.8-Max 这种级别的模型对中文电商文案的理解力已经相当强了能读懂上下文能识别语义冲突还能把跨文件的矛盾信息关联起来。我的思路很明确不追求写一个完美的通用工具而是让它作为一个“体检助手”把人工检查中最耗时最容易出错的环节接过去。1.3 这个项目最终产出的是什么整套方案的输入是任意数量的文本类资料标题、卖点、详情文案、规格表、价格表、SKU 表加一张商品主图。输出是一份结构化的“体检报告”里面包含问题描述、所在文件/区域、严重程度、修改建议。我在实际测试中用了 6 份文本资料加 1 张主图一共查出 27 个问题。后面我会详细拆解这 27 个问题分别是什么类型、怎么查出来的方便你对照自己的场景去评估这套方案的适用性。2. 方案设计为什么用 Qwen3.8-Max 而不是微调模型2.1 大模型做“资料体检”的技术选型逻辑现阶段做这类任务有三个可选路线传统规则脚本、微调垂直模型、调用通用大模型。我直接说结论在“商品资料体检”这个场景下通用大模型 API 是目前性价比最高的方案。微调这条路我一开始也考虑过。但冷静算一笔账就明白了微调需要准备大量“输入资料→标注问题”的训练集这个标注成本非常高。你得找懂电商运营的人逐条标200 条样本打底算下来光人工成本就够买好几年 API 了。而且商品类目千变万化今天做灯具明天做户外用品每个类目的规则和常识都不同微调模型的泛化能力反而不如通用模型。Qwen3.8-Max 的优势在于它的中文理解能力和指令遵循能力。电商资料里大量内容是中文口语化表达、营销话术、碎片化描述模型不需要额外训练就能理解“防风打火机”和“明火”之间存在逻辑冲突。加上它对 JSON 结构化输出的支持比较好正好满足我后续做自动化解析和报告生成的需求。2.2 核心流程分四步走整套体检流程我拆成了四个环节每个环节都有明确的目标和边界。第一步是资料解析与标准化。把 Excel、Word、PDF、TXT、图片统统转成纯文本贴上“文件名”和“区块名”的标签方便后面提示词里引用。第二步是分维度检测。我设计了六个检测维度敏感词与极限词、标题与详情不一致、参数与规格表冲突、SKU字段完整性、图片与文本信息一致性、基础信息规范性。每个维度单独让模型跑一遍防止任务太杂导致遗漏。第三步是结果聚合与去重。六个维度的检测结果合并到一起按严重程度排序把重复问题合并生成最终问题清单。第四步是报告生成。让模型基于问题清单生成一份修改建议报告按“紧急程度”和“所属模块”重新整理直接给运营同事用。这个流程看着简单但里面有个关键设计理念宁可多跑几轮小任务也不要一次性把所有要求塞给模型。大模型在单一任务上的表现远比多任务混杂时要稳定。后面我会详细说这个坑。2.3 为什么主图也要放进体检范围我特意把一张商品主图也加入输入是因为图片和文本不一致这个问题在人工核对时是重灾区。主图上的角标写着“三年质保”详情页文案里写“一年质保”这种问题靠人眼反复对比才能发现而且极其消耗注意力。Qwen3.8-Max 目前具备图像理解能力可以直接把图片传进去在提示词里要求它“读取图中的文字信息与给定资料进行核对”。实际测试下来它对主图上清晰文字的识别准确率是可以接受的。不过这里有个重要限制图片上的文字必须相对清晰、对比度正常如果字太小或者背景复杂它照样会看错。这一点后面在常见问题里我详细说。3. 实操拆解六份资料和一张图查出 27 个问题的全过程3.1 测试素材的准备与编排为了把这次测试做得尽量接近真实场景我准备了一个露营折叠灯的虚拟商品资料包包含 6 份文本资料和 1 张主图商品标题文本一段直接复制下来的标题文案包含品牌词、产品词、场景词和一堆卖点修饰词。卖点文案用于详情页前几屏的短文案强调续航、亮度、防水等级、便携性。详情页长文案更详细的介绍包含产品参数、使用场景、对比表格的描述文字。规格参数表Excel 转文本列名包括产品型号、电池容量、充电时间、防水等级、材质、重量、尺寸、质保期。价格与库存表Excel 转文本列出了不同 SKU 的颜色、价格、库存数量、划线价。SKU 属性表Excel 转文本包括颜色、尺寸、包装清单、是否含电池等等级属性。一张商品主图白底图配有营销角标文字和三段式卖点标签。为什么选露营灯这个品类因为它的参数维度足够多电池容量、续航时间、流明值、防水等级、色温、充电方式、重量、质保期等等。这些参数之间天然存在逻辑关联比如“电池容量 3600mAh”与“续航 20 小时”是否匹配是可以靠常识推断的。如果商品是个普通的手机壳参数维度太少检测价值的展示效果要弱很多。3.2 资料解析这一步的几个关键细节我先把几个文件的内容提取出来统一格式。这里分享一下实操中最实用的工具组合Excel 文件用 pandas 读取后转成“表格型文本”。注意不要用to_csv()简单输出而是要把列名拼在每行前面比如“SKU编号: A01 | 颜色: 军绿色 | 价格: 129.00”。这样做是为了让模型知道每个字段的含义而不是面对一堆裸数据。Word 文档用python-docx提取段落文字按“段落序号”标记。有的详情页文案是图片这个要留意图片里的文字是提取不出来的只能用 OCR 工具我在后面也有处理方案。图片用 Qwen3.8-Max 的图像输入能力直接处理不用额外 OCR。把主图以 base64 编码传给模型让它直接看图。不过这里有个技巧如果单张图太大可以先压缩到 768x768 或 1024x1024 以下官方对图像输入的尺寸有限制超了会报错或直接截断。我自己封装了一个函数能把多份资料拼成一个完整的“检索文本”每段前面加上“【文件名xxx】”的标记这样模型就能清楚知道哪段文字来自哪个文件在输出问题时也能自动带上文件来源。3.3 提示词设计的核心套路分层检测这是整个项目中价值最高的部分我把自己调了十几轮的提示词结构分享出来。核心思路是不搞“一个大提示词查所有”而是按维度分成六个独立的检查任务跑。每个任务的提示词都遵循同一套结构角色设定、检查规则、输入资料、输出格式。以“参数一致性检测”为例提示词的核心部分长这样你是一名资深的电商商品合规审核专家。我会给你以下资料商品标题、卖点文案、详情页文案、规格参数表。 请逐条对比规格参数表中的参数包括但不限于型号、电池容量、续航时间、防水等级、材质、重量、尺寸、质保期 与标题、卖点、详情文案中出现的同类描述是否一致。 检查规则 1. 注意单位换算如 mAh 和 Ah、g 和 kg、mm 和 cm。 2. 注意逻辑自洽如电池容量与续航时间是否匹配可用常识判断。 3. 注意标题中的极端描述与参数表是否矛盾。 输出格式严格JSON数组 [ {问题类型:参数不一致, 所在位置:标题, 原文:超长续航20小时, 参数表信息:续航时间: 12小时, 严重程度:高危, 问题描述:标题宣称续航20小时参数表为12小时差异过大属于夸大宣传。, 修改建议:将标题改为长续航12小时或核实真实续航} ]这里有几个关键点第一输出格式必须是 JSON而且要在提示词里给出示例模板。如果你让模型“自由发挥”它返回的结果五花八门后面做解析会非常头疼。我在测试中甚至见过它用 Markdown 表格输出的解析代码得额外兼容好几种格式麻烦得要死。直接约束成 JSON 数组省了很多事。第二每个维度的检查规则要尽量具体。比如“注意单位换算”“注意逻辑自洽”这些看似是废话但实际上是在引导模型调用它的常识推理能力。加上这些句子检测出问题的数量和质量都比不加强约束时高不少。第三严重程度只给三档高危、中危、低危。高危指涉及虚假宣传、违规词、参数造假中危指信息不完整、前后不一致但不至于违规低危指优化建议类。三档分类避免了模型“什么都是高危”的倾向。我用同样的方法做了另外五个维度的检测敏感词与极限词维度、图片与文本一致性维度、SKU 完整性维度、基础信息规范性维度、标题关键词堆砌维度。每个维度独立跑一次模型调用互不干扰。3.4 完整跑批后处理的代码骨架六个维度跑完后返回的是六组 JSON 数组。我做了一个简单的合并和排序逻辑在本地把问题汇总成一张表。核心代码骨架如下import json import pandas as pd def merge_issues(results): all_issues [] for dim_name, res in results.items(): try: data json.loads(res) except json.JSONDecodeError: print(f维度 {dim_name} 返回格式异常跳过) continue for item in data: item[检测维度] dim_name all_issues.append(item) # 去重同文件同位置同问题的合并 seen set() unique_issues [] for item in all_issues: key (item.get(所在位置), item.get(原文), item.get(问题类型)) if key not in seen: seen.add(key) unique_issues.append(item) df pd.DataFrame(unique_issues) severity_order {高危: 0, 中危: 1, 低危: 2} df[优先级] df[严重程度].map(severity_order) df df.sort_values(优先级) return df这段代码很简单但有两个细节值得提一下一个是在解析失败的时候不要直接崩溃要打印日志并跳过因为模型偶尔会返回不合法 JSON程序要能容错另一个是去重逻辑要选好 key我选的是“位置原文问题类型”这样既不会误删不同位置的问题也能把同一问题的重复检测结果消掉。3.5 27 个问题到底都查出了什么这次测试最终查出的 27 个问题分布在六个检测维度里。我挑几个典型的拿出来说说敏感词与极限词维度查出了 5 个问题。最典型的是标题里用了“极致亮眼”这在广告法语境下属于极限词风险卖点文案里用了“全网销量第一”这类没有依据的排名描述也是常见的违规点。参数一致性维度查出了 6 个问题。最典型的就是我开头说的那个情况标题写“超长续航 20 小时”参数表里写的续航却是 12 小时。另外还有一个更隐蔽的详情页写“充电 2 小时”参数表写“充电时间 2.5 小时”这种细微的不一致靠人眼很难看出来模型能比对出来确实有点东西。图片与文本一致性维度查出了 4 个问题。主图上角标写的“质保三年”详情页文案里写的是“一年质保”这是典型的图文不符。主图上的“IPX5 防水”和规格表里的“IPX4”也冲突了美工大概率是照着旧版资料做的图。SKU 完整性维度查出了 4 个问题。最典型的是“军绿色”这个 SKU 在价格表里有在 SKU 属性表里却没有对应的属性组合导致上架后可能出现属性缺失报错。基础信息规范性维度查出了 4 个问题。比如详情页里有“联系电话123456”这种未按平台要求脱敏的信息价格表里有一个 SKU 的划线价低于现价这在电商平台上属于“价格倒挂”会被风控拦截。标题关键词堆砌维度查出了 4 个问题。标题里塞了 12 个关键词明显超过平台推荐的 60 字符限制而且“露营灯”“户外灯”“帐篷灯”三个词高度重复有堆砌嫌疑。这 27 个问题中高危 9 个中危 11 个低危 7 个。整体跑批耗时大概一分半钟左右其中主要是大模型 API 的调用耗时六个维度串行跑的。如果想提速可以做并行调用一次六个请求同时发出去时间能压到 15 秒以内。4. 六个检测维度的具体提示词与经验4.1 敏感词与极限词检测别只会用禁词表这个维度很多人以为是“查一下有没有违禁词”其实没那么简单。纯靠词表查只能撞出“最”“第一”这种显性词遇到变体就歇菜了比如“宇宙级好用”“瞬间爱上”这种擦边表达词表根本识别不了但人一眼就能看出有夸大宣传的倾向。我的做法是让模型结合语境判断。提示词里明确写“除了法规明确禁止的极限词还需要识别借助网络流行语、夸张比喻等方式实现的变相夸大宣传”。实测下来Qwen3.8-Max 对“谁用谁知道”这类带有绝对暗示性质的表达是有感知的会把它标为“低危建议优化”。另外这个维度要特别注意类目差异。食品类目和 3C 类目的违禁词标准不一样同一个词在 A 类目能用在 B 类目就是违规。所以我在提示词里要求模型“注意输出格式中的类目标注”这样后续人工复核时可以快速判断是否误报。4.2 图片与文本一致性检测图像理解的价值这个维度的提示词结构稍微复杂一些因为它需要同时用到图像输入和文本输入。我传给模型的内容是一张图片加一份纯文本。提示词要求它先“读取图片中的所有文字信息”然后“将文字信息与给定的文本资料进行一致性比对”。实操中有个细节要注意图片里的角标文字通常有背景色有时候还被裁切模型不一定能完整识别。我做了个兜底策略如果模型报告“无法读取图片文字”我会用 PaddleOCR 先单独把图片上的文字提出来再把文字结果拼进提示词里让模型基于 OCR 结果做比对。这样虽然多一步但稳定性高了很多。还有一点我是让模型先输出“从图片中识别到的文字”再输出“比对发现的问题”这样有两个好处一是能看出来模型是不是真的“看”了图二是如果后续发现比对结果有问题能定位是识别错误还是比对逻辑错误。4.3 SKU 完整性检测让模型“读表格”的注意事项SKU 完整性这个维度输入素材主要是价格表和 SKU 属性表都是 Excel 转出来的文本。这里有一个表格数据的格式坑转出来的文本如果是用to_csv生成的列之间只有逗号分隔没有列名提示模型很可能搞混“价格”和“库存”字段。所以我前面强调过转文本时要把列名拼进内容里这一步在这个维度上尤其重要。检测规则方面我发现模型对“某个 SKU 缺少某列属性值”这种判断比较擅长但对“哪些属性组合是必填的”这种需要类目知识的内容依赖预设提示。我会在提示词里把常见的必填属性列出来比如颜色、尺寸、版本、适用场景等让模型照着比对。另一个常见问题是价格表里有 5 个 SKUSKU 属性表里只有 4 个模型很多时候能发现“存在缺失”但说不清是谁缺了。我的改进办法是在提示词里要求它“对比SKU编号集合输出具体缺失的SKU编号”实测准确率有明显提升。4.4 大模型“幻觉”问题如何抑制用大模型做检测最怕的就是它“编出不存在的问题”。我在调参过程中发现Qwen3.8-Max 在温度设为 0 时幻觉情况已经有明显缓解但在面对模糊表述时它仍有可能“脑补”出一个它在原文里见过的错误。我的做法是从两个维度去压制第一是在提示词里明确加一句“如果某个信息只在单一资料中出现且无冲突不要报告该问题”这条规则能拦住一大批“听起来不对但原文没写”的幻觉问题第二是在后处理阶段加一个“原文核对”逻辑用正则或者简单的字符串查找确认模型输出的“原文”确实存在于输入资料中。如果找不到直接丢弃这条路。这两个策略叠加之后误报率下降了不少。当然最稳妥的办法还是加一个“人工复核”环节。体检助手不是替代人工审核而是把 27 个问题从十几份资料里捞出来人工只需要花几分钟扫一遍而不是花一两个小时逐行找。这是我做这个方案的核心定位。5. 常见问题与排查技巧实录5.1 模型输出不合法 JSON解析直接崩了这是我调试前期最崩溃的问题。提示词里明明写了“严格输出 JSON 数组”模型偶尔还是会在前头加一句“好的以下是检查结果”或者在数组外面包一层 Markdown 代码块标记。我的解决办法是多管齐下先做字符串清洗把json 标记和末尾的去掉。再用正则把第一个[到最后一个]之间的内容截出来。如果这一步还是解析失败就做一次“修复调用”把模型输出单独丢回去让它“将以下内容修正为合法 JSON 输出”只修格式不改内容。这招在多数时候能救回来。最坏的情况下解析失败的直接丢掉因为单个维度检测失败不至于影响全局重新跑一次就行。5.2 图片中的文字识别不准怎么办主图上的文字通常都比较清晰但遇到角标被半透明底色干扰、标签文字被商品轮廓遮挡的情况模型偶尔会漏读。我的处理策略是把图片预先处理一下适度提高对比度或者裁切出顶部角标区域单独传一遍。实测下来把图片裁切成“左上角标”“右上角标”“底部卖点区”三个区域分别识别比整图一次识别的准确率高不少。另外要注意的是图片输入会占用相当大的 Token 空间。我有一张 2MB 的主图压缩到 1024x1024 后体积降到 300KB 左右Token 消耗减少了约七成文本检测的上下文空间也就更充裕了。5.3 模型把“建议优化”当成了“错误”误报率偏高前期测试的时候模型报了一堆“标题关键词堆砌”的中危问题我翻开原文一看有的只是正常的长尾描述谈不上堆砌。问题在于提示词里“标题关键词堆砌”的定义太含糊了模型默认把它理解成“标题里有多个关键词”。后来我把检测规则改成“标题中相同或近义的关键词出现 3 次及以上或核心词与长尾词数量超过平台建议上限或存在明显的无用填充词”并且加了一个要求“如果不是明确问题不要报告”。加上这句之后误报数量明显降了下来。所以大家在写检测类提示词的时候规则一定要写得足够具体最好带上数字阈值和反例说明。宁可规则多一些也不要让模型靠“感觉”去判断。5.4 多文件资料文本过长超出上下文窗口电商详情页文案有时候特别长加上多个文件拼在一起很容易把上下文撑爆。我的处理思路是不把所有资料一次性塞进同一个检测调用里而是按维度裁剪输入。比如“标题与详情一致性检测”只需要标题、卖点、详情文案不需要价格表和 SKU 表“SKU 完整性检测”只需要价格表和 SKU 属性表。如果单一维度内的文本还是太长就做分段处理按“亮点一、亮点二”之类的自然段落切分让模型分别检测最后合并结果。这个分段逻辑要结合具体文案的结构不要按固定字符数硬切否则容易切碎语义。6. 这套方案的边界与扩展方向6.1 它适合什么场景不适合什么场景这套体检助手最擅长的是“多文件间信息不一致”的发现以及“文案合规性”的初步筛查。它适合在商品上架前的质检环节作为辅助工具也适合在大促前批量检查已有链接的描述合规性。对于 SKU 数量上千的大店铺只要把数据转成标准表格文本跑批效率比人工高得多。它不适合的场景也很明确一是涉及法律责任的最终判定大模型输出的结论只能作为参考不能直接作为违规申诉依据二是需要行业专业知识的深度审核比如医疗器械的功能合规表述这种必须由专业人员复核三是图片中的复杂视觉问题比如主图中是否存在侵权的 Logo模型无法可靠判断。6.2 后续可以怎么扩展这个方案后续可以扩展的方向不少。比如接入定时任务每天定时跑一遍全店商品资料自动生成体检报告并推送到钉钉或企微也可以通过引入向量数据库让模型比对时参考历史商品数据沉淀上架经验和历史违规记录还可以把 27 个问题分类后接入工单系统自动分配给对应的运营或美工处理。我个人最看好的方向是“审核规则可配置化”。现在检测维度是写死在提示词里的改一条规则就要改代码。如果能把规则转成配置文件运营同学在后台自己增删规则选项这套工具的适用范围会大很多。不过要实现这个需要对提示词做动态组装复杂度会再上一个台阶这个以后有空我再单独写。6.3 成本与收益的粗略估算最后聊聊钱的问题。一次体检涉及六次模型调用文本量大概在 8000 字左右加一张图单次成本在几毛钱到一块钱之间取决于模型定价和上下文长度。如果是每天检查 50 个商品一天成本几十块钱一个月控制在千元以内。相比一个审核专员每天花两三个小时去核对资料的人力成本这个投入很划算。时间收益也很明显。人工核对 6 份资料加 1 张图熟练的运营大概需要 20 到 30 分钟而且视线离开很容易漏。体检助手跑一次一分半钟哪怕加上人工复核的 5 分钟整体效率也提升了少说有四五倍关键是它不会累每次检查都能保持同样的注意力水平。在我连续跑了接近一个月之后我自己的体会是这套方案的真正价值不在于“替代人工”而是把人的精力从“逐行逐字找不一致”这种低价值劳动里解放出来让审核人员只做最终判断和决策。你不需要懂多少大模型算法会写 Python 脚本、能把提示词写得清楚一点就能在三天内搭一套能用的版本出来。希望这篇拆解能给你一些思路少走几步我走过的弯路。