SPSS两步聚类结果怎么看?从自动聚类表到质心表全解读

发布时间:2026/10/5 3:51:33
SPSS两步聚类结果怎么看?从自动聚类表到质心表全解读 1. 打开结果之前先想清楚两步聚类到底在干嘛不少人第一次用SPSS跑两步聚类点完菜单之后盯着输出窗口里那一堆表格发懵自动聚类表是什么质心表是啥聚类质量那个“差/良好”到底听谁的别急我先说个定心丸——两步聚类在SPSS里的结果已经算是所有聚类方法里最容易解读的了因为它把“选几类”这个最头疼的问题替你做了大半。我在实际工作中用两步聚类处理过用户分群、问卷样本细分、还有一堆乱七八糟的混合类型数据。先说结论这个算法的最大优势是它能同时处理连续变量和分类变量而且会自动给出推荐聚类数。这意味着你在跑聚类之前不用像K-means那样必须先指定类别个数也不用像系统聚类那样对着谱系图瞪半天。它适合刚接触聚类的新手也适合变量类型比较杂、量纲差异大的场景。但正因为结果输出太多了新手反而容易迷失在表格里。这篇文章不打算重复说明书内容而是带着你从头到尾把结果文件里的每一张表、每一幅图过一遍告诉你怎么看、怎么看懂、看完了下一步能做什么。1.1 两步聚类和K-means、系统聚类有啥不一样先花一分钟理清楚两步聚类在SPSS家族里的位置不然你连“为什么要看这些表”都搞不明白。K-means要求你预先告诉它“我要分成几类”然后它按照距离不断迭代最后给你K类。系统聚类不需要提前定K但它会把所有个案一步步合并成树状图样本量大一点就画成一团黑可读性很差。两步聚类则夹在两者之间它也先通过一个预聚类过程把个案粗分成很多小“子类”然后在这个基础上用分层聚类的方法把子类逐级合并最后通过BIC或AIC指标自动选出最优类数。所以两步聚类的“两步”是这么来的第一步逐个扫描数据生成一个聚类特征树CF树的汇总结构第二步对刚才生成的各个子节点再进行层次聚类并利用BIC等准则决定最终合并成几类。SPSS把这两步封装成菜单所以你看到的结果里会有“自动聚类表”这种带着BIC信息的表格。理解了这个机制你就知道为什么第二步聚类的输出里自动聚类表是排在所有结果最前面的——它是整个算法的决策依据也是你判断“这个分几类是统计学上比较合理的”的核心依据。1.2 拿到输出前必须确认的几个前提别急着读表先检查三件事。第一你的数据里有没有缺失值。SPSS两步聚类在菜单里有“缺失值处理”选项默认是排除缺失值。如果缺失率太高最后参与聚类的样本量会缩水结果表里的“N”就不是你的总样本量。我自己就遇到过这种情况一万条记录最后只聚了三千条白跑一次。所以先到描述统计里扫一眼每个变量的缺失情况。第二你的变量类型有没有设置对。两步聚类的菜单里左侧变量列表框下方有“测量级别”的提示连续变量得是“标度”分类变量得是“名义”或“有序”。如果连续变量被当成分类变量处理结果会差得离谱。检查方法很简单把变量选进“分析变量”框然后看每个变量前面的图标标尺形状代表连续条形块代表分类。第三数据量也别太小。两步聚类虽然对大样本做了优化但样本量低于几十条时那些统计指标基本没有参考价值。如果你只有三十条记录我劝你直接换成系统聚类或者人工分群别跟算法较劲。2. 结果界面里最容易被忽略的第一张表自动聚类表双击输出窗口里的“模型概要”会看到一个模型视图里面是一个表格加一个“聚类质量”面板。但很多人没注意到在左侧“查看器”的树状结构里“模型概要”下面才藏着完整的结果列表。其中第一个重点就是“自动聚类表”。2.1 自动聚类表的长相和核心列自动聚类表的结构并不复杂核心列包括聚类数1、2、3……、BIC值、BIC变化量、变化量比率、距离度量比率。有些版本还带AIC但默认主要看BIC。我见过太多新手盯着“聚类数”那一列发呆明明只想要3类为什么表格从1一直列到10这是因为SPSS默认会尝试1到15类具体由最大聚类数决定然后把每次合并后的BIC值都记录下来。BIC越小代表模型越好但这里有个陷阱——BIC通常随着聚类数增加一直下降如果只求最小的BIC你往往得到一个类数非常多的方案实际解释不了。所以SPSS不让你直接看BIC最小值而是给你算了一个变化量比率。当“变化量比率”出现大幅度跳升、之后又趋于平稳的位置那个点就是要找的最佳类数。简单理解聚成K类比聚成K-1类带来的信息增益最大再往上加类就没有那么明显的收益了那就选K类。2.2 怎么判断该选几类BIC和距离变化我自己的读表习惯是两步走。第一步看“BIC变化量比率”。这个指标的正式名称挺拗口你可以把它理解为“从1类到2类、2类到3类……每一步带来的BIC改善幅度占整个改善过程的比例”。比率最大的那一步往往就是拐点。比如一张表里从1类到2类的比率只有0.2从2类到3类突然变成0.55然后从3类到4类又跌回0.1那就说明分成3类是一个明显的分水岭。第二步看“距离度量比率”。这个距离指的是两个最近聚类中心之间的距离变化。简单说如果从3类到4类时两个最近类之间的距离大幅缩水说明硬拆出来的第4类其实和某个类非常接近区分度不高。SPSS推荐“同时考虑BIC和距离”但当两者打架时也就是说BIC说你选4类、距离说你选2类我一般优先考虑距离比率的变化趋势因为它和实际分类的可解释性更相关。2.3 一个带真实数据的读表例子给你一个我最近处理案例的数据当时拿的是3000多条用户行为记录15个变量其中3个连续消费金额、频次、最近距今天数4个分类性别、会员等级、渠道来源、是否复购。跑完后自动聚类表关键数字如下聚类数BICBIC变化量变化量比率距离度量比率125000———220500-45000.321.65318200-23000.511.38417400-8000.080.41516900-5000.060.32注意表里的负号是因为BIC在下降变化量比率那一列SPSS显示的是绝对值占和的比例。看到没有2类到3类这一步BIC下降2300变化量比率0.51是整张表里最高的而3类到4类的距离比率直接从1.38掉到0.41说明4类方案里的某两类贴得太紧。所以最终我选了3类回表里看聚类质量也不错。如果你机器输出的表格列名略有不同记住对着“聚类数、变化量比率、距离比率”这三列看就行。3. 聚类质量面板好聚类的“体检报告”在模型概要的顶部SPSS会给你一个“聚类质量”的图通常是一张条形图标着“差、尚可、良好”的刻度以及一个具体的轮廓系数值。这个东西是新手最容易误读的地方。3.1 轮廓系数怎么读轮廓系数Silhouette measure的取值在-1到1之间。大于0说明类内距离小于类间距离聚类是有效的越大越好。SPSS把0.2以下标成“差”0.2到0.5为“尚可”0.5以上为“良好”。但注意这个阈值不是死的我自己跑过很多真实用户数据轮廓系数能到0.4就已经很有解释力了。比如有一次做问卷样本细分态度量表加人口学变量跑出来轮廓系数只有0.28按SPSS标准是“尚可”但结合后面的质心和频率表看每一类都有鲜明的态度倾向这种结果完全可以接受。相反如果轮廓系数是负的那真是白跑了——说明这个数据根本不适合聚类或者变量选取有问题。所以看到“尚可”不要慌结合业务实际判断看到“差”则要认真回到变量层面找问题。3.2 质量一般时的处理思路遇到聚类质量很低我的排查顺序是这样的第一先看输入变量的区分度。是不是混进了大量无关变量比如你研究消费行为但把一个“是否填过问卷”的字段也丢进去算法当然很难收敛出好结构。处理方法把变量重要性图里排在后半段的变量逐个删掉再跑往往质量就上来了。第二看分类变量的编码。两步聚类对分类变量做的是哑变量化处理如果你的分类变量类别太多比如“来源渠道”有100多个值它会变成100多个0/1变量把连续变量的影响稀释掉。这时候需要先对分类变量分箱归并再跑聚类。第三看连续变量的分布。两步聚类内置了正态化变换但如果你某个连续变量极端偏态比如人均消费最低0、最高十万块中位数才200那距离计算仍然容易失衡。建议先取对数或缩尾处理。补充一句SPSS目标里有一个“聚类数”选项如果你已经定了业务上必须要分几类可以直接指定“固定值”这时候自动聚类表会退居其次算法直接按你指定的类数跑。但我不推荐新手一开始就这么做还是先让算法给出推荐再对比业务合理性。4. 两步聚类各表格的逐项解读看完模型概要下面进入真正的主体结果。完整的输出里通常包含聚类分布、质心、频率、输入预测变量重要性、描述统计等。很多人这里就开始慌其实每张表都有固定读法。4.1 聚类分布/频率表先看类的大小是否均衡第一张要看的表是“聚类分布”它列出了每个聚类的样本量及百分比。这张表解决的核心问题你的分类是不是一边倒。假如你分了3类结果第一类占了95%剩下两类各2.5%那这个聚类基本没有实用价值——要么类数太少要么有一个“巨大而模糊”的簇把大多数样本都囊括进去了。这时候你需要把聚类数调大或者回到变量层面去看看是不是某些变量把样本集中拉向了一个方向。我遇到过一个典型案例做流失用户分群时因为把“是否流失”这个0/1变量作为输入而流失用户只占8%聚类结果里非流失用户汇集成了一个巨大的垃圾类整个聚类结构被带偏。后来我把目标变量排除出聚类变量只保留行为特征结构立刻清晰了。所以当你看到“聚类分布”里有一个占比过高的类第一反应不是删除这个类而是想一想是不是有某个强分类变量在主导算法导致所有个案都被吸到一类。4.2 质心表连续变量的中心在哪里质心表英文叫Centroids列出的是每个聚类里各连续变量的均值或者是均值调整后的值。这张表是整个结果里最“硬核”的一张它是你给每个类贴标签的主要依据。读法很简单横向看一个聚类逐列对比该聚类在连续变量上的均值和总体均值差别。比如三类用户的月均消费分别是80、500、2600元那很明显第一类是低消费组第三类是高消费组第二类是中间组。但这里有个坑SPSS两步聚类里如果选择了“标准化”处理质心表里的值可能不是原始量纲而是标准化后的均值读起来不直观。解决办法跑完聚类后把SPSS生成的“保存的聚类标识”变量比如“TwoStep Cluster Number”作为分组变量再去描述统计里跑各连续变量原始值的均值这样用来贴标签最准确。我一般会做一个交叉表行是聚类的类号列是各连续变量的均值、标准差再配上各分类变量的占比最后形成一张“人群画像卡”。质心表是这张画像卡的骨架。4.3 频率表分类变量的差异怎么找当输入变量里有分类变量时SPSS会输出“频率”表。这张表展示的是每个聚类中该分类变量的各个类别占比。注意这里检验的不是卡方而是两步聚类模型内部比较各类别相对分布的一种描述。读法对比同一个变量在不同聚类中的百分比差异。比如“会员等级”变量里聚类1的“钻石会员”比例是60%聚类2的比例是10%那这个变量就是用来区分这两类的重要特征。实际操作时我建议不要只看单张频率表而是把所有分类变量的频率表汇总横向对齐成一张大表。比如这样变量/类别聚类1聚类2聚类3性别-男55%20%48%性别-女45%80%52%渠道-线上30%85%40%渠道-线下70%15%60%这类表整出来以后每个聚类的形象一下子就立体了。比如聚类1是线下男性消费者聚类2是线上女性消费者聚类3相对均衡。注意频率表里的百分比是列百分比每个聚类内部的比例而不是占总体样本的比例别搞混。4.4 变量重要性图谁在决定你的分类SPSS会输出一张“输入预测变量重要性”图通常是一根根横条显示每个变量对聚类模型的贡献度SPSS还给出了“最不重要”和“最重要”的刻度。这张图的价值在于帮你筛选和验证变量。如果某个你认为关键的变量重要性非常低比如“复购次数”排在倒数第一说明它对当前的聚类结构几乎没贡献那你就要反思是不是变量之间存在严重冗余比如“复购次数”和“购买频次”高度相关算法认为只需要其中一个就够了。我的习惯是把重要性低于0.3的变量逐步剔除再跑一遍看看聚类质量是否提高类是否更可解释。还要提醒一下“变量重要性”不等于“业务重要性”。算法只关心统计区分度不关心商业含义。比如“性别”可能在统计上区分度很高但对你的业务分群来说毫无意义这种变量要不要删取决于你的分析目标而不是指数大小。5. 常见问题与排查技巧实录这部分是我踩过坑汇总出来的也是我认为比说明书更值钱的经验。新手跑两步聚类遇到的各种诡异问题绝大多数能在下面几条里找到答案。5.1 聚出垃圾类多半是输入变量问题垃圾类长什么样就是那一类样本里什么指标都接近总体均值没有鲜明特征占比还特别大。这种情况十有八九是输入变量里混进了“无关但方差大”的字段。比如把“用户ID”选进去或者把包含大量缺省值的字段也选进去算法就会因为噪音太大而强行聚出一堆没有意义的类。解决思路是不要急着全选变量先做相关性检查和变量筛选。对连续变量看相关性矩阵对分类变量看对应分析和多重对应分析。一般情况下保留5到10个有代表性的变量已经足够。变量太多时两步聚类的自动变量选择有一定抑制作用但你最好还是人工把关。5.2 类别数量为什么和预期不一样你心里想要5类结果SPSS推荐3类怎么办先别怀疑自己的业务感觉。两步聚类推荐的类数是基于BIC和距离的统计标准它不带业务视角。如果你有明确业务约束完全可以指定聚类数为固定值。但我建议你在固定类数前先看看3类方案能不能讲出故事往往统计上更优的方案在业务上也有更好的解释性。反过来如果SPSS推荐了7类而你业务上只能承接3类你也可以在“聚类数”里选择“固定值”填3让算法在3类条件下重新优化。不过这时候要注意聚类质量可能下降记得多看轮廓系数。5.3 结果怎么导出、交叉验证怎么做SPSS两步聚类结果可以直接在查看器里右键复制成文本或导出为Word/PDF。但如果你想要更灵活建议在“高级”选项里勾选“保存聚类结果”这样数据集里会多出一个新变量叫“TwoStep Cluster Number”之类的名字。有了这个变量以后你可以做两件好事第一做交叉验证。把样本随机拆成两部分分别跑两步聚类然后用保存的聚类编号比较两个子样本在每个类上的分布一致性看看结构是否稳定。这个操作在SPSS里需要配合“选择个案”或拆分文件功能有点繁琐但值得做。第二做后续分析。比如你用聚类结果当分组变量再去做方差分析、卡方检验、多重比较看看各类在未参与聚类的校标变量上是否有显著差异。这也是我常说的“外部效度验证”比单纯看轮廓系数更有说服力。5.4 与多重响应/缺失值处理的联动经验顺便提一个很常见的问题如果我用的是问卷数据里面有大量多选题多重响应能把多重响应集直接放进两步聚类吗答案是不能。SPSS的多重响应集是一种临时分组定义聚类菜单不认它。你需要先把多选题拆成多个0/1计分的变量比如“您偏好以下哪些渠道”每个选项生成一列“是否选该项”再把这些0/1变量作为分类变量放入聚类。另一个问题是缺失值。多重插补Multiple Imputation出来的数据可以导入SPSS跑聚类但要注意两步聚类的“缺失值处理”选项是针对单变量缺失的对于多重插补产生的多个数据集SPSS的标准菜单不会自动合并分析。如果你真的做了多重插补想用聚类比较实际的做法是用插补后的合并数据集比如取了均值填充后的数据再跑一次两步聚类把聚类结果作为一种稳健性检验而不是当成唯一的结论。6. 最后分享一个我自己的读表顺序在准备收尾前我把这套流程浓缩成一张顺序清单送给第一次跑两步聚类的你先看“模型概要”里的个案数确认参与聚类样本量没有缩水太多看“自动聚类表”的BIC变化量比率和距离比率确定推荐类数看“聚类质量”的轮廓系数判断整体聚类有效性看“聚类分布”确认各类大小均衡性看“质心”表和“频率”表给每一类贴业务标签最后回看“变量重要性图”判断哪些变量贡献低能做精简就精简再跑一遍做对比。这个顺序我用了很多年也推荐给团队里的新人基本能在十分钟内把两步聚类结果消化干净。如果你是一个喜欢用语法操作的人可以把两步聚类导出成SPSS Syntax核心命令大概是TWOSTEP CLUSTER /CONTINUOUS VARIABLESvar1 var2 /CATEGORICAL VARIABLESvarA varB /DISTANCE LIKELIHOOD /NUMCLUSTERS AUTO /CRITERIA INITIAL100 MXBRANCH8 MXLEVEL3 /PRINT MODEL SUMMARY /SAVE VARIABLETSC_Result.这个语法里MXBRANCH8表示聚类特征树的每个节点最多有8个分支MXLEVEL3限制树深度为3层不是核心推荐值但新手可以保持默认。真正需要调的是NUMCLUSTERS AUTO你可以改成FIXED5强制分5类。我个人的经验是两步聚类产出的结果不是乾坤大挪移不会替你解决所有分类问题它只是帮你从数据中提炼出一个“统计上可行”的参考结构。最后分几类、每一类叫什么名字、怎么用还是要落回你的业务场景。所以我一直建议大家把这个结果当成一个探索工具而不是一个金科玉律。跑完多问自己一句这个分类拿去给运营同事看他们能立刻知道该做什么吗如果答案是可以那这个聚类就是成功的。

关于本文作者

来自尧图内容编辑团队

尧图内容编辑团队 内容团队

尧图内容编辑团队

本文由尧图网络内容编辑团队执笔。团队由资深项目经理、前端工程师与设计师组成,所有内容均来自亲手交付的真实项目,先讲清问题、再给出可落地的解法。尧图深耕北京网站建设十年,服务过京华建材集团、智造科技等各行业客户,把一线经验沉淀为可复用的行业观察。

  • 十年建站经验,覆盖建材、制造、服务、文创等
  • 项目经理把关选题与事实准确性
  • 工程师与设计师联合撰写专业细节
  • 统一编辑规范,保证文风与排版一致
  • 每月复盘转化数据,迭代选题方向

延伸阅读

相关资讯与近期热门内容

深度阅读推荐

建站决策前值得细读的三篇

网站改版的5个关键决策
2024-08-12

网站改版的5个关键决策

什么时候该改版、改到什么程度、如何避免流量掉光,京华建材集团改版复盘给出答案。

获取专属建站方案

看完文章,把您的行业与预算告诉我们,免费获取一份量身定制的官网建设方案与报价。

立即免费咨询