spss聚类分析--用于筛选聚类变量的一套方法

spss聚类分析--用于筛选聚类变量的一套方法

ID:32658414

大小:238.58 KB

页数:9页

时间:2019-02-14

spss聚类分析--用于筛选聚类变量的一套方法_第1页
spss聚类分析--用于筛选聚类变量的一套方法_第2页
spss聚类分析--用于筛选聚类变量的一套方法_第3页
spss聚类分析--用于筛选聚类变量的一套方法_第4页
spss聚类分析--用于筛选聚类变量的一套方法_第5页
spss聚类分析--用于筛选聚类变量的一套方法_第6页
spss聚类分析--用于筛选聚类变量的一套方法_第7页
spss聚类分析--用于筛选聚类变量的一套方法_第8页
spss聚类分析--用于筛选聚类变量的一套方法_第9页
资源描述:

《spss聚类分析--用于筛选聚类变量的一套方法》由会员上传分享,免费在线阅读,更多相关内容在工程资料-天天文库

1、SPSS聚类分析:用于筛选聚类变量的一套方法来源:数据小兵聚类分析是常见的数据分析方法之一,主要用于市场细分、用户细分等领域。利用SPSS进行聚类分析时,用于参与聚类的变量决定了聚类的结果,无关变量有时会引起严重的错分,因此,筛选有效的聚类变量至关重要。案例数据源:在SPSS自带数据文件plastic.sav中记录了20中塑料的三个特征,分别是tear_res(抗拉力)、gloss(光滑度)、opacity(透明度),相关经验表面这20中塑料可以分为3个种类,如果用这三个变量进行聚类,请判断和筛选有效聚类变

2、量。一套筛选聚类变量的方法—、盲选将根据经验得到的、现有的备选聚类变量全部纳入模型,暂时不考虑某些变量是否不合适。本案例采用SPSS系统聚类方法。对话框如下:统计量选项卡:聚类成员选择单一方案,聚类数输入数字3;绘制选项卡:勾选树状图;方法选项卡:默认选项,不进行标准化;保存选项卡:聚类成员选择单一方案,聚类数输入数字3;二、初步聚类这是盲选得到的初步聚类结果并且在数据视图我们可以看到已经自动生成了一个聚类结果变量,这个变量非常有用。DendrogramusingAverageLinkage(Between

3、Groups)RescaledDistanceClusterCombine051015202544121211881313151514142020557719193311119966171722101018181616三、方差分析是不是每一个纳入模型的聚类变量都对聚类过程有贡献?利用已经生成的初步聚类结果,我们可以用一个单因素方差分析来判断分类结果在三个变量上的差异是否显著进而判断哪些变量对聚类是没有贡献的。古1单因素方差分析分析——比较均值——单因素方差分析:选项选项卡:勾选均值图ANOVASumofSq

4、uaresdfMeanSquareF■Sig.透明度BetweenGroups56.260228.13026.649.000WithinGroups17.945171.056Total74.20619光滑BetweenGroups.0382.019.063.939WithinGroups5.04817.297Total5.08619抗拉力BetweenGroups.1202.060.247.784WithinGroups4.14517.244Total4.26619II由方差分析我们很明确的得知,纳入模型的

5、三个聚类变量,其中只有〃透明度"指标在各个分类上有显著的差异,也就是说分类有效果,让每个分类的差异很大,而两外两个变量则在三个分类上没有显著差异,没有很好的类别区分度,所以,我们可以认为,这两个变量对聚类无作用或者无贡献,可考虑踢出模型。我们还想从可视化的角度来查看和判断,单因素方差分析为我们提供了均值图,可惜,这三个图却最容易误导我们的判断,因为spss在自动生产均值图时为每一个变量单独制图,而且分配不同的纵轴坐标,导致每个图看起来都有非常大的差异,从视觉上迷惑我们做岀错误的判断。这里需要改进!四、均值描

6、述为改进以上SPSS默认选项的不足之处,我们需要自己生成三个变量在不同类别上的均值,means过程可以帮助到我们。从数字上来看,抗拉力(6&6.7、7.1)、光滑度(9.3、9.4、9.2)两个指标在三个类别上并没有多大的差异,而对聚类有贡献的透明度指标在不同类别上区分度非常明显。ReportMeanAverageLinkage(BetweenGroups)抗拉力I光滑度、明度16.7869.3002.88626.7209.3805.98037.1009.2008.400Total6.7859.315j3.

7、935五、多线均值图克服纵轴刻度的方法是将这三个指标放在同一个坐标轴上进行对比也就是制作一个多线均值图。10.00-指标—光滑度—抗拉力8.00-均值(M)均值6.00-4.00-2.00"0.0012类别此时,结果已经一目了然了。综上,我们可以将抗拉力、光滑度两个指标从模型中剔除,只留下透明度一个指标再进行聚类。序号tearresglossopacityCLU31ri119J■46.59.64.111

8、

9、56.59.2.811

10、

11、66.99.15.722

12、

13、77.210.02.01186.99.93.91

14、196.19.51.911106.39.45.722116.79.12.811126.69.34.111137.28.33.811147.18.41.611156.88.53.411167.19.28.433177.08.85.222187.29.76.922197.510.12.711207.69.21.911我们发现,前后两次聚类的结果一模一样,用一个指标可以代替以前三个指标的进行聚类。我们这样做的意义何在?

当前文档最多预览五页,下载文档查看全文

此文档下载收益归作者所有

当前文档最多预览五页,下载文档查看全文
温馨提示:
1. 部分包含数学公式或PPT动画的文件,查看预览时可能会显示错乱或异常,文件下载后无此问题,请放心下载。
2. 本文档由用户上传,版权归属用户,天天文库负责整理代发布。如果您对本文档版权有争议请及时联系客服。
3. 下载前请仔细阅读文档内容,确认文档内容符合您的需求后进行下载,若出现内容与标题不符可向本站投诉处理。
4. 下载文档时可能由于网络波动等原因无法下载或下载错误,付费完成后未能成功下载的用户请联系客服处理。