第2章数据挖掘可挖掘的知识类型



《第2章数据挖掘可挖掘的知识类型》由会员分享,可在线阅读,更多相关《第2章数据挖掘可挖掘的知识类型(24页珍藏版)》请在装配图网上搜索。
1、单击此处编辑母版文本样式,第二级,第三级,第四级,第五级,*,单击此处编辑母版标题样式,数据挖掘原理与,SPSS Clementine,应用宝典,元昌安 主编,邓松李文敬刘海涛编著,电子工业出版社,双击添加主标题,概念,/,类描述,关联模式,分类,聚类分析,预测,时间序列,偏差检测,2,概念,/,类描述,就是通过对某类对象关联数据的汇总、分析和比较,用汇总的、简洁的、精确的方式对此类对象的内涵进行描述,并概括这类对象的有关特征。,概念描述分为,特征性描述,和,区别性描述,。,特征性描述,是指从与某类对象相关的一组数据中提取出关于这些对象的共同特征。生成一个类的特征性描述只涉及该类对象中所有对象
2、的共性。,区别性描述,描述两个或更多个不同类对象之间的差异。生成区别性描述则涉及目标类和对比类中对象的共性。,2.1,概念,/,类描述,2.1,概念,/,类描述,数据特征的输出可以用多种形式提供。包括饼图、条图、曲线、多维数据方和包括交叉表在内的多维表。结果描述也可以用泛化关系或规则(称作特征规则)形式提供。,例如:利用面向属性的归纳方法(,AOI,),在一个商场数据库(,2000,销售)中进行属性归纳操作,获得了如下的归纳结果:,表,2-1 AOI,方法挖掘结果表格表示示意描述,地点,商品,销售额(百万),个数累计(千),亚洲,欧洲,北美,亚洲,欧洲,北美,电视,电视,电视,电脑,电脑,电脑
3、,15,12,28,120,150,200,300,250,450,1000,1200,1800,2.1,概念,/,类描述,对于以上结果,也可以用组合表(,crosstab,)或其他图表的形式来加以描述。数据分析中可视化图示非常普遍。,表,2-2,对应表,2-1,的组合表表示描述 图,2-1,对应表,2-2,棒图表示描述,TV,Computer,TV+Computer,sales,count,sales,count,sales,count,Asia,15,300,120,1000,135,1300,Europe,12,250,150,1200,162,1450,North_Amaerica,2
4、8,450,200,1800,228,2250,All_region,45,1000,470,4000,525,5000,item,Location,2.1,概念,/,类描述,图,2-2,对应表,2-1,(部分数据)的饼图表示描述,北美,51%,亚洲,27%,欧洲,22%,电视销售图,2.1,概念,/,类描述,区别性描述是将目标类对象的一般特性与一个或多个对比类对象的一般特性比较。这种比较必须是在具备可比性的两个或多个类之间进行。,例如,对某校讲师和副教授的特征进行比较,可能会得到这样一条规则:,“讲师:(,78%,)(,paper3,),and(teaching course=3,),and
5、(teaching course=2)”,;,该对比规则表示该校讲师中约有四分至三的人发表论文少于三篇且主讲课程不超过一门;而对比之下该校副教授中约有三分至二的人发表论文不少于三篇且主讲课程不少于一门。,2.2,关联模式,关联模式挖掘旨在从大量的数据当中发现特征之间或数据之间的相互依赖关系。这种存在于给定数据集中的频繁出现的关联模式,又称为关联规则。关联可分为简单关联、时序关联、因果关联等。这些关联并不总是事先知道,而是通过数据库中数据的关联分析获得的,其对商业决策具有重要价值。因而关联分析广泛用于市场营销、事务分析等应用领域。,挖掘关联知识的一个典型应用实例就是市场购物分析。根据被放到一个购
6、物袋的(购物)内容记录数据而发现的不同(被购买)商品之间所存在的关联知识无疑将会帮助商家分析顾客的购买习惯。发现常在一起被购买的商品(关联知识)将帮助商家指定有针对性的市场策略。,比如:顾客在购买牛奶时,是否也可能同时购买面包或会购买哪个牌子的面包,显然能够回答这些问题的有关信息肯定回有效地帮助商家进行有针对性的促销,以及进行合适的货架商品摆放。如可以将牛奶和面包放在相近的地方或许会促进这两个商品的销售。,2.2,关联模式,根据关联规则所涉及变量的多少,可以分为,多维关联规则,和,单维关联规则,。通常,关联规则具有:,X,Y,的形式,即”,A1,.,Am,B1,.,Bn,”,的规则;其中,Ai
7、(i,1,.,m),Bj,(j,1,.,n),是属性,-,值对。关联规则,X,Y,解释为“满足,X,中条件的数据库元组多半也满足,Y,中条件”。,例如:一个数据挖掘系统可以从一个商场的销售,(,交易事务处理,),记录数据中,挖掘出如下所示的关联规则:,age(X,”20-29”)income(X,”20K-30K”),buys(X,,”,mp3”)support=2%,confidence=60%,上述关联规则表示:该商场有的顾客年龄在,20,岁到,29,岁且收入在,2,万到,3,万之间,这群顾客中有,60%,的人购买了,MP3,,或者说这群顾客购买,MP3,的概率为六成。这一规则涉及到,年龄
8、,、,收入,和,购买,三个变量,(,即三维,),,可称为,多维关联规则,。,2.2,关联模式,对于一个商场经理,或许更想知道哪些商品是常被一起购买,描述这种情况的一条关联规则可能是,:,Contains(X,”computer,”),contain(X,”software,”)support=1%,confidence=60%,上述关联规则表示:该商场,1%,销售交易事物记录中包含“,computer”,和“,software”,两个商品;而对于一条包含(购买)“,computer”,商品的交易事物记录有,60%,可能也包含(购买)”,software”,商品。这条记录中由于只涉及到购买事物这
9、一个变量,所以称为,单维关联规则,。,2.3,分类,分类是数据挖掘中一项非常重要的任务,利用分类可以从数据集中提取描述数据类的一个函数或模型(也常称为分类器),并把数据集中的每个对象归结到某个已知的对象类中。,从机器学习的观点,,分类技术是一种有指导的学习,即每个训练样本的数据对象已经有类标识,通过学习可以形成表达数据对象与类标识间对应的知识,从这个意义上说,数据挖掘的目标就是根据样本数据形成的类知识并对源数据进行分类,进而也可以预测未来数据的归类。,2.3,分类,分类挖掘所获的分类模型可以采用多种形式加以描述输出。其中主要的表示方法有:分类规则(,IF-THEN,)、决策树(,decisio
10、n tree,)、数学公式(,mathematical formulae,)和神经网络。,决策树是一个类似于流程图的结构,每个结点代表一个属性值上的测试,每个分枝代表测试的一个输出,树叶代表类或类分布。决策树容易转换成分类规则。,神经网络用于分类时,是一组类似于神经元的处理单元,单元之间加权连接。,另外,最近有兴起了一种新的方法,粗糙集(,rough set,),其知识表示是产生式规则。,2.3,分类,分类通常用来预测对象的类标号。例如,银行信贷部门可以根据一个顾客信用信息数据库,将功课的信用等级记录为一般或良好,然后根据挖掘得出信用良好的顾客信息特征,应用这些特征描述,可以有效发现优质客户。
11、这一分类过程主要含有两个步骤:,(,1,)如图所示:建立一个已知数据集类别或概念的模型。,分类算法,分类规则,if,年龄,=30-40,且,收入,=,高,则,信用评估,=,良好,姓名,年龄,收入,信用评估,汪明,王刚,李勇,30,40,40,30,33-40,高,低,高,一般,一般,良好,图,2-5,分类挖掘第二步:分类测试,良好,测试数据,2.4,聚类分析,与分类技术不同,在机器学习中,聚类是一种无指导学习。也就是说,,聚类分析是在预先不知道欲划分类的情况下,根据信息相似度原则进行信息集聚的一种方法,。聚类的目的是使得属于同一类别的个体之间的差别尽可能的小,而不同类别上的个体见的差别尽可能的
12、大。因此,聚类的意义就在于将观察到的内容组织成类分层结构,把类似的事物组织在一起。通过聚类,人们能够识别密集的和稀疏的区域,因而发现全局的分布模式,以及数据属性之间的有趣的关系。,数据聚类分析是一个正在蓬勃发展的领域。聚类技术主要是以统计方法、机器学习、神经网络等方法为基础。比较有代表性的聚类技术是基于几何距离的聚类方法,如欧氏距离、曼哈坦(,Manhattan,)距离、明考斯基(,Minkowski,)距离等。,2.4,聚类分析,聚类分析广泛应用于商业、生物、地理、网络服务等多种领域。例如,聚类可以帮助市场分析人员从客户基本库中发现不同的客户群,并能用不同的购买模式来刻画不同的客户群的特征,
13、如图,2-6,显示了一个城市内顾客位置的二维图,数据点的三个簇是显而易见的。聚类还可以从地球观测数据库中帮助识别具有相似土地使用情况的区域;以及可以帮助分类识别互联网上的文档以便进行信息发现等等。,图,2-6,一个城市内顾客位置的二维图,2.5,预测,预测型知识(,Prediction,)是指由历史的和当前的数据产生的并能推测未来数据趋势的知识,。,这类知识可以被认为是以时间为关键属性的关联知识,因此上面介绍的关联知识挖掘方法可以应用到以时间为关键属性的源数据挖掘中。,前面介绍分类知识挖掘时曾经提到过:分类通常用来预测对象的类标号。然而,在某些应用中,人们可能希望预测某些遗漏的或不知道的数据值
14、,而不是类标号。,当被预测的值是数值数据时,通常称之为预测,。,也就是说,预测用于预测数据对象的连续取值,如:可以构造一个分类模型来对银行贷款进行风险评估(安全或危险);也可建立一个预测模型以利用顾客收入与职业(参数)预测其可能用于购买计算机设备的支出大小。,2.5,预测,例如,表,2-3,给出了一组年薪数据。其中,,X,表示大学毕业后工作的年数,而,Y,是对应的收入。这些数据点如图,2-7,所示,暗示我们,X,和,Y,之间存在线性关系。我们可以采用某种方法推出预测模型,从而可以利用这一模型预测有,10,年工作经验的大学毕业生的年薪。,X,(,工作年数),Y,(,年薪(单位:,$1K,),3,
15、8,9,13,3,6,11,21,1,16,30,57,64,72,36,43,59,90,20,83,表,2-3,工作年数与年薪关系表,图,2-7,工作年数与年薪对应的关系图,2.5,预测,预测型知识的挖掘可以利用统计学中的回归方法,通过历史数据直接产生连续的对未来数据的预测值;可以借助于经典的统计方法、神经网络和机器学习等技术。无论如何,经典的统计学方法是挖掘预测知识的基础。,2.6,时间序列,具有一个或多个时间属性的预测应用称为时间序列问题,。时间序列是数据存在的特殊形式,序列的过去值会影响到将来值,这种影响的大小以及影响的方式可由时间序列中的趋势周期及非平稳等行为来刻画。,例如:系统调
16、用日志记录了操作系统及其系统进程调用的时间序列,通过对正常调用序列的学习可以预测随后发生的系统调用序列、发现异常的调用。表,2-4,给出了一个系统调用数据表。,这样的数据源可以通过适当的数据整理使之成为调用序列,如表,2-5,,再通相应的挖掘算法达到跟踪和分析操作系统审计数据的目的。,2.6,时间序列,进程号,(,pro,id,),调用时间,(,call,time,),调用号,(,call,id,),744,744,1069,9,1069,744,1069,9,-1,04,:,01,:,10,:,30,04,:,01,:,10,:,31,04,:,01,:,10,:,32,04,:,01,:,10,:,34,04,:,01,:,10,:,35,04,:,01,:,10,:,38,04,:,01,:,10,:,39,04,:,01,:,10,:,40,23,14,4,24,5,81,62,16,进程号(,pro,id,),调用序列(,call,sequence,),744,1069,9,表,2-4,系统进程调用数据示例,表,2-5,系统调用序列数据表示例,2.7,偏差检测,偏差检测(,d
- 温馨提示:
1: 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
2: 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
3.本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
5. 装配图网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。