版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
1、,1,数据挖掘原理与SPSS Clementine应用宝典 元昌安 主编 邓 松 李文敬 刘海涛 编著 电子工业出版社,双击添加主标题,数据挖掘的体系结构与模型,数据挖掘的体系结构 数据挖掘的过程模型 Fayyad模型 CRISP-DM模型,3,3.1 数据挖掘的体系结构,数据挖掘系统由各类数据库、挖掘前处理模块、挖掘操作模块、模式评估模块、知识输出模块组成,这些模块的有机组成就构成了数据挖掘系统的体系结构。,数据挖掘系统的体系结构图,4,3.1 数据挖掘的体系结构,数据库管理模块,负责对系统内数据库、数据仓库、挖掘知识库的维护与管理。这些数据库、数据仓库是对外部数据库进行转换、清理、净化得到
2、,它是数据挖掘的基础。 挖掘前处理模块,对所收集到的数据进行清理、集成、选择、转换,生成数据仓库或数据挖掘库。其中:清理,主要清除噪音;集成,将多种数据源组合在一起;选择,选择与问题相关的数据;转换,将选择数据转换成可挖掘形式。,5,3.1 数据挖掘的体系结构,模式评估模块,对数据挖掘结果进行评估。由于所挖掘出的模式可能有许多,需要将用户的兴趣度与这些模式进行分析对比,评估模式价值,分析不足原因,如果挖掘出的模式与用户兴趣度相差大,需返回相应的过程(如,挖掘前处理或挖掘操作)重新执行。 知识输出模块,完成对数据挖掘出的模式进行翻译、解释,以人们易于理解的方式提供给真正渴望知识的决策者使用。,6
3、,3.1 数据挖掘的体系结构,挖掘操作模块,利用各种数据挖掘算法针对数据库、数据仓库、数据挖掘库,并借助挖掘知识库中的规则、方法、经验和事实数据等,挖掘和发现知识。,7,3.2 数据挖掘的过程模型,Fayyad数据挖掘模型将数据库中的知识发现看作是一个多阶段的处理过程,它从数据集中识别出以模式来表示的知识,在整个知识发现的过程中包括很多处理步骤,各步骤之间相互影响,反复调整,形成一种螺旋式的上升过程。,Fayyad数据挖掘过程模型,8,3.2.1 Fayyad模型,Fayyad处理过程共分为9个处理阶段,分别是 : 数据准备:了解KDD相关领域的有关情况,熟悉有关的背景知识,并弄清楚用户的要求
4、。 数据选择:根据用户的要求从数据库中提取与KDD相关的数据,KDD将主要从这些数据中进行知识提取,在此过程中,会利用一些数据库操作对数据进行处理。,9,3.2.1 Fayyad模型,数据清洗和预处理:对数据进行再加工,检查数据的完整性及数据的一致性,对其中的噪音数据进行处理,对丢失的数据可以利用统计方法进行填补。 数据降维/转换:对经过预处理的数据,根据知识发现的任务对数据进行再处理,主要通过投影或数据库中的其它操作减少数据量。 确定KDD的目标 根据用户的要求:确定KDD是发现何种类型的知识,因为对KDD的不同要求会在具体的知识发现过程中采用不同的知识发现算法。,10,3.2.1 Fayy
5、ad模型,确定知识发现算法: 根据阶段5所确定的任务,选择合适的知识发现算法,这包括选取合适的模型和参数,并使得知识发现算法与整个KDD的评判标准相一致。 数据挖掘(Data Mining) :运用选定的知识发现算法,从数据中提取出用户所感兴趣的知识,并以一定的方式表示出来。 模式解释: 对发现的模式(知识)进行解释,在此过程中,为了取得更为有效的知识。,11,3.2.1 Fayyad模型,知识评价: 将发现的知识以用户能了解的方式呈现给用户。这期间也包含对知识的一致性检查,以确信本次发现的知识不与以前发现的知识相抵触。,12,3.2.1 Fayyad模型,Fayyad过程模型是一个偏技术的模
6、型,该模型在实际应用中存在以下两个问题: 为什么选择这些数据?Fayyad过程模型忽略了具体业务问题的确定。这也是确定选择哪些数据的关键所在。 模型怎样使用?数据挖掘是分析型环境中的一门技术,如果数据挖掘是一种数据分析技术,那么数据挖掘应该在分析型环境中使用。但是,挖掘出的模型需要返回到操作型环境中进行应用。因此,需要构成一个从操作型环境到分析型环境再到操作型环境的封闭的信息流。,13,3.2.2 CRISP-DM模型,CRISP-DM(Cross-Industry Standard Process for Data Mining,跨行业数据挖掘标准流程)注重数据挖掘技术的应用,解决了Fayy
7、ad模型存在的两个问题。 CRISP-DM过程模型从商业的角度给出对数据挖掘方法的理解。目前数据挖掘系统的研制和开发大都遵循CRISP-DM标准,将典型的挖掘和模型的部署紧密结合。,14,3.2.2 CRISP-DM模型,CRISP-DM模型过程的基本步骤包括:业务理解、数据理解、数据准备、建立模型、模型评价、模型实施。,CRISP-DM数据挖掘过程模型,15,3.2.2 CRISP-DM模型,CRISP-DM模型的各个阶段任务。 业务理解 (Business Understanding) 最初的阶段集中在理解项目目标和从业务的角度理解需求,同时将这个知识转化为数据挖掘问题的定义和完成目标的初
8、步计划。,16,3.2.2 CRISP-DM模型,数据理解 (Data Understanding) 数据理解阶段从初始的数据收集开始,通过一些活动的处理,目的是熟悉数据,识别数据的质量问题,首次发现数据的内部属性,或是探测引起兴趣的子集去形成隐含信息的假设。,17,3.2.2 CRISP-DM模型,数据准备 (Data Preparation) 数据准备阶段包括从未处理数据中构造最终数据集的所有活动。这些数据将是模型工具的输入值。这个阶段的任务有一个能执行多次,没有任何规定的顺序。任务包括表、记录和属性的选择,以及为模型工具转换和清洗数据。,18,3.2.2 CRISP-DM模型,建立模型(
9、Modeling) 选择和应用不同的模型技术,模型参数被调整到最佳的数值。一般,有些技术可以解决一类相同的数据挖掘问题。有些技术在数据形成上有特殊要求,因此需要经常跳回到数据准备阶段。,19,3.2.2 CRISP-DM模型,评价(Evaluation) 已经从数据分析的角度建立了高质量显示的模型。在开始最后部署模型之前,重要的事情是彻底地评估模型,检查构造模型的步骤,确保模型可以完成业务目标。这个阶段的关键目的是确定是否有重要业务问题没有被充分的考虑。在这个阶段结束后,一个数据挖掘结果使用的决定必须达成。,20,3.2.2 CRISP-DM模型,实施 (Deployment) 通常,模型的创建不是项目的结束。模型的作用是从数据中找到知识,获得的知识需要便于用户使用的方式重新
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- 2024年吉林客运员试题
- 2024年贵阳客运从业资格证下载什么软件练题的
- 2024年乌鲁木齐客运证模拟考试题及答案
- 2024年宁德客运从业资格考试
- 2024年永州客运从业资格证仿真考试题库
- 大学教师个人教学总结完整版十篇
- 管理咨询常用模型波特五种竞争力分析模型
- 全省技工院校职业技能大赛技术文件-维修电工技术文件(中级组)
- 天津市南仓中学2024-2025学年高一上学期期中考试语文试卷(无答案)
- 畜牧养殖场员工合同
- 《国家基本专业档案目录》解读
- 长沙市长郡双语实验学校人教版七年级上册期中生物期中试卷及答案
- 高考文言通假字汇总
- “治未病”思想与脾胃病的防治
- 项目监理人员配置标准
- 磷酸二氢钾的安全技术说明书
- (高级)信息通信网络运行管理员技能鉴定考试题库(附答案)
- 垃圾渗滤液处理站运维及渗滤液处理投标方案(技术标)
- 3.3《不简单的杠杆》课件
- 弗洛伊德生平及精神分析学说的发展历程
- 普通高中语文课程标准解读课件
评论
0/150
提交评论