


下载本文档
版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
1、1、 数据挖掘技术包括三个主要部分:数据、建模能力、算法与技术2、 关于基本数据的元数据是指:基本元数据包括关于装载和更新处理,分析处理以及管理方面的信息。3、 关于OLAP和OLTP的说法不正确的是:OLAP事务量大,但事务内容比较简单且重复率高4、 将原始数据进行集成、交换、维度规约、数值规约是哪个步骤的任务:数据预处理5、 下面哪种不属于数据预处理的方法:估计遗漏值6、 在ID3算法中信息增益是指:熵减少的程度最大7、 以下哪个算法是基于规则的分类器:C4.58、 以下哪项关于决策树的说法是错误的:决策树算法对于噪声的干扰非常敏感9、 决策树中不包含一下哪种结点:外部结点10、 在抽样方
2、法中,当合适的样本容量很难确定时,可以使用抽样的方法是:渐进抽样11、 当不知道数据所带标签时,可以使用哪种技术促使带同类标签的数据与其他标签的数据相分离:聚类12、 以下关于人工神经网络(ANN)的描述错误的是:神经网络对训练数据中的噪声非常敏感13、 组平均:将两个簇的邻近度定义为不同族的所有点对的平均逐对邻近度,它是一种凝聚层次聚类技术14、 只有非零值才重要的二元属性被称作:非对称的二元属性15、 在基本K均值算法里,当邻近度函数采用:曼哈顿距离 的时候,合适的质心是簇中各点的中位数16、 下列关于数据粒度的描述不正确的是:数据综合度越高、粒度也就越大、级别也就越高17、 某超市研究销
3、售记录数据后发现,买啤酒的人很大概率也会购买尿布,这种属于数据挖掘的那类问题:关联规则发现。18、 OLAP技术的核心是:多维分析19、 假设12个销售价格记录组已经排序如下:5、10使用如下每种方法将他们划分成四个箱子,等深划分时,15在第几个箱子内:第二个 ;等宽度划分(宽度为50),15在第一个箱子里面。20、 熵是为消除不确定性所需要获得的信息量,投掷均匀正六面体骰子的熵是:2.6比特21、 假设属性income的最大最小值分别是12000元和98000元,利用最大最小规范的方法将属性的值映射到0-1的范围内。对属性income的73600元将被转换为:0.71622、 假定用于分析的
4、数据包含属性age,数据元组中age的值如下:13、15、16、问题:使用按箱平均值平滑方法对上述数据进行平滑,箱的深度为3,第二个箱子值为:18.323、 设定X(1,2,3)的频繁项集,则可由X产生(6)个关联规则24、 概念分层图是(有向无环图)25、 假设A事件为:“产品合格”,B为“机器工作正常”,现给出以下概率:机器正常工作的概率,即P(B|A非)=0.33326、 数据仓库的三级数据模型是指概念数据模型 、 逻辑数据模型 、和物理数据模型27、 OLAP的基本多维分析操作有 钻取 、切片、切块、旋转等28、 多维数据集通常采用 星型 或 雪花型架构 。以 事实 为中心,连接多个
5、维表29、 空缺值数据的处理方法主要有使用默认值、属性平均值 、同类样本平均值 和预测最可能的值等30、 连续数据的离散通常采用3-4-5规划,如果待划分区间最高位上包含2、4或8个不同值,则它划分成 4 个等宽区间31、 对具有直线相关关系的现象配以直线方程进行回归分析,称为:线性回归,对具有曲线相关关系的现象配以曲线方程进行回归分析,称为:非线性回归32、 神经网络的学习方式有三种:监督学习、非监督学习和再励学习33、 按照对应的数据类型,web挖掘可分为: 内容挖掘、 结构挖掘、和用户访问模式挖掘34、 ID3算法只能对描述属性分为: 离散 类型属性的数据集构造决策树35、 聚类分析的数
6、据通常可分为 区间标度变量 、 二元变量、标称变量、比例标度变量、序数型以及混合型等36、 数据仓库是面向主题的、集成的 、具有时间特征的、稳定的数据集合,用以支持经营管理中的决策制定过程37、 在给定数据立方体的一维上进行选择操作称为:切片 ,在两个或多个维上进行选择操作就是:切块38、 数据立方体的数据的多维建模和表示,由维和事实组成。维就是涉及的 属性 、而事实是一个具体的 数据39、 数据预处理的主要内容包括数据清洗、数据集成、数据变换 和数据规约等40、 关联规则的经典算法包括 Aprior 算法和FP-growth 算法 其中FP-growth算法的效率更高41、 EM算法可以广泛
7、地应用于处理:缺省数据、 截尾数据和 带有噪声的 数据等各种不完整数据。42、 人工神经网络的特点和优势主要表现在具有 自学习 功能、具有 联想存储 功能和具有高速寻找优化解的能力三个方面43、 按照对应的数据类型,web挖掘可分为内容挖掘、结构挖掘 和 用户访问模式挖掘44、 连续型属性的数据样本之间的距离有 欧几里得距离、曼哈坦距离 和明考斯基距离45、 BP神经网络由输入结点、输出结点、以及一个或多个结点组成46、 数据挖掘的主要任务是从数据中发现潜在的规则,从而能更好的完成描述数据、预测数据等任务(对)47、 离散属性总是具有有限个值(错)48、 用于分类的离散化方法之间的根本区别在于
8、是否使用类信息(对)49、 特征提取并不依赖于特定的领域(错)50、 定量属性可以是整数值或者是连续值 对 51、 WEB数据挖掘是通过数据中的一些属性来预测另一个属性,它在验证用户提供的假设过程中提取信息 错 52、 关联规则挖掘过程是发现满足最小支持度的所有项集代表的规则 错 53、 利用先验原理可以帮助减少频繁项集产生时需要探查的候选项个数 对 54、 具有较高的支持度的项集具有较高的置信度 错 55、 聚类是这样的过程:它找出描述并区分数据类或概念的模型,以便能够使用模型预测类标记位置的对象 错 56、 分类和回归都可以用于预测,分类输出是离散的类别值,而回归的输出是连续数值。 对 5
9、7、 K均值是一种产生划分聚类的基于密度的聚类算法,簇的个数由算法自动地确定 错58、 数据挖掘的目标不在数据采集策略,而在于对已经存在的数据进行模式的发掘 对 59、 模式为对数据集的全局性总结,它对整个测量空间的每个点做出描述,模型则对变量变化空间的一个有限区域做出描述 错 60、 数据仓库中间层OLAP服务器只能采用关系型OLAP 错 61、 特征提取技术并不依赖于特定的领域 错 62、 定量属性可以是整数值或者是连续值 对 63、 Web数据挖掘是通过数据库中的一些属性来预测另 一个属性,它在验证用户提出的假设过程中提取信息 错 64、 贝叶斯发是一种在已知后验证概率与类条件概率的情况下的模式分类方法,待分样本的
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- 2025年中国引擎外部清洁剂行业市场发展前景及发展趋势与投资战略研究报告
- 2025年中国推拉床架行业市场发展前景及发展趋势与投资战略研究报告
- 2025年PETG项目可行性分析报告
- xx公司试运行报告
- 中国土地流转行业发展前景预测及投资战略研究报告
- 中国电磁传感器行业市场运行现状及未来发展预测报告
- 2020-2025年中国大闸蟹养殖行业投资研究分析及发展前景预测报告
- 2025年中国车用柴油机行业市场调研及未来发展趋势预测报告
- 中国实验动物市场竞争格局及投资战略规划报告
- 二氨基行业深度研究分析报告(2024-2030版)
- 2025春季学期国开电大专科《机械制图》一平台在线形考(形成性任务1至4)试题及答案
- 红外热像仪性能提升行业深度调研及发展项目商业计划书
- CJ/T 410-2012隔油提升一体化设备
- DB14-T 2245-2025 煤炭洗选企业标准化管理规范
- 家庭成员现实表现情况
- 2025届湖南长沙雅礼实验中学七年级数学第二学期期末学业水平测试试题含解析
- 2025云南铝业股份限公司高校毕业生招聘100人易考易错模拟试题(共500题)试卷后附参考答案
- 黄旭华人物介绍
- TCWEA6-2019水利水电工程施工期度汛方案编制导则
- 2025成都劳动合同范本
- 2025-2030中国餐厨垃圾处理服务行业市场现状分析及竞争格局与投资发展研究报告
评论
0/150
提交评论