数据挖掘测试题_第1页
数据挖掘测试题_第2页
数据挖掘测试题_第3页
数据挖掘测试题_第4页
数据挖掘测试题_第5页
已阅读5页,还剩3页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

1、1.某超市研究销售纪录数据后发现,买啤酒的人很大概率也会购买尿布,这种属于数据挖掘的哪类问题? A关联规则发现聚类分类自然语言处理2.以下两种描述分别对应哪两种对分类算法的评价标准?A警察抓小偷,描述警察抓的人中有多少个是小偷的标准。描述有多少比例的小偷给警察抓了的标准。Precision, RecallRecall, PrecisionPrecision, ROCRecall, ROC3.将原始数据进行集成、变换、维度规约、数值规约是在以下哪个步骤的任务?C频繁模式挖掘分类和预测数据预处理数据流挖掘4.当不知道数据所带标签时,可以使用哪种技术促使带同类标签的数据与带其他标签的数据相分离? B

2、分类聚类关联分析隐马尔可夫链什么是 KDD ? A数据挖掘与知识发现领域知识发现文档知识发现动态知识发现6.使用交互式的和可视化的技术,对数据进行探索属于数据挖掘的哪一类任务?A探索性数据分析建模描述预测建模寻找模式和规则7.为数据的总体分布建模;把多维空间划分成组等问题属于数据挖掘的哪一类任务?B探索性数据分析建模描述预测建模寻找模式和规则建立一个模型, 通过这个模型根据已知的变量值来预测其他某个变量值属于数据挖掘的哪一类任务? C根据内容检索建模描述预测建模寻找模式和规则用户有一种感兴趣的模式并且希望在数据集中找到相似的模式,属于数据挖掘哪一类任务?根据内容检索建模描述预测建模寻找模式和规

3、则10.下面哪种不属于数据预处理的方法?D变量代换离散化聚集估计遗漏值11. 假设 12 个销售价格记录组已经排序如下:5, 10, 11, 13, 15,35, 50, 55, 72, 92, 204, 215每种方法将它们划分成四个箱。等频(等深)划分时,15 在第几个箱子内?B A第一个使用如下B 第二个C 第三个D 第四个12.上题中,等宽划分时(宽度为50),15又在哪个箱子里?AA 第一个B 第二个C 第三个D 第四个13.下面哪个不属于数据的属性类型:DA 标称B 序数C 区间D 相异在上题中,属于定量的属性类型是: C A 标称序数区间相异15.只有非零值才重要的二元属性被称作

4、:C计数属性离散属性非对称的二元属性对称属性16.以下哪种方法不属于特征选择的标准方法:D嵌入过滤包装抽样下面不属于创建新属性的相关方法的是:特征提取特征修改映射数据到新的空间特征构造考虑值集 1 、2、3、4、5、90 ,其截断均值( p=20% )是 CA 2 B 3 C 3.5 D 51 9 . 下面哪个属于映射数据到新的空间的方法?A傅立叶变换特征加权渐进抽样维归约20. 熵是为消除不确定性所需要获得的信息量,投掷均匀正六面体骰子的熵是:A1 比特B 2.6比特C 3.2比特D 3.8比特B21. 假设属性映射到 0至1income 的最大最小值分别是的范围内。对属性income120

5、00的 73600元和 98000 元。利用最大最小规范化的方法将属元将被转化为: D性的值0.8211.2241.4580.716假定用于分析的数据包含属性age。数据元组中 age 的值如下(按递增序): 13, 15, 16, 16,19, 20, 20, 21, 22, 22, 25, 25, 25, 30, 33, 33, 35, 35, 36, 40, 45, 46, 52, 70, 问题: 使用按箱平均值平滑方法对上述数据进行平滑 , 箱的深度为 3。第二个箱子值为: A18.322.626.827.923. 考虑值集 12 24 33 2 4 55 68 26 ,其四分位数极差

6、是:A312455324. 一所大学内的各年纪人数分别为:一年级 200 人, 二年级 160 人, 三年级 130 人, 四年级 110 人。则年级属性的众数是:A一年级二年级三年级四年级25.下列哪个不是专门用于可视化时间空间数据的技术:B等高线图饼图曲面图矢量场图26.在抽样方法中,当合适的样本容量很难确定时,可以使用的抽样方法是:D有放回的简单随机抽样无放回的简单随机抽样分层抽样渐进抽样27.数据仓库是随着时间变化的, 下面的描述不正确的是CA.数据仓库随时间的变化不断增加新的数据内容;B.捕捉到的新数据会覆盖原来的快照;C.数据仓库随事件变化不断删去旧的数据内容;D.数据仓库中包含大

7、量的综合数据,这些综合数据会随着时间的变化不断地进行重新综合.28. 关于基本数据的元数据是指 : DA.基本元数据与数据源 , 数据仓库 , 数据集市和应用程序等结构相关的信息 ;B.基本元数据包括与企业相关的管理方面的数据和信息;C.基本元数据包括日志文件和简历执行处理的时序调度信息;D.基本元数据包括关于装载和更新处理,分析处理以及管理方面的信息.下面关于数据粒度的描述不正确的是 : C数据越详细 , 粒度就越小 ,级别也就越高 ;数据综合度越高 ,粒度也就越大 ,级别也就越高 ;粒度的具体划分将直接影响数据仓库中的数据量以及查询质量有关数据仓库的开发特点 , 不正确的描述是 : A A. 数据仓库开发要从数据出发 ;B.

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论