版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
1、大数据关键技术大数据关键技术大数据技术,就是从各种类型的数据中快速获得有价值信息的技术。大 数 据领域已经涌现岀了大量新的技术,它们成为大数据采集、存储、处理 和呈现 的有力武器。大数据处理关键技术一般包扌 4 大数据采集、大数据预处理、大数据 存储 及管理、大数据分析及挖掘、 大数据展现和应用 大数据检索、 大数 据可视化、 大数据应用、大数据平安等。一、大数据采集技术数据是指通过 RFID 射频数据、传感器数据、社交网络交互数据及移动 互联 网数据等方式获得的各种类型的结构化、半结构化或称之为弱结构 化及非 结构化的海量数据,是大数据知识效劳模型的根木。重点要突破 分布式高速高 可靠数据爬
2、取或采集、 高速数据全映像等大数据收集技 术;突破高速数据解析、 转换与装载等大数据整合技术;设计质量评估 模型,开发数据质量技术。大数据采集一般分为大数据智能感知层:主要包扌舌数据传感体系、网 络 通信体系、传感适配体系、智能识别体系及软硬件资源接入系统,实现 对结构 化、半结构化、 非结构化的海量数据的智能化识别、 定位、跟踪、 接入、传输、 信号转换、监控、初步处理和管理等。 必须着重攻克针对大 数据源的智能识别、 感知、适配、传输、接入等技术。根底支撐层:提供 大数据效劳平台所需的虚 拟效劳器,结构化、半结构化及非结构化数据的 数据库及物联网络资源等根底 支撐环境。重点攻克分布式虚拟存
3、储技术, 大数据获取、存储、组织、分析和 决策操作的可视化接口技术,大数据的 网络传输与压缩技术,大数据隐私保护技术等二、大数据预处理技术主要完成对己接收数据的辨析、抽取、清洗等操作。 1抽取:因获取 的 数据可能具有多种结构和类型,数据抽取过程可以帮助我们将这些复杂 的数据 转化为单一的或者便于处理的构型,以到达快速分析处理的目的。 2清洗:对于大数据,并不全是有价值的, 有些数据并不是我们所关心的 内容, 而另一些数据那么是完全错误的干扰项,因此要对数据通过过滤“去 噪从而提 取出有效数据。三、大数据存储及管理技术大数据存储与管理要用存储器把采集到的数据存储起来,建立相应的数 据 库,并进
4、行管理和调用。重点解决复朵结构化、半结构化和非结构化大 数据管 理与处理技术。主要解决大数据的可存储、可表示、可处理、可靠 性及有效传 输等几个关键问题。开发可靠的分布式文件系统DFS、能效优化的存储、计 算融入存储、大数据的去冗余及高效低成木的大数据 存储技术;突破分布式非 关系型大数据管理与处理技术,异构数据的数 据融合技术,数据组织技术,研 究大数据建模技术;突破大数据索引技 术;突破大数据移动、备份、复制等技 术;开发大数据可视化技术。开发新型数据库技术,数据库分为关系型数据库、非关系型数据库以 及数 据库缓存系统。其中,非关系型数据库主要指的是 NoSQl数据库,分为:键值 数据库、
5、列存数据库、图存数据库以及文档数据库等类型。关系 型数据库包含 了传统关系数据库系统以及NewSQ数据库。开发大数据平安技术。改进数据销毁、透明加解密、分布式访问控 制、数据审计等技术;突破隐私保护和推理控制、数据真伪识别和取 证、数据持有完 整性验证等技术。四、大数据分析及挖掘技术大数据分析技术。 改进己有数据挖掘和机器学习技术; 开发数据网 络挖掘、 特异群组挖掘、图挖掘等新型数据挖掘技术;突破基于对象的 数据连接、相似 性连接等大数据融合技术;突破用户兴趣分析、网络行 为分析、情感语义分析 等面向领域的大数据挖掘技术。数据挖掘就是从大量的、不完全的、有噪声的、模糊的、随机的实际应 用 数
6、据中,提取隐含在其中的、人们事先不知道的、但又是潜在有用的信 息和知 识的过程。数据挖掘涉及的技术方法很多,有多种分类法。根据挖 掘任务可分 为分类或预测模型发现、数据总结、聚类、关联规那么发现、序 列模式发现、依 赖关系或依赖模型发现、异常和趋势发现等等;根据挖掘 对象可分为关系数据 库、面向对象数据库、 空间数据库、时态数据库、文 本数据源、多媒体数据库、 异质数据库、遗产数据库以及环球网 Web根据挖掘方法分,可粗分为:机器学 习方法、统计方法、神经网络方法和数据库 方法。机器学习中,可细分为 : 归纳 学习方法决策树、 规那么归纳等 、基于 范例学习、 遗传算法等。统计方法中, 可细分
7、为:回归分析多元回归、自 回归等、判别分析贝叶斯判别、费歇 尔判别、非参数判别等、聚类分析 系统聚类、动态聚类等、探索性分析 主元分析法、相关分析法等等。 神经网络方法中,可细分为 : 前向神经网络BP算法等、自组织神经网络 自组织特征映射、竞争学习等等。数据库 方法主要是多维数据分析或OLAP方法,另外还有而向属性的归纳方法。从挖掘任务和挖掘方法的角度,着重突破: 1?可视化分析。数据可视化 无论对于普通用户或是数据分析专家,都是最根本的功能。数据图像化可 以让数 据自己说话,让用户直观的感受到结果。 2. 数据挖掘算法。图像化 是将机器语 言翻译给人看,而数据挖掘就是机器的母语。分割、集群
8、、孤 立点分析还有各 种各样五花八门的算法让我们精炼数据,挖掘价值。这些 算法一定要能够应付 大数据的量,同时还具有很高的处理速度。 3. 预测性 分析。预测性分析可以让 分析师根据图像化分析和数据挖掘的结果做岀一些前瞻性判断。 4. 语义引擎。语义引擎需要设计到有足够的人工智能以足 以从数据中主动地提取信息。语言 处理技术包括机器翻译、情感分析、舆 情分析、智能输入、问答系统等。 5. 数 据质量和数据管理。数据质量与管 理是管理的最正确实践,透过标准化流程和机 器对数据进行处理可以确保获 得一个预设质量的分析结果。六、大数据展现与应用技术 大数据技术能够将隐藏于海量数据中的信息和知识挖掘出来,为人类的 社 会经济活动提供依据,从而提高各个领域的运行效率,大大提高整个社 会经济 的集约化程度。在我国,大数据将重点应用于以下三大领域:商业 智能、政府 决策、公共效劳。例如:商业智能技术,政府决策技术,电信 数据信息处理与 挖掘技术,电网数据信息处理与挖掘技术, 气象信息
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- 双组份市场调查研究报告
- 2024至2030年中国酶退浆剂数据监测研究报告
- 2024年造纸检测仪器项目评价分析报告
- 2024至2030年中国腌制食用菌数据监测研究报告
- 2024至2030年中国磨瓦楞机辊砂轮行业投资前景及策略咨询研究报告
- 2024至2030年中国生物识别指纹考勤机行业投资前景及策略咨询研究报告
- 2024至2030年中国滚筒式检测线数据监测研究报告
- 2024至2030年中国气球插花行业投资前景及策略咨询研究报告
- 2024至2030年中国插头桐木床行业投资前景及策略咨询研究报告
- 2024至2030年中国定焦盘拉板式信号灯座行业投资前景及策略咨询研究报告
- 海南省海口市2023-2024学年九年级上学期期末语文试题B卷(解析版)
- 2024年度生产设备操作安全协议
- 城市公共交通条例
- 第5课用发展的观点看问题2023-2024学年中职高教版2023哲学与人生
- 2021大学生个人职业生涯规划书6篇
- 24秋国家开放大学《计算机系统与维护》实验1-13参考答案
- 2024仁爱版初中英语单词表(七-九年级)中考复习必背
- 2024届高三英语二轮复习:读后续写 告别鹦鹉 讲义素材
- 《教师专业发展》课件
- 工程勘察设计收费标准快速计算表(EXCEL)
- 光荣升旗手PPT课件
评论
0/150
提交评论