版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
DataFrame与SparkSQL编程DataFrame与SparkSQLnameage第1步:制作“表头”第2步:制作“表中的记录”“Grace”29“Andy”30“John”19第3步:将表头和表中的记录拼装在一起nameage“Grace”29“Andy”30“John”19DataFrame与SparkSQL1导入相应的包scala>importorg.apache.spark.sql.types._importorg.apache.spark.sql.types._
scala>importorg.apache.spark.sql.Rowimportorg.apache.spark.sql.Row
DataFrame与SparkSQL2加载文件生成RDD//生成RDDscala>valpeopleRDD=spark.sparkContext.textFile("file:///usr/local/spark/examples/src/main/resources/people.txt")DataFrame与SparkSQL3制作表头
scala>valschemaString="nameage"
//根据模式字符串生成模式scala>valfields=schemaString.split("").map(fieldName=>StructField(fieldName,StringType,nullable=true))scala>valschema=StructType(fields)//从上面信息可以看出,schema描述了模式信息,模式中包含name和age两个字段
DataFrame与SparkSQL4对peopleRDD的每一行元素进行解析,将表头和表记录拼装起来scala>valrowRDD=peopleRDD.map(_.split(",")).map(attributes=>Row(attributes(0),attributes(1).trim))rowRDD:org.apache.spark.rdd.RDD[org.apache.spark.sql.Row]=MapPartitionsRDD[3]atmapat<console>:29
scala>valpeopleDF=spark.createDataFrame(rowRDD,schema)DataFrame与SparkSQL5注册为临时表供SQL查询使用//必须注册为临时表才能供下面查询使用scala>peopleDF.createOrReplaceTempView("people")scala>valresults=spark.sql("SELECTname,ageFROMpeople")results:org.apache.spark.sql.DataFrame=[name:string,age:string]
scala>results.map(attributes=>"name:"+attributes(0)+","+"age:"+attributes(1)).show()DataFrame与SparkSQL6显示查询结果一个小例子1导入相应的包importorg.apache.spark.sql.SparkSessionimportorg.apache.spark.sql.types.{IntegerType,StringType,StructField,StructType}一个小例子2制作表头valspark=SparkSession.builder().master("local").appName("dateprocess").getOrCreate()valschema=StructType(List(StructField("user_id",IntegerType),StructField("item_id",IntegerType),StructField("category_id",IntegerType),StructField("behavior",StringType)))一个小例子3生成DataFramevaldf=spark.read.format("com.databricks.spark.csv").schema(schema).option("header","false").load("hdfs://localhost:9000/dbtaobao/dataset/user_behavior/UserBehavior.csv")一个小例子4注册为临时表供SQL查询使用//必须注册为临时表才能供下面查询使用df.createOrReplaceTempView("user_behavior")//统计页面浏览量valbehavior_df=spark.sql("selectuser_id,count(if(beha
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- 2026年客户数据清洗合同协议
- 演出合同表演者义务与报酬协议
- 2026年全国法制宣传日五五普法知识竞赛试题及答案
- 2026年度全国消防安全知识竞赛试题及答案
- 慢病防控循证实践:个体化证据应用与群体化策略推广
- 慢病防控中健康促进的精准化策略
- 慢病管理健康促进与医疗产业生态联动策略
- 学校综合办公室专业素养培养计划
- 服务费用退还协议书
- 学校综合办公室信息资源整合方案
- 2026年及未来5年市场数据中国塑料型材行业市场深度分析及行业发展趋势报告
- 脑病康复科护理健康宣教
- IE七大工具培训
- 修坟墓合同协议
- 墓碑定做合同范本
- 山东大学硕士学位论文格式模板
- 病理报告撰写规范指南
- 机器人直销合同范本
- 河南青铜鸣大联考2025-2026学年上学期高二期中考试物理(A)试卷(含解析)
- 2025年科技馆临时展览合同协议
- 《物联网工程项目管理》课程标准
评论
0/150
提交评论