




版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
大数据分析与挖掘主讲教师:贺萌《大数据导论》课程Introductiontobigdata使用Pandas进行数据分析读写数据01文本文件是一种由若干行字符构成的计算机文件,它是一种典型的顺序文件,常见的txt文件就是文本文件。csv是一种逗号分隔的文件格式,因为其分隔符不一定是逗号,又被称为字符分隔文件,文件以纯文本形式存储表格数据(数字和文本)。文本文件读取使用read_table来读取文本文件。pandas.read_table(filepath_or_buffer,sep=’\t’,header=’infer’,names=None,index_col=None,dtype=None,engine=None,nrows=None)使用read_csv函数来读取csv文件。pandas.read_csv(filepath_or_buffer,sep=’\t’,header=’infer’,names=None,index_col=None,dtype=None,engine=None,nrows=None)文本文件读取文本文件读取read_table和read_csv常用参数及其说明。参数名称说明filepath接收string。代表文件路径。无默认。sep接收string。代表分隔符。read_csv默认为“,”,read_table默认为制表符“[Tab]”。header接收int或sequence。表示将某行数据作为列名。默认为infer,表示自动识别。names接收array。表示列名。默认为None。index_col接收int、sequence或False。表示索引列的位置,取值为sequence则代表多重索引。默认为None。dtype接收dict。代表写入的数据类型(列名为key,数据格式为values)。默认为None。engine接收c或者python。代表数据解析引擎。默认为c。nrows接收int。表示读取前n行。默认为None。文本文件储存文本文件的存储和读取类似,结构化数据可以通过DataFrame的to_csv方法实现以csv文件格式存储数据。DataFrame.to_csv(path_or_buf=None,sep=’,’,na_rep=”,columns=None,header=True,index=True,index_label=None,mode=’w’,encoding=None)文本文件储存参数名称说明参数名称说明path_or_buf接收string。代表文件路径。无默认。index接收boolean,代表是否将行名(索引)写出。默认为True。sep接收string。代表分隔符。默认为“,”。index_labels接收sequence。表示索引名。默认为None。na_rep接收string。代表缺失值。默认为“”。mode接收特定string。代表数据写入模式。默认为w。columns接收list。代表写出的列名。默认为None。encoding接收特定string。代表存储文件的编码格式。默认为None。header接收boolean,代表是否将列名写出。默认为True。Excel文件读取pandas提供了read_excel函数来读取“xls”“xlsx”两种Excel文件。pandas.read_excel(io,sheetname=0,header=0,index_col=None,names=None,dtype=None)Excel文件读取参数名称说明io接收string。表示文件路径。无默认。sheetname接收string、int。代表excel表内数据的分表位置。默认为0。header接收int或sequence。表示将某行数据作为列名。默认为infer,表示自动识别。names接收int、sequence或者False。表示索引列的位置,取值为sequence则代表多重索引。默认为None。index_col接收int、sequence或者False。表示索引列的位置,取值为sequence则代表多重索引。默认为None。dtype接收dict。代表写入的数据类型(列名为key,数据格式为values)。默认为None。Excel文件储存将数据存储为Excel文件,可以使用to_excel方法。其语法格式如下。DataFrame.to_excel(excel_writer=None,sheetname=None’,na_rep=”,header=True,index=True,index_label=None,mode=’w’,encoding=None)与to_csv方法的常用参数基本一致,区别之处在于指定存储文件的文件
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- 2024年海南澄迈教师招聘真题
- 河南省豫地科技集团招聘笔试真题2024
- 石大学前儿童保育学课件3-1常见病之疾病早发现
- 教学设计太原幼儿师范李慧芳26日改
- 职业教育产教融合实训基地建设项目可行性研究报告
- 跨学科教学视野下的高中语文评价体系创新
- 2025至2030年中国电动木铣行业投资前景及策略咨询报告
- 2025至2030年中国玻璃钢四连体桌行业投资前景及策略咨询报告
- 持续创新驱动下的绿色工业人才培养与合作
- 2025至2030年中国涤棉漂白布行业投资前景及策略咨询报告
- 参观河南省博物院
- 中国公民健康素养66条知识答题(试题及答案)
- 2024年一级注册计量师计量专业案例分析考试真题及答案
- 广东省佛山市南海区桂城街道2023-2024学年四年级下学期期末英语试卷
- 《财务会计基础》课件-错账更正
- 2024项目投资协议书
- 中考数学计算题练习100道(2024年中考真题)
- 统编版语文二年级上册8古诗二首 望庐山瀑布 公开课一等奖创新教学设计
- 自动控制原理 第3版 课件全套 陶洪峰 第1-8章 概论、控制系统数学模型-线性离散系统分析
- 2024年乌鲁木齐县国有资产投资有限责任公司招聘笔试冲刺题(带答案解析)
- 2024-2030年中国机器人关节模组行业市场竞争态势及前景战略研判报告
评论
0/150
提交评论