Pyspark读取parquet数据过程的示例分析-创新互联-快上网网站建设公司

Pyspark读取parquet数据过程的示例分析-创新互联

这篇文章主要介绍了Pyspark读取parquet数据过程的示例分析，具有一定借鉴价值，感兴趣的朋友可以参考下，希望大家阅读完这篇文章之后大有收获，下面让小编带着大家一起了解一下。

成都创新互联公司专注于常山企业网站建设,响应式网站建设,商城建设。常山网站建设公司,为常山等地区提供建站服务。全流程定制网站设计，专业设计，全程项目跟踪，成都创新互联公司专业和态度为您提供的服务

parquet数据：列式存储结构，由Twitter和Cloudera合作开发，相比于行式存储，其特点是：

可以跳过不符合条件的数据，只读取需要的数据，降低IO数据量；压缩编码可以降低磁盘存储空间，使用更高效的压缩编码节约存储空间；只读取需要的列，支持向量运算，能够获取更好的扫描性能。

那么我们怎么在pyspark中读取和使用parquet数据呢？我以local模式，linux下的pycharm执行作说明。

首先，导入库文件和配置环境：

import os
from pyspark import SparkContext, SparkConf
from pyspark.sql.session import SparkSession

os.environ["PYSPARK_PYTHON"]="/usr/bin/python3" #多个python版本时需要指定

conf = SparkConf().setAppName('test_parquet')
sc = SparkContext('local', 'test', conf=conf)
spark = SparkSession(sc)

然后，使用spark进行读取，得到DataFrame格式的数据：host:port 属于主机和端口号

parquetFile = r"hdfs://host:port/Felix_test/test_data.parquet"
df = spark.read.parquet(parquetFile)

而，DataFrame格式数据有一些方法可以使用，例如：

1.df.first() ：显示第一条数据，Row格式

print(df.first())

Pyspark读取parquet数据过程的示例分析

2.df.columns：列名

3.df.count()：数据量，数据条数

4.df.toPandas()：从spark的DataFrame格式数据转到Pandas数据结构

5.df.show()：直接显示表数据；其中df.show(n) 表示只显示前n行信息

6.type(df)：显数据示格式

Pyspark读取parquet数据过程的示例分析

感谢你能够认真阅读完这篇文章，希望小编分享的“Pyspark读取parquet数据过程的示例分析”这篇文章对大家有帮助，同时也希望大家多多支持创新互联，关注创新互联行业资讯频道，更多相关知识等着你来学习!

文章名称：Pyspark读取parquet数据过程的示例分析-创新互联
本文网址：http://www.cdkjz.cn/article/jeehc.html

多年建站经验

多一份参考，总有益处

联系快上网，免费获得专属《策划方案》及报价

咨询相关问题或预约面谈，可以通过以下方式与我们联系

网站建设

网站推广

案例

方案

电商网站开发

微信小程序

我们

联系

精准传达 • 有效沟通

查看其它板块

Pyspark读取parquet数据过程的示例分析-创新互联

多一份参考，总有益处

联系快上网，免费获得专属《策划方案》及报价

大客户专线成都：13518219792 座机：028-86922220

友情链接交换友情链接

网络推广

Network promotion

网站方案

Solution

电商网站开发

E-commerce & System

我们

About Us

联系

Contact Us

精准传达 • 有效沟通

查看其它板块

Pyspark读取parquet数据过程的示例分析-创新互联

相关资讯

全自动录播系统

印度若想发展人工智能，还有人才和数据两座大山翻不过

抽象圣经的意思

如皋是哪里(南通到南京多远)

新手建设网站要做好这些有哪些制作方法

为什么企业需要把所有东西都移动到云？

判断服务器好坏的标准是什么

夷陵之战中朱然死后，陆逊为何就撤兵了？

多一份参考，总有益处

联系快上网，免费获得专属《策划方案》及报价

大客户专线 成都：13518219792 座机：028-86922220

友情链接 交换友情链接

大客户专线成都：13518219792 座机：028-86922220

友情链接交换友情链接