网站建设 >

查看其它板块

SparkSQL性能优化

==> 在内存中缓存数据

我们提供的服务有：成都网站设计、成都做网站、微信公众号开发、网站优化、网站认证、沙湾ssl等。为成百上千企事业单位解决了网站和推广的问题。提供周到的售前咨询和贴心的售后服务，是有科学管理、有技术的沙湾网站制作公司

---> 性能调优主要是将数据放入内存中操作

---> 使用例子：

// 从 Oracle 数据库中读取数据，生成 DataFrame
val oracleDF = spark.read.format("jdbc")
        .option("url", "jdbc:oracle:thin:@192.168.10.100:1521/orcl.example.com")
        .option("dbtable", "scott.emp")
        .option("user", "scott")
        .option("password", "tiger").load
        
// 将 DataFrame 注册成表
oracleDF.registerTempTable("emp")

// 执行查询，并通过 Web Console 监控执行的时间
spark.sql("select * from emp").show

// 将表进行缓存，并查询两次，通过 Web Console 监控执行的时间
spark.sqlContext.cacheTable("emp")

// 清空缓存
spark.sqlContext.cacheTable("emp")
spark.sqlContext.clearCache

==> 优化相关参数

---> spark.sql.inMemoryColumnarStorage.compressed

---- 默认值： true

---- Spark SQL 将会基于统计信息自动地为每一列选择一种压缩编码方式

---> spark.sql.inMemoryColumnarStorage.batchSize

---- 默认值： 10000

---- 缓存批处理大小，较大的批处理可以提高内存利用率和压缩率，但同时也会带来 OOM(Out Of Memory)的风险

---> spark.sql.files.maxPartitionBytes

---- 默认值： 128M

---- 读取文件时单个分区可容纳的最大字节数

---> spark.sql.files.openCostinBytes

---- 默认值： 4M

---- 打开文件的估算成本，按照同一时间能够扫描的字节数来测量，当往一个分区写入多个文件时会使用，高估相对较好，这样小文件分区将会比大文件分区速度更快（优先调度）

---> spark.sql.autoBroadcastJoinThreshold

---- 默认值：10M

---- 用于配置一个表在执行 join 操作时能够广播给所有 worker 节点的最大字节大小，通地将这个值设置为-1可以禁用广播，

---- 注意：当前数据统计仅支持已经运行了 ANALYZE TABLE COMPUTE STATISTICS noscan 命令的 Hive Metastore 表

---> spark.sql.shuffle.partitions

---- 默认值： 200

---- 用于配置 join 或聚合操作混洗（shuffle）数据时使用的分区数

分享标题：SparkSQL性能优化
网页路径：http://www.cdkjz.cn/article/pdepij.html

返回首页了解更多建站资讯

多年建站经验

多一份参考，总有益处

联系快上网，免费获得专属《策划方案》及报价

咨询相关问题或预约面谈，可以通过以下方式与我们联系

大客户专线成都：13518219792 座机：028-86922220

在线咨询提交需求

友情链接交换友情链接

手机网站开发成都外贸网站建设郫县网站建设成都发电机组维修保养公司成都门户网站建设设计方案雷运建站成都广告设计大邑珉田数据中心都江堰做网站成都响应式网站建设公司

成都网站建设公司地址：成都市青羊区太升南路288号锦天国际A座10层建设咨询028-86922220

专家团队为您提供成都网站建设,成都网站设计,成都品牌网站设计,成都营销型网站制作等服务,成都建网站就找快上网！ | 成都网站建设哪家好？ | 网站建设地图

网站建设

网站推广

案例

方案

电商网站开发

微信小程序

我们

联系

精准传达 • 有效沟通

查看其它板块

SparkSQL性能优化

多一份参考，总有益处

联系快上网，免费获得专属《策划方案》及报价

大客户专线成都：13518219792 座机：028-86922220

友情链接交换友情链接

网络推广

Network promotion

网站方案

Solution

电商网站开发

E-commerce & System

我们

About Us

联系

Contact Us

精准传达 • 有效沟通

查看其它板块

SparkSQL性能优化

相关资讯

php表单提交数据 php提交post数据

php返回数据大 php返回值

mysql源代码怎么查看 mysql源码在哪里

linux启动浏览器命令 linux打开浏览器

go语言结构体的方法 go 结构体实现接口

python微信函数 python一微信

linux性能测试命令 linux常用的性能测试工具

linux终端命令自定义 linux 自定义命令

多一份参考，总有益处

联系快上网，免费获得专属《策划方案》及报价

大客户专线 成都：13518219792 座机：028-86922220

友情链接 交换友情链接

大客户专线成都：13518219792 座机：028-86922220

友情链接交换友情链接