本文作者:kris

Spark SQL常见4种数据源详解-spark sql支持的数据源

kris 2025-02-02 23:06:04 2
Spark SQL常见4种数据源详解-spark sql支持的数据源摘要: mysql作为数据源可否直接用spark处理?谢邀,Spark通过Jdbc来查询来自RDB的数据源。但是Spark对Jdbc的支持也是一个逐渐演变的过程,其中关键点在于版本1.3,...

mysql作为数据源可否直接用spark处理?

谢邀,Spark通过Jdbc来查询来自RDB的数据源。但是Spark对Jdbc的支持也是一个逐渐演变的过程,其中关键点在于版本1.3,也就是data frame的引入。在1.3以前,Spark通过Jdbc RDD来处理对对Jdbc的查询。它实现了标准的RDD接口,比如支持partition和compute。但是对很多用户来说,还是太复杂了。从1.3 起,可以直接用DF接口来做同样的事情。比如以下代码就可以完成对一个RDB表的查询

Spark SQL常见4种数据源详解-spark sql支持的数据源

图片来源:网络

可以看到,不管数据来自什么数据源(hive,parquet, 甚至NoSql),引入data frame以后,它的代码是非常相似的,得到的结果都是dataframe,你尽可以把它们揉在一起。至于data frame内部是如何支持多种数据源的,以及如何优化,我再去看看源代码。

文章版权及转载声明

作者:kris本文地址:https://www.damoyx.com/p/29932.html发布于 2025-02-02 23:06:04
文章转载或复制请以超链接形式并注明出处大漠游侠网

阅读
分享