Hadoop环境下基于SparkSQL海量自动站数据查询统计初探 |
| |
引用本文: | 黄志,詹利群,任晓炜,李涛.Hadoop环境下基于SparkSQL海量自动站数据查询统计初探[J].气象科技,2019,47(5):768-772. |
| |
作者姓名: | 黄志 詹利群 任晓炜 李涛 |
| |
作者单位: | 广西区气象信息中心,南宁 530022,广西区气象信息中心,南宁 530022,广西区气象信息中心,南宁 530022,广西区气象信息中心,南宁 530022 |
| |
基金项目: | 国家档案局项目(2016 X 06)“基于 Hadoop大数据处理的广西气象数字档案馆建设”资助 |
| |
摘 要: | 在Hadoop分布式计算和存储架构下,自定义ETL数据清洗规则将海量自动站小时单站文件按所属年和站号合并为大文件流转存储至HDFS中,并运用SparkSQL并行计算框架进行统计处理生成常用气象要素日统计值。结果表明,数据处理和获取时效较关系型数据库方式有显著提升。采用SparkSQL并行计算框架对多气象要素多站点和长时间序列进行数据统计处理查询均能达到秒级别响应,并随着统计站点数的不断增加和时间跨度的延长其优势更为明显,能更高效地支撑此类气象数据服务,为海量气象数据处理从关系型数据库到大数据分布式架构的转换处理提供了新思路。
|
关 键 词: | Hadoop HDFS SparkSQL ETL |
收稿时间: | 2018/4/8 0:00:00 |
修稿时间: | 2019/5/21 0:00:00 |
本文献已被 CNKI 等数据库收录! |
| 点击此处可从《气象科技》浏览原始摘要信息 |
| 点击此处可从《气象科技》下载免费的PDF全文 |
|