首页 | 本学科首页   官方微博 | 高级检索  
     检索      

Hadoop环境下基于SparkSQL海量自动站数据查询统计初探
引用本文:黄志,詹利群,任晓炜,李涛.Hadoop环境下基于SparkSQL海量自动站数据查询统计初探[J].气象科技,2019,47(5):768-772.
作者姓名:黄志  詹利群  任晓炜  李涛
作者单位:广西区气象信息中心,南宁 530022,广西区气象信息中心,南宁 530022,广西区气象信息中心,南宁 530022,广西区气象信息中心,南宁 530022
基金项目:国家档案局项目(2016 X 06)“基于 Hadoop大数据处理的广西气象数字档案馆建设”资助
摘    要:在Hadoop分布式计算和存储架构下,自定义ETL数据清洗规则将海量自动站小时单站文件按所属年和站号合并为大文件流转存储至HDFS中,并运用SparkSQL并行计算框架进行统计处理生成常用气象要素日统计值。结果表明,数据处理和获取时效较关系型数据库方式有显著提升。采用SparkSQL并行计算框架对多气象要素多站点和长时间序列进行数据统计处理查询均能达到秒级别响应,并随着统计站点数的不断增加和时间跨度的延长其优势更为明显,能更高效地支撑此类气象数据服务,为海量气象数据处理从关系型数据库到大数据分布式架构的转换处理提供了新思路。

关 键 词:Hadoop    HDFS    SparkSQL    ETL
收稿时间:2018/4/8 0:00:00
修稿时间:2019/5/21 0:00:00
本文献已被 CNKI 等数据库收录!
点击此处可从《气象科技》浏览原始摘要信息
点击此处可从《气象科技》下载免费的PDF全文
设为首页 | 免责声明 | 关于勤云 | 加入收藏

Copyright©北京勤云科技发展有限公司  京ICP备09084417号