大数据采集专项职业能力考核规范

一、定义

运用工具从传感器、社交网络及互联网等方式获得各种类型的结构化、半结构化已经非结构化的海量数据的能力

二、适用对象

运用或准备运用本项技能求职、就业的人员。

三、能力标准与鉴定内容

能力名称:大数据采集                        职业领域:数据分析处理工程技术人员

工作任务

操作规范

相关知识

考核比重

(一)

安装部署操作系统及服务

1.安装WindowsLinux操作系统

2.掌握Linux系统基本命令

3.能在WindowsLinux上安装、配置防火墙

4.能在WindowsLinux上进行包括文件管理、系统进行库配置、管理、差错、保证各种自带和薪安装的系统服务正常运行

1.WindowsLinux操作系统基础知识及安装步骤操作

2.虚拟机原理

3.Linux基本命令使用

4.基本的防火墙知识和系统自带防火墙的基本配置

5.Shell脚本的基本知识,文件管理、库管理、库依赖关系等Shell命令

10

()

采集数据

1.能安装部署非关系型数据库RedisMongoDBHBASEhive

2.能使用非关系型数据库直接进行数据的采集

1.非关系型数据库的基本知识及安装配置知识

2.非关系型数据库的存储原理

3.非关系型数据库语言

20

(三)

搭建分布式系统

1.能够搭建和部署分布式系统

2.能够运行使用分布式系统

3.能够实现大数据的分布式存储

1.分布式系统的基础原理

2.分布式架构体系

3.分布式系统的运行方式

4.分布式系统存储原理

10

(四)

采集系统日志

1.能利用FlumeScribe等系统采集日志数据

2.能利用JS采集浏览器页面日志数据(包括浏览日志、交互操作日志等)

3.能利用SDK采集APP客户端的数据采集

1.FlumeScribe基础知识

2.FlumeScribe采集日志方法

3.JS基础编程

4.JS采集数据方法

5.SDK采集数据的原理及方法

20

(五)

搭建

Python

开发环境

1.能搭建Python开发环境用IDE编写Python代码

2.会使用Python语言工具掌握面向对象编程使用Python连接数据库

3.能处理出现的错误及异常

1.Python编程基础

流程控制与数组

文件处理

2.面向对象及方法重载Python连接数据库方法

3.并发编程

10

(六)

采集网络

数据

1.能利用Python爬取网站数据

2.能利用分布式爬虫框架Apache Nutch进行分布式获取网页数据

3.能使用Crawler4jScrapy爬虫框架提供的API爬取数据

4.能利用网站平台提供的公共API获取数据

1.分布式爬虫框架Apache Nutch的原理及体系

2.Crawler4jScrapy爬虫框架的原理

3.http基本原理与网页基础

4.Python爬虫原理及流程

20

(七)

存储数据

1.能够安装部署关系型数据库MySQLOracleSQL Server

2. 数据库的系统配置,包括连接设置、线程设置等

3.能配置分布式数据仓库hivehbase

4.能将采集的数据存储到数据库

1.数据库的基础知识、安装操作及服务配置知识

2.数据库的系统管理指令

3.Hbase工作原理及基本操作方法

4.Hbase工作原理及基本操作方法

10


四、鉴定要求

(一)申报条件

达到法定劳动年龄,取得高中(或同等学历,含尚未取得毕业证书的中专、技校、技师学院的应届毕业生)及以上学历,具有计算机操作能力的人员。

(二)考评员构成

考评员具备大数据采集的理论知识和实践操作能力;每个考评组不少于3名考评员。

(三)鉴定方式与鉴定时间

技能操作考核采取现场上机操作方式。

技能考试时间为120min

(四)鉴定场地设备要求

考场面积不小于60㎡,操作场地光线充足,整洁无干扰,满足技能鉴定需要的软硬件环境,包括台式计算机(内存16GB,至少具备两套操作系统)、光纤交换机、核心交换机、边界防火墙,水电等基础设施良好。