大数据采集专项职业能力考核规范
一、定义
运用工具从传感器、社交网络及互联网等方式获得各种类型的结构化、半结构化已经非结构化的海量数据的能力。
二、适用对象
运用或准备运用本项技能求职、就业的人员。
三、能力标准与鉴定内容
|
能力名称:大数据采集 职业领域:数据分析处理工程技术人员 |
|||
|
工作任务 |
操作规范 |
相关知识 |
考核比重 |
|
(一) 安装部署操作系统及服务 |
1.安装Windows、Linux操作系统 2.掌握Linux系统基本命令 3.能在Windows、Linux上安装、配置防火墙 4.能在Windows、Linux上进行包括文件管理、系统进行库配置、管理、差错、保证各种自带和薪安装的系统服务正常运行 |
1.Windows、Linux操作系统基础知识及安装步骤操作 2.虚拟机原理 3.Linux基本命令使用 4.基本的防火墙知识和系统自带防火墙的基本配置 5.Shell脚本的基本知识,文件管理、库管理、库依赖关系等Shell命令 |
10% |
|
(二) 采集数据 |
1.能安装部署非关系型数据库Redis、MongoDB、HBASE、hive等 2.能使用非关系型数据库直接进行数据的采集 |
1.非关系型数据库的基本知识及安装配置知识 2.非关系型数据库的存储原理 3.非关系型数据库语言 |
20% |
|
(三) 搭建分布式系统 |
1.能够搭建和部署分布式系统 2.能够运行使用分布式系统 3.能够实现大数据的分布式存储 |
1.分布式系统的基础原理 2.分布式架构体系 3.分布式系统的运行方式 4.分布式系统存储原理 |
10% |
|
(四) 采集系统日志 |
1.能利用Flume、Scribe等系统采集日志数据 2.能利用JS采集浏览器页面日志数据(包括浏览日志、交互操作日志等) 3.能利用SDK采集APP客户端的数据采集 |
1.Flume、Scribe基础知识 2.Flume、Scribe采集日志方法 3.JS基础编程 4.JS采集数据方法 5.SDK采集数据的原理及方法 |
20% |
|
(五) 搭建 Python 开发环境 |
1.能搭建Python开发环境用IDE编写Python代码 2.会使用Python语言工具掌握面向对象编程使用Python连接数据库 3.能处理出现的错误及异常 |
1.Python编程基础 流程控制与数组 文件处理 2.面向对象及方法重载Python连接数据库方法 3.并发编程 |
10% |
|
(六) 采集网络 数据 |
1.能利用Python爬取网站数据 2.能利用分布式爬虫框架Apache Nutch进行分布式获取网页数据 3.能使用Crawler4j、Scrapy爬虫框架提供的API爬取数据 4.能利用网站平台提供的公共API获取数据 |
1.分布式爬虫框架Apache Nutch的原理及体系 2.Crawler4j、Scrapy爬虫框架的原理 3.http基本原理与网页基础 4.Python爬虫原理及流程 |
20% |
|
(七) 存储数据 |
1.能够安装部署关系型数据库MySQL、Oracle、SQL Server等 2. 数据库的系统配置,包括连接设置、线程设置等 3.能配置分布式数据仓库hive、hbase等 4.能将采集的数据存储到数据库 |
1.数据库的基础知识、安装操作及服务配置知识 2.数据库的系统管理指令 3.Hbase工作原理及基本操作方法 4.Hbase工作原理及基本操作方法 |
10% |
四、鉴定要求
(一)申报条件
达到法定劳动年龄,取得高中(或同等学历,含尚未取得毕业证书的中专、技校、技师学院的应届毕业生)及以上学历,具有计算机操作能力的人员。
(二)考评员构成
考评员具备大数据采集的理论知识和实践操作能力;每个考评组不少于3名考评员。
(三)鉴定方式与鉴定时间
技能操作考核采取现场上机操作方式。
技能考试时间为120min。
(四)鉴定场地设备要求
考场面积不小于60㎡,操作场地光线充足,整洁无干扰,满足技能鉴定需要的软硬件环境,包括台式计算机(内存16GB,至少具备两套操作系统)、光纤交换机、核心交换机、边界防火墙,水电等基础设施良好。