大数据分析专项职业能力考核规范
一、定义
运用大数据技术,能在大数据平台基础上对各种类型的海量数据进行分析,挖掘数据的隐藏价值的能力。
二、适用对象
运用或准备运用本项技能求职、就业的人员。
三、能力标准与鉴定内容
|
能力名称:大数据分析 职业领域:数据分析处理工程技术人员 |
|||
|
工作任务 |
操作规范 |
相关知识 |
考核比重 |
|
(一)安装操作系统及搭建Python开发环境 |
1.安装Windows、Linux操作系统 2.掌握Linux系统基本命令 3.搭建Python开发环境 4.用IDE编写Python代码 5.会使用Python语言工具 6.会面向对象编程
|
1.Windows、Linux操作系统基础知识及安装步骤操作 2.虚拟机原理 3.Linux基本命令使用 4.Python编程基础 5.流程控制与数组 6.文件处理 7.面向对象及方法重载 8.并发编程 |
10% |
|
(二)安装、管理和操作数据库 |
1.能在Windows、Linux系统上安装配置MySQL、Oracle、SQL Server等数据库系统,保证其正常的启动和停止 2.数据库的系统配置,包括连接设置、线程设置等 3.能够通过SQL语句实现表的管理 4.能够通过SQL语句实现数管理的基本操作,能够通过SQL语句实现子查询、拼接查询、合并查询等复杂查询 5.能够了解数据库的优化方法 6.能对上述1-5中出现的错误指令进行解决 |
1.数据库的基础知识、安装操作及服务配置知识 2.数据库的系统参数含义及用途 3.数据库的系统管理指令 4.DDL数据库定义语言 5.DML数据库操纵语言 6.DCL数据库控制语言 7.表索引设计、SQL执行计划分析和优化 |
5% |
|
(三)安装和运用分布式集群架构 |
1.能安装和使用大数据处理框架Hadoop 2.能单机运行Hadoop 3.能搭建Hadoop伪分布式、分布式 4.能用多节点安装Hadoop集群 5.能用MapReduce的计算框架 6.能用Yarn的资源管理和资源调度机制 7.能对上述1-6中出现的错误指令进行处理及解决 |
1.Hadoop的基础架构与组成 2.Hadoop的运行方式 3.HDFS基础及核心原理 4.HDFS操作方法 5.HDFS体系结构和运行机制 6.Hadoop资源管理框架YARN工作原理 7.MapReduce基本原理 |
15% |
|
(四)安装和使用分布式数据仓库Hbase |
1.能对分布式数据仓库Hbase进行安装部署 2.能启用分布式数据仓库Hbase 3.能使用Hbase Shell基本操作 4.使用HQL操作Hbase中数据 5.能对上述1-4中出现的错误指令进行处理及解决 |
1.Hbase核心原理 2.Hbase的工作原理及运用 3.Hbase配置文件与修改方法 4.Hbase基本操作方法 |
5% |
|
(五)安装和使用分布式数据仓库Hive |
1.能对分布式数据仓库Hive进行安装部署 2.能启用分布式数据仓库Hive 3.能利用Hive做日志分析的查询 4.能对上述1-3中出现的错误指令进行处理及解决 |
1.数据仓库的背景与原理 2.常用数据仓库工具及分布式数据仓库 3.Hive的原理及核心特性 4.Hive部署与访问方法 |
5% |
|
(六)获取数据 |
1.能安装部署Sqoop 2.能利用Sqoop进行关系型数据库(MySQL、Oracle、SQL Server等)和分布式仓库(hive、hdfs,hbase)之间数据的相互导入 3.能够从结构化数据库采集数据到新的数据库中,从应用系统中采集数据到新的数据库中。 4.能对上述1-3中出现的错误指令进行解决 |
1.ETL基本概念 2.Sqoop组件特性及核心功能 3.Hadoop生态中的数据转化方法 4.Sqoop导入数据方法 5.基本关系型数据库知识 |
10% |
|
(七)加工、清洗、整合大数据 |
1.能运用Hadoop生态系统处理海量历史数据 2.能安装配置Spark 3.能利用Spark SQL对数据进行清洗 4.能利用Spark GrapX对图形进行处理 5.能运用Spark处理流式数据 6.能利用数据源工具对流式数据进行处理和连接 7.能对上述1-6中出现的错误指令进行处理及解决 |
1.分布式计算框架原理 2.Spark背景和原理 3.Spark基本定位与核心特性 4.Spark运行基本流程 5.Spark三种部署方式 6.Spark与Hadoop统一部署 7.数据处理方法RDD、DataFrame、Spark SQL |
10% |
|
(八)掌握Python机器学习算法 |
1.能用机器学习进行 建模分析 2.能运用scikit-learn机器学习算法库 3.能对上述1-2中出现的错误指令进行处理及解决 |
1.机器学习基本思想 2.Scikit-Learn算法库 3.有监督学习算法 4.无监督学习算法 |
20% |
|
(九)运用机器学习分析数据 |
1.能利用Spark MLlib进行大数据建模分析 2.能创建ML机器学习流 3.能在大数据集群上进行分布式机器学习运算 4.能对上述1-3中出现的错误指令进行处理及解决 |
1.Spark调用API接口方法 2.机器学习流概念 3.MLlib基本原理 4.MLlib机器学习 |
20% |
四、鉴定要求
(一)申报条件
达到法定劳动年龄,取得高中(或同等学历,含尚未取得毕业证书的中专、技校、技师学院的应届毕业生)及以上学历,具有计算机操作能力的人员。
(二)考评员构成
考评员具备大数据分析的理论知识和实践操作能力;每个考评组不少于3名考评员。
(三)鉴定方式与鉴定时间
技能操作考核采取现场上机操作方式。
技能考试时间为120min。
(四)鉴定场地设备要求
考场面积不小于60㎡,操作场地光线充足,整洁无干扰,满足技能鉴定需要的软硬件环境,包括台式计算机(内存16GB,至少具备两套操作系统)、光纤交换机、核心交换机、边界防火墙,水电等基础设施良好。