本次培训环境基于Windows 10/11 或 Linux Ubuntu 22.04 LTS,优先推荐Ubuntu,大数据组件兼容性最优。
如果是Windows用户,可直接通过Hyper-V虚拟机或WSL2部署,WSL2更轻量化,操作步骤如下:
大数据核心组件(Hadoop、Hive、Spark)均依赖Java 8,执行以下命令一键安装:
```bash 1. 更新apt源 sudo apt update 2. 安装OpenJDK 8 sudo apt install openjdk-8-jdk -y 3. 验证安装 java -version ```若终端输出“openjdk version \"1.8.0_\"”开头的内容,说明安装成功。
Hadoop需要SSH免密访问本地节点,执行以下步骤:
exit退出。
本次采用单节点伪分布式模式,满足档案采集、存储、处理、查询的完整培训需求。
~/.bashrc文件,添加以下内容:
```bash
打开文件
nano ~/.bashrc
添加到文件末尾
export HADOOP_HOME=/home/$(whoami)/hadoop-3.3.4
export HADOOP_CONF_DIR=$HADOOP_HOME/etc/hadoop
export PATH=$PATH:$HADOOP_HOME/bin:$HADOOP_HOME/sbin
```
按Ctrl+O保存,Enter确认文件名,Ctrl+X退出,执行source ~/.bashrc生效。标签内的内容为:
```xml
若终端输出NameNode、DataNode、SecondaryNameNode、ResourceManager、NodeManager5个进程,说明集群启动成功。
Hive作为数据仓库工具,用于结构化档案的SQL查询,操作步骤如下:
~/.bashrc,添加:
```bash
export HIVE_HOME=/home/$(whoami)/apache-hive-3.1.3-bin
export PATH=$PATH:$HIVE_HOME/bin
```
保存后执行source ~/.bashrc。若终端出现hive>提示符,说明Hive启动成功。
模拟档案数据为“干部档案表”,完成采集(上传HDFS)、存储(创建Hive表)、查询(SQL统计)三个核心培训环节。
在本地创建CSV格式的测试数据,执行:
```bash 1. 创建测试文件 nano ~/test_cadre_archives.csv ``` 写入以下内容(可复制): ```csv 001,张三,男,1985-03-15,2007-07-01,技术部,高级工程师 002,李四,女,1988-09-20,2010-09-01,人事部,主管 003,王五,男,1979-12-05,2002-06-01,财务部,经理 004,赵六,女,1992-05-30,2015-07-01,技术部,工程师 ``` 保存退出。在hive>提示符下执行以下命令:
SELECT FROM cadre_archives;SELECT department, COUNT() AS count FROM cadre_archives GROUP BY department;SELECT FROM cadre_archives WHERE department='技术部' AND position='高级工程师';培训结束后可停止集群释放资源,执行:
```bash 1. 停止YARN stop-yarn.sh 2. 停止HDFS stop-dfs.sh 3. 若需完全清理环境(谨慎操作) rm -rf ~/hadoop-3.3.4 ~/apache-hive-3.1.3-bin ~/hadoop_data ~/hive_data ~/test_cadre_archives.csv ~/.bashrc.bak ```