本书是中高职贯通培养系列教材,以项目任务为导向,旨在帮助学生全面了解并掌握大数据关键技术中的数据采集与预处理技术及其实践方法。
本书分为7个项目,包括:大数据应用基础、Python编程语言基础与网络爬虫入门、XPath与Beautiful Soup的应用、Python网络爬虫实践、日志数据采集实践、数据文件与数据库的读写、数据清洗实践。
本书配套课件、教案等辅教辅学资源,请登录高等教育出版社新形态教材网(https://abooks.hep.com.cn)获取相关资源。详细使用方法见本书最后一页“郑重声明”下方的“学习卡账号使用说明”。
本书可作为职业院校大数据技术专业“数据采集与处理”课程的教材使用,同时也可以作为从事大数据相关工作的工程技术人员的参考用书。
- 目录
- 前辅文
- 项目1 大数据应用基础
- 任务1 认识大数据与配置开发环境
- 子任务1 在Windows操作系统中安装Anaconda软件
- 子任务2 认识Jupyter Notebook代码编辑器
- 任务2 认识数据采集与完成第一个Python程序
- 子任务1 安装Visual Studio Code代码编辑器
- 子任务2 我的第一行Python代码
- 项目2 Python编程语言基础与网络爬虫入门
- 任务1 掌握Python编程基础
- 子任务1 运算符与条件判断实践
- 子任务2 循环语句实践
- 子任务3 break与continue语句实践
- 子任务4 列表练习
- 任务2 了解HTTP与Python网络爬虫
- 子任务1 模拟登录网站
- 子任务2 传递URL参数
- 子任务3 定制请求头
- 子任务4 设置Cookie
- 子任务5 设置超时
- 子任务6 获取二进制文件
- 项目3 XPath与Beautiful Soup的应用
- 任务1 掌握XPath的应用
- 子任务1 使用XPath对XML文档进行查找和提取信息
- 子任务2 使用XPath对HTML文档进行分析和抓取
- 任务2 掌握Beautiful Soup库
- 项目4 Python网络爬虫实践
- 任务1 爬取图书信息
- 子任务1 分析目标网页的结构和URL规律
- 子任务2 分析网页数据
- 子任务3 编写提取信息函数
- 子任务4 编写遍历页码函数
- 子任务5 数据转换与存储
- 任务2 Selenium模拟浏览器爬取历史天气数据
- 子任务 使用Selenium模拟浏览器爬取历史天气数据
- 项目5 日志数据采集实践
- 任务1 Flume的安装配置
- 子任务1 下载安装配置Flume
- 子任务2 在CentOS操作系统中安装配置Flume
- 任务2 使用Flume采集数据上传到集群
- 项目6 数据文件与数据库的读写
- 任务1 数据文件的读写
- 子任务1 普通文件读写实践
- 子任务2 数据文件读写实践
- 任务2 数据库的读写操作
- 子任务1 SQLite数据存储实践
- 子任务2 MySQL数据库读写实践
- 子任务3 MongoDB数据库操作实践
- 项目7 数据清洗实践
- 任务1 使用Pandas进行数据清洗
- 子任务1 处理缺失值与重复值
- 子任务2 处理错误值与数据格式转换
- 子任务3 数据筛选与排序
- 子任务4 数据分组与聚合
- 子任务5 数据合并与拆分
- 任务2 使用OpenRefine进行数据预处理
- 子任务1 创建项目和导入数据
- 子任务2 浏览和分析数据
- 子任务3 转换和清洗数据
- 子任务4 使用表达式和函数处理数据
- 子任务5 使用外部服务扩充数据
- 子任务6 导出和保存项目
- 参考文献