用Pandas进行数据分析和可视化,316页pdf
本书适用于任何想要使用 Python 进行数据分析和可视化的人。
本书适用于具有 Pandas 库工作知识的新手和有经验的读者,Python的基本知识是必须的。
本书将首先快速介绍 Python 及其用于数据科学的生态系统库,例如 JupyterLab、Numpy、Pandas、SciPy、Matplotlib 和 Seaborn。
本书将帮助学习数据工程所需的 Python 数据结构和基本概念,例如函数、Lambda、列表推导、日期时间对象等。它还涵盖了对 Python 数据科学包的深入理解,其中 JupyterLab 用作编写、记录和执行 Python 代码的 IDE,Numpy 用于计算数值运算,Pandas 用于清理和重组数据,处理大型数据集和合并数据框以获得有意义的见解。您将通过统计数据了解使用 SciPy 的变量之间的关系,并使用 Matplotllib 和 Seaborn 库构建可视化图表。
本书主要内容
-
了解 Python 数据容器、它们的方法和属性。 -
学习用于计算数值数据的 Numpy 数组。 -
学习 Pandas 数据结构、DataFrames 和 Series。 -
学习集中趋势、中心极限定理、置信区间和假设检验的统计量度。 -
简要了解可视化、控制和绘制不同的内置图表以使用 Matplotlib 和 Seaborn 提取重要变量、检测异常值和异常。
Python是一种多范式的编程语言。它支持面向对象、程序化、函数式和命令式编程,并有一个庞大而全面的标准库。Python是开源的,简单易学,并支持主要的跨平台操作系统,如windows、linux、mac等。它确实支持不同的领域,如网络和互联网开发、物联网、桌面GUI、游戏、DevOps、大数据、网络测试/自动化、AI/数据科学等等。
本书的主要目标是关注数据科学的子集部分,即数据分析和可视化。数据分析是数据科学家在清理和组织数据方面花费大部分时间的核心领域。本书的主要重点是学习Python的数据科学库的用法。本书将指导你学习Python的基本和高级概念,如列表理解、lambdas、函数式编程,这些都有助于数据操作。本书包含许多例子和实时数据集,帮助你更好地理解这些概念。
目录
本书分为11章,详细介绍了Python数据科学库,如JupyterLab、Numpy、Pandas、Scipy、Matplotlib和Seaborn,它们有助于清理和重组数据、数据分析和可视化。
- 第1章介绍了数据科学、机器学习、人工智能的核心概念 ,以及数据分析的不同过程。它还介绍了为什么Python被用作数据科学领域的一个重要工具,用于数据分析的核心库,以及安装过程。
- 第2章讨论了核心和基本工具jupyterlab ,它被用作IDE来创建和分享从Python代码到完整报告的文件。这一章涵盖了jupyterlab的架构和不同的组件,如单元格和单元格模式,用于编写代码和使用markdown语言记录代码,以及键盘快捷键和工具栏的使用。
- 第3章介绍了Python的概况 ,包括数据类型及其方法的基本概念。本章还包括函数、lambdas、列表理解、函数式编程和数据时间对象,这些都是用于数据分析和可视化的工作。
- 第4章简要介绍了numpy库及其在数值计算中的应用。 这里我们还介绍了Python列表和numpy数组的内部存储、类型检查和执行速度。本章还包括 numpy 数组的切片和切块、统计操作、花式索引和广播。
- 第5章指导你完成对pandas的基本介绍。 它还涵盖了pandas数据结构系列,数据帧,以及它们的方法和属性。我们还通过一个实时样本数据集来更好地理解这些概念。
- 第6章涵盖了处理不同的文件格式 ,标题操作,基于行、列、索引的数据过滤,分组操作,以及在分组对象上执行聚合,连接和合并数据帧,填补缺失的数据,透视表,交叉表和使用各种方法处理大型数据集。
- 第7章涉及使用各种参数创建日期范围 ,如开始和结束日期、时期、年、月、小时和秒,将字符串和基于unix的日期转换为日期时间对象,在实时数据集上进行时间序列分析,寻找关于数据的洞察力,处理不同的时区和假期。
- 第8章是对统计学的简要介绍。 本章包括人口、样本、中心趋势的测量(平均值、中位数和模式)、推理和微分统计、标准化、中心极限定理、置信区间和假设检验,以及每个主题的实际例子。
- 第9章解释了使用matplotlib进行数据可视化的概念。 本章简要介绍了matplotlib的架构、后台、艺术和脚本层,以及示例、参数和控制可视化图的方法。本章还包括不同的内置可视化图、散点图、柱状图、线图、饼图、直方图和子图。
- 第10章介绍了使用seaborn的数据可视化概念。 本章涵盖了使用实时数据集pokemon的统计可视化。它还包括可视化变量之间的统计关系,绘制分类数据,以及使用单变量和双变量特征可视化数据的分布。
- 第11章是前面所有章节的综合,它被称为探索性数据分析。 为了更好地理解这一章,我们采取了一个 Titanic 数据集。本章涵盖了对数据集的分析,填补空白或空值,变量识别和使用单变量和多变量分析对信息进行可视化,处理异常值,使用不同的可视化技术(如散点图、柱状图、线状图、热图)找到对数据的洞察力,并对数据进行推断。
便捷阅读
316页 《使用Pandas进行实际数据分析和可视化:使用强大的Python库设计、分析和可视化数据》高清epub下载:
扫码添加云朵君微信,务必备注【DAVWP】![]()
🏴☠️宝藏级🏴☠️ 原创公众号『 数据STUDIO 』内容超级硬核。公众号以Python为核心语言,垂直于数据科学领域,包括 可戳 👉 Python | MySQL | 数据分析 | 数据可视化 | 机器学习与数据挖掘 | 爬虫 等,从入门到进阶!
长按👇关注- 数据STUDIO -设为星标,干货速递