在 Mac 上安装 PySpark 保姆级教程
本文中,云朵君将和大家一起学习如何在 Mac 上安装 PySpark。步骤包括使用 Homebrew 安装 Java、Scala、Python 和 PySpark。在之前,云朵君已经介绍了 (点击查看) 在 Windows 上安装 PySpark 保姆级教程 ,大佬可自行查看。
在 Mac 上安装 PySpark 有多种方法,下面已经解释了在 Mac OS 上使用 Homebrew 安装 PySpark、运行 PySpark shell 并创建 PySpark DataFrame 的分步操作。除此之外,还可以使用 Anaconda 安装 PySpark 并从 Jupyter notebook 运行程序。
使用 Homebrew 在 Mac OS 上安装 PySpark 的步骤-
第 1 步 – 安装 Homebrew -
第 2 步 – 安装 Java -
第 3 步 – 安装 Scala(可选) -
第 4 步 - 安装 Python -
第 5 步 - 安装 PySpark -
第 6 步 - 启动 PySpark shell 并验证安装
1. 使用 Homebrew 安装 PySpark
Homebrew 是 macOS(或 Linux)的包管理器 ,用于在 Mac OS 上安装第三方包,如 Java、PySpark。首先,需要使用以下命令安装它。# Install Homebrew
/bin/bash -c "$(curl -fsSL https://raw.githubusercontent.com/Homebrew/install/HEAD/install.sh)"
这会提示输入 root 密码。需要输入你的 root 密码才能运行此命令。在个人笔记本电脑上,这与登录 Mac 时输入的密码相同。如果你没有 root 访问权限,请联系系统管理员。成功安装自制软件后,应该会在下面看到类似的内容。
$PATH
。
# Set brew to Path
echo 'eval "$(/opt/homebrew/bin/brew shellenv)"' >> /Users/admin/.zprofile
eval "$(/opt/homebrew/bin/brew shellenv)"
如果上面的命令有问题,你可以从 Homebrew 找到最新的命令。
2.安装Java版本
PySpark 使用 Java 底层,因此需要在 Mac 上安装 Java。由于 Java 是第三方,可以使用 Homebrew 命令安装它
brew
。由于 Oracle Java 不再是开源的,所以我使用的是 OpenJDK 版本 11。在终端中运行以下命令进行安装。
# Install OpenJDK 11
brew install openjdk@11
3.安装Scala
由于 Spark 是用 Scala 语言编写的,很明显需要 Scala 来运行 Spark 程序,但是我们使用的是 PySpark,这一步是可以忽略。
# Install Scala (optional)
brew install scala
4.安装Python
PySpark 用于在 Python 中运行 Spark 任务,因此还需要在 Mac OS 上安装 Python。我们使用 Homebrew 安装它。如果你已经安装了python,请忽略此步骤。
# install Python
brew install python
5. 在 Mac 上安装 PySpark
PySpark 是一个用 Python 编写的 Spark 库,用于使用 Apache Spark 功能运行 Python 应用程序。Spark 基本上是用 Scala 编写的,后来由于它的行业适应,它的 API PySpark 是使用 Py4J 为 Python 发布的。
Py4J
是一个集成在 PySpark 中的 Java 库,它允许 python 与 JVM 对象动态交互,因此要运行 PySpark,还需要与 Python 和 Apache Spark 一起安装 Java。所以要使用 PySpark,我们需要在 Mac 上安装 PySpark。
# Install Apache Spark
brew install apache-spark
这将安装最新版本的 Apache Spark,理想情况下包括 PySpark。
pyspark
以启动 PySpark shell。
它会向终端显示 Spark 和 Python 版本。
6. 从 Shell 验证 PySpark 安装
我们使用一些示例数据创建一个 PySpark DataFrame 来验证安装。在 PySpark shell 中以相同的顺序输入以下命令。
# Create DataFrame in PySpark Shell
data = [("Java", "20000"),
("Python", "100000"),
("Scala", "3000")]
df = spark.createDataFrame(data)
df.show()
http://localhost:4041/jobs/
以访问 Spark Web UI 以监控 jobs。
🏴☠️宝藏级🏴☠️ 原创公众号『 数据STUDIO 』内容超级硬核。公众号以Python为核心语言,垂直于数据科学领域,包括 可戳 👉 Python | MySQL | 数据分析 | 数据可视化 | 机器学习与数据挖掘 | 爬虫 等,从入门到进阶!
长按👇关注- 数据STUDIO -设为星标,干货速递