如何在jupyter notebook中使用pyspark

注:電腦上必須已經(jīng)安裝java

第一步:轉(zhuǎn)到官方Apache Spark下載最新版本的Apache Spark,我下載的是spark-2.4.5-bin-hadoop2.6

第二步:解壓縮下載的Spark tar文件

$ tar -xvf Downloads/spark-2.4.5-bin-hadoop2.6.tgz

第三步:在啟動(dòng)PySpark之前,需要在/etc/profile中設(shè)置以下環(huán)境變量

export SPARK_HOME=/home/luban/spark-2.4.5-bin-hadoop2.6
export PATH=$PATH:/home/luban/spark-2.4.5-bin-hadoop2.6/bin
export PYTHONPATH=$SPARK_HOME/python:$SPARK_HOME/python/lib/py4j-0.10.7-src.zip:$PYTHONPATH
export PATH=$SPARK_HOME/python:$PATH
export PYSPARK_PYTHON=python3

第四步:更新配置文件

$ source /etc/profile

第五步:安裝findspark,并啟動(dòng)或者重啟jupyter notebook

$ pip install findspark
$ jupyter notebook

第六步:在import pyspark前,運(yùn)行findspark,它會(huì)找到spark安裝的位置

import findspark
findspark.init()
?著作權(quán)歸作者所有,轉(zhuǎn)載或內(nèi)容合作請(qǐng)聯(lián)系作者
【社區(qū)內(nèi)容提示】社區(qū)部分內(nèi)容疑似由AI輔助生成,瀏覽時(shí)請(qǐng)結(jié)合常識(shí)與多方信息審慎甄別。
平臺(tái)聲明:文章內(nèi)容(如有圖片或視頻亦包括在內(nèi))由作者上傳并發(fā)布,文章內(nèi)容僅代表作者本人觀點(diǎn),簡(jiǎn)書系信息發(fā)布平臺(tái),僅提供信息存儲(chǔ)服務(wù)。

相關(guān)閱讀更多精彩內(nèi)容

友情鏈接更多精彩內(nèi)容