数据分析起步:环境创建、安装NumPy与Jupyter项目搭建

发布时间:2026/8/31 4:21:03
数据分析起步:环境创建、安装NumPy与Jupyter项目搭建 很多刚开始学 Python 数据分析的读者都经历过这种场景照着网上的教程装好了 Anaconda打开 Jupyter Notebookimport numpy跑一个数组求和一切都正常。然后过了几天换了电脑或者重装了系统重新打开 Jupyter发现刚才还能用的 numpy 突然报ModuleNotFoundError。再执行一遍pip install numpy又提示这个包已经存在。问题出在哪里大概率不是包没装好而是环境搞混了。数据分析的环境搭建表面上看是“安装软件”本质上其实是“环境管理”。会用 conda 创建独立环境、会激活并切换环境、会把 numpy 和 Jupyter 装对地方、会用合理的目录结构创建数据分析项目这四件事看起来基础但恰恰是后续所有数据分析工作的地基。地基没打牢后面每开一个新项目都会在 import 和装包上浪费大量时间。这篇文章会从一个完整的视角带你走一遍数据分析起步阶段必须掌握的链路环境创建、安装 numpy、配置 Jupyter、创建数据分析项目。文章会先解释这几个工具到底是做什么的再说每一步为什么需要这样做最后给出可以直接复制的命令和代码以及高频踩坑的排查思路。1. 这篇文章真正要解决的问题在正式操作之前有必要先回答一个最容易被忽略的问题为什么偏偏是“环境创建”排在数据分析学习路径的最前面因为数据分析领域的 Python 生态有一个显著特点依赖极多版本敏感。你会发现numpy 的数组运算依赖底层 C 和 Fortran 编译库pandas 依赖 numpymatplotlib 又依赖 pandas 和 numpy。这些库之间存在版本耦合。更麻烦的是你同时可能在做多个项目一个项目需要用 Python 3.8 配合旧版 numpy另一个项目在 Python 3.11 上跑最新版 pandas。如果所有包都装进同一个全局 Python只要有一个库升级就有可能导致另一个项目运行失败。而 conda 可以创建多个相互隔离的独立 Python 环境。每个环境相当于一个独立的小房间房间里有各自版本的 Python、numpy、pandas 和 Jupyter。A 项目的升级不会影响 B 项目。这一步解决了数据分析开发中“环境混乱”这个最典型的痛点。结合本文标题“数据分析-2-3-环境创建-安装numpy-jupyter-创建项目”这篇文章适合以下读者阅读刚入门数据分析准备学习 numpy、pandas、matplotlib但不知道从哪个环节开始。已经装过 Anaconda 或 Python但一直搞不清“环境”“kernel”“pip”“conda”这些概念之间的关系。遇到过“Jupyter 里 import numpy 失败但在命令行里却能成功”这类诡异问题。准备开始第一个正式的数据分析项目希望从一开始就建立起规范的目录和流程。读完本文后你会得到一个可靠的最小知识闭环创建一个独立环境安装 numpy 和 Jupyter启动 Jupyter Notebook在里面建立并运行自己的第一个数据分析项目文件。2. 核心概念numpy、Jupyter 与环境隔离很多新手容易把“工具”和“概念”混为一谈。要真正理解环境创建先要搞清楚三个主角分别是什么以及它们各自解决什么问题。2.1 numpy数据分析的运算地基numpy 是 Python 科学计算最基础的第三方库全称是 Numerical Python。它的核心是提供一个高性能的多维数组对象 ndarray以及对数组进行数学运算、切片、索引、排序、统计等操作的能力。为什么要单独提它因为 Python 自带的列表 list 虽然也可以装数字但做大规模数值运算时速度很慢而且不支持真正的矩阵级操作。numpy 用 C 语言实现了底层数组结构计算性能远远高于原生 Python 循环。数据分析栈里的 pandas、scipy、scikit-learn、matplotlib 都依赖 numpy所以 numpy 通常被称作“数据分析的地基库”。学习 numpy 时你会反复接触到这些操作创建数组np.array()、np.zeros()、np.arange()。查看形状.shape。切片取值arr[0:2, 1:3]。统计计算.sum()、.mean()、.std()。如果你的环境里没有 numpy或者 numpy 版本和 Python 版本不兼容那么 import 这一步就会直接失败后面所有分析代码都无从谈起。2.2 Jupyter Notebook 与 Jupyter Lab交互式分析工作台Jupyter Notebook 是一个基于网页的交互式开发环境。它允许你在浏览器里编写 Python 代码并把代码、运行结果、文字说明、图表整合在同一个.ipynb文件中。这种形式非常适合数据分析流程一个单元格写“读取数据”下一个单元格写“查看数据概览”再下一个单元格写“画图观察规律”。Jupyter Lab 是 Jupyter Notebook 的下一代界面。你可以理解为Notebook 是老版单文档编辑模式Lab 是升级版的多窗口工作台。Lab 里可以同时打开多个 Notebook、终端、文本编辑器布局更灵活。两者核心的内核机制相同启动命令分别是jupyter notebook和jupyter lab。初学者建议从 Jupyter Notebook 开始因为界面更简单教程资料最多。有一个必须注意的点jupyter 不是一个独立软件而是 Python 包提供的命令行工具。你在命令行里敲jupyter之前必须保证命令所在的环境里已经安装了 jupyter 包。很多新手在 CMD 里直接敲 jupyter 报“不是内部或外部命令”核心原因就是没有先激活 conda 环境系统找不到这个命令。2.3 conda 环境隔离为什么必须建独立环境conda 是 Anaconda 或 Miniconda 自带的包管理和环境管理工具。它解决两类问题安装 Python 包以及创建互相隔离的 Python 环境。“环境”这个词在数据分析语境里可以类比为一个独立的实验室。每个实验室有自己的一份 Python 解释器、自己的第三方库目录。你在实验室 A 里安装的包实验室 B 里完全看不到。这样做有三个直接好处不同项目可以依赖不同版本的 Python 和库。项目化开发时可以把当前环境依赖导出成清单别人用一份清单快速复现环境。避免“升级一个包弄坏整个系统 Python”的灾难。在 conda 出现之前很多 Python 开发者直接用系统 Python 装包包装多了以后全局环境变得不可维护。conda 从源头解决了这个问题。而 pip 也能安装包但不具备完整的“多 Python 版本多环境”管理能力。两者对比下表对比项condapip主要定位包管理 环境管理Python 包安装工具环境隔离原生支持需要搭配 venv 或 virtualenv非 Python 依赖能安装和管理 C 库等非 Python 依赖基本只处理 Python 包典型命令conda create、conda installpip install使用场景数据科学、机器学习、科学计算普通 Python 项目2.4 环境、kernel 与解释器三者的关系还有一个初学者最容易迷惑的概念Jupyter 里的 kernel、conda 环境、Python 解释器到底是什么关系简单说conda 环境是一个容器容器里有一个 Python 解释器和一组 Python 包Jupyter 是一个编辑器它需要一个“运行代码的引擎”这个引擎就是 kernelkernel 对应到某个 Python 解释器。当你启动 Jupyter 并新建 Notebook 时系统默认使用启动 Jupyter 的那个 Python 环境。所以“Jupyter 里 import numpy 失败但在命令行却成功”这个问题本质上是你启动 Jupyter 的环境和你用命令行激活的环境不是同一个环境。后面第 7 章会专门讲排查办法。3. 环境准备与前置条件在开始创建环境之前需要确保电脑上已经安装了 Anaconda 或 Miniconda。两者都是 conda 工具的分发版本区别在于预装包的多少。Anaconda 自带 numpy、pandas、matplotlib 等常用包安装包体积大适合不想单独装包的新手Miniconda 只带 conda 和 Python体积小所有数据分析包需要自己安装适合希望保持干净环境、不想被预装包打扰的用户。安装方式请以实际官网版本为准这里重点说安装完成后的验证步骤。安装完成后需要打开命令行工具Windows打开“Anaconda Prompt”或者“开始菜单”里的 Anaconda 相关命令提示符。macOS / Linux打开系统终端。然后在终端里执行conda --version如果输出类似conda 23.x.x的信息说明 conda 安装成功。接下来查看当前默认环境conda info --envs输出会列出当前已有的环境列表其中base是 conda 自带的默认环境旁边会有一个星号标记当前正在使用的环境。只要能看到这个列表就说明环境管理工具可以正常使用。4. 核心流程创建环境、安装 numpy、配置 Jupyter、创建项目现在进入文章的核心动作。整个流程可以拆成四个步骤创建独立环境、安装 numpy 和 Jupyter、启动 Jupyter、创建数据分析项目目录。每一步都要理解“为什么这么做”而不只是复制命令。4.1 创建独立 conda 环境打开 Anaconda Prompt 或终端执行下面这条命令conda create -n>conda activate>conda install numpy jupyter -y如果下载速度很慢或者经常安装失败可以通过配置国内镜像源解决。镜像源配置是一个通用做法但具体地址请以当前网络环境和官方文档为准。安装成功的标志是命令执行结束没有报错并且终端可以看到类似done的提示。这里有一个值得注意的细节conda 安装包时会自动检查依赖关系可能同时升级或降级环境中已有的其他包。这是正常现象。如果你希望保持 conda 和 pip 混合安装时稳定更推荐在同一个环境里尽量统一使用 conda 安装pip 安装只用于 conda 源里没有的包。4.3 启动 Jupyter Notebook 并连接环境安装完成后在同一终端里执行jupyter notebook启动正常时终端会输出一长串日志并且默认浏览器会自动打开一个页面地址通常是http://localhost:8888。这个页面就是 Jupyter Notebook 的文件管理界面里面会显示当前目录下的文件列表。这里要特别再强调一次jupyter命令不是 Windows 系统自带的命令它是 Python 包提供的可执行脚本。启动前必须保证当前处于># 1. 创建独立环境 conda create -n>mkdir -p>import numpy as np # 创建一个 2 行 3 列的二维数组 arr np.array([[1, 2, 3], [4, 5, 6]]) # 查看 numpy 版本 print(numpy 版本:, np.__version__) # 查看数组形状 print(数组形状:, arr.shape) # 数组求和 print(全部元素求和:, arr.sum()) # 按列求和 print(按列求和:, arr.sum(axis0)) # 切片操作取第一行、第二列 print(第一行第二列:, arr[0, 1]) # 切片操作取第二行的前两列 print(第二行前两列:, arr[1, :2])这一段代码覆盖了 numpy 最基础也最常用的功能。运行后预期输出类似numpy 版本: 1.x.x 数组形状: (2, 3) 全部元素求和: 21 按列求和: [5 7 9] 第一行第二列: 2 第二行前两列: [4 5]如果这段代码可以顺利运行说明环境创建、numpy 安装、Jupyter 启动三件事已经全部打通。后续学习 pandas、matplotlib、机器学习算法时会一直踩在这条已经铺好的路上。5.3 导出依赖清单当环境里已经安装了很多包之后建议把当前环境的依赖信息导出到requirements.txt。这个文件的作用是换一台电脑或者团队成员想复现你的分析环境时只需要基于这个文件安装一次即可。在项目根目录执行pip freeze requirements.txt在新环境里复现依赖时执行pip install -r requirements.txt需要注意的是pip freeze导出的包名和版本号如果环境是conda install出来的包通常也能直接用 pip 安装但个别包可能只能通过 conda 安装。对于初学者来说先把依赖导出这一步养成习惯后续再根据实际项目决定是否使用更严格的依赖锁定机制。6. 运行结果与效果验证完成上面的步骤后需要有一套清晰的验证标准而不是只看“命令没报错”就结束。6.1 验证环境激活是否成功在终端里执行conda activate>python -c import numpy; print(numpy.__version__)如果输出一个版本号例如1.24.3说明当前环境中的 numpy 可以正常被 import。如果这里就报错不要先去 Jupyter 里排查因为命令行是最小验证环境先确定 base 级别能不能 import。6.3 验证 Jupyter 的 kernel 是否对应当前环境启动 Jupyter Notebook 后在 Notebook 里执行import sys print(sys.executable)这个命令会打印当前 Notebook 实际使用的 Python 解释器绝对路径。如果路径中包含>cd>