Linux深度学习环境搭建全流程指南
|
Linux系统是深度学习开发的主流平台,稳定高效且生态丰富。推荐使用Ubuntu 20.04或22.04 LTS版本,兼顾驱动兼容性与软件支持。安装时建议勾选“安装第三方驱动”选项,便于后续NVIDIA显卡识别。 验证GPU基础环境:执行nvidia-smi命令,若显示显卡型号与驱动版本,则CUDA驱动已就绪;若报错,需从NVIDIA官网下载对应系统版本的.run或.deb驱动包并静默安装。注意禁用nouveau开源驱动,通过编辑/etc/modprobe.d/blacklist.conf添加blacklist nouveau行,并更新initramfs。 CUDA Toolkit安装优先选用官方.run包或apt仓库方式。例如Ubuntu 22.04可添加NVIDIA官方源后运行sudo apt install cuda-toolkit-12-2,安装完成后将/usr/local/cuda-12.2/bin加入PATH,/usr/local/cuda-12.2/lib64加入LD_LIBRARY_PATH,并写入~/.bashrc生效。验证使用nvcc --version。 cuDNN非独立安装,需登录NVIDIA开发者账号下载与CUDA版本严格匹配的deb文件(如v8.9.7 for CUDA 12.2),按官方指南依次安装运行时库、开发库与代码示例。安装后检查/usr/include/cudnn.h和/usr/lib/x86_64-linux-gnu/libcudnn.so是否可访问。
2026效果图由AI设计,仅供参考 Python环境建议使用miniconda而非系统自带Python,避免依赖冲突。下载Miniconda3-Linux-x86_64.sh并bash执行安装,初始化conda后创建专用环境:conda create -n dl python=3.10。激活环境后,优先使用conda install pytorch torchvision torchaudio pytorch-cuda=12.1 -c pytorch -c nvidia,自动匹配CUDA扩展。 TensorFlow用户应确认版本兼容性:TF 2.15+默认支持CUDA 11.8及以上,但需手动指定pip install tensorflow[and-cuda],conda则推荐tf-nightly-gpu。无论哪种框架,均需在Python中运行import torch; print(torch.cuda.is_available())或import tensorflow as tf; print(tf.config.list_physical_devices('GPU'))验证GPU可用性。 开发工具链补全:安装Jupyter Lab(conda install -c conda-forge jupyterlab)、VS Code(官网deb包)并配置Remote-SSH或Dev Containers插件实现远程开发;同时安装htop、nvidia-ml-py等监控工具,便于实时查看GPU显存与利用率。 环境封装与复现至关重要。导出当前环境为YAML文件:conda env export > environment.yml;他人可通过conda env create -f environment.yml一键重建。关键依赖如CUDA/cuDNN版本需在README中明确标注,避免“在我机器上能跑”的陷阱。 遇到常见问题可优先查阅各框架官方安装文档,错误信息中包含“CUDA driver version is insufficient”说明驱动过旧,“no module named 'torch'”多因未激活conda环境。调试时善用which python、python -c "import sys;print(sys.path)"定位路径混乱问题。 (编辑:站长网) 【声明】本站内容均来自网络,其相关言论仅代表作者个人观点,不代表本站立场。若无意侵犯到您的权利,请及时与联系站长删除相关内容! |

