创建 JupyterLab 开发环境
1. 进入创建页
- 进入 开发环境 > JupyterLab。
- 单击 新建。
2. 填写配置信息
基本信息
资源信息
环境信息
高级配置
3. 提交创建
单击 新建 提交。开发环境会异步创建,您可以在列表中查看状态变化。打开和保存工作内容
打开 JupyterLab
- 进入 开发环境 > JupyterLab。
- 在列表中找到目标开发环境。
- 确认开发环境处于运行中状态。
- 单击 打开。
- 进入 JupyterLab 后,确认默认目录、Volume、数据集或模型挂载路径符合预期。

保存工作内容
需要长期保留的 Notebook、代码、输出结果和中间文件,应保存到已挂载的 Volume 路径下。数据集和模型建议作为输入读取,训练产物和分析结果写入 Volume,避免输入和输出混在同一路径中。 建议为团队或项目约定稳定的挂载路径。例如将项目代码和输出结果放在 Volume 路径下,将数据集和模型作为只读输入路径使用。这样 Notebook、脚本和训练命令可以复用固定路径,减少因路径变化导致的调试成本。 挂载目录不要相互重叠,也不要覆盖镜像中的系统关键目录。如果需要使用同一个 Volume 支撑多个开发环境,可按项目、实验或成员划分子目录,避免相互覆盖。查看和管理开发环境
查看配置、事件和监控
详情页用于确认开发环境配置、生命周期事件和资源用量。开发环境创建、启动、停止、重启或访问异常时,建议先进入详情页查看状态、事件和停止原因。- 基本配置:查看资源规格、区域、集群、所有者、创建时间、更新时间、项目组和可见性等信息。
- 资源信息:查看资源池、用户选择的实例规格、实际使用规格和所在节点。
- 环境信息:查看时区、镜像、镜像地址、挂载的存储、数据集、模型、环境变量、启动命令和默认目录。
- 事件:查看开发环境调度、启动、异常和生命周期变化,适合排查创建失败、启动失败、卷挂载失败等问题。
- 监控:查看开发环境的 CPU、内存、GPU 等资源用量曲线,用于判断资源是否够用或是否长期闲置。
管理生命周期
创建后,您可以在列表或详情页对 JupyterLab 开发环境执行生命周期管理操作。- 更新:修改镜像、资源规格、Volume 挂载、数据集或模型挂载、启动命令、环境变量等配置。部分变更需要重启后才能生效。
- 启动:将已停止的开发环境重新拉起。启动时会重新申请算力并进行调度。
- 停止:关闭运行中的开发环境并释放算力。开发环境配置和已写入 Volume 的数据会保留。
- 重启:重启会中断开发环境内正在运行的 Notebook、脚本或终端进程。原地重启通常用于重置运行进程;重调度重启会重新校验资源并重新调度,可能被分配到其他节点。
- 保存镜像:将运行中的开发环境保存为自定义镜像,便于后续复用已安装的依赖和工具。保存期间开发环境会暂时不可用,建议在无交互操作时执行。
- 调整可见性:将开发环境设置为私有或项目组内公开。调整可见性不影响运行状态。
- 删除:移除开发环境记录并释放占用资源。删除为不可逆操作,删除前请确认需要保留的数据已保存到 Volume。
配置闲置回收
JupyterLab 开发环境长时间运行会持续占用算力。您可以按使用习惯配置定时启停或自动缩容,减少闲置资源占用。定时启停
定时启停用于按周期性时间规则自动启动或停止开发环境,适合固定工作时间的开发场景。例如工作日前自动启动、夜间自动停止,让算力集中在实际使用时段。 配置定时启停时,请关注开发环境时区,避免计划触发时间与预期不一致。定时计划可以与手动启停并用;计划外需要使用时仍可手动启动,后续计划会在下一个触发点继续生效。按 GPU 利用率自动缩容
按 GPU 利用率自动缩容用于回收长时间闲置的 GPU 算力。当 GPU 利用率在设定观测时长内持续低于阈值时,平台会自动停止开发环境并释放 GPU。 配置自动缩容时,需要关注观测时长、GPU 利用率阈值和策略类型。策略类型用于决定按观测期内的最大值或平均值判断是否闲置。自动缩容触发后不会自动重新启动开发环境;需要继续使用时,请手动启动,或配合定时启停计划启动。对需要长时间保留 GPU 会话的开发环境,请调高阈值或关闭自动缩容,避免误停正在进行的工作。使用 JupyterLab 调试分布式任务
如果需要在 Notebook 环境中临时验证分布式训练脚本,可以创建多个 JupyterLab 开发环境,并在各环境终端中使用同一主节点地址和端口运行torchrun。主节点地址可在主节点环境中通过 echo $POD_IP 获取。
--master_addr、--master_port、--nnodes 和 --nproc_per_node 需要保持一致,--node_rank 按节点顺序分别设置。正式的大规模训练、需要队列调度或需要更稳定容错能力时,建议使用训练任务。
排查常见问题
开发环境长时间排队或创建失败怎么办?
开发环境长时间排队或创建失败怎么办?
查看事件和状态详情,确认所选资源规格、用户剩余配额和资源池可用量是否满足要求。配额不足时,可减少规格数、更换规格或联系管理员扩容。
JupyterLab 打不开或反复重启怎么办?
JupyterLab 打不开或反复重启怎么办?
检查镜像是否包含
bash 和 JupyterLab 相关组件,并查看启动命令和环境变量是否会导致进程退出。Volume、数据集或模型路径不可用怎么办?
Volume、数据集或模型路径不可用怎么办?
确认挂载对象与 Pod 中挂载路径已成对配置,挂载路径没有覆盖系统目录,也没有与其他挂载路径冲突。
重启或迁移后文件丢失怎么办?
重启或迁移后文件丢失怎么办?
确认文件是否写入 Volume。容器本地盘不适合保存重要代码、数据和输出结果。
