Nex-N2-Pro 部署路线图:从权重准备到多节点推理一次跑通

发布时间:2026/8/21 16:04:25
Nex-N2-Pro 部署路线图:从权重准备到多节点推理一次跑通 Nex-N2-Pro 部署路线图从权重准备到多节点推理一次跑通【免费下载链接】Nex-N2-Pro项目地址: https://ai.gitcode.com/hf_mirrors/nex-agi/Nex-N2-Pro想在自己的机器上把 Nex-N2-Pro 这套 397B 级代理模型部署起来其实没有想象中那么难。它基于 Qwen3.5-397B-A17B 架构构建推理统一走定制版 sglang 服务框架官方既提供预构建的 Docker 镜像也保留了一条源码安装路径。下面这份 Nex-N2-Pro 部署路线图会把硬件要什么、权重有哪些、命令怎么敲、翻车怎么救一次讲清楚你照着走就能把服务真正跑起来。先弄清它是谁一个专门干活的代理模型和只负责回答的聊天模型不同Nex-N2-Pro 被设计成能独立完成长任务的代理模型。它内部的 Agentic Thinking 框架把需求理解、任务规划、代码实现、环境反馈、评估调试和持续迭代串成一个闭环其中 Adaptive Thinking 让模型自己决定思考的深度小事快办、大事细想Coherent Thinking 则保证它在推理、编程、调工具时保持同一套思维模式。这套设计在真实代理场景里兑现得相当明显Terminal-Bench 2.1 拿到 75.3、GDPval 拿下 1585、SWE-Bench Verified 达到 80.8、GPQA Diamond 达到 90.7基本和当前第一梯队的闭源模型站在同一水平线上。如果你暂时用不上这么大的规格可以关注同一系列的 Nex-N2-mini基于 Qwen3.5-35B-A3B-Base两张卡就能带起来适合先跑通流程再逐步升级。维度Nex-N2-ProNex-N2-mini底座架构Qwen3.5-397B-A17BQwen3.5-35B-A3B-Base典型显存需求多卡 / 多节点单机 2 卡适用场景生产级复杂任务流程验证、轻量部署动手之前先把三张清单核对一遍部署失败十有八九不是命令的问题而是环境差一口气。建议按顺序核对下面三样。硬件清单Linux 系统Ubuntu 20.04 或 CentOS 8 均可NVIDIA GPU并装好 NVIDIA 驱动与 CUDA 工具链内存建议 64GB 起步Pro 权重文件以百 GB 计磁盘余量务必留足Docker 版本 20.10.0 以上且已安装 NVIDIA Container Toolkit软件清单Docker 本体nvidia-container-toolkit让容器能看见 GPU一条 curl 命令用于验证服务权重清单拿到模型文件的方式很简单把仓库克隆下来git clone https://gitcode.com/hf_mirrors/nex-agi/Nex-N2-Pro或者直接在模型页按分片下载。仓库根目录下就是完整的一套文件整理如下文件组用途model-00001-of-00122.safetensors ~ model-00122-of-00122.safetensors模型权重分片共 122 个缺一不可model.safetensors.index.json分片索引加载时据此定位权重config.json架构与超参数配置tokenizer.json / tokenizer_config.json分词器chat_template.jinja对话模板preprocessor_config.json / processor_config.json多模态预处理配置提示config.json里藏着不少值得读的信息——60 层结构、512 个专家每次激活 10 个、26 万 token 的超长上下文甚至还有一套内置的视觉编码器。部署前后翻一翻能帮你理解参数的含义。两条路径怎么选源码编译还是现成镜像官方推荐用它们定制的 sglang 分支来提供服务理由很简单Nex 系列用到的线性注意力与 Mamba 调度策略只有这个分支支持得最完整。路径 A源码安装适合想深入定制的人git clone https://github.com/nex-agi/sglang.git cd sglang pip install --upgrade pip pip install -e python路径 B直接用现成镜像推荐大多数人镜像nexagi/sglang:v0.5.12已经把定制版 sglang 预装好了省去编译等待和依赖冲突的麻烦。它的价值可以概括成三笔账环境一致换台机器结果不变、开箱即用镜像拉完就能跑、隔离安全容器里的依赖不会污染宿主机。无论走哪条路先确认 GPU 能被 Docker 看见docker run --rm --gpus all nvidia/cuda:12.0.0-base nvidia-smi如果能看到显卡信息列表说明 NVIDIA Container Toolkit 工作正常可以进入下一步。第一段旅程单机环境把服务跑起来先拿 Nex-N2-mini 练手单机两张 H100 的配置即可。把权重目录挂载进容器后执行docker run --gpus all --shm-size 32g --ipchost \ -p 30000:30000 \ -v /path/to/your/model:/model \ nexagi/sglang:v0.5.12 \ python3 -m sglang.launch_server \ --model-path /model \ --tp 2 \ --host 0.0.0.0 --port 30000 \ --reasoning-parser qwen3 \ --tool-call-parser qwen3_coder \ --mamba-scheduler-strategy extra_buffer逐条解释一下每个参数在做什么--gpus all把全部 GPU 交给容器--shm-size 32g与--ipchost保证进程间共享内存充足这对大模型推理至关重要-p 30000:30000把容器的 30000 端口映射到宿主机-v /path/to/your/model:/model把宿主机权重目录挂载为容器里的/model--tp 2张量并行度设为 2让两张卡协同推理--reasoning-parser qwen3把模型的思考过程与最终回复分开返回--tool-call-parser qwen3_coder开启函数调用解析这是代理能力的关键开关--mamba-scheduler-strategy extra_buffer为 Mamba 层启用额外缓冲换取更稳定的调度性能启动日志里出现类似The server is fired up and ready to roll的提示就说明服务已就绪。第二段旅程多节点把 Nex-N2-Pro 完整拉起Pro 的参数量决定了它需要 16 张卡级别的显存常见做法是两台 8×H100 服务器组成双节点。此时每一台机器都要执行同一条命令只有两个占位符不同主节点--node-rank 0从节点--node-rank 1--dist-init-addr统一填主节点的 IP。docker run --gpus all --shm-size 32g --network host \ -v /path/to/your/model:/model \ nexagi/sglang:v0.5.12 \ python3 -m sglang.launch_server \ --model-path /model \ --tp 16 \ --nnodes 2 \ --node-rank node-rank \ --dist-init-addr node0-ip:20000 \ --host 0.0.0.0 --port 30000 \ --reasoning-parser qwen3 \ --tool-call-parser qwen3_coder \ --mamba-scheduler-strategy extra_buffer几个要点值得单独拎出来说--tp 16表示 16 张卡共同切分模型--nnodes 2告诉框架跨两台机器并行多节点场景下网络用的是--network host而非端口映射因为节点间需要直接通信20000是节点间握手用的初始地址端口确保两台机器能互相访问启动顺序建议从节点先起、主节点后起能减少等待握手的空转时间启动命令里的参数逐个读懂如果你觉得上面的命令参数太多记不住记住这张速查表就够了参数含义常见取值--tp张量并行度约等于参与推理的卡数2 / 16--nnodes节点数量多机部署时填写1 / 2--node-rank节点排名0 代表主节点0 / 1--dist-init-addr分布式初始化地址主节点IP:20000--model-path模型目录路径/model--reasoning-parser思考过程解析器qwen3--tool-call-parser函数调用解析器qwen3_coder生成质量方面官方推荐的采样参数可以直接照抄参数推荐值作用temperature0.7在稳定与多样性之间取平衡top_p0.95控制候选词的累计概率top_k40限制每步候选词数量怎么确认它真的在工作服务启动后别急着走做三个自检动作看容器状态docker ps确认容器处于 Up 状态且端口已映射看启动日志docker logs 容器ID重点确认模型权重加载完成、端口监听成功探活接口curl http://localhost:30000/health返回{health: [OK]}之类的结果即代表服务健康。更进一步可以发一条真实的推理请求到 OpenAI 兼容的/v1/chat/completions接口验证带思考过程的完整链路是否通畅——能跑通这一步说明这套 Nex-N2-Pro 部署已经可以接入你的上层应用了。如果翻车了按这个顺序排查部署常见的坑就那么几个绝大多数按下面这张表对号入座就能解决症状原因对策启动即报显存不足tp 设置超过实际卡数调小 --tp或改用 Nex-N2-mini端口被占用30000 已有人使用换端口映射如 -p 30001:30000模型加载失败权重文件不完整或路径错误核对 122 个分片是否齐全检查挂载路径多节点一直卡在握手节点间网络不通或 rank 填错确认 --dist-init-addr 可达、主从 rank 正确推理极慢共享内存不足检查 --shm-size 设置与容器内存限制上线之后日常观察与维护服务稳定运行后把它当作一台需要保养的设备来对待。观察什么nvidia-smi看每张卡的利用率与显存占用判断负载是否均衡docker stats看容器 CPU 与内存水位记录 API 响应延迟出现明显上升时优先怀疑显存碎片或共享内存不足升级与清理新版本发布时把新权重放到挂载目录docker stop停掉旧容器再用相同的命令重新docker run即可完成热切换。空闲的容器和镜像定期清理避免磁盘被占满docker container prune docker image prune下一步从能跑到真正用起来回顾整条路线先核对硬件、软件与权重三张清单再根据规模选择单机或双节点方案启动后用探活与真实请求完成验证最后靠一套排查表和监控习惯守住长期稳定。至此你的 Nex-N2-Pro 部署已经从下载了权重推进到了对外提供服务。如果你手头正好有自动化、代码生成或深度研究的场景不妨今晚就试试先用 Nex-N2-mini 在单机把流程走通确认--tool-call-parser qwen3_coder下函数调用符合预期再决定要不要上多节点跑 Pro。模型已经开源路线图也摆在眼前剩下的就交给你的第一次docker run了。【免费下载链接】Nex-N2-Pro项目地址: https://ai.gitcode.com/hf_mirrors/nex-agi/Nex-N2-Pro创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考