如何用vLLM部署DeepSeek-V4-Pro-MXFP4?保姆级教程:一条命令启动1M上下文推理服务 如何用vLLM部署DeepSeek-V4-Pro-MXFP4保姆级教程一条命令启动1M上下文推理服务【免费下载链接】DeepSeek-V4-Pro-MXFP4项目地址: https://ai.gitcode.com/hf_mirrors/amd/DeepSeek-V4-Pro-MXFP4DeepSeek-V4-Pro-MXFP4 是AMD官方基于 DeepSeek-V4-Pro 量化而来的 MoE 大模型将全部专家层权重压缩为 MXFP4 格式配合 vLLM 推理引擎即可在 AMD MI350/MI355gfx950上高效运行。本教程将带你一步步完成 vLLM 部署 DeepSeek-V4-Pro-MXFP4 的全过程并附上一条命令启动 1M 上下文推理服务的完整方案新手也能轻松上手。一、DeepSeek-V4-Pro-MXFP4 是什么简单说这是一份开箱即用的量化模型仓库模型架构DeepseekV4ForCausalLMMoE 混合专家架构61 层 Transformer、384 个路由专家、每次激活 6 个量化方式OCP MXFP4 静态权重量化 动态激活量化由 AMD-Quark 工具完成最大上下文max_position_embeddings高达 1048576即1M token 超长上下文支持硬件AMD MI355 / MI350gfx950ROCm 7.2.0推理引擎vLLM官方推荐后端因为专家层被压到 MXFP4模型体积和显存占用大幅下降推理吞吐显著提升而精度损失极小——GSM8K 评测恢复率达99.0%93.6 vs 原版 94.90。二、部署前需要准备什么2.1 硬件与系统要求 ✅项目要求GPUAMD MI355 / MI350gfx950系统LinuxROCm7.2.0显存建议多卡并行教程以 4 卡为例2.2 获取模型权重 克隆仓库获取完整权重共 64 个分片git clone https://gitcode.com/hf_mirrors/amd/DeepSeek-V4-Pro-MXFP4仓库内包含model-00001-of-00064.safetensors到model-00064-of-00064.safetensors全部权重分片以及model.safetensors.index.json、config.json、tokenizer.json等必要文件。2.3 准备 vLLM 运行环境官方推荐的镜像为rocm/vllm-dev:nightly_main_20260714vLLM 与 lm_eval 均从源码安装。直接拉取 Docker 镜像即可获得包含 AITER 加速的环境docker pull rocm/vllm-dev:nightly_main_20260714三、一条命令启动 1M 上下文推理服务核心步骤3.1 设置 AITER 加速环境变量AITERAMD 的融合算子库配合共享专家融合能显著提升 MXFP4 模型的解码性能export VLLM_ROCM_USE_AITER1 export VLLM_ROCM_USE_AITER_FUSION_SHARED_EXPERTS13.2 启动 vLLM 服务一条命令搞定vllm serve amd/DeepSeek-V4-Pro-MXFP4 --tensor-parallel-size 4 --kv-cache-dtype fp8 \ --trust-remote-code --tokenizer-mode deepseek_v4 --reasoning-parser deepseek_v4 \ --tool-call-parser deepseek_v4 --enable-auto-tool-choice \ --compilation-config {mode: 3, cudagraph_mode: FULL_DECODE_ONLY}各参数含义速查参数作用--tensor-parallel-size 44 卡张量并行显存压力更小--kv-cache-dtype fp8KV Cache 用 FP8节省显存--trust-remote-code信任远端自定义代码--tokenizer-mode deepseek_v4使用 DeepSeek V4 专用分词模式--reasoning-parser deepseek_v4正确解析思考过程Reasoning--tool-call-parser deepseek_v4启用工具调用解析--enable-auto-tool-choice自动工具选择--compilation-config编译优化模式提升解码性能 这条命令就是官方评测使用的标准启动方式服务默认监听 8000 端口支持 OpenAI 兼容 API。四、验证服务是否启动成功4.1 健康检查启动成功后浏览器访问或 curl 探测curl http://localhost:8000/v1/models看到模型 ID 返回即代表服务已就绪。4.2 测试 1M 上下文推理用 OpenAI 兼容接口发起一次对话传入超长文本即可体验 1M 上下文能力from openai import OpenAI client OpenAI(base_urlhttp://localhost:8000/v1, api_keyEMPTY) resp client.chat.completions.create( modelamd/DeepSeek-V4-Pro-MXFP4, messages[{role: user, content: 请总结这段超长文档的核心观点...}], max_tokens512, ) print(resp.choices[0].message.content)五、进阶用 lm_eval 复现官方评测结果官方在 GSM8K8-shot上使用 lm_eval 评测。先启动上面的服务注意把默认 8000 端口映射为 30000再开新终端执行lm_eval --model local-completions \ --model_args modelamd/DeepSeek-V4-Pro-MXFP4,base_urlhttp://localhost:30000/v1/completions,tokenized_requestsFalse,num_concurrent32 \ --tasks gsm8k --batch_size auto --num_fewshot 8六、常见问题排查 服务启动报显存不足将--tensor-parallel-size从 4 调大如 8或确认 KV Cache 已使用fp8。无法解析思考内容检查--reasoning-parser deepseek_v4与--tokenizer-mode deepseek_v4是否都已添加。工具调用不生效确认已加--enable-auto-tool-choice与--tool-call-parser deepseek_v4。七、相关资源一览模型配置与部署说明README.md推理代码目录inference/官方评测命令inference/README.md模型量化配置config.json总结DeepSeek-V4-Pro-MXFP4 把1M 超长上下文 MXFP4 极致压缩 99% 精度恢复做到了开箱即用。只需克隆仓库、拉取官方 vLLM 镜像、执行一条启动命令你就能在 AMD MI350 上拥有自己的 1M 上下文推理服务。赶紧动手试试吧【免费下载链接】DeepSeek-V4-Pro-MXFP4项目地址: https://ai.gitcode.com/hf_mirrors/amd/DeepSeek-V4-Pro-MXFP4创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考