MiniMax H3 是 2026 年 8 月开源的全模态视频生成系统由三个模块串联构成H3-Context-IR多模态指令理解托管 API、H3-Base33B 核心生成已开源输出 768p、H3-Regenerate-2K超分还原 2K托管 API尚未开源。H3-Base 提供 FL2VA首尾帧和 Ref2VA全能参考两个开源检查点可通过 SGLang、vLLM 或 diffusers 本地部署完整的 2K 输出需要将本地 H3-Base 与官方 Context-IR 和 Regenerate-2K API 组合为 Full 2K Workflow。本文从零梳理三条路径的完整配置直接调用官方 APIH3-2K 直出、本地部署 H3-Base 输出 768p、Full 2K 三段式流水线附完整代码示例和关键参数说明帮助开发者选择适合自身场景的接入方式。三模块架构与开源边界在动手之前先搞清楚哪部分可以本地跑、哪部分必须调 API避免走弯路模块功能是否开源接入方式H3-Context-IR将用户输入的多模态描述文字图/视频/音频转换为结构化、语义丰富的视频提示词否托管POST /v2/h3_context_irH3-Base核心生成输出 768p 原生立体声音频是FL2VA / Ref2VA 两个检查点SGLang / vLLM / diffusers 本地部署H3-Regenerate-2K将 768p 基础输出再生成为 2K 高分辨率利用原始上下文还原细节否尚未开源后续发布POST /v2/video_regeneration官方建议即使本地部署了 H3-Base也应先通过 H3-Context-IR API 处理输入再把增强后的提示词喂给本地模型——Context-IR 对最终生成质量影响显著绕过它直接输入原始 Prompt 效果会下降。两个开源检查点对应不同输入场景检查点任务支持输入H3-Base FL2VA首尾帧生成fl2va文本可选首帧 / 尾帧 / 首尾帧各一张图H3-Base Ref2VA全能参考生成ref2va文本 参考图片≤9张/ 参考视频≤3段/ 参考音频≤3段组合路径一官方 API 直接调用H3-2K 直出最省事适合不需要本地部署、数据非敏感、想最快出 2K 视频。获取 API Key前往 platform.minimaxi.com国内或 platform.minimax.io海外注册账号在「账户管理 → 接口密钥」中生成 API Key。最简文生视频importosimporttimeimportrequests api_keyos.environ[MINIMAX_API_KEY]headers{Authorization:fBearer{api_key},Content-Type:application/json}BASE_URLhttps://api.minimaxi.com# 国内端点海外改为 api.minimax.io# 第一步提交任务defcreate_t2va_task(prompt:str,duration:int5,ratio:str16:9)-str:urlf{BASE_URL}/v2/video_generationpayload{model:MiniMax-H3,content:[{type:text,text:prompt}],resolution:2K,duration:duration,ratio:ratio# 文生视频必填不能用 adaptive}rrequests.post(url,headersheaders,jsonpayload)r.raise_for_status()returnr.json()[task_id]# 第二步轮询任务状态defpoll_task(task_id:str)-dict:urlf{BASE_URL}/v2/query/video_generationwhileTrue:rrequests.get(url,headersheaders,params{task_id:task_id})r.raise_for_status()taskr.json()[task]statustask[status]ifstatussucceeded:returntaskelifstatusin(failed,cancelled):raiseRuntimeError(f任务失败{task})print(f状态{status}等待中...)time.sleep(5)# 第三步下载视频defdownload_video(task:dict,output_path:str):video_urltask[content][url]rrequests.get(video_url,streamTrue)r.raise_for_status()withopen(output_path,wb)asf:forchunkinr.iter_content(chunk_size8192):f.write(chunk)print(f已保存{output_path})# 完整调用示例task_idcreate_t2va_task(镜头拍摄一个女性坐在咖啡馆里她抬头看向窗外镜头缓缓推向窗外的街道暖色调。)taskpoll_task(task_id)download_video(task,output.mp4)图生视频首尾帧模式defcreate_fl2va_task(prompt:str,first_frame_url:str,duration:int8)-str:urlf{BASE_URL}/v2/video_generationpayload{model:MiniMax-H3,content:[{type:text,text:prompt},{type:image_url,image_url:{url:first_frame_url},role:first_frame# 或 last_frame / 同时传两张}],resolution:2K,duration:duration,ratio:adaptive# 图生视频由输入图片决定宽高比}rrequests.post(url,headersheaders,jsonpayload)r.raise_for_status()returnr.json()[task_id]关键参数速查参数类型说明modelstring固定MiniMax-H3resolutionenum768P或2Kdurationint4–15 秒整数ratioenum文生视频必填非adaptive可选21:9、16:9、4:3、1:1、3:4、9:16callback_urlstring可选任务状态变更时推送通知避免轮询aigc_watermarkbool是否添加 AIGC 水印默认false请求体总大小上限 64 MB大文件建议通过公网 URL 传入不推荐 Base64。通过聚合平台接入统一 Key 管理如果你的项目同时调用 MiniMax H3 和其他模型DeepSeek、Kimi、GLM 等也可以通过七牛云 AI Token Plan 接入——MiniMax 在其支持的模型列表内base_url换成七牛云端点其余代码结构不变# 通过七牛云接入 MiniMax H3兼容 OpenAI 协议统一 API KeyBASE_URLhttps://api.qnaigc.com/v1# 七牛云端点# 视频生成请求结构与官方 API 相同model 字段填 MiniMax-H3多模型并用时统一 Key 省去为每个模型维护独立鉴权配置的麻烦对只调 MiniMax 单一模型的项目直连官方 API 更直接。详见七牛云 AI Token Planqiniu.com/ai/plan。路径二本地部署 H3-Base输出 768p适合数据不出内网、需要微调、有 GPU 算力。硬件要求H3-Base 为 BF16 精度的 Omni Transformer 权重推理时 AdaLN 相关的约 13B 参数可以预计算缓存不常驻显存。推荐配置配置说明4 × A100 80GFL2VA 或 Ref2VA 单检查点推理8 × A100 80G更大 batch或同时部署双检查点4 × H100 80G更高吞吐支持--performance-mode speed操作系统LinuxCUDA下载权重# 安装 huggingface_hub CLIpipinstallhuggingface_hub# 仅下载 FL2VA 检查点文生视频 / 首尾帧hf download MiniMaxAI/MiniMax-H3\--includemodel_index.jsonmodular_model_index.jsonFL2VA/*\--local-dir MiniMax-H3# 同时下载两个检查点hf download MiniMaxAI/MiniMax-H3\--includemodel_index.jsonmodular_model_index.jsonFL2VA/*Ref2VA/*\--local-dir MiniMax-H3国内网络可改用魔搭社区镜像modelscope.cn/models/MiniMax/MiniMax-H3通过 ModelScope SDK 或直接git clone下载。每个检查点目录结构FL2VA/ ├── model_index.json ├── processor/ ├── tokenizer/ ├── text_encoder/ # H3-Encoder基于 Qwen3-VL-32B 第50层隐状态 ├── transformer/ # H3-Omni-Transformer 主体 ├── visual_vae/ # 空间16×、时间4×压缩的视频 VAE └── audio_vae/ # 32kHz 立体声音频 VAESGLang 部署pipinstallsglang# 部署 FL2VA文生视频 / 首尾帧sglang serve\--model-path MiniMax-H3\--num-gpus4\--ulysses-degree4\--performance-mode speed\--host0.0.0.0\--port30010\--model-variant fl2va# 部署 Ref2VA全能参考生成需另开端口sglang serve\--model-path MiniMax-H3\--num-gpus4\--ulysses-degree4\--performance-mode speed\--host0.0.0.0\--port30011\--model-variant ref2va调用本地 SGLang 服务768p 推理importrequests,base64,time SGLANG_URLhttp://localhost:30010deflocal_generate(prompt:str,duration:int5,ratio:str16:9)-str:payload{model:MiniMax-H3,content:[{type:text,text:prompt}],resolution:768P,duration:duration,ratio:ratio}rrequests.post(f{SGLANG_URL}/v2/video_generation,jsonpayload)r.raise_for_status()task_idr.json()[task_id]# 轮询本地任务whileTrue:rrequests.get(f{SGLANG_URL}/v2/query/video_generation,params{task_id:task_id})taskr.json()[task]iftask[status]succeeded:# 本地输出通常为 base64 Data URL 或本地路径returntask[content][url]time.sleep(3)vLLM 部署可选替代pipinstallvllm --torch-backendauto vllm serve MiniMax-H3/FL2VA\--trust-remote-code\--tensor-parallel-size4diffusers 部署适合研究 / 微调fromdiffusersimportMiniMaxH3ModularPipeline pipeMiniMaxH3ModularPipeline.from_pretrained(MiniMaxAI/MiniMax-H3)# diffusers 会自动按需拉取所需组件路径三Full 2K Workflow本地 H3-Base 官方 API 串联这是 MiniMax 官方推荐的复现最优质量路径用户输入 → H3-Context-IR API → 结构化提示词 ↓ 本地 SGLang (H3-Base) ↓ 768p 视频文件 ↓ H3-Regenerate-2K API → 2K 成片环境变量配置SGLANG_DEPLOYMENT_URLhttp://localhost:30010MINIMAX_API_BASEhttps://api.minimaxi.com# 国内TOKEN你的 MiniMax API Key第一步H3-Context-IR增强提示词importos,time,requests api_keyos.environ[MINIMAX_API_KEY]headers{Authorization:fBearer{api_key},Content-Type:application/json}defrun_context_ir(prompt:str,duration:int,ratio:str)-str:调用 H3-Context-IR返回结构化提示词字符串。payload{model:MiniMax-H3,content:[{type:text,text:prompt}],duration:duration,ratio:ratio}rrequests.post(f{os.environ[MINIMAX_API_BASE]}/v2/h3_context_ir,headersheaders,jsonpayload)r.raise_for_status()task_idr.json()[task_id]# 轮询直到完成whileTrue:rrequests.get(f{os.environ[MINIMAX_API_BASE]}/v2/query/video_generation,headersheaders,params{task_id:task_id})taskr.json()[task]iftask[status]succeeded:# content.prompt 是增强后的结构化提示词returntask[content][prompt]time.sleep(3)Context-IR 输出的content.prompt是一段详细的英文结构化描述包含镜头描述integrated_multimodal_description、音景overall_soundscape、非剧情音乐non_diegetic_music三个字段。以 10 秒视频为例典型输出约消耗 8565 token输入 5650 输出 2915。第二步本地 H3-Base 生成 768p把 Context-IR 输出的结构化提示词直接传入本地 SGLang 服务defrun_h3_base_local(enhanced_prompt:str,duration:int,ratio:str,output_path:strh3_base_768p.mp4):用增强提示词调本地 SGLang保存 768p 视频。payload{model:MiniMax-H3,content:[{type:text,text:enhanced_prompt}],resolution:768P,duration:duration,ratio:ratio}rrequests.post(f{os.environ[SGLANG_DEPLOYMENT_URL]}/v2/video_generation,jsonpayload)r.raise_for_status()task_idr.json()[task_id]whileTrue:rrequests.get(f{os.environ[SGLANG_DEPLOYMENT_URL]}/v2/query/video_generation,params{task_id:task_id})taskr.json()[task]iftask[status]succeeded:video_urltask[content][url]# 下载保存到本地withopen(output_path,wb)asf:f.write(requests.get(video_url).content)returnoutput_path time.sleep(3)第三步H3-Regenerate-2K768p → 2Kdefrun_regenerate_2k(original_prompt:str,video_path:str,duration:int,ratio:str)-str:将本地 768p 视频超分到 2K返回最终视频 URL。# 生产环境建议上传到公网 URL本地测试可用 Base64 Data URLwithopen(video_path,rb)asf:video_b64data:video/mp4;base64,__import__(base64).b64encode(f.read()).decode()payload{model:MiniMax-H3,content:[{type:text,text:original_prompt},{type:video_url,video_url:{url:video_b64},role:base_video}],resolution:2K}rrequests.post(f{os.environ[MINIMAX_API_BASE]}/v2/video_regeneration,headersheaders,jsonpayload)r.raise_for_status()task_idr.json()[task_id]whileTrue:rrequests.get(f{os.environ[MINIMAX_API_BASE]}/v2/query/video_generation,headersheaders,params{task_id:task_id})taskr.json()[task]iftask[status]succeeded:returntask[content][url]time.sleep(5)# 完整 Full 2K Workflowdeffull_2k_workflow(user_prompt:str,duration:int10,ratio:str16:9)-str:print(Step 1: H3-Context-IR 增强提示词...)enhancedrun_context_ir(user_prompt,duration,ratio)print(Step 2: 本地 H3-Base 生成 768p...)local_videorun_h3_base_local(enhanced,duration,ratio)print(Step 3: H3-Regenerate-2K 超分到 2K...)final_urlrun_regenerate_2k(enhanced,local_video,duration,ratio)print(f完成{final_url})returnfinal_url三条路径怎么选场景推荐路径原因快速验证 / 小团队 / 数据非敏感路径一官方 API 直出 2K无需 GPU最快出片0.8 元/秒全包数据合规要求 / 企业内网 / 需要微调路径二本地 H3-Base 768p数据不离本地支持 LoRA 微调768p 已满足大部分分发需求追求最高质量 数据自控路径三Full 2K Workflow本地生成 官方超分画面细节最优需要调两次 API 自建 SGLang 服务ComfyUI 可视化工作流使用官方 ComfyUI 节点参考 T2V 模板 / R2V 模板常见问题QH3-Context-IR 不开源可以自己替代吗官方提供了 Prompting Guidance 文档HuggingFace README说明了如何手工构建包含integrated_multimodal_description、overall_soundscape、non_diegetic_music三部分的结构化提示词给有 Prompt Engineering 能力的团队提供替代路径。自建系统质量低于官方 Context-IR但在简单场景下差距可控。QH3-Regenerate-2K API 未开源Full 2K Workflow 是否完全本地化目前不能完全本地化——H3-Base 768p 生成可以本地完成但 2K 超分必须调官方 API。MiniMax 表示 H3-Regenerate-2K 后续会单独开源。如果无法接受任何外部 API 调用当前只能输出 768p。Q本地部署后如何计费本地部署 H3-Base 本身不产生 API 费用仅服务器 GPU 成本。调用官方 H3-Context-IR 和 H3-Regenerate-2K API 按使用量计费具体定价见 platform.minimaxi.com/pricing。直接调官方/v2/video_generation端点输出 2K 按 0.8 元/秒计费一次性包含三个模块。Q多模态参考Ref2VA和首尾帧FL2VA如何搭配两种模式互斥不能在同一请求中混用。first_frame/last_frame角色的图片属于 FL2VA 模式reference_image/reference_video/reference_audio属于 Ref2VA 模式混用会报参数错误。需要同时控制首帧和参考风格的场景官方目前没有单次请求支持可以分两步先用 Ref2VA 生成带参考风格的视频再用该视频的首帧做第二次 FL2VA 请求。Q本地部署时能否同时运行 FL2VA 和 Ref2VA两个检查点可以在不同端口同时运行但各自需要一套 4 卡配置或合理分配 GPU 资源。SGLang 的--port参数隔离两个服务代码里按任务类型路由到对应端口即可。小结MiniMax H3 的三模块设计意味着开发者需要根据数据合规要求和成本预算在三条路径中做选择直接调官方 API 最省事0.8 元/秒一步到位本地部署 H3-Base 能把数据留在内网但目前 2K 超分仍依赖官方 APIFull 2K Workflow 是质量最优的本地云端混合方案适合对画面要求高且有工程能力的团队。H3-Regenerate-2K 开源后完全本地化 2K 流水线将成为可能。数据来源MiniMax H3 官方 HuggingFace READMEhuggingface.co/MiniMaxAI/MiniMax-H32026 年 8 月 4 日、MiniMax 开放平台 API 文档platform.minimaxi.com/docs2026 年 8 月、MiniMax H3 发布公告minimaxi.com/blog/minimax-h32026 年 7 月 31 日。延伸阅读MiniMax H3 开源权重与完整 READMEhuggingface.co/MiniMaxAI/MiniMax-H3MiniMax 开放平台 API 文档国内platform.minimaxi.com/docs/guides/video-generationSGLang 官方 MiniMax-H3 部署指南docs.sglang.io/cookbook/diffusion/MiniMax/MiniMax-H3七牛云 MiniMax Token Planqiniu.com/ai/plan