Skip to main content
MiniMax-H3 是面向视频生成的多模态模型。它支持文本、首尾帧、参考图片、参考视频和参考音频输入,生成任务采用异步模式:先创建任务,再根据 task_id 查询结果。

核心能力

  • 文本生成视频 — 通过提示词控制主体、场景、镜头和动作
  • 首尾帧控制 — 传入首帧,或同时传入首帧与尾帧
  • 多模态参考 — 最多组合 12 个图片、视频和音频素材
  • 灵活输出 — 支持 768P2K,时长范围为 4–15 秒
  • 异步任务 — 支持轮询查询,也可设置 callback_url 接收任务状态通知

快速开始

1. 创建视频任务

创建成功后返回:

2. 查询任务结果

任务状态包括 queuedrunningsucceededfailedcancelled。成功后可从 task.content.url 获取视频地址。查询接口仅保证可查询最近 7 天内创建的任务。

输入模式

content 必须且只能包含一个非空的 text 项,还可以添加媒体项:
首帧/尾帧模式不能与参考图片、参考视频或参考音频模式混用。所有媒体项合计最多 12 个。

首帧图生视频示例

多模态参考示例

参数说明

纯文本生成视频时,ratio 不能使用 adaptive,请指定一个明确比例。图生视频或参考素材模式可使用 adaptive

媒体要求

  • 请求体总大小不超过 64 MB
  • 图片支持 JPG、JPEG、PNG、WEBP、HEIC、HEIF,单张不超过 30 MB
  • 视频支持 MP4、MOV;视频编码支持 H.264/H.265,音频编码支持 AAC/MP3;单个不超过 50 MB、时长 2–15 秒
  • 音频支持 WAV、MP3;单个不超过 15 MB、时长 2–15 秒
  • 图片和视频宽高均为 256–5760 像素,宽高比范围为 0.4–2.5
  • 视频帧率范围为 23.976–60 FPS

创建视频任务

查看完整请求字段并在线调试。

查询视频任务

根据 task_id 查询状态与视频结果。