ithome
汽车
采集 2026-08-03T04:37:11+00:00
通用视频模型MiniMax H3正式开源,支持多模态输入与2K分辨率输出
原始标题:通用视频模型 MiniMax H3 正式开源,支持多模态上下文、2K 分辨率
来源
ithome
发布时间
2026-08-03T02:52:25
采集批次
2026-08-03-04
字数
843
URL 指纹
f2c0270a3c41dc6b
📌 AI 总结(246 字)
MiniMax于8月3日正式开源新一代通用视频模型MiniMax H3,这是一个全模态生成系统,可统一理解文本、图像、视频和音频构成的多模态上下文,并生成最高2K分辨率、最长15秒的带原生立体声音频视频。H3支持4至15秒输出、多种宽高比、24帧率及32kHz立体声,稳定支持11种语言对话。该系统由H3-Context-IR、H3-Base和H3-Regenerate-2K三个模块组成,采用MiniMax H3 Community License发布,代码已在HuggingFace开源。
📄 正文(843 字)
IT之家8月3日消息,今日MiniMax正式开源新一代通用视频模型MiniMax H3。 据介绍,MiniMax H3是一个通用型全模态生成系统。它能够统一理解由文本、图像、视频和音频构成的多模态上下文,并可生成最高2K分辨率、最长15秒、带有原生立体声音频的视频。得益于以任务泛化为导向的系统设计,H3在预训练阶段便已具备广泛的多模态上下文理解与生成能力,因此能够出色地遵循复杂的多模态指令。 H3支持以下输入与输出规格: 输出时长为4至15秒;输出宽高比支持21:9、16:9、4:3、1:1、3:4和9:16等多种比例;输出分辨率默认将较短边设置为768像素,使用H3-Regenerate-2K可实现2K分辨率生成;输出帧率为24 FPS;输出音频为32 kHz立体声。语言方面,H3稳定支持阿拉伯语、中文、英语、法语、德语、意大利语、日语、韩语、葡萄牙语、俄语和西班牙语共11种语言。 模型版本与输入规格方面,H3-Base-FL2VA为首尾帧模式,支持输入0张、1张或2张图像,分别对应文生视频、首帧生视频、尾帧生视频和首尾帧生视频模式。H3-Base-Ref2VA为全模态参考模式,图像最多支持9张,视频最多3段(每段2至15秒,总时长不超过15秒),音频最多3段(必须与图像或视频一同输入),混合输入总计不超过12个文件。 完整的H3系统由三个模块组成:H3-Context-IR用于深入理解和提炼输入的多模态指令,并将其转换为Context Intermediate Representation;H3-Base根据H3-Context-IR的输出生成768p分辨率的音频和视频;H3-Regenerate-2K将768p结果连同原始上下文送回H3,以2K分辨率重新生成更高质量的输出。 MiniMax H3基于MiniMax H3 Community License发布,开源地址为huggingface.co/MiniMaxAI/MiniMax-H3。