ithome
其他
采集 2026-07-31T13:30:55+00:00
MiniMax H3 通用多模态视频模型将于 8 月 3 日开源
原始标题:MiniMax H3 通用多模态视频模型将于 8 月 3 日开源,最高可支持 15s 2K 分辨率
来源
ithome
发布时间
2026-07-31T13:13:29
采集批次
2026-07-31-10
字数
568
URL 指纹
300d2518c6ee405a
📌 AI 总结(236 字)
稀宇科技宣布推出 MiniMax H3 通用多模态视频模型,并将于北京时间 8 月 3 日 0 点正式开源。H3 支持对文本、图像、视频、声音的统一理解,并能输出原生双声道音视频,最高支持 15 秒 2K 分辨率。官方称凭借 Contextual Omni Representation 等多项技术,模型在 2K 分辨率下每秒价格不到主流模型的三分之一,768P 下是主流 720P 模型的一半。该模型面向影视、广告、电商、游戏等商用场景,支持多模态编辑与精细化指令控制。
📄 正文(568 字)
IT之家 7 月 31 日消息,稀宇科技今天宣布推出 MiniMax H3 通用多模态视频模型,魔搭社区显示,这款模型将于北京时间 8 月 3 日 0 点正式开源。 MiniMax H3 支持对文本、图像、视频、声音组成的多模态上下文的统一理解能力,能够输出具备原生双声道的音视频,最高可支持 15s 2K 分辨率。 得益于 Contextual Omni Representation、H3-VAE、H3-Omni Transformer、In-context Regeneration 等多项技术,MiniMax 称有能力提供行业内最优的性价比,默认提供 2K 的分辨率,模型在 2K 分辨率下每秒价格不到主流模型的三分之一,768P 分辨率下是主流模型 720P 的一半。 官方表示,这款模型有以下亮点: 原生多模态理解与生成:支持文字、图片、音频、视频等多种输入,理解不同素材中的人物、动作、声音、情绪、镜头、风格与表达意图,并将多种参考信息自然融合。 多模态精准编辑与控制:支持对人物、物体、场景、声音与节奏进行多维度编辑,并具备精细化指令遵循能力。 商用级多场景内容生成:面向影视、广告、品牌、电商与游戏等真实商业内容场景,兼顾文字字幕、品牌信息、创意特效、产品展示、UI/UX 动态演示、游戏视觉及风格化表达。