MiniMax 预告 H3 将作为 Hailuo AI 的统一多模态模型

MiniMax 正在将 H3 定位为一个用于文本、图像、视频和音频的单一系统,旨在跨媒体传递创作性上下文。

By · Published

Primary source: MiniMax

Why it matters

MiniMax is pitching H3 as a unified system for text, images, video and sound. If it can carry shared context across those formats, H3 could reduce the tool handoffs involved in producing longer, more complex creative work.

MiniMax teases H3 as a unified multimodal model for Hailuo AI

Yan JunjieMiniMax 公开预热了 H3,仅写道 “就要来了。” 并标注了 Hailuo AI,这是 MiniMax 的视频生成产品。措辞将 H3 与 Hailuo 面向创作者的服务联系在一起,但并未确立产品发布。

MiniMax 在 X

Yan,MiniMax 的创始人、董事长、首席执行官兼首席技术官,是通过学术研究进入基础模型领域的,而非来自消费软件。他在 Southeast University 获得数学学位,在 Chinese Academy of Sciences 完成了人工智能方向的博士学位,并在 清华大学 从事博士后研究。在创办 MiniMax 之前,他在 SenseTime 工作超过六年,担任过副总裁和研究院副院长等职务。

这一背景契合 MiniMax 在视频生成、角色应用和基础模型方面的工作。

H3 是一次对工作流程的押注

在 X 上的预热之前,MiniMax 已经展示过发展方向。一个由 Shanghai Securities News 报道并由 Sina Finance 转载的 7月17日报告 表示,MiniMax 在 WAIC 2026 预览了 H3,称其为下一代多模态生成模型。展区描述了一个系统,能够解释由文本、图像、视频和声音组成的共享上下文,然后在这些格式之间生成更连贯的结果。

如果 MiniMax 实现了该设计,H3 将减少许多当前创作工作流程中的交接环节。用户通常需要在故事开发、图像生成、视频生成、音频和剪辑等独立工具之间切换。MiniMax 主打的是一种将整个项目理解为连续上下文的模型。

这与只在短片质量上竞争的产品目标不同。例如,Runway 的 Gen-4.5 强调的是运动质量、提示遵循性、时间一致性和精细控制。H3 仍将面临这些考验。MiniMax 也试图提升到更高一层,从生成单一资产转向管理围绕资产的更多创作流程。

有用的比较将需要关于输出时长和分辨率、同步音频、角色与场景一致性、编辑控制、延迟和生成成本的细节。API 的可用性将表明 MiniMax 是否将 H3 主要视为 Hailuo 的一项功能,还是作为其他产品团队可以集成到自身软件中的基础设施。

Yan 将产品节奏与融资计划配对

H3 紧随 MiniMax 在 6 月 1 日发布的 MiniMax M3 之后发布,M3 是一个面向编码、代理与多模态输入的开放权重模型。MiniMax 表示 M3 支持高达 100 万 token 的上下文窗口,并且可以处理图像和视频输入。该发布确立了 Yan 的产品结构的另一半:M 系列用于语言、编码和代理,Hailuo 系列用于视觉创作。

发布顺序也呼应了一项大规模资本计划。MarketScreener 报道,MiniMax 在 7 月寻求通过股权出售和可转换债券发行筹集约 HK$16.04 billion,或约 $2.05 billion。

如果完成,这笔融资将有助于资助模型训练、推理能力、研究招聘和分发,同时在 MiniMax 与更知名的视频平台竞争时提供支持。但这一资本计划并不能证明 H3 的技术表现。

MiniMax 的经济情况仍然使模型效率和变现成为核心。MiniMax 披露 2025 年收入为 $79.0 million,调整后净亏损为 $250.9 million。年终账目列示了在现金、存款和若干类别金融资产中合计 $1.05 billion。MiniMax 还表示其产品已为来自 200 多个国家的超过 3 亿个人用户以及超过 100 万家企业和开发者提供服务,其视频模型已生成超过 6 亿个视频。

MiniMax 的 annual report 将收入分为 AI 原生产品和开放平台及其他 AI 企业服务;收入表并未将 Hailuo AI 单列。因此,H3 不仅需要推进 MiniMax 的模型工作,还要为创作者提供另一个直接付费给 MiniMax 的理由。

发布细节将决定叙事方向

MiniMax 的 prospectus 称 MiniMax “从成立之初”就致力于开发多模态模型。在其 2025 年业绩公告中,MiniMax 单独引用了 Yan 的话,称 MiniMax 在这一年内已建立起全模态的研发能力。H3 将 MiniMax 的战略浓缩为一个实用的赌注:创作者会更倾向于一个能够在文本、视觉、运动和声音之间传递意图的系统,而不是在每一步都被迫重建上下文。

下一次公告需要把这一赌注变成产品。模型卡、公开访问条款和可复现的演示将展示 H3 中有多少是统一架构,有多少是围绕专用组件的编排。定价将揭示 MiniMax 是否计划利用其新资本压低竞争对手价格、保护利润率,或将 H3 保留给更高价值的制作工作。

这次预热本就信息有限。MiniMax 已在寻求大量新融资,通过 Hailuo 建立分发渠道,并描述了其认为多模态创作的发展方向。现在 H3 需要把这些部分连接起来。

Reader comments

Conversation for this story loads after sign-in.