MiniMax 安排 H3 消费级硬件演示,性能仍未得到验证
8月7日的会议承诺提供开放的 H3 权重、立体声音频和现成的工作流程,但尚无官方基准测试确定硬件、内存使用或生成速度。
By Ryan Merket · Published
Primary source: MiniMax
Why it matters
H3 could put synchronized audio-video generation on personal machines, but developers still need reproducible GPU, memory and runtime measurements before they can assess its cost or compare it with Wan, HunyuanVideo and LTX-2.

MiniMax,由 Junjie Yan 创立并领导,原定于 2026 年 8 月 7 日与 ComfyUI 举行一次直播,演示其 H3 视频模型在消费级硬件上的运行情况。该场次定于太平洋时间上午 10 点开始。
官方公告称 MiniMax 将展示“how H3 got small enough to run on consumer hardware”(H3 如何变得足够小以在消费级硬件上运行),并提供可直接使用的 ComfyUI 工作流模板。这构成了一个承诺的演示,但并非已验证的性能。在已审阅来源中,没有官方录音或日志能确定用于演示的 GPU、显存、系统内存、量化设置、卸载配置、生成时间,或是否在本地生成了 2K 片段。
此活动延续了 Yan 推动让先进模型更廉价、更易分发的努力。Yan(MiniMax 的董事长、首席执行官兼首席技术官)于 2015 年加入 SenseTime,后任副总裁,之后创办 MiniMax。他在东南大学学习数学,在中国科学院获得人工智能博士学位,并在清华大学从事博士后研究,依据其MiniMax 管理层简介。
在一场2025 年主题演讲中,Yan 表示开源创新正在赶上来,推理成本在下降,而有用的 AI 需要变得更可负担和更易获得。MiniMax 成立于 2021 年 12 月,总部位于上海,开发涵盖语言、视频、音频和音乐的模型与产品。
硬件细节将决定“consumer”意味着什么
研究简报支持这个更狭义的描述:H3 是一个开源权重的多模态视频生成模型,内置立体声功能,输出选项最高可达 2K,并支持 ComfyUI 工作流。MiniMax 的平台文档 列出文本到视频、图片到视频、首尾帧生成以及多模态参考输入,剪辑时长为 4 到 15 秒不等,帧率为每秒 24 帧。
ComfyUI 的官方text-to-video 工作流资料为用户提供了用于本地生成的现成 H3 工作流。现有资料未提供完整的本地 2K 基准或用于运行该基准的硬件信息。
这些工作流文件使模型可检查且可配置,但它们并未显示哪些个人电脑可以以有用的速度生成剪辑。“消费级硬件”可能涵盖从高内存桌面 GPU 到使用激进量化和 CPU 卸载的笔记本电脑等一系列系统。如果没有指明机器型号、可见的内存消耗和测量的运行时间,开发者无法重现 MiniMax 的性能主张或估算自己运行 H3 的成本。
ComfyUI 的参与为这次测试带来了实际意义。其界面将生成管线表示为相连节点,公开模型加载、提示词、参考媒体、分辨率和输出处理。Comfy Org 联合创始人兼 CEO Yoland Yan(前 Google Search 的机器学习工程师和 Chromium 提交者)已将该项目从最初的图像生成用例拓展到视频、音频和 3D 工作流。
围绕这一方法,Comfy 也吸引了机构支持。Comfy Org 在 2025 年筹集了 1700 万美元,随后在 2026 年 4 月完成了 3000 万美元融资,据报道估值为 5 亿美元。报道的投资者包括 Craft Ventures、Pace Capital、Chemistry、Abstract Ventures、Cursor Capital、Essence VC、Stratus Ventures、TruArrow 以及 Vercel 创始人 Guillermo Rauch。
H3 进入竞争激烈的本地视频赛道
MiniMax 正在与若干公开或可下载的视频模型竞争,这些模型的开发者公布了更具体的内存目标。Alibaba 的 Wan2.2 包含一个 50 亿参数的文本和图像到视频模型,目标是至少 24GB 显存的 GPU。Tencent 的 HunyuanVideo-1.5 使用 83 亿参数架构,并在启用卸载时记录了 14GB 显存的最低要求。Lightricks 的 LTX-2 结合了独立的 140 亿参数视频流和 50 亿参数音频流。
H3 所宣称的开源权重、立体声和最高 2K 剪辑组合为 MiniMax 提供了独特的技术卖点。在 MiniMax 发布足够的运行时细节以便将 H3 与这些替代方案进行衡量之前,这种比较仍不完整。仅凭参数数量不能决定内存使用或生成速度;模型精度、注意力实现、编码器加载和卸载选择都可能实质性地改变结果。
MiniMax 拥有充足的资金来支持模型计划。Alibaba 在 2024 年 3 月领导了一轮超过 6 亿美元的融资,估值约为 25 亿美元。MiniMax 的披露材料还列出了包括腾讯相关实体、MiHoYo、Hillhouse、HongShan、IDG Capital、Yunqi Capital、GL Ventures 和上海国资在内的其他支持者。公司随后在 2026 年 1 月在香港首次公开募股中筹集了约 6.19 亿美元,依据其上市招股说明书。
这些资金为 Yan 提供了 H3 的分发基础。尚未解决的问题是个人机器上的执行情况。一个可复现的基准需要展示所用 GPU、显存和系统内存使用情况、模型精度、卸载设置、生成时间、分辨率和剪辑长度。已审阅来源确立了 H3 宣布的能力和可下载的 ComfyUI 工作流,但并未确立其在消费级硬件上的实际性能。