智东西(公众号:zhidxcom)
作者 |  杨京丽
编辑 |  李水青

智东西9月11日报道,上个月,MiniMax开源通用视频模型MiniMax H3。在第三方评测平台Artificial Analysis上,该模型一度登顶有声视频编辑榜榜首,Elo得分达到1130。凭借开放权重、视频生成质量和性价比,H3很快在开发者社区内衍生出大量适配和新玩法

模型开源解决了“能不能部署”的问题,但距离真正真正进入创作流程,中间还有一道速度门槛。对于需要反复调整画面的创作者来说,生成速度直接影响创作节奏。

针对这一痛点,RunningHub近期推出并开源了H3视频生成加速方案H3 Lightning。在一组5秒视频生成对照测试中,RunningHub将H3的生成耗时从348.8秒缩短至28.7秒,整体推理速度达到基础方案的约12倍,等待时间减少约92%

目前,相关技术方案和复现说明已经在GitHub公开。有多卡设备的用户可以参考方案进行本地部署,没有设备的普通创作者也可以直接在RunningHub上使用

15秒视频,54秒生成!AI视频创作的“等待焦虑”,被RunningHub这套开源方案治好了

项目开源地址:

https://github.com/RH-RunningHub/MiniMax-H3-MultiGPU-Lightning

一、5秒视频不到半分钟生成,等待时间减少92%

H3开源后迅速受到创作者关注,但实际部署后,一个问题随之显现:模型权重虽然可以下载,生成速度却依然影响使用体验。

在RunningHub的一组对照测试中,测试环境配备4张NVIDIA RTX 6000D专业显卡,生成一段5秒、1344×768分辨率的视频。采用BF16基础方案,完成这一过程需要50步,耗时348.8秒,接近6分钟

RunningHub首先引入RH后训练加速模型,将生成步数从50步压缩至9步,用更少的计算轮次完成视频生成。在这一配置下,生成耗时缩短至60秒,速度达到基础方案的5.8倍

在此基础上,RunningHub进一步叠加算子和编译优化,将生成耗时继续压缩至28.7秒。相较基础方案,整体推理速度提高约12倍,等待时间减少约92%

为验证这一能力,智东西也在RunningHub平台进行了测试,我们先让H3生成了一段5秒的视频,内容是一只流浪猫吃猫粮,平台用时28秒完成生成,整体过程较为流畅。

▲5秒视频生成用时28秒(生成过程经倍速处理)

随后,我们提高测试难度:将视频时长增加到15秒,让模型生成一段发生在高级餐厅的都市短剧,角色变多、还加上了台词。

15秒视频,54秒生成!AI视频创作的“等待焦虑”,被RunningHub这套开源方案治好了

▲15秒视频生成用时54秒(生成过程经倍速处理)

这段视频用时约54秒完成。视频中,一名身穿红裙、披着西装的女子带着两名保镖愤怒地冲进餐厅,宣布“在场的所有人,一个都不许走”,现场气氛迅速变得紧张。实测来看,画面整体完成度较高,角色动作衔接自然人物表情能够配合情节变化,台词、口型与画面基本匹配,声音也较为清晰,很有短剧的感觉。

除了文生视频,RunningHub这套加速方案还可用于多参考图视频生成。在另一组测试中,RunningHub使用8张RTX 6000D显卡,以4步生成15秒、768×1344分辨率的竖屏视频。其中,文生视频耗时约48秒,根据两张参考图生成视频耗时约73秒

值得注意的是,H3 Lightning在提高速度的同时兼顾生成效果,仍保留BF16数值精度,且各项配置均经过组合测试和画质验收。

生成时长缩短,意味着创作者可以更快看到生成结果、调整提示词并尝试下一个版本。对于依赖反复迭代的AI视频创作,单次等待时间的缩短,最终会转化为整个创作流程效率的提升

二、从50步压到9步,三层优化实现12倍提速

从近6分钟缩短至不到30秒,背后是一套覆盖模型计算和硬件协作的系统优化

首先,视频生成需要经过多轮计算逐步形成画面,通常生成步数越多,耗费的时间越长。RH后训练加速模型将对照测试的生成步数从50步压缩至9步,使耗时由348.8秒缩短至60秒,率先实现5.8倍提速

减少生成步骤之后,RunningHub继续提高剩余计算的执行效率SageAttention2用于加快注意力计算,Cache-DiT通过缓存复用部分中间结果,减少后续步骤中的重复计算,torch.compile则对模型的计算流程进行编译优化,使其以更适合GPU的方式执行。

三项技术与RH后训练加速模型叠加后,5秒视频的生成耗时由60秒进一步缩短至28.7秒,相较BF16基础方案实现约12倍的整体加速

最后一层优化,是让多张显卡配合得更好。多卡视频生成不仅需要拆分计算任务,还需要在不同显卡之间交换数据。显卡之间如何分工,会直接影响生成速度、通信开销和显存占用。

针对主要通过PCIe连接、没有NVLink高速互联的多卡环境,RunningHub选择了TP2+Ulysses4的并行组合。在8张RTX 6000D的测试中,这一组合相比TP4+Ulysses2约12%,同时减少约14GiB显存占用

RunningHub将后训练加速、注意力优化、计算缓存、编译优化和多卡并行等方法统一整合进SGLang的multimodal_gen推理引擎,由同一套推理流程完成调度和执行。

三、适配RTX 6000D多卡环境,人人可用本地可部署

一套加速方案的实际价值,不只体现在跑得多快,也取决于它能落到什么样的硬件上,以及普通创作者能否真正用起来。

目前,不少视频生成加速方案多建立在B300等高端数据中心GPU上。此类硬件虽然性能强,但采购和部署门槛较高,普通工作室和创作者较难按照公开配置复现。

在上面测试中,RunningHub采用8张RTX 6000D专业显卡,这些显卡主要通过PCIe连接,不依赖NVLink高速互联,就实现了生成速度的大幅提升,成本更低,更贴近工作室的硬件条件

为了让本地部署更方便,RunningHub在GitHub中提供了环境安装、模型下载、服务启动和推理测试步骤。有多卡设备的用户可以参考公开方案,在自己的服务器上部署H3,并将模型接入已有的创作流程。没有多卡设备的普通创作者,也可以直接在RunningHub上使用,可以说是实现了人人可用,本地可部署

这也不是RunningHub第一次参与H3开源生态建设。H3上线后,RunningHub先完成模型接入,随后开放全套ComfyUI节点,此次又进一步公开H3 Lightning加速方案。

据RunningHub披露,H3上线以来,RunningHub平台上已有上千名创作者开源近万条相关工作流,覆盖电商、短剧、漫剧、声音克隆、动作克隆和音频驱动等场景。节点、工作流和加速方案的持续开放,也为开发者进一步创作和开发提供了基础。

15秒视频,54秒生成!AI视频创作的“等待焦虑”,被RunningHub这套开源方案治好了

目前,RunningHub的企业级API已接入上千家企业,日均调用量达到千万级。从模型接入、工具封装到推理优化,RunningHub在H3生态中的角色,也逐步转向技术方案贡献者。

四、十年GPU调度积累,搭建AI产品矩阵

H3 Lightning的推出,离不开RunningHub母公司海马云十余年的GPU工程积累。海马云成立于2014年,是一家覆以GPUaaS为底座,业务覆盖基础设施、模型服务和智能体应用的原生AI公司

随着AI技术正从基础设施建设走向应用爆发和原生应用形成,行业关注的问题也从智能能否被规模化供给,转向这些智能如何被调用、如何被组织成真正能够完成任务的产品。在这一过程中,算力始终是支撑模型运行和应用落地的基础。

过去十余年,海马云围绕GPU容器调度、图形虚拟化和实时流媒体等环节进行技术投入,并在国内建设60余个边缘节点,为超过3000万月服务用户提供云渲染服务。在这一过程中,海马云积累了GPU资源调度、多任务并发和内容实时分发等工程能力,并逐步将这些能力延伸至AI推理。

在此基础上,海马云形成了从底层算力到上层应用的AI产品矩阵。其中,RunningHub已面向全球140多个国家和地区提供服务,接入170余个模型API;HaimaAPI面向企业聚合350余个主流模型;RHTV、RHStory和VibeX等智能体工具,则进一步将模型能力延伸到视频及其他内容生产环节。

海马云不直接训练基础模型,其重点是解决模型发布和开源之后的运行问题,包括新模型如何快速接入、如何在有限的硬件条件下提高推理效率,以及如何转化为创作者可以直接使用的产品。

具体到H3,RunningHub先完成模型接入,随后开放ComfyUI节点,再进一步公开H3 Lightning加速方案。这一过程也体现了海马云在发展过程中的能力演进:从解决高性能内容“怎么跑”,到解决AI模型“怎么调用、怎么落地”。H3 Lightning正是其GPU工程能力在AI推理环节的一次具体应用。

结语:开源之后,推理优化成为视频生成提速的关键

模型开源,给了开发者自行部署、修改和二次开发的选择;推理优化,则进一步影响每次生成需要等待多久、消耗多少计算资源。当视频生成从尝鲜走向日常生产,生成质量之外,速度、稳定性、成本和部署条件,也会直接影响创作者的选择。

RunningHub的H3 Lightning,推进模型权重走向实际生产:有多卡设备的创作者可以参考公开方案本地部署,没有设备的创作者也可以在线使用。随着开源模型越来越多,推理加速、硬件适配和工作流生态,正在成为决定模型能否真正进入创作流程的关键环节。