反超Seedance 2.0!RunningHub发布增强版H3,1秒只要0.1 元

AITNT-国内领先的一站式人工智能新闻资讯网站
# 热门搜索 #
反超Seedance 2.0!RunningHub发布增强版H3,1秒只要0.1 元
8139点击    2026-09-30 11:55

7月底MiniMax H3开源的时候,Artificial Analysis视频编辑榜Elo 1130分。


直冲全球第一,社区一片叫好。


不得不说,H3底子确实好。


但真拿去做量产,短板也在:多镜头一长,角色开始走样;商品多拍几组,轮廓就说不准;十几个镜头连着跑,后面越来越不像同一部片子。


从「跑得通」到「生产能用」,差的那一段是工程。


现在这段被补上了。


9月29日,RunningHub发布H3 RH Enhanced,一个基于MiniMax H3开源基座做深度后训练的增强模型。


RunningHub是海马云旗下的一站式全能创作平台,是目前全球最大的AIGC开发者创作者社区,聚集了500万以上专业创作者,覆盖140多个国家和地区。


通过 2000 组实测,H3 RH Enhanced 多镜头长时序叙事能力显著优于 Seedance2.0,整体表现直追 seedance2.5。


一秒一毛钱即可直接产出成片,降低成本。


这意味着,一个开源后训练模型,做到了闭源的效果。而成本仅为同等效果闭源模型的十分之一。


H3 RH Enhanced已经登陆 MiniMax ,面向全球B端创作者进行公开调用。现在可以在RunningHub平台上限时免费体验。


反超Seedance 2.0!RunningHub发布增强版H3,1秒只要0.1 元


体验链接:


rhTV:


https://rhtv.runninghub.cn/projects?inviteCode=sn3gnlj9&model=484


RHSTORY:


https://story.runninghub.cn/ai-comic


2000组盲测


多镜头叙事显著优于Seedance 2.0


1 秒只要 0.1 元


发布会上的Demo都好看,问题是真实场景什么样。


RunningHub这次的评测是按业务场景铺开的:人物连续特写、多场景转场运镜、多角色互动、16镜头以上完整叙事,四类各500组,合计2000组对照样本,横向拉齐当前主流模型。


结果里最关键的一项是多镜头长叙事:8到16镜连续生成,人物身份一致性、场景元素留存、指令约束留存三项指标,RH Enhanced全部显著领先Seedance 2.0。


来看几条实测。


先看一条15秒的赛博机车追逐。 同一张参考图、同一段14镜提示词,分别喂给RH Enhanced和Seedance 2.0,480P直出,音频由模型自己生成,不做任何针对性调参。


反超Seedance 2.0!RunningHub发布增强版H3,1秒只要0.1 元


RH Enhanced这边,两辆车从起跑到冲线一直是参考图里那两辆,07号黑橙、12号白蓝,号码牌没糊过、没换过。


女主换了正面、背后、双人特写、终点定格四种机位,始终是同一张脸、同一套带橙色肩甲的机车服,背景城市也没跑偏。


声音跟画面一起生成出来:起跑前近乎安静,弹射那一拍轰鸣骤起,进隧道声画同时压暗,出隧道一起拉起。


反超Seedance 2.0!RunningHub发布增强版H3,1秒只要0.1 元


RH Enhanced生成


Seedance 2.0单帧画质不差,护目镜里的倒计时甚至更贴提示词。


但镜头一多就松了:第4镜两辆车变成Tron风格的光环轮,已经不是参考图那款车;第5镜航拍直接换了一座城,广告牌全没了,还有明显穿模;第6镜女主的机车服从装甲款退成了普通皮衣。


不算崩,但已经不是同一部片子。


反超Seedance 2.0!RunningHub发布增强版H3,1秒只要0.1 元


Seedance 2.0生成


十个镜头之后,RH Enhanced还认得参考图,Seedance 2.0开始凭印象重画。


再看一条电商的。 电商最怕的不是画面不美,是商品变样。


这条15镜香水片,RH Enhanced全程瓶子都是参考图那一只:方正厚玻璃、满瓶琥珀液、黑盖金环,ORBIT 07标识没漂过。


模特穿过沙漠、雨夜橱窗、电梯、天台,同一张脸、同一件黑丝绒礼服。


反超Seedance 2.0!RunningHub发布增强版H3,1秒只要0.1 元


RH Enhanced生成


Seedance 2.0同样精致,但电梯那镜,瓶子悬在了掌心上方。


反超Seedance 2.0!RunningHub发布增强版H3,1秒只要0.1 元


Seedance 2.0生成


极端长场景:人物崩坏率降低60%以上。


16镜往上,Seedance 2.0的角色遗忘开始集中爆发,前面还好好的女主角,后面突然换了张脸,衣服变了,道具丢了。RH Enhanced在同等条件下,这类崩坏砍掉了六成以上。


我们拿两条18镜的片子试了试。


18镜、五个世界,考的就是模型记不记得她是谁。


RH Enhanced从雨巷、沙漠、雪林、地铁到空间站再回雨巷,四次正面特写是同一张脸,黄雨衣一直敞着帽、红伞一直在手、黑包一直斜挎。第1镜埋下的街角时钟,第16镜回来还挂在原处。


反超Seedance 2.0!RunningHub发布增强版H3,1秒只要0.1 元


RH Enhanced生成


Seedance 2.0开场和结尾都不差,最后回眸那帧很像参考图。


但中段崩了:雨巷里帽子戴着,到雪林就摘了;更要命的是红伞,从雪林奔跑、进地铁到整段空间站漂浮,将近4秒、3个镜头里伞直接不见了,到舱门那镜才重新出现——


而提示词里「红伞、黑包、雨衣同时漂浮」恰恰是这段要测的东西。


反超Seedance 2.0!RunningHub发布增强版H3,1秒只要0.1 元


Seedance 2.0生成


另一条18镜的东方奇幻,两个人加一只灵兽,三个主体得同时在线。


RH Enhanced很稳:女剑仙的白发、额心红印从特写到收尾是同一张脸,剑没离过手;黑甲将军有正面近景,脸、盔甲、披风、长枪都对得上参考图;灵兽每次出现都是同一只鹤。


最难的最后一镜也守住了:天宫半塌、碎石还在掉,女主和鹤在桥头,将军在远处残阶,三者位置一眼清楚。


反超Seedance 2.0!RunningHub发布增强版H3,1秒只要0.1 元


RH Enhanced生成


Seedance 2.0画面同样华丽,但将军的近景只有盔甲没有脸;收尾天宫大门完好无损,「半塌」没发生。


反超Seedance 2.0!RunningHub发布增强版H3,1秒只要0.1 元


Seedance 2.0生成


RH Enhanced能在长叙事上拉开差距,靠的是一套自研的RH长程记忆引擎。


普通模型的记性像一扇滑动的窗,镜头一多,第1镜那张脸就被挤出窗外了。


长程记忆引擎干的事,是在模型架构层面把跨帧信息钉住,让第14镜还记得第1镜的五官、服装和道具,不靠后期修补。


上线以来,RH Enhanced日均生成接近100万秒视频,相当于每天6.7万条15秒短视频,或者3300多集5分钟短剧。


RunningHub后训练做了什么


五层工程改造


让H3在量产场景更稳更快更省


RunningHub这次动的不只是权重。


从后训练、分辨率适配、采样策略、推理引擎到服务调度,五层一起改,每一层对应量产里一个绕不过去的问题。


第一层:场景定向后训练——把短剧、电商、漫剧的业务约束练进模型里。


H3基座管的是通用能力,什么都能做。


但短剧里人物频繁换装换场,电商里商品轮廓和材质一点不能变,漫剧里动作要连贯不能断,这些垂直场景各有各的细规矩,需要单独练。


RunningHub基于H3的单流Omni-Transformer架构和MM-RoPE多模态位置编码,给RH Enhanced搭了一条「场景SFT → 一致性优化 → 少步蒸馏」的训练链路。


训练数据是RunningHub围绕短剧、电商、漫剧三类真实业务构建的,每条样本都标清楚哪个是参考素材、哪个是目标人物、镜头指令指向谁。


训练时盯死四件事:人不换脸、有参考图就要像、动作做完整、运镜不乱跳,正是废片率最高的四种情况。再加上长程记忆引擎在跨帧维度上的增强,就有了前面16镜以上崩坏率下降60%的结果。


第二层:分辨率感知适配——训练分布对齐实际交付规格。


短剧、电商、漫剧的成片有自己的交付规格,跟模型默认的训练分辨率并不一样。


RunningHub按宽高比、帧数、时长给训练数据分桶,让分布直接贴着交付规格走;再做区域加权,人脸、商品轮廓、服饰结构这些决定「能不能用」的地方权重拉高,背景适当放宽。


结果是视觉Token更短、算力更省,但该清楚的脸和商品依然清楚。出来的就是成片,直接进剪辑时间线。


第三层:少步蒸馏——把几十步的质量压进几步。


视频生成本质上是从噪声一步步迭代成画面,H3默认要跑几十步,每步都是一轮完整的Transformer前向。


RunningHub用「教师—学生」式轨迹蒸馏:教师跑完整采样,学生不只学最终结果,还学教师在每个阶段的速度场方向和终点重建目标,把多步才有的质量压进少步模型里。


步数也不是一刀切,静态镜头、对话戏少给几步,大幅运动、多参考素材的镜头多给几步。


第四层:注意力与缓存协同加速——让每一步算得更快。


推理执行层,RunningHub叠了三项技术。


SageAttention2对注意力矩阵做离群值平滑和细粒度低精度运算,不丢精度地提高吞吐。


Cache-DiT是RunningHub自研的Dual Block缓存,相邻采样步之间DiT中间层特征变化不大,全部重算是浪费,它按特征变化幅度决定哪些模块复用、哪些重算,首尾模块保留实时计算,中间按阈值复用残差,并设连续复用上限防止误差累积。


torch.compile把计算图编译成融合算子,减少Python层和显存之间的来回搬运。


多卡用TP2+Ulysses4混合并行,张量并行切权重,Ulysses切长序列注意力。这个组合专门适配PCIe连接的普通多卡环境,不需要NVLink,京东上能买到的RTX级服务器就能跑。


第五层:批量服务调度——一万条一起跑,成本才压得下来。


前四层解决单条视频怎么又快又好,但量产面对的是一天几十万条。


单条再快,GPU利用率上不去、任务调度不合理、显存碎片化,综合成本照样下不来。


RunningHub的服务层把输入形状相近、采样配置兼容的任务自动分桶组batch;高频配置做参数预热和编译缓存复用,省掉冷启动;再按任务队列的实时负载在多台服务器间调度。


考核的不是一条视频几秒生成,而是GPU时间、合格成片率和批量吞吐一起算,落到每条合格成片的交付成本上。


算下来,一秒一毛钱。


海马云十年GPU工程底子,加速和超分同步就位


五层改造讲起来清楚,做起来要的是从训练到推理内核到集群调度的全栈GPU工程能力。


RunningHub的母公司海马云做了十年云渲染,国内60多个边缘节点,3000万以上月活,8到10毫秒的实时云游戏。


十年云渲染真正留下的,是大规模异构GPU集群的运营和调度经验:型号不一的卡怎么统一管,怎么让每一张都跑满,推理优化怎么压进链路里。


这套经验迁移AI推理上是通的。


云渲染的高峰集中在晚上10点以后,AI推理的高峰在早9点到晚6点,两种负载刚好错峰,实现渲推一体。同一批GPU白天推理、晚上渲染,利用率拉满,成本自然摊薄。


所以RH Enhanced对外交付的也不只是一份权重,而是后训练模型、算力和服务打包在一起的整套方案,客户拿到手就能跑。


这也是它跟同赛道其他平台的最大差别。


大多数AI视频平台做的是模型聚合,把各家API接进来供用户调用;RunningHub做的则是模型工程化改造,从权重层面一直改到服务层面。


要理解RunningHub为什么肯把手伸这么深,得先看清一件事:模型本身正在不紧缺。


开源基座一个接一个,各家能力越拉越近,很多场景下调哪个、编排谁,出来的东西差不了多少。


真正的差距往两头走了。往下,是能不能把GPU规模化地运营起来、把推理成本打下来;往上,是能不能通过后训练和私有部署,把一个行业的知识变成模型自己的本事。两头都拿住的,才站得稳。


海马云就是按这个思路:五层能力栈,中间用一个数据闭环转起来。


最底下是算力层。上面说的异构GPU调度、渲推错峰,都在这一层,RH Enhanced的推理加速和批量调度也落在这里。


往上是模型层,管三件事:后训练、模型本身、编排。海马云不从零训通用大模型,一头是像RH Enhanced这样拿开源基座做后训练,另一头是把全球主流模型统一编排起来:哪个场景该上贵的,哪个场景用性价比高的就够,怎么按业务需求组合调度。这个能力在RunningHub上看得最直接。


再往上是Harness执行层,给模型装上手和脚。模型自己只会吐文字、出图片,Harness让它能接住一整条业务链路,真正在流程里干活。落到RunningHub上,就是那套工作流和Agent引擎。


第四层是数据层,护城河最深的一层。RunningHub上每天产生上万条专业工作流,这些真实业务行为被沉淀成专家轨迹条件示范数据集,再转成垂类知识库。


应用跑出数据,数据反哺Harness和模型,模型变强,应用更好,再跑出更多数据——一个自己转起来的闭环,实现递归自我进化,外面很难照抄。


最上面是应用层,对外就三种形态:API、SDK、带界面的App。RunningHub就是这套能力栈跑通的验证:工作流、AIGC应用市场、可视化画布、API服务,全链路都走了一遍。


模型能力在商品化,壁垒往两头走:底下是把算力成本打下来,上面是把行业知识变成模型自己的能力。海马云两头都在做。


所以它推出来的不是一个模型,是一套。


此前开源的RH Lightning把H3推理提速12倍,5秒视频从349秒压到29秒,方案完整公开在GitHub上;近期发布的RH Upscale视频超分,在含火山引擎方案在内的13个参测配置中综合性能第一,Ultra模式人脸视频得分行业最优。


Lightning管速度,Enhanced管出片,Upscale管画质:RH Enhanced出成片,要1080P的再过一遍Upscale。


从生成到加速到画质增强,一条完整的AIGC视频工业管线在RunningHub平台内闭环。


还有一个信号:RH Enhanced已经获得MiniMax官方认可,上架MiniMax官网面向全球调用。基座厂商给第三方后训练方案背书,这在行业里不常见。


模型够用只是第一步


能接进生产工作流才算数


现在做AI短剧、电商视频、漫剧的团队,卡住他们的早就不是画质。


而是多镜头一拉长角色就飘、废片率高到算不过来账;是自己部署开源模型运维比API还贵,用闭源API效果好但月底账单吃不消。


RH Enhanced要解决的就是这两个数字:崩坏率和每秒成本。


多镜头稳到能批量生产,价格低到小团队用得起,打开平台就能调,不用自己伺候120GB显存的机器。


参数翻倍、榜单登顶当然更好看,但AI视频要从热点变成基础设施,得先把这两个数字打下来。


文章来自于微信公众号 “新智元”,作者 “新智元”

AI转型,免费服务,就找AITNT
AITNT资源拓展
根据文章内容,系统为您匹配了更有价值的资源信息。内容由AI生成,仅供参考
1
AI工作流

【开源免费】字节工作流产品扣子两大核心业务:Coze Studio(扣子开发平台)和 Coze Loop(扣子罗盘)全面开源,而且采用的是 Apache 2.0 许可证,支持商用!

项目地址:https://github.com/coze-dev/coze-studio


【开源免费】n8n是一个可以自定义工作流的AI项目,它提供了200个工作节点来帮助用户实现工作流的编排。

项目地址:https://github.com/n8n-io/n8n

在线使用:https://n8n.io/(付费)


【开源免费】DB-GPT是一个AI原生数据应用开发框架,它提供开发多模型管理(SMMF)、Text2SQL效果优化、RAG框架以及优化、Multi-Agents框架协作、AWEL(智能体工作流编排)等多种技术能力,让围绕数据库构建大模型应用更简单、更方便。

项目地址:https://github.com/eosphoros-ai/DB-GPT?tab=readme-ov-file



【开源免费】VectorVein是一个不需要任何编程基础,任何人都能用的AI工作流编辑工具。你可以将复杂的工作分解成多个步骤,并通过VectorVein固定并让AI依次完成。VectorVein是字节coze的平替产品。

项目地址:https://github.com/AndersonBY/vector-vein?tab=readme-ov-file

在线使用:https://vectorvein.ai/(付费)

2
AI数据分析

【开源免费】DeepBI是一款AI原生的数据分析平台。DeepBI充分利用大语言模型的能力来探索、查询、可视化和共享来自任何数据源的数据。用户可以使用DeepBI洞察数据并做出数据驱动的决策。

项目地址:https://github.com/DeepInsight-AI/DeepBI?tab=readme-ov-file

本地安装:https://www.deepbi.com/

【开源免费】airda(Air Data Agent)是面向数据分析的AI智能体,能够理解数据开发和数据分析需求、根据用户需要让数据可视化。

项目地址:https://github.com/hitsz-ids/airda

3
智能体

【开源免费】AutoGPT是一个允许用户创建和运行智能体的(AI Agents)项目。用户创建的智能体能够自动执行各种任务,从而让AI有步骤的去解决实际问题。

项目地址:https://github.com/Significant-Gravitas/AutoGPT


【开源免费】MetaGPT是一个“软件开发公司”的智能体项目,只需要输入一句话的老板需求,MetaGPT即可输出用户故事 / 竞品分析 / 需求 / 数据结构 / APIs / 文件等软件开发的相关内容。MetaGPT内置了各种AI角色,包括产品经理 / 架构师 / 项目经理 / 工程师,MetaGPT提供了一个精心调配的软件公司研发全过程的SOP。

项目地址:https://github.com/geekan/MetaGPT/blob/main/docs/README_CN.md

4
知识库

【开源免费】FASTGPT是基于LLM的知识库开源项目,提供开箱即用的数据处理、模型调用等能力。整体功能和“Dify”“RAGFlow”项目类似。很多接入微信,飞书的AI项目都基于该项目二次开发。

项目地址:https://github.com/labring/FastGPT

5
prompt

【开源免费】LangGPT 是一个通过结构化和模板化的方法,编写高质量的AI提示词的开源项目。它可以让任何非专业的用户轻松创建高水平的提示词,进而高质量的帮助用户通过AI解决问题。

项目地址:https://github.com/langgptai/LangGPT/blob/main/README_zh.md

在线使用:https://kimi.moonshot.cn/kimiplus/conpg00t7lagbbsfqkq0