过去两天,一段名为《韩国的黄金时代》(The Golden Age of Korea)的AI短片在社交平台上引发了爆发式讨论。视频中AI演员的情感细腻饱满,动作与微表情自然流畅,让不少网友直呼“谁敢信这是AI呀”。
而打造这段逼真视频的核心驱动力,正是MiniMax最新发布的视频模型 H3。
视频截图
不仅在社交网络引发现象级传播,H3在权威评估榜单上也展现出统治级实力。
8月6日,全球最大规模的众包AI生成设计Benchmark平台Design Arena官宣:MiniMax H3在多图生视频、图生视频和视频编辑三个类别中全面登顶,综合表现不仅开创了全新的SOTA(行业最高水平),更一举超越了Seedance 2.0、Grok Imagine Video 1.5以及Gemini Omni Flash等顶尖闭源模型。
一系列高度评价也将这款模型迅速推上了全球最大开源社区Hugging Face的趋势榜第一名,甚至热度超越了DeepSeek最新发布的模型。
继DeepSeek颠覆文本模型格局之后,中国开源AI正在视频生成领域迎来第二次标志性突破。
视频AI迎来“DeepSeek时刻”
近年来,DeepSeek让全球开发者重新认识了中国AI,它将世界级文本模型开源,开人工智能历史先河,让开放权重模型真正站上全球第一梯队,使“开源”不再意味着性能妥协,而成为效率、成本与生态竞争的新基准。
如今,MiniMax H3正将这场革命带入难度更高的视频赛道。相比文本模型,视频一直被视为生成式AI最难攻克的堡垒。模型不仅要理解文字,还要在连续帧中精准处理人物动作、空间关系、镜头语言以及原生立体声。
过去,顶尖的视频生成能力长期被少数闭源模型垄断,开发者只能付费调用API接口,无法获得模型内核,且面临较高成本。
H3的出现,标志着视频赛道首个开源旗舰的诞生。公开评测显示,H3能够统一理解文本、图片、视频和音频,生成最长15秒、最高2K分辨率、带原生双声道立体声的视频。
而且,H3 2K分辨率音视频直出的API价格仅约0.8元/秒(每分钟约7.8美元),仅为同类主流闭源旗舰模型的三分之一甚至更低。随着模型权重的全面开放,企业与开发者无需拘泥于API调用,而是能够直接将其进行本地部署与私有化微调,实际运行成本还将进一步下探。
H3概念图截图
H3性能对标世界第一梯队、成本可控且可自由定制,这意味着视频AI正从昂贵的“封闭收费工具”,加速演变为低门槛的产业基础设施。
0天适配与百家接入
一款开源模型真正的生命力,不在于榜单排名,而在于有没有人敢用、有没有平台能接、有没有产业链跟进。
8月3日,H3宣布开源当天,产业界展现出了前所未有的协同响应速度:华为昇腾、摩尔线程、沐曦、海光信息、昆仑芯、天数智芯、壁仞科技、AMD、Intel等九大国内外主流芯片厂商首日即完成算力适配;Hugging Face、魔搭ModelScope、ComfyUI等开发平台以及 vLLM-Omni、SGLang等推理框架同步跟进。上百家推理框架、开发平台及应用厂商迅速(Day 0)接入,直接将这款模型推上了生产一线。
这种全产业链的瞬间共振,深刻揭示了中国开源AI的核心竞争力,即产业链、创新链、生态链的协同发力。
在此之前,文本领域的DeepSeek与MiniMax等中国旗舰模型已经在OpenRouter等全球聚合平台上占据了大部分调用量。如今,从DeepSeek到MiniMax,“开源双雄”在文本与视频两个最核心的赛道上完成了接力。
中国AI的开源选择已经从一次偶然的探索,成长为一条连续、成体系、具备全球吸引力的技术路线。
中美AI路线抉择
H3现象的背后,是中美AI产业正在形成的两条截然不同的发展路径。
美国头部AI巨头更倾向于将前沿模型保留在闭源高墙和高价API之后,靠高壁垒维持高估值叙事;而中国AI企业则走出了一条更加包容开放的道路,通过开放模型权重,把芯片企业、开发者社区、云平台与行业客户拉进同一个创新生态。
连Hugging Face首席执行官克莱门特·德朗格都指出,中国已经在开放模型领域占据主导地位,开放协作正成为中国AI进步的重要推动力。而从全球产业生态与商业利益出发,包括英伟达CEO黄仁勋在内的硅谷领军人物也公开声援开源模型。毕竟,开源模型的蓬勃发展能极大拓展算力应用边界,“AI最终将由每个国家构建,世界既需要前沿闭源模型,也需要前沿开源模型”。
更重要的是,中国AI企业正在从单纯的“技术输出者”,走向规则与治理的参与定义者。H3在开源许可中,明确要求境外部署者需承诺建立符合当地法律合规要求的内容审核机制。
这表明,中国开源路线既不是闭门造车,也不是无原则地泛滥,而是在开放共享、安全治理与产业赋能之间建立平衡。