视频生成2026-08-04

我用国产视频模型 MiniMax H3 跑了 20 条片子,说点大实话

MiniMax H3 是 2026 年 8 月开源的通用全模态视频模型,把"文字+图像+视频+音频"一起当上下文,一次生成带原生立体声的视频。开源这事,在圈内炸了锅。

H3 一次生成多模态进,视频出喂素材图文音视写提示画面+声生成带声视频迭代局部改

它特别在哪

过去做 AI 视频最累的是"拼接":出图、定动作、补声音分头搞。H3 把这些都合一,还自带立体声,对口型、环境音、配乐一起出。开源主体(768p)让本地免费跑成为可能,社区当天就合入了 ComfyUI 节点。

能力参数

原生立体声 32kHz;一次最多 12 个素材(9 图+3 视频+3 音频);提示词最长 7000 字符;最高 2K、6 种宽高比、4–15 秒、24fps。详见本库 MiniMax H3 教程分类那 7 篇,参数和玩法都拆细了。

和闭源比

把 2K 单价压到闭源三成左右,权重免费、商用基本无门槛。要完全免费+可控,本地跑开源版;要省心出 2K,走 API 更便宜。对预算敏感的小团队,这一个变化就值得重做选型。

适合谁先试

做短视频、广告、动效、口播的内容团队,尤其想要"可控 + 低成本 + 可本地"的。本库视频分类里还有可灵、即梦、Runway 的横向对比,可以一起看再决定主用哪款。

H3 在视频上的能力

MiniMax 的 H3 不只做文本和语音,视频生成也是它的主战场:支持文生视频和图生视频,对中文提示词理解自然,能处理较长的时长与较高分辨率,且和 MiniMax 的语音、音乐生态打通——做一条"有配音、有配乐"的短视频可以在一个体系内闭环,不用东拼西凑多个工具。

它比较适合"带叙事感"的短片:产品演示、角色独白、场景动画。中文创作者用它的一个隐形优势是术语和风格词不用翻译成英文也能被准确理解,prompt 写得越本土,出片越对味。

实用建议

想提高一致性,先用图像模型(或 H3 的生图能力)定好关键帧,再让视频模型"基于这张图运动",角色和场景才不漂移。复杂动作拆小步、短镜头多次生成,比一次硬刚长镜头成功率高。

生成后一定要看"运动是否自然"——AI 视频最容易在手部、步态、物体物理上露怯。挑最稳的片段拼接,再用剪辑软件补节奏和音乐。把它当"分镜助手"而非"成片工厂",预期对了满意度才高。

老陈点评:H3 的意义不在单帧画质,在"开源把价格和能力门槛一起打下来"。想深入,去看本库 MiniMax H3 那 7 篇。
老陈打码老陈打码