入门2026-08-15

MiniMax H3 是什么?把视频、声音、动作装进一个模型的开源炸弹

2026 年 8 月初,MiniMax 把第三代视频模型 H3 的权重开源了。这不是又一个"文生视频"小玩具——它是一个通用全模态生成系统:你给它文字、图片、视频、音频当上下文,它一次性吐出一条带原生立体声的视频。

官方 H3 使用指南封面官方《从创意到成片:MiniMax H3 使用指南》封面
H3 一次生成多模态进,视频出喂素材图文音视写提示画面+声生成带声视频迭代局部改

它到底强在哪

过去做一条像样的 AI 视频,最累的往往是"拼接":先找图做角色参考,再找视频定动作,画面出来还得去另一个工具补声音,想改一句台词前面的素材全得重对齐。H3 想解决的正是这件事——把文字、图像、视频、音频一起当上下文,一次生成。

三个模块,只有中间开源

H3 完整系统由三个模块组成:Context-IR(理解指令,闭源、只走 API)、Base 33B(生成 768p 音视频,这是开源主体)、Regenerate-2K(把 768p 重绘成 2K,闭源、只走 API)。所以"本地免费跑"基本成立,但成立的只有 768p 这一半;想要官方原汁原味的 2K,得走 API。

看看 H3 出的片长啥样:一段 logo 材质蒙太奇动效

关键参数一表速记

原生立体声 32kHz;一次最多喂 12 个素材(9 张图 + 3 段视频 + 3 段音频);提示词最长 7000 字符;最高 2K(2560×1440),6 种宽高比,时长 4–15 秒,24fps。本分类还有 6 篇讲怎么上手、写提示词、本地部署和对比,建议顺着看。

H3 适合谁用

H3 比较对路的是"重度中文 + 多模态 + 长文本"的用户:写长文、做文档分析、要生图生视频、要自然语音对话的人,能在它一套体系里闭环。开发者可以接 API 把它嵌进自家产品;内容创作者能用它从文案到配音到短片一条龙产出。

如果你主要做英文硬推理或极客向 coding,可能别的模型更尖;但走"中文内容生产"这条路,H3 的整合度(文本+语音+音乐+视频)确实是少数能打的选项,值得内容工作者重点试。

老陈点评:H3 最有杀伤力的不是单帧画质,是"迭代循环"——开源权重 + Day 0 的 ComfyUI 支持,社区能立刻微调优化,而不是苦等官方更新。
老陈打码老陈打码