Seedance 2.5 已上线!一折特惠 全部模型 · 限时至10月31日

返回博客

MiniMax H3 参考视频指南

在您花费更多积分之前,使用 MiniMax H3 参考视频以及正确的资源包、提示标签、运行时限制和审查循环的实用指南。

2026年8月16日中国视频AI编辑团队
MiniMax H3 参考视频指南

当单个第一帧无法承载整个指令时,MiniMax H3 视频参考非常有用。诚实的简短答案是:保持包小,给每个参考一份工作,并在添加更多动作、更多音频或更多风格压力之前测试一个短片。如果您跳过该规则,那么您就没有运行受控的工作流程。您要求模型协商相互冲突的输入,然后猜测结果为何出现偏差。

如果您仍需要组织源材料,请从 中国视频AI主页 开始。当您准备好测试时,打开 MiniMax H3 工作区。深层链接很重要,因为它将您带入本指南描述的同一运行时,而不是通用模型选择器。

两个辅助岗位已经涵盖了相邻的工作。如果您的问题仍然是如何将一张静态图像分解为简短的商业镜头,请阅读如何利用一张图片制作人工智能产品广告。如果您的主要目标是在致力于较繁重的参考工作流程之前以更便宜的方式完成第一步,请阅读相关的 Seedance 2 迷你视频参考清单。

在添加更多参考之前,干净的静止帧通常是最好的第一个锚点

直接答案:一个包,每项资产有一个明确的责任

当每个资产回答不同的问题时,MiniMax H3 参考视频效果最佳。一张图像可以锁定主体。一段短视频可以承载节奏或镜头行为。一段简短的音频剪辑可以指导时间或声音方向。然后,提示告诉模型什么必须保持忠实,什么可以自由更改。

常见的故障不是“MiniMax H3 是随机的”。常见的故障是包裹超载。用户添加了几个相似的图像、两个矛盾的运动剪辑、一个长音频文件和一个风格重的提示。输出可能看起来仍然令人印象深刻,但测试不再具有诊断作用。您无法判断哪个输入实际上控制了结果。

这就是为什么第一个评论片段应该感觉几乎是保守的。您还没有试图给客户留下深刻印象。您试图回答三个操作问题:

  1. 主题是否连贯?
  2. 运动参考是否以有用的方式传递?
  3. 包是否足够小,以便下一次迭代是显而易见的?

如果其中任何一个的答案是“并非如此”,请不要扩大工作流程。

1. 在设计包之前了解真正的运行时契约

当前的 China Video AI 运行时将 MiniMax H3 公开为真正受支持的模型,而不是占位符标签。它将普通图像到视频与参考到视频区分开来。一旦进入参考工作流程,系统就可以接受额外的图像、短视频剪辑和短音频剪辑,但这些输入仍然需要一个真正的存在理由。

要记住的最实际的限制是:

MiniMax H3 参考视频清单
- 输出持续时间:4至15秒
- 输出分辨率:768P或2K
- 参考图像:最多 9 张
- 参考视频:最多 3 个
- 参考音频:最多 3 个
- 定时参考长度:每次 2 至 15 秒

这些数字并不是建议最大限度地利用一切。它们是护栏。更聪明的解释是,该模型允许相当丰富的包,但丰富的包应该仅在最小的有用包已经稳定之后发生。

如果您需要单个第一帧或第一帧和最后一帧对,则可能根本不需要视频参考。添加的输入越多,审核规则就变得越重要。

2. 当镜头已经明确定义时使用图像到视频

参考视频并不一定比图像到视频更好。它只是更灵活。这很重要,因为许多失败的一代实际上是模式选择的错误。

在以下情况下使用纯图像转视频:

  • 第一帧已经清楚地定义了主题;
  • 动作足够简单,提示可以直接描述;
  • 您只需要第一帧或第一帧和最后一帧过渡;
  • 真正的问题是场景动画是否清晰,而不是多个参考是否可以组合。

在以下情况下使用视频参考:

  • 一张图像不足以保留特征或产品;
  • 包含您想要借用的相机行为的短片;
  • 音频时序或节奏应塑造剪辑;
  • 您需要一个用于识别身份的参考,另一个用于运动或场景感觉的参考。

这种区别可以节省学分,因为它可以防止您将不必要的参考带入可以用更简单的模式回答的测试中。

3. 构建最小的有用参考包

最强大的 MiniMax H3 封装通常比人们预期的要小。一个好的起始包通常如下所示:

参考包v1
- 图1:锁定主题或产品标识
- 视频1:借用动作节奏或相机行为
- 音频 1:可选,仅当时间或节奏很重要时

这种结构很强大,因为它将工作分开。如果话题偏离了,你首先要看看身份锚。如果相机感觉不对劲,您可以检查运动剪辑。如果感觉节奏不对,您可以确定音频参考是否有助于测试或使测试混乱。

不要仅仅因为界面允许就提供多个几乎重复的图像。额外的图像仅在每个图像捕获指令的真正不同部分时才有帮助,例如前视图、侧面轮廓或必须在运动中幸存下来的面部特写。

相同的规则适用于运动参考。一个具有清晰摄像机移动的短片段比三个暗示不同速度和不同场景几何形状的嘈杂片段更有用。

4. 在提示中为每个参考人提供一个指定的工作

当提示明确命名每个资源时,MiniMax H3 视频参考更容易控制。目标不是优美的散文。目标是明确的指导。

MiniMax H3 的公共 ComfyUI 文档使用基于位置的参考标签。即使您不在 ComfyUI 中工作,这也是一个很好的实用习惯,因为它迫使您思考责任而不是氛围。

使用<图片 1> 来了解主体身份和表面细节。
使用<视频 1> 确定摄像机速度和转向方向。
<音频 1> 仅用于计时重音,不适用于主题设计。
保持与<图1>相同的主题。
不要复制与新场景冲突的背景对象。

这种结构比“使其具有电影感且一致”之类的通用提示要好。模型仍然需要样式语言,但样式应该在控制语言之后。首先定义每个资产的作用。然后描述新的场景、取景、动作和排除。

一种可行的骨架是:

主题:与<图1>保持相同的主题和主要视觉特征。
运动:借用<视频1>中的摄像机节奏和方向能量。
场景:将主体置于支持提示的新场景中。
时机:如果使用<音频1>,则仅将重点与其节奏对齐。
排除:没有重复的主题,没有随机的文字,没有不相关的道具,没有相机抖动。

如果某个资产没有指定作业,请在第一次传递时将其删除。

5. 从简短的回顾剪辑开始,而不是最终的交付成果

当第一个输出较短时,MiniMax H3 参考工作流程更容易调试。简短的剪辑减少了身份可能漂移的地方的数量,并且更容易判断参考逻辑是否有效。

这就是为什么第一遍通常应该回答一个狭窄的问题:

  • 引入运动时主体能否保持连贯?
  • 相机行为可以在不破坏场景的情况下转移吗?
  • 音频时序可以指导剪辑而不接管整个结果吗?

执行此操作时保留一个小实验日志:

运行:h3-r2v-v1
图1:front-reference.png
视频1:慢转.mp4
音频 1:无
持续时间:6秒
结果:主体保持不动、动作转移、背景在最后一秒变得过于忙碌
下一步:简化背景线,保持所有引用不变

这可以防止工作流程崩溃到模糊的内存中。 MiniMax H3 可以产生引人注目的输出,但引人注目并不等于可再现。

6. 在添加更多参考之前诊断真正的故障

更多参考不默认修复。它们常常使失败的内容更难以阅读。

使用一个小的诊断循环来代替:

|症状|可能的原因 |最小的下一个变化| | --- | --- | --- | |主题偏离了参考文献|身份资产薄弱或不明确 |在添加更多资产之前替换或加强图 1 | |运动感觉不对|视频参考和提示描述了不同的动作|保留相同的剪辑并重写动作指令| |场景超载 |太多的参考资料正在做设计工作|删除最不需要的资产| |音频使结果变得混乱 |音频主导了太多的时间|删除音频 1 进行基线测试 | |输出在技术上看起来不错,但不可用 |该软件包解决了风格,而不是任务 |围绕真实查看器作业重写提示 |

当你回顾时,每次都使用相同的顺序:

1. 主题连贯性
2. 动作或时间的转移
3. 不需要的对象或重复的细节
4.相机稳定性
5.剪辑是否真正解决了预期的任务

这个顺序很重要,因为它会阻止你赞扬已经未通过身份检查的剪辑上的灯光。

7. 当参考文献互补时,MiniMax H3 最强

最好的 MiniMax H3 套件让人感觉像是一个团队,而不是一群人。图像给出了主题。短动作片段给出了行为。可选的音频赋予节奏。他们都不应该为同一份工作而奋斗。

这也是为什么“只添加更多参考文献”是一个坏习惯。如果两张图像的姿势不一致,或者视频暗示相机速度与提示不同,则模型被迫妥协。有时这种妥协看起来仍然很有趣。但结果变得更难以重用,因为您不再知道哪条指令获胜。

实际规则很简单:如果您无法用简短的一句话描述每项资产的工作,则该包尚未准备好。

8. 确定 MiniMax H3 何时是正确答案

MiniMax H3 视频参考并不是普遍默认的。当您需要比一帧所能提供的更多控制时,尤其是当您想要结合身份、运动和计时而不切换到不同的创意工具链时,这是一个很好的答案。

如果一张角色图和一个动作片段已经足以定义任务,可以先按 Kling 3 运动控制故障排除指南 测试这条更窄的动作迁移路径,再决定是否组装更大的参考素材包。

在以下情况下,答案可能是错误的:

  • 镜头已经通过第一帧解决了;
  • 提示仍然很模糊,没有参考包可以挽救它;
  • 该任务实际上是一个简单的产品广告基线,另一个更轻的工作流程已经可以回答;
  • 真正的需要是不同的模型系列或完全不同的创建模式。

当您需要更广泛的模型系列决策时,请使用 中国AI视频模型指南。如果该项目仍然更接近于单一产品图像商业测试,请返回如何利用一张图片制作人工智能产品广告。如果实际优先考虑的是更便宜的早期过滤器,则相关的 Seedance 2 迷你视频参考清单 是更好的第一站。

9. 在扩展包之前查看真实的运动示例

观看真实的剪辑会改变审查标准。一旦行动开始,听起来在纸上组织得井井有条的计划仍然可能会失败。使用下面的示例的方式与使用您自己的第一遍输出的方式相同:检查一致性、检查运动传递以及检查最终帧是否仍然可编辑。

当你回顾时,问:

  • 主题在运动弧上是否仍然可读?
  • 相机的移动感觉是故意的而不是有弹性的吗?
  • 有没有一个干净的框架是你可以真正保留的?
  • 如果剪辑失败,您知道接下来要更改哪一个资产或指令吗?

如果最后一个问题的答案是否定的,那么这个包就太复杂了。

10. 生产安全的 MiniMax H3 检查表

在您调用工作流程准备就绪之前,请运行此清单:

- 模式选择正确:图像到视频或参考到视频
- 每项资产都有一个指定的工作
- 第一遍使用最小的有用包
- 定时参考保持简短且相关
- 提示明确命名每个引用
- 第一个回顾剪辑足够短以进行诊断
- 在添加另一个资产之前,下一个变化是显而易见的

这个清单是故意缩小的。狭窄的清单可以使参考工作流程保持诚实。一旦基线剪辑通过,您就可以证明更长的持续时间、更多的场景野心或其他受控参考。

当 MiniMax H3 可以帮助您保留重要的内容并更改应该更改的内容时,它是最有用的。包装设计决定了这是否真的发生。

常见问题

MiniMax H3 视频参考最适合什么?

当一个提示还不够并且您需要继承图像、短片或音频中的主体身份、摄像机行为、场景风格或声音提示时,请使用 MiniMax H3 参考视频。

MiniMax H3 在 China Video AI 上可以使用多少个参考?

当前运行时最多接受九个参考图像、三个参考视频和三个参考音频,但真正的目标是使包足够小,以便每个资产都有一项明确的工作。

我应该先使用图像到视频还是参考到视频?

当第一帧或第一帧和最后一帧对已经定义了镜头时,请使用图像到视频。当您需要额外的图像、运动剪辑或音频来控制结果时,请使用视频参考。

为什么 MiniMax H3 忽略我的参考文献之一?

该包通常会同时完成太多工作。减少输入,在提示中明确命名每个引用,并检查两个资产是否给出了矛盾的指令。

MiniMax H3 参考剪辑应该多长?

保持视频和音频参考简短。当前的运行时间和公共文档都指出每个定时参考需要 2 到 15 秒,这足以在不淹没生成的情况下进行运动。

我现在可以在哪里测试 MiniMax H3?

打开MiniMax H3 工作区,上传最小的有用包,并在展开测试之前查看一个短片。

我们的目标不是构建接口允许的最大参考包。我们的目标是创建仍然能够解决读者真正问题的最小包。如果包清晰了,那么下一次迭代也就清晰了。如果包是泥泞的,每一个额外的资产都会使工作流程变得更加昂贵并且更难教授。

如果您仍需要组织源材料,请返回中国视频AI主页。如果您已经知道主题、动作示例以及需要回答的第一个复习问题,请直接转到 MiniMax H3 工作区。这是正确的顺序:定义任务,构建最小的包,然后让模型证明它可以遵循概要。