如何用 MiniMax H3 制作讲解视频(2026)

用 AI 做讲解视频时,最好把 MiniMax H3 当成镜头素材生成器,而不是把脚本、配音、剪辑和真实产品画面一次性交给它。确定观众和结果后,写好旁白,再把内容拆成短小的视觉节拍。原创动态画面可以由文本、首尾帧或多模态参考生成;涉及产品操作的证据,仍然应该使用真实界面录屏。所有镜头与旁白、字幕、音乐和录屏最后在剪辑软件里组装。
MiniMax H3 能根据文本和参考素材生成短而精致的画面,但一条讲解视频通常由很多镜头共同完成一段论证。模型适合制作概念场景、转场、动态物体、视觉隐喻和统一氛围。观众最终能不能听懂,仍然取决于脚本和剪辑。
本文依据 MiniMax H3 当前公开文档和线上 minimaxh3.tv AI 视频生成器 编写,没有为文章新开付费生成。产品能力和页面状态核验于 2026 年 8 月 15 日。
先确定观众应该听懂什么
第一句话应该回答:视频播完后,你希望观众能复述什么?提示词放到后面再写。
产品讲解可以是:“这项服务把经过审核的支持文档变成团队可以搜索的答案。”流程讲解可以是:“每个请求都要经过审核、制作和质检后才能交付。”如果一句话里出现两类观众、三个产品,或者一串互不相关的功能,就该缩小范围。
一份可用的简报放在一个屏幕里就够了:
| 决策 | 要写清的内容 |
|---|---|
| 观众 | 一类具体观众,以及他们原本知道多少 |
| 问题 | 他们已经能感受到的阻力 |
| 结果 | 看完后应该理解或想要的变化 |
| 证据 | 能让主张可信的真实界面、示例或来源 |
| 行动 | 视频结束后唯一的下一步 |
这能分清“讲清楚”和“做宣传”。视频可以呈现问题、解释机制,再给出下一步,不需要把整个落地页念一遍。
讲解视频也不同于商业广告。广告可以靠几个强烈镜头卖一种感受,讲解视频却必须保留因果关系。如果目标是广告投放,可以参考 MiniMax H3 AI 商业广告视频指南。
先写旁白,再设计镜头
旁白决定讲解视频的节奏。用口语写,读出声,删掉那些必须额外画一张图才能明白的长句。
这套结构已经够用:
- 点出观众熟悉的问题。
- 用一句话介绍产品、概念或流程。
- 用两三个具体环节解释它如何工作。
- 呈现变化后的结果。
- 只留一个行动指令。
每句话只负责一个视觉概念。“上传源文件、选择格式,再把完成链接分享给团队”其实是三个镜头,不是一句话。拆开后,旁白会更从容,每个生成镜头也有明确任务。
拿计时器读一遍脚本。一个画面刚出现时,要留出理解时间;需要展示真实界面文字时,也要保证观众看得完。当前 minimaxh3.tv 提供 5 到 15 秒的片段时长,这种长度更适合承担一个视觉节拍,而不是独自撑起整段一分钟场景。
不要让视频模型直接生成重要文案、价格、法律声明或产品操作说明。把它们留到剪辑阶段处理,拼写和出现时间才可控。
把脚本拆成镜头表

镜头表负责把语言变成可见动作,也能提前判断某段素材该来自 MiniMax H3,还是相机、录屏、设计文件或已有素材库。
每句旁白至少记录五项:
| 字段 | 要回答的问题 |
|---|---|
| 用途 | 这个镜头帮助观众理解什么? |
| 可见动作 | 画面里发生了什么变化? |
| 来源 | 生成片段、真实 UI、已有素材,还是剪辑时添加的图形? |
| 连贯锚点 | 哪个人、物体、颜色、地点或镜头规则必须延续? |
| 时长 | 画面需要停留多久才看得清? |
假设脚本介绍一款收件箱自动化产品。开场可以表现一个人被大量请求包围;方案出现时,可以用抽象但清晰的转变,让混乱逐步归位。到了机制说明,如果必须证明某个按钮或结果真实存在,就切换成实际录屏。结尾再回到同一个人和更平静的环境。
这样安排,生成画面负责压力、变化和氛围,不会伪造产品界面;真正承担产品主张的是实际录屏。
为每个镜头选择合适的 MiniMax H3 输入方式
MiniMax 当前文档把 H3 描述为一套可接收文本、首尾帧和多模态参考的模型。官方输出规格为 768P 或 2K,时长支持 4 到 15 秒的整数值。minimaxh3.tv 当前页面提供 5 到 15 秒和原生 2K 的站内工作流。正式制作前再核对一次控制项,因为产品设置可能变化。
镜头可以完全从零创造时,使用文生视频。它适合开头的问题场景、抽象转场、环境镜头,或者不需要对应真实界面的视觉隐喻。
必须控制首帧时,使用图生视频。分镜稿、已批准插画、产品照片或设计构图都可以先固定主体和布局,再加入动作。真实截图里如果有重要界面细节,应该只做克制的镜头运动,或者直接使用录屏,不要让模型大幅改造。
多段镜头需要共用人物、物体、运动语言、声音参考或剪辑节奏时,使用参考素材工作流。MiniMax 公开指南显示,H3 参考输入最多可接收 9 张图片、3 段视频和 3 段音频,同时受单文件规格和总时长限制。当前站内工作区把图片、视频和音频参考放在同一个界面里。

这是 2026 年 8 月 15 日的线上生成器工作区。截图用于说明公开控制项和模型选择,不代表生成结果,也不包含价格结论。
当开头和结尾状态都很重要时,可以使用首尾帧。例如,一个流程从散乱物体开始,以整齐排列结束;一个品牌片头从空白表面开始,以经过批准的品牌画面收尾。模型负责在两个锚点之间生成动作,最终文字仍在剪辑里完成。
想先了解这些模式,可以阅读如何使用 MiniMax H3。MiniMax H3 发布日期指南则区分了 MiniMax 官方能力和 minimaxh3.tv 当前实现。
准备一组精简参考素材
参考素材越少越明确,通常越容易保持一致。文件多不代表结果更清楚。
人物主导的讲解片,可以准备一张中性人物视图、一张服装参考和一张地点参考。产品主导的讲解片,需要提供与目标镜头角度一致的实物图、色彩样本,以及经过批准的环境或光线参考。动作主导的镜头,则用一小段只展示所需动作的参考视频。
会频繁变化的信息不要放进生成参考。价格、日期、功能列表、字幕和法律文字都应该留在可编辑图层中,产品 UI 也是一样。截图可以指导构图,但一旦被模型重绘,就不能再作为功能证据。
每个段落指定一个连贯锚点。它可以是一盏珊瑚色台灯、一本蓝绿色笔记本、一件米白外套、同一方向的晨光,或固定的平视机位。把它重复写进相关提示词。几项稳定细节比一长串风格形容词更容易控制。
一个提示词只写一个镜头
好用的镜头提示词描述观众能看到的证据,不负责解释整套商业策略。
按可见信息的顺序写:
主体和环境。
一个可见动作。
机位和运镜。
光线、色彩和材质。
必须保持不变的连贯细节。
画面中不能出现的内容。
问题场景可以这样写:
一位运营经理坐在采光自然的小办公室里,面前是暖色木桌。
打印出的请求和通知卡片不断堆到笔记本电脑旁,她试着把它们分进文件夹。
平视中广角,镜头缓慢推进。自然窗光,克制的珊瑚色与蓝绿色点缀,
纸张和布料质感真实。保持其他镜头中的米白外套和珊瑚色台灯。
不出现可读文字、Logo 或界面特写。
结果场景可以这样写:
同一位运营经理坐在同一张桌前,流程已经处理完成。
桌面清爽,文件夹排列整齐,她合上电脑并看向同事。
平视中广角,镜头轻轻后退。保持米白外套、珊瑚色台灯、
窗光方向和暖色木桌。不出现可读文字、Logo 或界面特写。
这两段提示词只描述可观察到的变化,不会宣称某个界面功能完成了变化。真正的功能证据应该放在两个生成场景之间,用产品实录呈现。
开始制作时,可以打开 AI 视频生成器,按照镜头表选择输入模式。脚本、时长、参考文件和验收标准没有定下来之前,不要急着消耗积分。
把每次生成当成受控备选镜头
每次生成只服务于剪辑表中的一个位置。把提示词、参考素材、时长、画幅和连贯锚点记录在那个位置旁边。
先按用途检查,再判断画面是否漂亮:
- 不听旁白时,能不能看懂动作?
- 首帧能否自然接上前一个镜头?
- 主体能否在计划时长内保持稳定?
- 重要物体、手、边缘和反射是否可信?
- 有没有意外文字或可能误导观众的虚假界面?
如果一个镜头很漂亮,却改变了原来的故事,就应该舍弃。讲解视频更看重清楚,而不是炫技。
只有说得出当前镜头哪里有问题,才值得继续生成备选。“做得更好”无法验收;“保持同一机位高度,减少物体动作,让最终状态停留两秒”才是可测量的修改目标。
MiniMax H3 模型页列出了本站当前能力,案例展示页可以用来观察已发布视频的动作和构图。它们都不能替代针对自己镜头的检查。
保持人物和美术方向一致

尽早把相邻镜头并排检查。单独看很自然的一张脸,放到前后镜头里可能已经变化到破坏连贯。服装、道具、房间结构、光线方向、镜头质感和动画风格也会出现同样问题。
准备一张简单的连贯表,每个反复出现的元素只放一张批准帧,然后拿所有候选镜头与它比对。如果人物或物体比运镜更重要,就减少运动;空间持续变化时,可以裁得更紧,或者使用固定背景板。两个镜头始终接不上,就在中间加入真实 UI、标题卡或切换镜头,不要硬装成连续场景。
调色可以拉近曝光和色彩,却修不好变掉的脸或被重画的产品。结构性问题要在精修前解决。
正确理解官方 Product Website 示例
MiniMax 官方 H3 公告的 Use Cases 部分包含一段名为 “Product Website” 的视频。它能证明 MiniMax 把 H3 用于精致的网站视觉内容,但不能证明 H3 会自动写脚本、准确复刻你的界面,或者独立组装一条完整讲解片。
查看 MiniMax H3 官方公告和原始上下文。这段案例由 MiniMax 在官方页面公开展示。
官方案例适合用来确定视觉方向,不应该被写成每个提示词都能得到同样结果的承诺。参考素材、镜头难度和剪辑方式共同决定成片能不能统一。
组装旁白、真实 UI 和生成镜头
先围绕旁白搭建剪辑。每句话下面放最清楚的镜头,再删掉那些没有增加理解、只是在重复信息的画面。
真实 UI 必须看得清。录屏尺寸要经得起最终裁切,鼠标移动要慢,只展示支撑旁白主张的操作路径。如果功能流程长于现有时长,可以在“操作开始”和“最终结果”之间剪切,不要把录屏加速到无法阅读。
字幕放在剪辑软件里添加。逐一核对名称、数字和产品术语,注意安全边距,并给每行文字足够停留时间。音乐要给人声留空间,音效用于帮助理解动作,不要与旁白争夺注意力。
MiniMax 官方公告把原生立体声列为 H3 能力,minimaxh3.tv 当前工作区也支持添加音频参考,但它不应该被当成完整的旁白录制和混音套件。通过团队获准的方式准备旁白,再在剪辑软件中混音和输出。
做一次清晰度和准确性检查
完整导出后,分别带声音看一遍、静音看一遍,再用较快速度看一遍。三种观看方式会暴露不同问题。
| 现象 | 可能原因 | 修改方法 | 应核对的证据 |
|---|---|---|---|
| 画面漂亮但故事不清楚 | 镜头按风格选,没有按用途选 | 在每个镜头旁写清观众结果,删掉无关镜头 | 脚本和镜头表 |
| 产品在不同场景中变样 | 生成画面替代了真实 UI 或实物细节 | 恢复真实素材承担证明,生成片段只做外围表达 | 批准的 UI 或产品源文件 |
| 人物在镜头间变化 | 参考素材或连贯锚点太松 | 减少运动、复用相同参考,或用切换镜头隔开 | 连贯表 |
| 字幕难读 | 字幕压在繁忙的生成画面上 | 增加安静底图、移动字幕或缩短句子 | 按交付尺寸观看最终导出 |
| 视频夸大能力 | 把视觉隐喻误当成功能主张 | 补真实证据、收窄旁白,或明确标注概念画面 | 当前产品文档 |
| 结尾有多个行动指令 | 脚本保留了多个 CTA | 只留一个下一步 | 原始简报 |
所有功能陈述都要回到当前产品核验。如果视频提到套餐限制或积分,上线当天查看价格页。不要把会变的价格做进生成画面。
确认每个 Logo、截图、声音、音乐、字体和参考文件都具备使用权。第三方素材要保留来源记录,并完成团队要求的审批。使用生成画面并不会免除对主张、肖像和授权输入的审核。
哪些项目适合这套方法
这套工作流适合已经知道“要解释什么”,并希望在真实证据周围加入原创动态画面的团队。落地页讲解、入门介绍、内部流程视频、培训开场、融资演示插片和短篇科普都可以采用。
如果每一帧都必须精确复现不断变化的界面,视频主要是一段长教程,或者合规要求必须提供逐帧证据,就不适合让生成画面承担主体。这时应以录屏、可控动效设计或实拍为主。MiniMax H3 仍然可以补充转场和辅助镜头,但不能替代证据。
生成第一个镜头
先完成一句话结果、旁白、镜头表和参考素材,再打开生成器。从最短、最能证明视觉方向的镜头开始。把它与真实产品录屏和下一个计划镜头并排看。如果三者像同一个故事,再继续;如果不像,先调整美术方向,不要急着把剩余镜头全部做完。
第一个镜头准备好后,打开 MiniMax H3 生成器。进行任何付费生成前,先查看当前套餐和积分。
来源与方法
- MiniMax H3 官方公告,访问于 2026 年 8 月 15 日。用于核对官方模型定位、多模态能力、原生立体声说明和 Product Website 案例。
- MiniMax 视频生成指南,访问于 2026 年 8 月 15 日。用于核对输入方式、输出规格、参考素材限制、文件格式和任务流程。
- minimaxh3.tv AI 视频生成器,核验于 2026 年 8 月 15 日。用于确认当前公开工作区控制项,以及本站展示的时长和画质设置。
本文依据当前公开文档、线上产品界面和已有公开案例编写,没有为文章新开 MiniMax H3 付费生成。最后核验:2026 年 8 月 15 日。



