如何用 MiniMax H3 制作 AI 肖像视频(2026 指南)

MiniMax H3
|
发布于 2026/08/12

快速回答

把一张肖像变成视频,看起来只是让画面动起来。真正棘手的是,人脸容错率很低。眼睛稍微变形,人物就像换了一个人;转头幅度过大,下颌线可能重画;镜头运动太猛,背景会滑动,脸却像贴在画面上。

稳妥的做法很朴素:准备一张适合运动的肖像图,只写一个短动作,先生成短片,再优先检查人脸。MiniMax H3 支持视觉参考和高分辨率短视频生成,适合做有氛围的肖像动态。但它是通用视频模型,不是专门的数字人口播工具。这里讲的是人物反应、时尚镜头、创作者开场、角色片段等肖像运动,不承诺精确口型同步。

本文按当前的 MiniMax H3 图生视频生成器 展开。后面的提示词是可以直接修改的起点,不是效果基准。

一位虚构成年人坐在柔和日光中的室内,作为近景肖像起始帧

好的肖像视频,不只是让脸动起来

有用的肖像短片,会在保住人物身份的前提下,增加一次可信的注意力、表情、姿态、光线、头发、衣料或背景变化。观众先注意到人物,之后才意识到画面经过生成,这种结果通常更耐看。

动作越克制,往往越容易成立。一次眨眼、一口轻微呼吸、视线偏移,或者衣料被风带动,都能让静态肖像有生命感。把转头、挥手、运镜、变焦、灯光变化和背景运动塞进同一镜头,模型需要同时解释太多变化,人物身份最容易先漂移。

肖像视频也不等同于数字人口播。数字人产品通常围绕脚本、声音和口型同步设计。MiniMax H3 的参考工作流可以接收多模态素材,但一张人像加一段对白,并不会自动变成专业口播流程。需要精确对词时,应该另外安排配音和口型环节。需要的是电影感反应、时尚片段、创作者开场或氛围人物镜头时,本文这套做法更合适。

选对 H3 工作流

MiniMax 当前视频文档列出了三类主要工作流:文生视频、首帧或首尾帧图生视频、参考生成。对于肖像,起始图通常比很长的文字描述更关键。如果图片已经确定人物、服装、构图和光线,优先从首帧开始。

参考生成适合让人物身份或其他素材去引导一个新构图。它给模型的创作空间更大,因此未必会保留原图的准确裁切和场景。首尾帧适合结尾画面必须固定的转场,但它并不天然更稳,因为中间运动仍然需要模型补全。

第一次制作时,可以这样判断:

  • 想让原有构图动起来,用首帧。
  • 想让人物引导一个新镜头,用参考输入。
  • 结尾画面必须准确落位,再用首尾帧。
  • 不需要保留特定人物时,才考虑纯文生视频。

当前公开生成器能看到图片、参考图、视频和音频输入区,也能设置画幅、时长、生成模式和分辨率。选项可能更新,真正生成前以页面当时显示的标签为准。

当前 MiniMax H3 生成器,显示图片、参考图、视频、音频输入区和生成设置

准备一张经得住运动的肖像图

先找一张脸清楚、身体结构也容易判断的图片。清晰度重要,但画面结构更重要。一张头发挡住双眼的高清图,未必比一张稍软却能看清视线、下颌、肩膀和背景的图片更好用。

起始肖像最好具备这些条件:

  • 双眼和主要五官可见。
  • 除非是有意的特写,否则不要从下巴、额头或脸颊中间截断。
  • 肩膀姿势自然,身体朝向说得通。
  • 手要么完整出现,要么完全不入镜。被截掉一半的手指很容易被重新解释。
  • 头发边缘和背景能区分开。
  • 光线方向明确,不要让多个光源互相打架。
  • 背景只保留你愿意让模型理解的元素。

近景适合眨眼、轻微转头和表情变化。半身画面能容纳姿态、手势和衣料运动。更宽的环境肖像氛围更足,也会让模型同时维持更多物体。

文件规范同样要检查。MiniMax 当前文档列出的首尾帧格式包括 JPG、PNG、WEBP、HEIC 和 HEIF,单张上限 30 MB,尺寸范围为 256 到 5760 像素,画幅范围为 2:5 到 5:2。本站上传器可能还有自己的当前限制,以页面实际校验为准。

不要因为网上能找到一张照片,就直接上传。只使用自己拥有、获得许可或得到本人同意处理的肖像。涉及个人信息和肖像权时,要先取得同意。如果成片可能被误认为真实影像,应按平台规则和当地法律标注合成内容。

构图要给动作留空间

图片里需要有动作发生的余地。想让人物转头,脸却已经贴着画面边缘,模型只能补出不存在的空间。需要手势,就把整只手放进画面。想让风带动头发或外套,就要让这些边缘清楚可见。

下面这张窗边肖像能看清脸、上半身、双手、窗帘和植物,适合设计一个克制动作。并不需要所有东西一起动。选一个人物动作,再加一个环境反应就够了。例如,人物把视线移向窗外,窗帘轻轻晃动。双手、镜头、植物、窗帘、灯光和表情同时变化,风险会明显增加,却不一定更有内容。

一位虚构成年人站在窗边,半身、双手、窗帘和植物都完整可见

做竖屏社交视频时,最好一开始就准备竖图,不要依赖后期硬裁。头顶和衣料周围多留一点空间,还要预估平台界面会遮住画面顶部和底部哪些位置。

一位虚构成年人站在雨后街道,竖屏构图保留了头发、外套和环境灯光

把提示词写成一条简短的表演指令

肖像图已经承担了大部分视觉信息,提示词应该集中描述“哪里会变”。一个实用结构是:

人物动作 + 表情或视线 + 环境运动 + 镜头方式 + 节奏

把最影响人物身份的动作放在前面,尽量用具体动词。“她慢慢把视线移向窗外”比“让画面更电影、更有情绪”清楚得多。氛围词可以保留,但只能辅助动作,不能代替动作。

运镜要轻。固定镜头或缓慢推进,通常比大幅环绕更有利于稳定人脸。提示词也不要和原图对着干。侧脸人物不适合立刻转向另一侧;坐着的人物如果要突然站起,需要画面和时长提供足够空间。

也可以用普通语言写清需要稳定的部分,例如“五官保持一致”“服装不变”“背景结构连续”。这类描述不能保证结果,却能把边界说清楚。

近景轻微动作

女子轻轻呼吸并眨眼一次,然后把视线略微移向窗外。几缕头发被室内微风轻轻带动。五官、发型、米白色针织上衣和室内背景保持一致。固定镜头,自然节奏,动作克制。

窗边环境肖像

男子看向窗外,随后稍微垂下视线,双手慢慢放松。薄窗帘和植物叶片被同一阵微风轻轻带动。五官、深色外套、手部结构和房间几何保持一致。镜头极慢推进,动作符合真实节奏。

竖屏街道肖像

人物把注意力从街道转向镜头,表情只有轻微变化。短发和羊毛外套边缘随着晚风小幅摆动,雨后路面的反光轻轻闪烁。脸、服装和街道结构保持一致。竖屏肖像构图,镜头稳定,动作从容。

创作者开场

创作者在画面中站稳,露出短暂而自信的微笑,并在胸前做一个小手势。背景保持安静整洁。五官、手指、服装和光线保持一致。胸部以上构图,固定镜头,动作干净自然。

这些不是经过对比测试的固定参数。每次只改一个变量。人脸稳定但动作太弱,就稍微增加动作;动作很丰富但脸开始漂移,先缩小转头和运镜幅度,不要一次重写全部提示词。

在当前界面生成第一条短片

打开 MiniMax H3 图生视频工作区。如果当前不是 MiniMax H3,先切换模型。把肖像放进图片输入区。只有额外参考素材目的明确时才添加,因为每多一个来源,模型就多一组需要协调的信息。

粘贴简短的运动提示词,画幅尽量和原图一致。本站当前为 MiniMax H3 提供 5 到 15 秒的时长选择和 2K 输出;MiniMax API 文档则列出 4 到 15 秒、768P 或 2K。你正在使用的页面选项,才是这次任务的直接依据。

第一次生成对身份稳定要求较高时,选择能装下动作的最短时长。一次视线变化通常不需要 15 秒。短片更容易判断问题,也更方便剪辑,不容易在后半段持续积累人脸漂移。根据发布平台和可用积分选择分辨率。当前套餐信息请看 价格页,本文不重复可能变化的数字。

确认输入后再生成。视频任务是异步完成的,进入进度状态不等于已经产出。关闭页面前,先确认当前界面会怎样保存生成任务。

想了解更完整的控件操作,可以阅读 MiniMax H3 使用方法

先看脸,再看特效

成片先用正常速度完整看一遍,不要急着拖进度条。第二遍重点看五个位置:眼睛、嘴、下颌线、发际线和手。第一眼很惊艳的镜头,也可能在中段改变一只眼睛的形状,或者在闭嘴表情里突然出现牙齿。

按这个顺序检查:

  1. 开头、中段和结尾还是同一个人吗?
  2. 两只眼睛是否配合完成同一个动作,形状和颜色有没有变化?
  3. 嘴部是否符合要求的表情?
  4. 下颌到脖子的连接是否连续?
  5. 头发、耳朵、首饰和衣服是否始终属于同一个人物?
  6. 手入镜时,手指数目和位置是否合理?
  7. 运镜过程中,背景几何有没有变形或滑动?
  8. 动作开头和结尾能否自然剪掉?

最好的版本不一定动作最大。肖像视频更看重人物稳定。一条安静但身份一致的片段,往往比一条戏剧性很强却经不起特写的片段更有用。

修正常见的人像问题

脸发生变化时,先减小动作,不要先堆更多“保持一致”。大幅转头会露出原图没提供的脸部区域,模型只能补画。可以改成视线偏移或轻微抬下巴,也可以换一张更正面的起始图。

人物像静止照片时,增加一个能看见的动作,不要只加“更生动”。把“更有生命力”改成“轻轻呼吸并眨眼一次”。这一步稳定后,再加入一个小幅环境运动。

背景像水一样滑动时,取消运镜,或者换更干净的起始图。栏杆、文字、花纹墙面和重复窗户很容易暴露几何漂移。光线和景深足够好时,固定镜头配人物动作也能有电影感。

手部变形时,可以把手裁掉,或改用双手完整可见的起始图。手势保持小幅,尽量远离脸部。除非动作很重要,不要要求一只手从原图之外突然进入画面。

结果过度光滑或戏剧化时,删掉叠加的风格词。一个明确的光线说明加一个节奏说明通常就够了。视觉风格交给原图,表演交给提示词。

长镜头后段开始漂移时,把它缩短,用几个镜头拼成序列。MiniMax H3 可以生成更长的短视频,不代表每次都要用满。能剪、好剪,才是更实际的目标。

用三个小镜头代替一个复杂镜头

与其把所有动作压进一条片,不如规划三个短镜头。用近景建立人物,再用中景加入手势或环境,收尾时换成细节、侧面或更宽的画面,给剪辑留下出口。

不同起始图的服装、光线方向和色调要一致。工作流支持时可以复用清楚的参考素材,但每个镜头仍要单独检查。参考输入能引导生成,不能代替连续性审核。

剪辑时,先去掉不稳定的开头和结尾。可以在眨眼、视线变化或姿态改变的位置切镜头。画面确认后,再加声音、音乐、字幕和精确口型。这样不会提前花时间对音频,后来却因为人脸漂移弃掉整个镜头。

想继续细化提示词,可以参考 MiniMax H3 提示词指南,每次只把示例改成一个肖像动作。MiniMax H3 发布概览 则提供模型更完整的多模态背景。

一份可直接使用的肖像视频检查表

生成前:

  • 确认自己有权使用这张肖像。
  • 选择脸清楚、姿势易读、背景可控的图片。
  • 让起始图画幅匹配最终发布平台。
  • 只确定一个人物动作,最多再加一个环境反应。
  • 第一次尝试时保持轻微运镜。
  • 以当前页面为准,核对时长、分辨率、文件和积分要求。

发布前:

  • 对比开头、中段和结尾的人脸。
  • 检查眼睛、嘴、下颌、发际线、耳朵、配饰和手。
  • 留意背景直线是否滑动、物体是否改变。
  • 确认动作可以被干净裁切。
  • 检查音乐、声音、字幕和平台裁切有没有遮住缺陷。
  • 在需要时标注合成内容,不要用他人肖像制造误导。

开始制作第一条肖像短片

最可靠的起点很小:一张清楚的肖像、一个可信动作、一条短片。让原图定义人物和视觉风格,让提示词定义表演。先确认身份稳定,再考虑更高分辨率、更花的运镜和更复杂的剪辑。

准备好后,打开 MiniMax H3 图生视频生成器,上传一张自己有权使用的肖像,从本文最短的一条动作提示词开始。先得到一个克制、稳定的版本,再逐步增加变化。

来源与方法

产品能力和输入限制于 2026 年 8 月 12 日对照 MiniMax 官方的 MiniMax H3 发布说明视频生成文档 核验。肖像权和同意建议对照了 MiniMax 当时的服务条款隐私材料。站点控件来自 minimaxh3.tv 当前生成器。

#AI 肖像视频#肖像动画#图生视频#AI 视频工作流#MiniMax H3
继续阅读
查看全部文章