定位与差异
MIMO 是一种面向角色动画的视频生成方法,主打"用一张角色图加一段动作序列,就能驱动出可控的角色视频"。与传统文生视频或图生视频模型不同,它把"角色外观"和"动作信号"做了显式分离:角色由单张图像提供身份,动作则由可编辑的序列(如关键帧、姿态轨迹或参考动作)输入,从而在保持角色形象稳定的同时,让动作可被精确编辑和复用,更贴近动画与游戏等需要"可控"的创作场景。
核心能力
- 单图角色驱动:仅凭一张参考图即可生成多帧一致的角色视频,无需多张素材或 3D 建模。
- 动作序列控制:通过输入动作序列来指定走、跑、挥手等动作,输出视频会按序列推进。
- 角色与动作解耦:身份和动作相互独立,方便把同一段动作套用到不同角色,或让同一角色做不同动作。
- 可控编辑:支持对动作轨迹进行局部调整,便于反复迭代镜头与表演。
适用与不适用
适用场景:角色动画预演、短视频角色复刻、动效原型、游戏与影视前期分镜、需要快速试不同动作的创意工作流。
不太适合:纯风景或空镜类生成、对写实人物面部细节要求极高的影视成片、以及需要严格版权一致性的大规模商业生产——这些场景往往仍需专业动捕或 3D 流程兜底。
上手提示
建议先准备一张清晰的角色参考图(背景简洁、正面或 3/4 侧脸为佳),再规划好目标动作的关键帧序列;动作幅度过大或参考图分辨率过低时,输出可能出现形变或抖动,需要多次调整。更多参数细节和最佳实践请以官网为准。