从事动漫行业的专业人士都知道,AI角色动画一直有个绕不开的老难题。过去绝大多数动作迁移方案,都要先提取姿态、骨骼、关键点,一旦人物角度复杂、微表情丰富,就很容易出现身份漂移、动作扭曲,多角色同框更是很难做好。
阿里万相Wan‑Animate‑2的放出,直接换了一套解题思路,把中间骨骼提取环节彻底拿掉,做端到端的角色动画生成,并且完整开源权重、代码与技术文档。

据阿里Wan在“X”的官方账号发布推文,宣布新一代角色动画框架Wan‑Animate‑2正式对外开源,除基础版本之外同步推出轻量变体Wan‑Animate‑2‑Lite,瞄准数字人直播、虚拟互动场景的实时流式生成需求,开发者可以在ModelScope、HuggingFace、GitHub获取完整资源包。
为什么抛弃骨骼提取?传统方案的现实短板
很多人接触过第一代角色动画模型,工作链路基本是:参考图 + 驱动视频 → 运动提取器解析骨骼姿态 → 动作重绘到目标角色。这套方案的短板很现实:
- 细节丢失严重: 骨骼提取本身就会过滤掉大量信息,眨眼、嘴角变化这类微表情极易被忽略
- 非人类对象适配差: 卡通形象、机器人、动物等非标准人体结构,骨骼适配处处碰壁
- 多角色同框困难: 多人场景需要拆分多次渲染,效率低且一致性难保证

Wan-Animate-2核心突破:端到端生成,两大直观收益
Wan‑Animate‑2最大的改动,就是完全抛弃显式姿态骨骼提取流程,直接把驱动视频的潜在表征输入重新设计的扩散Transformer(DiT),让模型自己从原始视频中学习运动规律,不再依赖中间姿态模块做翻译转换。这带来两个直观收益:
✅ 高保真角色还原
人类、卡通形象、机器人、动物都可以迁移动作,微表情、手部细微动作保留更完整,角色身份一致性明显提升。
✅ 天然支持多角色动画
单轮生成就可以处理画面内多个主体,每个角色保留独立身份与动作,不用拆分多次渲染。
底层架构:三项核心技术支撑
| 技术模块 | 核心机制 | 解决的问题 |
|---|---|---|
| 双分支DiT架构 | 固定在t=0时刻的参考分支,向去噪生成分支输出运动相关Key‑Value特征 | 避免运动信息在降噪过程中不断衰减 |
| 时间对齐RoPE | 参考令牌与目标令牌共享同一套时间流 | 前后分辨率不一致时,帧间时序对应关系仍保持稳定 |
| 稀疏参考注意力 | 每个目标帧令牌只与时序对齐的参考令牌建立注意力计算 | 不损失画质前提下,大幅降低内存占用与计算开销 |
亮点功能:文本控制相机视角
以往动作迁移,输出画面镜头角度被死死绑定在驱动视频上,想要换俯视、环绕、侧拍,就得重新准备一份驱动素材。
Wan‑Animate‑2训练了视角LoRA,基于约50K条虚幻引擎多视角样本完成训练,把机位控制转化为文本任务。开发者直接输入“俯视视角”“缓慢环绕镜头”一类提示词,就可以把生成画面摄像机视角和原始驱动视频解耦。同一套动作素材,可以输出多种镜头版本,对动画分镜、短视频创作实用性很高。
Wan-Animate-2-Lite:面向实时交互场景
如果说基础版本偏向离线高质量动画产出,Wan‑Animate‑2‑Lite就是专门面向线上交互场景打造:
- 经过模型蒸馏与推理优化,把推理延迟压到实时流式角色动画的可用阈值
- 能够适配数字人直播、实时虚拟互动这类对时延敏感的业务
- 不需要等待完整视频渲染完毕,做到边推理边输出画面帧
团队观点:参考视频本身就是最好的运动先验
“之前行业很多方案把重心放在把骨骼做得更精细,但是现实世界运动的信息远比骨骼坐标丰富。参考视频本身就是最好的运动先验。” ——阿里万相团队算法工程师 周沐
Wan‑Animate‑2的设计思路,就是尽量少做人工定义的中间表征,让基础模型直接学习原始视频里面的运动、表情、镜头信息,降低上游预处理环节带来的信息损耗。
开源资源汇总
目前全部资源已经公开,相关访问地址如下:
客观局限与行业价值
当然也要客观看到局限:
- 实时Lite版本依旧对GPU硬件有一定要求
- 复杂多角色极限场景,偶尔依旧会出现肢体小瑕疵,仍然需要后期微调修复
我们不可否认,Wan‑Animate‑2给国内开源角色动画领域,提供了一套完整可落地的端到端技术基线。高保真身份保持、多角色同帧、文本解耦运镜、实时流式轻量版本,几项能力集中在同一个开源项目里,不管是独立创作者做二创动画,还是企业搭建数字人、虚拟直播管线,都可以直接基于开源权重二次开发。
AITOP100-AI资讯频道将持续关注AI行业新闻资讯消息,带来最新AI内容讯息。
想了解AITOP100平台其它版块的内容,请点击下方超链接查看
AI创作大赛 | AI活动 | AI工具集 | AI资讯专区 | AI小说
AITOP100平台官方交流社群二维码:










