
最近刷到阿里最新的 AI 视频视频里是一只穿西装打领结的卡通猫正在跳一段复杂的街舞。动作行云流水衣服的褶皱随着每一个转身自然抖动猫脸上的表情配合节拍变化眼神里甚至有点得意。而这个视频是一张图片一段参考视频AI 自动生成的前后不到五分钟。01AI 图片驱动动画PART 让虚拟角色动起来这不是我第一次见图片驱动动画说实话这条赛道我跟了很久。两年前 Animate Anyone 第一代出来我也兴奋过。输入一张人物图给一段动作视频AI 生成对应的动画。原理清楚效果……能看但只能看一眼。问题出在哪中间有一步提取骨架。AI 先把驱动视频分析成一堆骨骼节点再用这套骨架去套目标角色。听起来合理实际上漏洞很多骨架提取一旦出错目标角色的脸就开始飘衣服开始糊看着像被施了什么奇怪的魔法。业内把这叫身份漂移一直是这类技术的死穴。做了两年大家没根本解决只是在打补丁。02阿里 Wan- Animate -2PART 让虚拟角色动起来阿里这次把中间那一步直接删掉了这就是Wan-Animate-2做的事。来自阿里通义实验室8月7日开源模型权重、推理代码、ComfyUI 插件全部放出来了。核心思路说起来简单粗暴既然骨架提取这一步会引入误差那就不要这一步。把驱动视频直接送进模型让模型自己去理解动作、理解时序、理解和参考图的关系端到端输出目标角色的动画视频。没有中间人没有信息损耗没有骨架漂移。底层用的是重新设计过的 Diffusion Transformer 架构加了两个关键机制——一个负责让动作序列和参考图在时间维度精准对齐另一个负责让模型选择性关注参考图里最关键的特征而不是什么都混在一起。效果是什么我看了他们放出的演示跳舞的人发丝的飘动方向是对的拉小提琴的角色手指按弦的细节是对的轮滑的动作重心转移时衣服的形变是对的。这些细节以前的方案几乎必然会在某个地方崩掉。03Wan- Animate -2 可控视角拍摄PART 动作保真视角转换有一个功能让我觉得这次不一样动作保真度提升在我意料之中。但有一个功能是我没预料到的用文字控制拍摄视角。以前所有的角色动画方案镜头角度是被驱动视频死死锁住的。驱动视频正面拍输出就是正面驱动视频侧拍输出就是侧面。没有商量余地。Wan-Animate-2 加了文本驱动的视角控制。你可以在保持动作不变的前提下用文字指定输出的镜头角度——正面、左侧45度、俯视模型会自己重新架摄像机生成对应视角的画面。演示里有一组对比同一个角色跳同一段舞同时输出了四个不同机位的版本动作完全一致只是观察角度不同。这意味着什么以前一个场景要拍四个机位你得录四遍或者做四段不同的驱动视频。现在一遍搞定。04Wan- Animate -2 实时版PART肉眼无感延迟实时版延迟压到了肉眼无感标准版已经很能打但他们同时还发布了Wan-Animate-2-Lite。Lite 版是专门给实时场景设计的。你打开摄像头Lite 在另一个屏幕实时输出你的虚拟角色——你动它动你的表情变它的表情变。延迟达到实时阈值肉眼基本感知不到卡顿。技术上他们把推理步骤从标准版的 40 步压缩到了 10 步用了一套三阶段训练方案专门解决流式生成时的误差累积问题。我个人觉得 Lite 版的意义比标准版更大——因为它打开的场景是以前根本不可能做到的虚拟直播、实时 AI 会议形象、游戏里的实时 NPC 互动。这些都不只是效果更好而是原来做不到现在能做了。05谁会最先用起来PART自媒体的福音我想了一下受益最直接的大概是这几类人做虚拟 IP 的个人创作者。以前想让自己的卡通形象活起来要么外包给动画公司要么自己学 Blender 搞骨骼绑定。现在的门槛是一张图一段你自己录的动作视频。做短视频和直播的人。虚拟主播这条路一直有但实时驱动的技术门槛让很多人望而却步。Lite 版把这个门槛压低了一个台阶。独立游戏开发者。过场动画、NPC 对话动作以前每一个都是成本。有了这个工具至少原型阶段可以先跑起来。企业的产品演示和培训视频。做一个虚拟讲师形象用 AI 驱动它讲课、演示操作不需要每次都重新录制真人。现在能用吗能。模型权重已经在 HuggingFace 和 ModelScope 上公开搜Wan-AI/Wan2.2-Animate-2-14B就能找到。想先试试效果不想配环境ModelScope 上有在线 Demo直接上传图片和视频就能跑。本地部署的话最低配置大概是 2 张 A800可以跑 480P8 张跑 720P。对普通开发者来说门槛还在但租 GPU 云服务器跑一次的成本并不高。代码在 GitHub 开源Wan-Video/Wan-Animate-2ComfyUI 节点已经支持对已经在用 ComfyUI 的人来说接入很顺。最后说一句我真实的感受。我跟过这个方向很多年见过很多接近可用的方案。Wan-Animate-2 是第一个让我觉得它在解决真正的问题而不只是在刷 benchmark的版本。身份保持、视角控制、实时输出——这三件事这次被同时做对了。技术窗口打开的速度永远比我们预期的快。06核心技术一览PART核心架构架构核心双分支 DiTWan-Animate-2 采用双分支 Diffusion Transformer 架构。一个分支处理参考图静态外观信息另一个分支处理驱动视频动态运动信息两路特征在 Transformer 层内融合而不是在输入侧做早期融合。这样做的好处是外观信息和运动信息各自保持独立表征不会互相污染。Time-Align RoPERoPE旋转位置编码是现在大模型里常见的位置编码方案原本用于语言模型的序列建模。Wan-Animate-2 对其做了时间维度的扩展让去噪视频 token 和参考图 token 在时间轴上建立显式对应关系。简单说就是告诉模型当前生成的这一帧对应参考视频的第几帧从而保证逐帧动作的时序一致性。Sparse-Ref Attention标准的交叉注意力Cross-Attention会让生成 token 对所有参考 token 打分但参考图里并非每个区域都同等重要。Sparse-Ref Attention 引入了稀疏化机制让模型只选择性关注高信息量的参考特征比如脸部、手部、服装纹理降低了无效计算也减少了背景噪声对生成结果的干扰。Lite 版的三阶段训练Wan-Animate-2-Lite 的推理步骤从 Base 版的 40 步压缩到 10 步靠的不是简单量化而是一套专门设计的三阶段训练方案第一阶段Teacher Forcing 预训练 误差缓冲机制。用完整模型作为教师训练轻量学生模型误差缓冲机制用于防止流式生成时误差逐帧累积放大。第二阶段Self-Forcing 蒸馏。让学生模型在自己的输出上继续训练减少对教师模型的依赖提升自主生成能力。第三阶段分块反向传播Chunk-wise Backpropagation。流式生成场景中视频是分块输出的逐块计算梯度并更新避免长序列带来的显存爆炸问题。模型规模与推理配置Base 模型参数量14BWan2.2-Animate-2-14B。推荐推理配置为 8× A800 80G支持 720P 视频生成2× A800 可跑 480P。Distillation 版本推理步骤 10 步guidance_scale 设为 1.0关闭 CFG使用 Euler scheduler在速度和质量之间取得平衡。更多transformerVITswin tranformer 参考头条号人工智能研究所 v号人工智能研究Suo, 启示AI科技动画详解transformer 在线视频教程