ARTICLE DETAIL

资讯详情

深耕网站建设、视觉设计与SEO优化的一线实战洞察。

Stable Video Infinity 快速上手:从一张静图生成无限长视频的完整指南

Stable Video Infinity 快速上手:从一张静图生成无限长视频的完整指南 Stable Video Infinity 快速上手从一张静图生成无限长视频的完整指南【免费下载链接】Stable-Video-Infinity[ICLR 26 Oral] Stable Video Infinity: Infinite-Length Video Generation with Error Recycling项目地址: https://gitcode.com/GitHub_Trending/st/Stable-Video-Infinity一张静图能持续动多久视频模型超过几十秒就糊、就飘。Stable Video InfinitySVI用 Error Recycling 微调把模型自生成的误差回收进训练、让它学会纠错支持从一张图做无限长视频生成还能叠加文本、音频与骨骼条件。SVI 是什么定位与三个关键特性一句话SVI 不是新的视频模型而是给 Wan 2.1 I2V 14B 底模换上的一个 LoRA轻量适配层专门治越生成越差。长度不设限推理时按 clip每段 81 帧循环续写官方 20 分钟测试中 SVI-Shot 无漂移、无遗忘。条件全兼容文本流多场景电影感、音频SVI-Talk 说话人、骨骼SVI-Dance 舞蹈都能驱动同一条管线。训练数据量小只调 LoRA 参数官方仅用 5k 条片段就调出 SVI-TalkWan 2.2 Animate 上 1k 条即可解锁无限长data/toy_train/里有可复现的玩具数据。图SVI 通过 Error Recycling 把自生成误差回收为监督信号说明它如何在长视频上不出现质量衰减。最快跑通环境、安装与第一次生成官方在 A100 80G、CUDA 12.0、torch 2.8.0 上测试安装脚本会装 torch 2.5.0torch 2.4.1/2.5.0 均验证可用。14B 底模吃显存显存吃紧时可用--num_persistent_param_in_dit压低常驻显存的参数量。先克隆仓库、建好环境这一步装完后你会得到一个带完整推理管线的svi环境git clone https://gitcode.com/GitHub_Trending/st/Stable-Video-Infinity cd Stable-Video-Infinity conda create -n svi python3.10 conda activate svi pip install -e . pip install flash_attn2.8.0.post2 conda install -c conda-forge ffmpeg librosa libiconv再下两个模型Wan2.1-I2V-14B-480P 底模和 SVI-Shot 的 LoRA。下完后weights/里应能看到Wan2.1-I2V-14B-480P/与Stable-Video-Infinity/version-1.0/svi-shot.safetensors两处内容huggingface-cli download Wan-AI/Wan2.1-I2V-14B-480P --local-dir ./weights/Wan2.1-I2V-14B-480P huggingface-cli download vita-video-gen/svi-model version-1.0/svi-shot.safetensors --local-dir ./weights/Stable-Video-Infinity最后跑最小生成输入是仓库自带的样例图加提示词跑完到videos/svi_shot/查看结果视频bash scripts/test/svi_shot.sh想换成自己的素材改脚本里的--ref_image_path输入图和--prompt_path提示词文件每行一条、按 clip 循环使用即可。样例输入图如下图官方样例输入 frame.jpg配合 prompt.txt 中的游艇提示词续写成连续镜头。参数调优速查表生成脚本里的关键开关以scripts/test/svi_shot.sh为例其它分支脚本参数名一致参数作用建议取值什么时候动它--num_clips续写多少个 clip每个 81 帧先设 10 试水svi_2.0.sh直接给了 999想试更长时长时改它别一上来就拉满--num_motion_frames从上一段带过来做参考的帧数跟模型走Shot/Talk/Dance/Tom 用 1Film 用 5基本别动官方说默认值与训练对齐--cfg_scale_text文本提示词的引导强度默认 5.0出现鬼影、动作不听提示词时调到 7--max_width输出视频最大宽度默认 832原图远超训练分辨率 480×832 导致没运动时调小用终端Video dimensions日志核对--ref_pad_num参考图填充方式-1 用随机帧、0 补零单场景 -1允许场景变化 0单场景怕漂移选 -1要切场景选 0--num_steps每段采样步数默认 50用量化/蒸馏 LoRA 时官方建议多于 4/8 步随机种子每段 clip 的随机性每段用不同种子分段出片时同种子复用会明显掉质量进阶玩法音频、骨骼与自己的 LoRASVI-Talk 说话人视频用途人物图加音频生成口型连贯的长对话视频官方 10 分钟测试无漂移。入口scripts/test/svi_talk.sh调用test_svi_talk.py需另按 README 下载 chinese-wav2vec2-base 与 MeiGen-MultiTalk 权重并建软链。关键设置--ref_image_path给人物图、--audio_path给音频样例在data/toy_test/talk/obama.png 加 obama_5min.wav。图三种对话视频方案对比SVI-Talk 在长视频上保持文本细节与画面一致性。SVI-Dance 骨骼驱动舞蹈用途人物图加姿态视频生成跟随骨骼动作的长舞蹈视频。入口scripts/test/svi_dance.sh调用test_svi_dance.py需另下 UniAnimate-DiT LoRA 权重。关键设置--image_path给人物图、--pose_path给姿态视频样例在data/toy_test/dance/素材预处理看scripts/data_preprocess/prepare_video_pose.py。训练自己的 LoRA用途官方 FAQ 里治颜色漂移的头号方案——用几条贴合目标风格的视频微调 LoRA顺便学走你的风格。入口仿照data/toy_train/的数据格式准备素材跑scripts/train/svi_shot.sh多机训练改--num_nodes。关键设置只调 LoRA 参数官方在 8/64 卡上都验证过训练。避坑速查症状、原因与解法⚠️ 先对号入座再回头改参数症状原因解法长视频颜色渐漂、画面发灰VAE 反复编解码累积误差测试素材偏离训练分布用目标风格的小批量视频微调 LoRA官方 FAQ 首选方案几乎没运动、切不了场景输入图远超训练分辨率缩放后与训练不符调--max_width在终端日志确认Video dimensions: 832x1472鬼影、动作不听提示词文本引导不足调高--cfg_scale_text如 7风格与训练差异大时必加ComfyUI 出片闪烁、退化用了原版 Wan 2.1 工作流或每段同种子换仓库自带的comfyui_workflow_svi_1.0官方工作流每段换种子flash-attn 装不上缺编译依赖按 README 指向的 issue #3 处理生成卡顿、显存紧张分辨率/步数偏高降--num_steps或用--num_persistent_param_in_dit压显存下一步通读docs/FAQ.md含参数含义与 ComfyUI 注意事项再照着data/toy_test/里的样例逐个复现各分支效果。【免费下载链接】Stable-Video-Infinity[ICLR 26 Oral] Stable Video Infinity: Infinite-Length Video Generation with Error Recycling项目地址: https://gitcode.com/GitHub_Trending/st/Stable-Video-Infinity创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表