ARTICLE DETAIL

资讯详情

深耕网站建设、视觉设计与SEO优化的一线实战洞察。

MiniMax H3量化包上手教程:消费级显卡本地生成2K视频

MiniMax H3量化包上手教程:消费级显卡本地生成2K视频 MiniMax H3量化包上手教程消费级显卡本地生成2K视频【免费下载链接】Minimax-H3-nvfp4-INT4-INT8-Convrot项目地址: https://ai.gitcode.com/hf_mirrors/Abiray/Minimax-H3-nvfp4-INT4-INT8-Convrot手里有一张产品图、一句文案想直接出一条带原生声轨的2K视频又不想把素材传给云端、按次付费——这个仓库就是干这个的。MiniMax-H3-nvfp4-INT4-INT8-Convrot 把原版 MiniMax H3海螺3.0拆成 INT4、INT8、NVFP4 三种量化格式打包16~24GB 显存的消费级显卡就能完成本地生成2K视频全程免费。仓库按输入能力分两条线FL2VA 系列收 0~2 张参考图对应纯文本或首尾帧控制Ref2VA 系列最多吃 9 张图、3 段视频、3 段音频。文本编码器是 Qwen3-VL-32B同样提供三种量化档位。提示词可以直接用母语写中、英、日、韩、法、德、西、俄、葡、意、阿共 11 种语言都有稳定支持。硬件门槛按显存挑量化版本⚠️ 无论选哪档vae/里的两个文件必须一起下载minimax_h3_video_vae_fp16.safetensors5.21GB视频解码器和minimax_h3_audio_vae_fp32.safetensors605MB音频解码器。缺任何一个工作流都跑不起来。扩散模型选哪份版本单文件大小定位适合谁INT4pruned_int4_convrot约 11.3GB门槛最低试错快16GB 卡4070 Ti Super、4080 等第一次上手混合pruned_mixed_int4_int8_convrot约 15.5GB压缩率与画质折中15GB 以上显存想省显存又不想画质掉太多INT8pruned_int8_convrot约 21GB剪枝后质量最高24GB 卡3090、4090出成片NVFP412.5GBRef2VA 混合版 24.4GB4位浮点仅 Blackwell 架构可用RTX 5090 等新卡30/40 系卡别下加载不了文本编码器要跟扩散模型同档位配套编码器文件大小配套显卡qwen3vl_32b_minimax_h3_int4_convrot.safetensors15.0GB16GB 卡qwen3vl_32b_minimax_h3_int8_convrot.safetensors27.1GB24GB 卡qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors15.7GBBlackwell一句话16GB 卡就走 INT4INT4 组合24GB 卡再考虑 INT8显存紧张就别硬上 INT8。最小上手跑通第一条视频的最短路径以 16GB 卡为例拉仓库、放模型、起工作流三步git clone https://gitcode.com/hf_mirrors/Abiray/Minimax-H3-nvfp4-INT4-INT8-Convrot cd Minimax-H3-nvfp4-INT4-INT8-Convrot # 模型按类型拷进 ComfyUI 的 models 目录 cp MiniMax_H3_FL2VA_pruned_int4_convrot.safetensors $COMFYUI/models/diffusion_models/ cp text_encoders/qwen3vl_32b_minimax_h3_int4_convrot.safetensors $COMFYUI/models/text_encoders/ cp vae/minimax_h3_video_vae_fp16.safetensors vae/minimax_h3_audio_vae_fp32.safetensors $COMFYUI/models/vae/然后在 ComfyUI 里加载 UNETLoader扩散模型、CLIP 加载器编码器和两个 VAELoader挂上分辨率节点选 16:9、0.98MP约 1344×768、时长 4 秒点执行。仓库自带的ref2.json是一份现成的 Ref2VA 示例工作流可直接导入照着改。场景实战三种玩法与模型文件选择纯文本出片FL2VA 不喂图选任意量化档的 FL2VA 文件即可。提示词把主体、动作、镜头、声音四件事写清楚比堆形容词有效清晨厨房窗边手冲壶向玻璃杯缓慢注水水汽升起水面有细小涟漪镜头缓慢下移背景是轻微的市集人声。图文混剪首帧、尾帧控制同样用 FL2VA。给 1 张图就是首帧或尾帧转视频给 2 张图就是首尾帧插值。需求描述要锚定画面里不能变的东西以上传照片为首帧人物保持五官、服装与照片一致缓缓抬头向镜头招手背景虚化的街道车流缓慢移动。多素材合成Ref2VA 全模态参考选任意量化档的 Ref2VA 文件。输入上限图 ≤9 张、视频 ≤3 段每段 2~15 秒、音频 ≤3 段每段 2~15 秒音频必须搭配图片或视频、不能单独作为输入所有文件合计 ≤12 个总时长不超过 15 秒。示例工作流里用的 Timeline Audio 分段写法值得照搬Timeline: [0s-5s] 镜头从巷口雨夜招牌摇到吧台湿地板反射霓虹 Audio: 低频 lo-fi 鼓点雨点打在屋檐上吧台上冰块碰撞调参取舍分辨率、时长、帧率为什么这么设参数常用值权衡逻辑分辨率短边 768px 起0.98MP 16:9 ≈ 1344×768直出是中间分辨率2K 靠 H3-Regenerate-2K 再放大一次16GB 卡直接开大尺寸OOM 风险比省下的时间更不值时长4~15 秒显存和时间都随时长涨。先用 4 秒验构图和提示词定稿再拉长到 10~15 秒帧率24 FPS模型固定输出电影感节奏没有可选项音频32kHz 立体声原生带出声轨不需要后期配音轨画幅21:9 到 9:16 均可按发布渠道定竖屏给短视频2.39:1 宽幅给预告片排错速查症状可能原因解法显存爆OOM16GB 卡强跑 INT8或分辨率拉太大换 INT4约11.3GB或混合档约15.5GB分辨率降一档生成速度慢编码器与扩散模型量化不匹配、ComfyUI 版本旧两者同档位先更新 ComfyUI 再重跑画面发虚、细节不够INT4 压缩损失或未做 2K 放大换 INT8/混合档出片后加一遍 H3-Regenerate-2K节点红框、提示找不到文件漏放 VAE 或编码器检查 vae 两个文件和对应量化档的编码器是否都已就位有画面没声音音频 VAE 没加载把 605MB 的 audio_vae 文件放入 vae 目录并在工作流加载NVFP4 加载失败30/40 系显卡不支持NVFP4 仅限 Blackwell老卡改用 INT4/INT8仓库资源地图Minimax-H3-nvfp4-INT4-INT8-Convrot/ ├── MiniMax_H3_FL2VA_pruned_*.safetensors # 基础线纯文本 / 首帧 / 首尾帧 ├── MiniMax_H3_Ref2VA_*.safetensors # 进阶线图 视频 音频多素材参考 ├── text_encoders/ # Qwen3-VL-32B 编码器三档量化按显卡选 ├── vae/ # 必装视频 VAE5.21GB 音频 VAE605MB └── ref2.json # Ref2VA 示例 ComfyUI 工作流使用边界底模为 MiniMax 的海螺3.0本仓库是社区编译的量化衍生版统一遵循 MiniMax H3 社区许可协议商用前再确认协议条款。官方 API 场景下输入内容会过自动审核涉嫌违法、侵权或不当的内容会被拦截本地使用也别碰这些红线。音频类输入不能单独喂给模型必须搭配图片或视频这是模型侧的硬限制不是参数能绕过的。下一步16GB 卡直接下 INT4 的 FL2VA INT4 编码器加 vae 两个文件先出一条 4 秒、1344×768 的样片验证环境样片没问题后再拿一张自己的图走首帧模式跑 8 秒确认人物一致性后加 H3-Regenerate-2K 出 2K 成片。【免费下载链接】Minimax-H3-nvfp4-INT4-INT8-Convrot项目地址: https://ai.gitcode.com/hf_mirrors/Abiray/Minimax-H3-nvfp4-INT4-INT8-Convrot创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表