ARTICLE DETAIL

资讯详情

深耕网站建设、视觉设计与SEO优化的一线实战洞察。

如何3分钟上手InternVL3_5-30B-A3B-Instruct:从下载到首次推理的完整教程

如何3分钟上手InternVL3_5-30B-A3B-Instruct:从下载到首次推理的完整教程 如何3分钟上手InternVL3_5-30B-A3B-Instruct从下载到首次推理的完整教程【免费下载链接】InternVL3_5-30B-A3B-Instruct项目地址: https://ai.gitcode.com/hf_mirrors/OpenGVLab/InternVL3_5-30B-A3B-InstructInternVL3_5-30B-A3B-Instruct 是开源多模态大模型 InternVL3.5 家族的指令微调版本支持图像理解、视觉问答、多图对话与思考推理单张 A100 显卡即可部署。本教程带你 3 分钟完成模型下载、环境配置和首次推理跑通你的第一句看图说话。模型速览为什么选 InternVL3_5-30B-A3B-Instruct在 InternVL3.5 家族中这款模型是典型的效率担当——采用MoE混合专家架构总参数约 30.8B但每次推理只激活约 3B 参数兼顾能力与速度 项目说明模型架构ViT–MLP–LLM 三段式视觉语言架构语言模型Qwen3-30B-A3BMoE128 个专家每 token 激活 8 个视觉编码器InternViT-300M支持动态高分辨率切图训练阶段多模态持续预训练CPT 监督微调SFT部署门槛单张 A100 即可运行 16-bit 推理开源协议Apache-2.0可商用 提示本仓库是InstructCPT SFT版本如果需要更强的推理能力同系列还有经过 CascadeRL 完整训练的InternVL3_5-30B-A3B版本可选。第一步下载模型权重模型仓库包含完整权重与自定义模型代码直接 clone 即可约 60GB 磁盘空间git clone https://gitcode.com/hf_mirrors/OpenGVLab/InternVL3_5-30B-A3B-Instruct如果已有 Hugging Face 环境也可以用官方命令行工具加速下载huggingface-cli download OpenGVLab/InternVL3_5-30B-A3B-Instruct --local-dir InternVL3_5-30B-A3B-Instruct下载完成后仓库核心文件一目了然文件作用vision.safetensors视觉编码器InternViT权重layer-0-ep-0-of-1.safetensors等 48 个分层文件语言模型Qwen3-MoE各层专家权重others.safetensors嵌入层、MLP 投影等其余权重model.safetensors.index.json权重索引定位每个参数所在分片config.json模型总配置视觉 语言双配置modeling_internvl_chat.py对话模型主体提供chat()/batch_chat()推理接口modeling_intern_vit.py视觉编码器实现conversation.py对话模板本模型使用internvl2_5模板tokenizer.json/vocab.json分词器文件第二步环境配置5 分钟装好依赖只需 Python PyTorch transformers 三件套版本要求很宽松pip install torch torchvision pip install transformers4.52.1⚠️ 两个常见坑transformers 版本必须 ≥ 4.52.1否则会因缺少 Qwen3-MoE 支持而报错加载模型时必须加trust_remote_codeTrue因为模型使用了自定义建模代码modeling_internvl_chat.py。第三步首次推理——让模型看图说话下面是最简推理流程共 4 步加载模型 → 加载图像 → 切图预处理 → 调用chat()。import torch from PIL import Image from transformers import AutoModel, AutoTokenizer path InternVL3_5-30B-A3B-Instruct # 本地模型目录 model AutoModel.from_pretrained( path, torch_dtypetorch.bfloat16, low_cpu_mem_usageTrue, use_flash_attnTrue, trust_remote_codeTrue, device_mapauto).eval() tokenizer AutoTokenizer.from_pretrained(path, trust_remote_codeTrue, use_fastFalse)图像预处理采用 InternVL 标志性的动态高分辨率策略按宽高比把大图切成 1~12 块 448×448 的切片config.json中max_dynamic_patch: 12文字、细节多的图片会自动获得更高分辨率。# 预处理后得到 pixel_values具体工具函数见 README 的 load_image question image\n请简要描述这张图片。 response model.chat(tokenizer, pixel_values, question, dict(max_new_tokens1024, do_sampleTrue)) print(response)至此你的 InternVL3_5-30B-A3B-Instruct 多模态推理环境就跑通了 ✅ 除单图问答外模型还原生支持纯文本对话、单图多轮、多图对比、视频理解与批量推理batch_chat接口。进阶开启思考模式提升推理能力对于数学、图表等需要多步推理的任务只需换一段系统提示词即可开启思考模式R1_SYSTEM_PROMPT You are an AI assistant that rigorously follows this response protocol: 1. First, conduct a detailed analysis of the question... (详细思考过程写入 think 标签) 2. After the thinking section, provide a clear, concise answer. .strip() model.system_message R1_SYSTEM_PROMPT官方建议开启思考模式时设置do_sampleTrue、temperature0.6可避免输出重复。服务化部署LMDeploy / vLLM 一键上线如果要在生产环境提供 API 服务推荐用 LMDeploy一条命令即可拉起兼容 OpenAI 接口的服务pip install lmdeploy0.9.1 lmdeploy serve api_server InternVL3_5-30B-A3B-Instruct --server-port 23333 --tp 1 --backend pytorch启动后即可用 OpenAI SDK 风格调用chat.completions接口图像问答、多轮对话开箱即用。vLLM 同样支持该模型的部署。常见问题 FAQQ1显存不够怎么办单张 A10080G可跑 16-bit 推理显存吃紧可开启 8-bit 量化加载load_in_8bitTrue或加device_mapauto多卡分摊。Q2为什么加载时报错 Unrecognized model升级transformers4.52.1并确认保留了trust_remote_codeTrue参数。Q3Instruct 版和无后缀版有什么区别本仓库Instruct完成了 CPT SFT 训练擅长指令跟随与通用对话无后缀版额外完成了 CascadeRL 强化学习在 MMMU、MathVista 等推理基准上更强按需选择。Q4能微调吗可以SWIFT、XTuner 等主流微调框架均已支持 InternVL3.5 系列。总结回顾一下 InternVL3_5-30B-A3B-Instruct 上手的三条主线下载git clone拿到含自定义代码的完整模型仓库环境transformers4.52.1trust_remote_codeTrue单卡 A100 起步推理一行model.chat()完成看图说话再进阶到思考模式与 LMDeploy 服务化部署。MoE 架构带来的高吞吐 动态高分辨率带来的强感知让它在 30B 量级开源多模态模型中兼具性能与部署经济性。现在就可以动手跑通你的第一条图像问答 【免费下载链接】InternVL3_5-30B-A3B-Instruct项目地址: https://ai.gitcode.com/hf_mirrors/OpenGVLab/InternVL3_5-30B-A3B-Instruct创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表