ARTICLE DETAIL

资讯详情

深耕网站建设、视觉设计与SEO优化的一线实战洞察。

10 分钟快速上手 Dolphin 2.9.1 Yi 1.5 34b:开源大模型本地部署新手教程

10 分钟快速上手 Dolphin 2.9.1 Yi 1.5 34b:开源大模型本地部署新手教程 10 分钟快速上手 Dolphin 2.9.1 Yi 1.5 34b开源大模型本地部署新手教程【免费下载链接】dolphin-2.9.1-yi-1.5-34b项目地址: https://ai.gitcode.com/hf_mirrors/dphn/dolphin-2.9.1-yi-1.5-34b想在自己的电脑上运行一个能写代码、能对话、还能调用工具的开源大模型吗Dolphin 2.9.1 Yi 1.5 34b 就是这样一个优秀的选择。它是基于零一万物 Yi-1.5-34B 微调的开源大模型采用 Apache 2.0 协议可免费商用MMLU 评测高达 77.4 分支持 8K 上下文与 ChatML 对话格式。本文是一篇面向新手的开源大模型本地部署教程带你 10 分钟完成从下载模型到本地运行的全流程。Dolphin 2.9.1 Yi 1.5 34b 是什么为什么值得部署Dolphin 系列由 Cognitive Computations 团队打造Dolphin 2.9.1 Yi 1.5 34b 是其中口碑极佳的版本。它基于 Yi-1.5-34B 基础模型做全参数微调FFT16bit融合了 Dolphin-2.9、OpenHermes-2.5、CodeFeedback、orca-math、Agent-FLAN 等多个高质量数据集因此兼具对话、代码生成、数学推理和函数调用能力甚至可以当 Agent 使用。核心参数数值参数规模34B60 层 Transformer基础模型Yi-1.5-34BLLaMA 架构上下文长度8K位置编码采用扩展 RoPE对话格式ChatML|im_start|/|im_end|评测成绩MMLU 77.4 分开源协议Apache 2.0允许商用权重格式bfloat16共 15 个 safetensors 分片想了解模型的训练细节与评测数据可以直接查看项目里的 README.md模型的完整参数定义如 60 层、隐藏维度 7168、rope_theta 等记录在 config.json 中分词器配置ChatML 模板、特殊 token 定义则见 tokenizer_config.json。模型权重总量约 68GB由 model.safetensors.index.json 索引 15 个分片文件结构一目了然。本地部署前的硬件配置要求显存与内存怎么选部署大模型前先对照下表确认你的硬件是否达标。显存决定模型能否完整加载内存则影响加载速度。部署方式显存/内存需求适合人群bfloat16 原版全量约 68GB 显存需 A100/H100 或双卡企业/实验室8bit 量化约 36GB 显存RTX A6000 级别高端工作站4bit 量化GPTQ/AWQ约 20GB 显存RTX 4090 足够个人玩家GGUF 量化Q4_K_M约 20GB可 CPU/GPU 混合运行普通用户首选对新手来说最推荐的路径是先用本仓库的 bfloat16 权重 Transformers 验证效果日常使用则下载 GGUF 量化版以降低门槛。第一步快速获取模型文件下载与目录结构最方便的方式是使用 git 克隆整个仓库需要先安装 git-lfs 大文件插件git lfs install git clone https://link.gitcode.com/i/0220eb95e2a6dc050abfbc071e6ba4db克隆完成后目录内包含 15 个model-0000X-of-00015.safetensors权重分片、model.safetensors.index.json 权重索引以及 config.json、generation_config.json、tokenizer.json、tokenizer.model 等配置文件。只要整个目录保持完整Transformers 就能自动识别加载。第二步使用 Transformers 一行代码加载模型最快上手方法如果你有足够显存安装依赖后即可用 HuggingFace Transformers 加载原版模型pip install transformers torch acceleratefrom transformers import AutoModelForCausalLM, AutoTokenizer model AutoModelForCausalLM.from_pretrained(./dolphin-2.9.1-yi-1.5-34b, device_mapauto) tokenizer AutoTokenizer.from_pretrained(./dolphin-2.9.1-yi-1.5-34b)模型会自动按 ChatML 模板拼接对话注意在加载时设置trust_remote_codeFalse本模型为标准 LLaMA 架构无需远程代码推理时记得do_sampleTrue以发挥其对话风格。第三步低显存方案Ollama / llama.cpp 量化部署显存不足 24GB 的读者推荐下载社区发布的 GGUF 量化版Q4_K_M 约 20GB配合 Ollama 一键运行ollama create dolphin-2.9.1-34b -f Modelfile ollama run dolphin-2.9.1-34b在 Modelfile 中指定 GGUF 文件路径并填入 ChatML 模板见下一节即可。Ollama 自动做显存/内存调度普通 16GB 内存的电脑也能跑起来只是速度稍慢。追求性能的进阶玩家还可以用 llama.cpp 的llama-server启动一个 OpenAI 兼容的本地 API 服务。第四步进阶方案vLLM 高性能推理部署需要把模型开放给多人使用、追求高吞吐vLLM 是当前最流行的高性能推理框架pip install vllm vllm serve ./dolphin-2.9.1-yi-1.5-34b --max-model-len 8192启动后会自动提供 OpenAI 兼容接口默认http://localhost:8000/v1业务系统只需改一行 base_url 即可接入非常省心。ChatML 对话模板格式详解必须掌握的调用方式Dolphin 2.9.1 使用 ChatML 格式手动调用时请严格遵循如下结构|im_end|为结束标记|im_start|system You are Dolphin, a helpful AI assistant.|im_end| |im_start|user 你的问题写在这里|im_end| |im_start|assistant系统提示词可自由替换如设定角色、指定输出语言。若通过 vLLM 或 Ollama 调用这些框架会自动套用 tokenizer_config.json 中内置的chat_template无需手写。新手常见问题与避坑指南显存不足OOM改用 GGUF 或 4bit 量化版本或将max-model-len调小减少 KV Cache 占用。对话总以英文回复在 system 提示中明确要求“用中文回答”即可。上下文超长报错本模型原生 8K 上下文超长内容需自行截断或改用长上下文版本。关于“无审查”特性Dolphin 过滤了对齐数据模型遵从度极高对外提供服务前请务必自行叠加安全对齐层并对生成内容负责。总结Dolphin 2.9.1 Yi 1.5 34b 是一个性能与灵活性兼备的开源大模型Apache 2.0 可商用、77.4 的 MMLU 成绩、支持函数调用与 Agent 场景。按照本文的开源大模型本地部署教程先克隆 模型仓库 验证原版再按硬件情况选择 Transformers、Ollama 或 vLLM 方案10 分钟内就能让这只“海豚”在本地为你工作。动手试试吧【免费下载链接】dolphin-2.9.1-yi-1.5-34b项目地址: https://ai.gitcode.com/hf_mirrors/dphn/dolphin-2.9.1-yi-1.5-34b创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表