ARTICLE DETAIL

资讯详情

深耕网站建设、视觉设计与SEO优化的一线实战洞察。

LocalAI:无需GPU在本地跑起LLM、语音与图像模型的开源AI引擎

LocalAI:无需GPU在本地跑起LLM、语音与图像模型的开源AI引擎 LocalAI无需GPU在本地跑起LLM、语音与图像模型的开源AI引擎【免费下载链接】LocalAILocalAI is the open-source AI engine. Run any model - LLMs, vision, voice, image, video - on any hardware. No GPU required.项目地址: https://gitcode.com/GitHub_Trending/lo/LocalAI如果你想在自家服务器上部署一套类 OpenAI的 AI 服务LocalAI 是目前门槛较低的选择之一它是一个开源 AI 引擎一个核心加按需拉取的后端能在纯 CPU 或消费级硬件上运行 LLM、图像、视频、语音等多模态模型并直接提供 OpenAI / Anthropic / ElevenLabs 兼容的 REST API。数据不出内网也不产生按 token 计费。本地模型服务的痛点LocalAI 如何解决把模型跑在本地通常要面对三件事环境复杂llama.cpp、vLLM、whisper.cpp、Stable Diffusion 各是一套依赖逐个装会消耗大量时间API 不统一每接入一种能力文本、图像、语音就要适配一套不同的调用方式数据外发顾虑企业或隐私敏感场景下请求不能离开自己的机器。LocalAI 的解法是把能力和入口拆开问题LocalAI 的做法后端依赖重核心是一个小二进制或容器llama.cpp、vLLM、whisper.cpp、MLX 等引擎各自打包成独立 OCI 镜像只在真正加载对应模型时才拉取后端实现代码 均独立维护调用方式碎片化统一暴露/v1/chat/completions、/v1/images/generations、/v1/audio等 OpenAI 风格端点现有 OpenAI SDK 改个 base URL 即可接入模型来源分散模型可从内置模型库、Hugging Face、Ollama 注册表或 YAML 配置导入gallery/ 目录下是全部可用模型的清单与量化变体它还有两个常被忽略的附加能力内置 Web 界面聊天、模型管理、代理配置、系统监控一站式完成以及多用户支持API Key 鉴权、用户配额、角色控制这意味着它既能给一个人当本地工具箱也能给一个小团队当内部 AI 网关。小核心 插件式后端LocalAI 的架构思路理解 LocalAI 只需要记住一句话核心很小后端是插上去的。具体来说每个后端是一个独立的 gRPC 服务进程围绕某个成熟引擎构建比如 llama.cpp 负责文本生成whisper.cpp 负责语音转写后端可以单独安装、升级、移除甚至部署到另一台机器上单个后端故障不会影响核心和其他服务后端契约只是一份简单的 gRPC 接口见 backend.proto所以你可以用任意语言写自己的后端插进来。这种设计的直接好处装了什么就跑什么镜像体积和内存占用都只与你要用的能力相关而不是与全家桶相关。CPU 上 3 步跑起 LocalAI推荐路径是容器。一条命令启动纯 CPU 镜像无需任何 GPU 参数docker run -ti --name local-ai -p 8080:8080 localai/localai:latest然后打开http://localhost:8080你会看到 Web 界面。接着在 Models 页面安装一个小模型官方快速上手文档quickstart.md建议从qwen3-4b这类 CPU 友好、支持工具调用的小模型开始装好即可在 Chat 页面直接对话。如果你习惯命令行也可以用内置 CLI 从模型库直接拉起模型并开聊local-ai run qwen3-4b local-ai chat --model qwen3-4b其他模型来源同样是一条local-ai runhuggingface://指 GGUF 文件、ollama://指 Ollama 注册表、oci://指 OCI 镜像、https://...yaml指模型配置文件。需要源码参与时再执行git clone https://gitcode.com/GitHub_Trending/lo/LocalAI获取仓库仓库为只读参考。能力清单与边界它能跑什么、不能跑什么能跑什么——项目文档overview.md列出的完整能力面文本生成llama.cpp、vLLM、SGLang、transformers、MLX 等 60 后端支持函数调用、受约束语法grammar、结构化输出音频TTSKokoro、Piper、MOSS-TTS 等、ASR 转写whisper.cpp、parakeet.cpp、说话人分离、实时语音对话Realtime API WebRTC图像与视频Stable Diffusion、Flux 等图像生成LTX-2 / WAN 视频生成目标检测与图像理解嵌入与重排embeddings、reranker 端点配套内置向量库 local-store代理内置自治 Agent支持 MCP 工具、RAG、技能可在 UI 里直接创建services/agents。边界在哪里——几点务实的提醒CPU 推理速度有限小模型1B–8B 量化版在普通服务器上可日常使用70B 级别模型在纯 CPU 下延迟会很高大模型场景建议配 GPU 镜像不是云端算力它解决的是在自己的硬件上按自己的条件跑吞吐上限取决于你的机器横向扩展要用它自带的分布式模式PostgreSQL NATS 的 worker 集群见 services/distributed对外暴露需要防护官方明确建议远程部署时至少设置LOCALAI_API_KEY多用户场景开启LOCALAI_AUTHtrue启用角色与配额。从加载模型到接入应用一条典型工作流一个比较完整的落地过程大致是这样起服务docker run启动 CPU 或 GPU 镜像确认http://localhost:8080可访问选模型在 Web 界面的 Models 页按类型文本生成 / TTS / 图像 / 嵌入和标签cpu、gguf、function-calling 等筛选点击安装或local-ai models install name验证在 Chat 页面发一条消息或用最短的 API 调用确认curl http://localhost:8080/v1/chat/completions \ -H Content-Type: application/json \ -d {model:qwen3-4b,messages:[{role:user,content:你好}]}这条请求返回的就是标准 OpenAI 格式换 SDK、换语言都不需要改协议。接应用把现有 OpenAI 客户端的 base URL 指向http://主机:8080即可需要语音、图像生成时对应的/v1/audio/...、/v1/images/...端点也是同一风格。加能力可选装 TTS/ASR 后端做多模态、创建 Agent 挂 MCP 工具、开启分布式模式扩容。选型建议按硬件选镜像按场景选模型硬件与镜像的对应关系摘自 containers.md硬件镜像纯 CPUlocalai/localai:latestNVIDIACUDA 12/13localai/localai:latest-gpu-nvidia-cuda-12/13加--gpus allAMDROCmlocalai/localai:latest-gpu-hipblasIntel GPUlocalai/localai:latest-gpu-intelVulkanlocalai/localai:latest-gpu-vulkanApple Silicon支持 MLX 系列后端macOS 有独立 DMG/Launcher几点选择建议个人开发机 / 笔记本纯 CPU 镜像 4B 以下量化模型优先体验 API 兼容性与工作流别急着上大模型团队内部服务NVIDIA 镜像 vLLM 或 llama.cpp 后端跑 7B–70B开启 API Key 与配额作为私有 AI 网关多机 / 边缘设备用分布式模式或 P2P 联邦推理把模型拆到多台机器上services/nodes 里是节点管理的实现需要私有后端对照 后端目录 用 gRPC 契约实现自己的推理服务接入方式与内置后端完全一致。动手前检查清单开始之前过一遍这五项确认硬件档位纯 CPU 可跑小模型7B 模型建议 GPU端口 8080 空闲容器运行时Docker / Podman可用明确了要暴露还是内网使用——远程访问记得配LOCALAI_API_KEY或LOCALAI_AUTH挑好第一个模型官方建议qwen3-4b这类小且支持工具调用的模型预留模型下载空间与带宽量化版q4/q8比全精度省数倍磁盘。下一步就是执行第一条docker run装一个模型发第一句对话。跑通之后再按能力清单逐项接入你的应用。【免费下载链接】LocalAILocalAI is the open-source AI engine. Run any model - LLMs, vision, voice, image, video - on any hardware. No GPU required.项目地址: https://gitcode.com/GitHub_Trending/lo/LocalAI创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表