
三行命令跑起本地大模型Text Generation Web UI 推理前端上手实录【免费下载链接】textgenOpen-source desktop app for local LLMs. Text, vision, tool-calling, OpenAI/Anthropic-compatible API. 100% private.项目地址: https://gitcode.com/GitHub_Trending/te/textgen想让大模型的聊天界面跑在自己电脑上Text Generation Web UI一个文本生成 Web 界面可以做到克隆仓库、跑一遍启动脚本、刷新浏览器就得到一个完全离线可用的 LLM 聊天界面不用申请任何云端密钥对话内容也不会离开你这台机器。下面按真实使用顺序把从启动到选后端、调参数再到进阶玩法和排坑一次讲清楚。先把痛点说透为什么大模型要跑在自己电脑上用云服务时有两类人会膈应一类担心对话内容落在别人服务器上另一类嫌申请密钥、限流、按 token 计费太麻烦。这两件事本地部署都能解决——模型文件在你自己的硬盘里界面只监听本机全程离线。但把模型跑起来并不等于终端敲一行字后端要选、模型格式要选、量化精度也要选。Text Generation Web UI 做的正是这件事它把 llama.cpp、Transformers 等多个推理后端加上一整套生成参数统一收进一个网页里是一个普通人能直接用起来的大模型推理前端。 三行命令跑起本地大模型从克隆到第一次对话Linux 上就这三行Windows 用start_windows.batmacOS 用start_macos.sh代替第三个命令git clone https://gitcode.com/GitHub_Trending/te/text-generation-webui cd text-generation-webui ./start_linux.sh首次运行会问你 GPU 厂商脚本自己用 Miniforge 建隔离环境、装依赖装完自动在浏览器里打开 http://127.0.0.1:7860 。实测首次安装要几分钟之后每次直接再跑一遍启动脚本就能拉起界面。界面起来后只缺模型下载一个 GGUF 格式llama.cpp 使用的单文件模型格式不需要一堆附属文件的模型文件丢进user_data/models/目录就会被自动识别不用改任何配置。⚖️ 显存不够时怎么挑后端llama.cpp、GPTQ、Transformers后端决定模型怎么被加载。项目内置 llama.cpp一个纯 C/C 写的推理引擎没有 GPU 也能跑、ik_llama.cpp、Transformers、ExLlamaV3、TensorRT-LLM切换模型不用重启服务。怎么选一张表说清后端模型格式适合硬件实操建议llama.cppGGUF 单文件纯 CPU 到低显存兼容性最好上手首选优先挑 4 比特或 8 比特量化版量化就是把参数精度压缩省显存、缩体积GPTQ量化格式8GB 级显存GPTQ 是一种权重量化方法显存有点紧时的性价比之选Transformers多文件 safetensors16GB 以上显存全精度、质量上限最高但需要完整安装约 10GB 磁盘空间一句话总结显存宽裕直接 Transformers显存不足 8GB 或者干脆没有 GPUllama.cpp 配 GGUF 最稳。️ 调顺输出温度和最大长度到底给多少模型默认出活一般参数才决定它的性格。最常动的是这两个温度我实测 0.7–1.0 适合写故事、起名字这类创意任务输出有活气0.3–0.7 适合事实问答、写代码、做摘要输出稳。想要同一输入每次结果一致就往 0 压。最大生成长度按任务给。写一段、答一题不用给太多数字开大了既吃内存又拖慢速度要写长文再往上加。一个容易忽略的细节界面带预设功能user_data/presets/里自带 Creative、Top-P、Deterministic 三个现成例子调好的参数存成预设之后一键复用不用每次重调。输出顺了接下来可以琢磨这个界面还能干点别的。 进阶玩法角色卡、扩展插件、LoRA 微调角色扮演。在user_data/characters/放一个 YAML 角色卡仓库自带 Example.yaml 等示例聊天界面里就能跟这个角色对话比默认助手更有沉浸感适合长期陪伴式的使用场景。扩展插件。extensions/目录自带一批开箱即用的插件Silero TTS 把回复读出来、Whisper 语音输入、谷歌翻译、调 SD 的画图接口、图片画廊。把自己的插件放进user_data/extensions/或者启动参数里启用现成的聊天界面就接上了声音、图片这些能力。更多说明见扩展文档。LoRA 微调。LoRA 是一种轻量微调方式只训练一小撮附加参数不动原模型权重普通显卡就干得动。训练标签页支持基于多轮对话或纯文本数据集微调中断了还能续训。想让模型按特定语气说话、按特定领域格式答题这是最省事的路细节参考训练标签页文档。️ 避坑手册内存不足和生成慢怎么办我被问得最多的就两个问题加载时或生成中报内存不足先换更小的量化8 比特降到 4 比特再调小上下文长度实在不行就换更小的模型。CPU 路线还可以把部分层放到内存里算。生成速度慢先确认模型真的吃满了 GPU 而不是回落 CPU再看上下文和最大长度是不是给太大都正常的话试试 ExLlamaV3它是奔着速度去的。参数想永久生效写进user_data/CMD_FLAGS.txt每次启动自动读取不用在终端里重复敲。另外顺手把 OpenAI 兼容 API 也开了的话这套本地界面还能直接当现有工具的接口后端用接入成本很低。 下一步装完先做这两件事别一上来就扎进参数细节。下次打开界面建议只做两件事第一挑一个 7B 级、4 比特量化的 GGUF 模型放进user_data/models/用默认参数聊一轮感受你这台机器的实际吞吐第二启用一个 TTS 插件让模型把回复念出来体验一下从能用到好用的差别。这两步做完再回头挑后端、调参数心里就有底了。【免费下载链接】textgenOpen-source desktop app for local LLMs. Text, vision, tool-calling, OpenAI/Anthropic-compatible API. 100% private.项目地址: https://gitcode.com/GitHub_Trending/te/textgen创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考