
先说说最近被问得最多的一件事“本地大模型到底怎么跑起来”答案其实很统一装一个 Ollama然后拉模型就完事了。它把以前要搞半天的大模型运行环境压缩成了一个开机自启的本地服务。你在命令行敲一行ollama run qwen2.5一个能对话的模型就起来了再把服务端口暴露给局域网IDE 插件、Web 页面、甚至你自己写的脚本都能通过 API 直接调用。这篇文章适合几类人刚接触本地大模型的初学者想在公司内网或自己电脑上部署私有模型的开发者以及折腾过 Ollama 但卡在“模型下载慢”“IDE 连不上”“API 报 context 错误”这些问题上的人。我会把从下载、安装、模型管理到接入 IDE、Web 和 API 的完整链路讲一遍重点放在那些文档里不会写的坑和取舍上。1. 为什么要选 Ollama 做本地部署1.1 它解决的不只是“能跑模型”的问题在 Ollama 之前本地跑模型的门槛确实不低。你要自己装 Python、用虚拟环境、处理 PyTorch 或 llama.cpp 的依赖还要搞清楚模型格式转换。这些对专业搞机器学习的人来说不算什么但对做 Web 开发、Java 后端、前端、测试、运维的人来说属于额外负担。Ollama 做的事情可以理解成“模型界的 Docker”它把模型权重、运行环境、推理参数都封装好用户只需要执行ollama pull或ollama run就能把模型拉下来并跑起来。它提供了一个本地服务默认监听11434端口支持原生 API也兼容 OpenAI API 格式。意味着你之前写过调用 OpenAI 接口的代码只需要改动 base_url就能无缝切到本地模型。它内置了对 GPU 的加速支持无论是 NVIDIA 的 CUDA、AMD 的 ROCm还是 Apple Silicon 的 Metal都能直接用。没有 GPU 时也能回落到 CPU虽然慢但至少能跑。我实际用下来的感受是Ollama 最大的贡献不是性能多强而是把“本地大模型”变成了一个普通开发者也能顺手使用的基础组件。就像你用 MySQL 不需要关心 InnoDB 内部实现一样你用 Ollama 也不需要自己编译 llama.cpp。1.2 本地部署的收益和边界本地部署不是万能的先说清楚它适合什么场景。第一数据隐私。代码、文档、数据库结构这类东西发给云端 API 始终有合规风险。本地部署意味着输入和输出都不出本机或内网适合企业内部工具链、个人知识库、以及那些涉及机密代码片段的场景。第二离线可用。内网开发环境往往不能访问外网。只要提前把模型文件拉下来后续所有推理都在本地完成不需要外网连接。第三长期使用成本。高频调用大模型 API以中文场景为例一个月下来账单也不容小觑。本地部署最大的一次性成本是硬件之后每个请求只花电费。但也要看清边界。普通消费级显卡能流畅跑起来的模型一般是 7B 到 14B 的量化版本智力水平和 GPT-4 级云端模型有明显差距。它最适合的是“代码补全、命名建议、文本改写、结构化信息抽取、简单问答”这类任务而不是“逻辑推理、复杂代码生成、长文档分析”这类高难度任务。另外要强调Ollama 本身是文本模型的推理运行时不负责生成图片。你在聊天界面看到图片生成能力那需要单独部署 Stable Diffusion 或 ComfyUI 之类的图像生成服务。本地文本模型通常有对齐机制在正常使用下不会出现出格内容但使用本地模型的底线责任在你自己别拿去做违规的事也别把没有鉴权的服务裸奔到公网。1.3 硬件上怎么评估先看内存/显存再看要不要跑多大数据量的模型。7B 模型量化到 Q4 大概占 4~6GB 显存16GB 内存的电脑可以跑效果能用。14B 量化后需要 9~12GB 左右显存建议至少 RTX 4070 或以上。32B 及以上量化模型建议 24GB 显存或直接多卡普通人没必要追求这个档位。Apple Silicon Mac 以 16GB 内存起步比较舒服因为 Ollama 会用 Metal 统一内存跑。如果显存不够Ollama 会自动把部分层卸载到 CPU速度会断崖式下降上下文长的时候可能变成“打字机”。有个判断技巧当看到推理速度低于 5 token/s基本就是显存顶不住在调用系统内存了。这时候要么换小模型要么把上下文长度调小。2. Ollama 安装全过程加速下载、装到 D 盘、环境变量配置2.1 官方下载和国内镜像加速官方安装包可以从 Ollama 官网或 GitHub Releases 下载。Windows 用户拿OllamaSetup.exemacOS 用户拿 zipLinux 用户用安装脚本curl -fsSL https://ollama.com/install.sh | sh这个官方脚本做的事很简单下载二进制文件、安装到/usr/local/bin、创建 systemd 服务如果检测到 systemd。如果你不放心管道执行安装脚本也可以去 GitHub Releases 找对应平台的二进制包手动安装。很多人卡在“下载太慢”这一步。一个最直接的解决办法是如果 GitHub 下载速度不理想先尝试用国内镜像站下载安装包。Windows 的安装包几十到一百多 MB用镜像工具或加速下载后几秒钟就能拿到。另一个更通用的办法是放弃在线安装找一个文件完整的离线安装包或解压版拷到内网机器上手动配置。还有一点要说清楚ollama pull默认从官方模型仓库拉取权重国内网络经常出现卡在 0% 或者断流的状态。这不是你电脑的毛病是网络链路问题。处理方式有几种第一多试几次模型文件支持断点续传第二配置OLLAMA_MODELS环境变量后把模型文件放到另一个目录配合下载工具先下载 GGUF 文件第三从国内提供模型权重加速下载的站点直接下 GGUF再用ollama create导入。最后这种方式最可控后面第三部分我会详细写。2.2 Windows 安装时如何装到 D 盘Windows 安装包默认会把程序装到 C 盘而且模型文件默认也会放到C:\Users\用户名\.ollama\models。C 盘空间不够的话两个地方都要处理。程序本体安装到 D 盘可以直接用静默安装参数指定目录。以管理员身份打开终端执行OllamaSetup.exe /DIRD:\Ollama这里有个细节如果直接双击安装它不会询问安装路径。所以一定是通过命令行执行并带上/DIR参数。装完之后可以到 D:\Ollama 确认是否生成了ollama.exe。模型文件目录通过环境变量迁移打开系统环境变量设置新建用户变量OLLAMA_MODELS值设为D:\ollama_models。重启 Ollama 服务右下角托盘或服务管理器里重启。如果之前已经拉过模型把旧的C:\Users\用户名\.ollama\models目录里的内容剪切到新目录。Linux 和 macOS 同理设置OLLAMA_MODELS/data/ollama/models后重启服务。把模型放独立数据盘好处很多重装系统不丢模型、C 盘不爆炸、备份时只需要单独备份这一个目录。2.3 验证安装和常见启动问题安装完成后在终端执行ollama --version能打印版本号就说明程序装好了。然后执行ollama run qwen2.5:7b第一次执行会先拉模型等进度条走完就进入交互式对话界面。如果在 Windows 上启动后浏览器访问http://localhost:11434报错“拒绝连接”多半是服务没起来。Windows 上 Ollama 默认以后台服务方式运行你可以到服务管理器里看Ollama服务状态也可以直接在终端跑ollama serve前台启动方便看日志。这里我建议所有新手先记住一句话Ollama 的底层就是一个 HTTP 服务。你后续遇到的 90% 连不上、访问不了、插件报错本质都是在问“这个服务有没有监听在正确的地址和端口上”。3. 模型下载与管理从官方仓库到自定义 GGUF 导入3.1 模型该怎么选Ollama 模型库目前收录了大量模型。但老实说不是每个模型都值得下载。我的日常选择如下通义千问系列qwen2.5中文能力强7B 和 14B 量化版本适合普通用户。DeepSeek-R1 系列deepseek-r1:7b/8b推理和代码能力在国产开源模型里排前列适合代码场景但体感比同参数通义更吃显存。Qwen2.5-Coder 系列纯代码场景首选自动补全比通用模型更稳。Llama 3.1 系列英文能力强中文一般不推荐中文场景为主的人盲目下载。Embedding 模型如 nomic-embed-text, bge-m3做 RAG 知识库和 IDE 代码检索时用。模型名字里的 7B、14B 是参数量。后面的分支标签例如qwen2.5:7b-instruct-q4_K_M表示指令微调版本和量化等级。默认拉取的是 Q4 量化版本效果好且占用不高。不懂量化的话就不要自己纠结用 Ollama 默认标签就行。3.2 拉取模型和交互式对话# 拉取模型不带标签默认拉取该模型的最新推荐版本 ollama pull qwen2.5:7b # 直接运行模型并进入交互模式 ollama run qwen2.5:7b # 带参数运行单次问答 ollama run qwen2.5:7b 用一句话解释什么是 HTTP 三次握手交互模式下除了正常聊天还可以通过CtrlD退出。如果模型坏了或者版本太多占空间可以查看和删除# 列出本地已安装模型 ollama list # 查看模型详情包括参数量、量化等级、上下文长度 ollama show qwen2.5:7b # 删除模型 ollama rm qwen2.5:7b有一个很容易被忽略的命令是ollama stop。当你同时跑好几个模型显存不够用的时候可以用它停掉不用的模型ollama stop deepseek-r1:8b或者干脆设置环境变量OLLAMA_KEEP_ALIVE5m让模型在空闲 5 分钟后自动释放。3.3 下载太慢时的杀手锏直接用 GGUF 导入ollama pull走官方仓库很慢时换一个思路不通过 Ollama 仓库拉取而是直接下载 GGUF 格式的模型文件再用本地导入的方式创建模型。第一步找一个可靠的模型文件下载渠道。Hugging Face 上有大量 GGUF 格式权重也可以找国内云厂商的 HF 镜像站下载。文件一般比较大7B 量化版也要 4~5GB建议用支持断点续传的下载工具。第二步写好 Modelfile。新建一个文本文件里面指定基础模型文件路径FROM /data/models/qwen2.5-7b-instruct-q4_k_m.gguf第三步执行导入ollama create qwen2.5:7b -f ./Modelfile导入完成后ollama list里就能看到这个模型之后的使用方式和从官方仓库拉下来的一模一样。这个办法也适用于那些 Ollama 仓库里没有的模型比如你自己微调出来的模型。3.4 模型文件结构和管理习惯Ollama 的模型文件并不是单个文件而是按层拆分的 blob 文件这也是为什么ollama list显示的大小和磁盘占用不一定完全一致。日常备份模型不要直接复制文件夹就完事更推荐用 Modelfile 方式做“备份”——只保存一份几 KB 的文本配置真需要恢复时再下载底层 GGUF。我的习惯是给每个项目用独立的 Modelfile并记录模型名称和地址FROM qwen2.5:14b PARAMETER temperature 0.7 PARAMETER num_ctx 8192 SYSTEM 你是一名资深后端工程师回答尽量简洁准确然后执行ollama create my-coder -f ./Modelfile项目里就用my-coder这个名字。这样既避免了改系统提示词时反复拉模型也让团队内共享配置变得简单。4. API 接入实战原生接口与 OpenAI 兼容端点4.1 两个核心原生接口Ollama 服务起来后默认在http://localhost:11434提供 REST API。最常用的是/api/chat和/api/generate。/api/generate适合纯文本补全场景输入 prompt直接返回续写结果curl http://localhost:11434/api/generate -d { model: qwen2.5:7b, prompt: 用一句话解释 TCP 三次握手, stream: false }/api/chat适合多轮对话场景需要维护 messages 数组curl http://localhost:11434/api/chat -d { model: qwen2.5:7b, messages: [ {role: system, content: 你是一个简洁的助手}, {role: user, content: 什么是闭包} ], stream: false }两个接口都支持stream参数。设成true时服务端会以application/x-ndjson格式逐行返回增量内容适合做流式打字机效果。设成false则一次性返回完整结果适合后端调用。这两个接口都支持options字段用来控制推理参数options: { temperature: 0.7, top_p: 0.9, num_ctx: 8192, repeat_penalty: 1.1 }num_ctx是上下文长度单位是 token。它决定模型“能记住多少前面的对话内容”也直接决定显存占用和推理速度。同一个模型num_ctx从 2048 调到 8192显存占用可能翻倍。新手一上来不要开太长够用就行。4.2 OpenAI 兼容端点Ollama 从很早就支持了 OpenAI 兼容接口地址是http://localhost:11434/v1/chat/completions也就是说你不需要改任何业务逻辑只要把 OpenAI SDK 的base_url指向 Ollama再用一个任意非空字符串当 API Key就能请求本地模型。用 Python 的 openai 库示例from openai import OpenAI client OpenAI( base_urlhttp://localhost:11434/v1, api_keyollama, # 任意字符串本地服务不校验 ) resp client.chat.completions.create( modelqwen2.5:7b, messages[ {role: user, content: 写一段 Python 快排} ], streamFalse, ) print(resp.choices[0].message.content)Node.js 里也一样import OpenAI from openai; const client new OpenAI({ baseURL: http://localhost:11434/v1, apiKey: ollama, }); const resp await client.chat.completions.create({ model: qwen2.5:7b, messages: [{ role: user, content: 写一个防抖函数 }], }); console.log(resp.choices[0].message.content);这个兼容端点对已接入 OpenAI 的项目来说太友好了。很多开源项目比如 NextChat、LobeChat、各种 IDE 插件都是靠这个端点做到“只改配置就能用本地模型”。4.3 接口调用时的上下文长度报错很多人调用时会遇到这么一条 400 错误this models maximum context length is 1048576 tokens看着吓人其实含义很简单请求里传的上下文长度已经超出模型允许的上限或者是模型返回的 token 数量超过了服务端设置的最大值。常见原因有三个在请求参数里显式设置了极大的num_ctx比如 1048576 甚至更大。SDK 里把max_tokens设置成了很大值比如max_tokens800000。对话 messages 累计的历史内容实在太长超过了模型上限。解决办法是按实际需求设置合理值。通用模型默认是 4K 到 8K 上下文长对话场景可以调到 16K 或 32K但不要调到一个夸张的数字。推理价格不是按 token 计费却按显存和速度“计费”——上下文越长显存占用越大速度越慢。如果你用 OpenAI SDK 接入特别注意max_tokens这个参数要小于模型上限比如设成 2048 或 4096。把max_tokens理解成“允许模型输出多长”而不是“总上下文长度”就不会混淆了。4.4 局域网内 API 访问和鉴权Ollama 默认只监听127.0.0.1:11434也就是说只有本机能访问。要让局域网其他设备访问需要设置环境变量export OLLAMA_HOST0.0.0.0:11434Windows 在系统环境变量里新建OLLAMA_HOST值为0.0.0.0:11434然后重启 Ollama 服务。这里必须提醒一句Ollama 本身不带鉴权功能。把服务绑到0.0.0.0后同一局域网内任何人都能调用你的 API他们可以消耗你的显存甚至读取你已加载的模型列表。所以只在可信内网使用不要直接暴露公网。如果必须跨网络访问在前面套一层反向代理加上 Basic Auth。或者干脆用 SSH 隧道等安全方式把端口映射到本机访问。我在本地开发时最常用的方式是Windows 上不开全局监听而是用系统防火墙只放行特定 IP 段的 11434 端口或者干脆用 IDE 所在的机器直接访问宿主机的127.0.0.1。最省事的是把 Ollama 和 IDE 装在同一台机器上没必要为了“看起来高级”把自己暴露在风险里。5. 把 Ollama 接进 IDE写代码时用本地模型辅助5.1 推荐方案Continue 插件想在 VS Code 或 JetBrains 里用 Ollama我最推荐的方式是安装 Continue 插件。它不是把模型塞进 IDE而是把 IDE 变成大模型客户端通过 API 和 Ollama 通信支持聊天、代码补全、选中代码解释、重构等操作。安装 Continue 后打开配置文件config.yaml添加一个 Ollama 模型提供方name: local models: - name: qwen2.5-coder provider: ollama model: qwen2.5-coder:7b apiBase: http://localhost:11434保存配置后在 Continue 面板里切换模型就能看到本地模型。可以用Tab触发代码补全也可以用Cmd/CtrlI打开内联编辑。我实测下来代码补全这个场景对模型要求不高7B 的 Coder 模型响应很快比每次弹到云端 API 更顺手。Cline 这个插件也能连 Ollama它的优势是能调用工具并按步骤完成任务适合“让它自己改代码、跑测试、修 bug”的 Agent 工作流。但注意工具调用对模型的要求比普通对话高。如果你用 7B 模型跑 Cline经常会出现“参数格式错误”或者“执行到一半忘记上下文”的情况。我自己建议Agent 类工作流至少用 14B 或 32B 的模型且要选支持 function calling 的模型否则容易翻车。5.2 PyCharm / JetBrains 全家桶的接法JetBrains 系 IDE 里同样可以通过 Continue 插件连接 Ollama。安装完 Continue 后配置方法和 VS Code 几乎一样。不过 JetBrains 插件的生态比 VS Code 少一些一些能力比如自动补全的灵敏度不如 VS Code 版但在 PyCharm 里写 Python、在 IntelliJ IDEA 里写 Java日常聊天和代码解释是够用的。如果你用的是 JetBrains 自带的 AI Assistant比如 Junie它起来是为了接 JetBrains 云端服务或企业配置的模型端点官方并不直接支持连接本地 Ollama。要接本地模型还是回到 Continue 这类插件更实在不要指望默认的 AI Assistant 直接读 Ollama。在 IDE 里接本地模型还有个很容易踩的坑IDE 进程的环境变量和终端里看到的不一定一致。如果你设置了OLLAMA_HOST但 IDE 里仍然连不上先重启 IDE让环境变量重新加载。如果还不行直接在 IDE 的终端里执行ollama list确认服务可用。5.3 Codex 和 Claude Code 这类命令行工具Command Line Agent 类工具现在很火比如 OpenAI 的 Codex CLI、Anthropic 的 Claude Code。它们默认调用各自的云端 API但通常都支持通过环境变量覆盖接口地址。以通用做法为例很多 CLI 工具支持设置OPENAI_BASE_URL或ANTHROPIC_BASE_URL来指向自建端点。理论上可以把地址指到 Ollama比如export OPENAI_API_KEYollama export OPENAI_BASE_URLhttp://localhost:11434/v1但这里必须说句公道话这些 Agent 工具对模型指令遵循和工具调用能力的要求很高普通 7B 模型跑起来大概率是“能连上但不听话”你会看到它一本正经地乱写路径、调用不存在的命令。如果你真想折腾建议选支持工具调用的较大模型推荐 32B 量化以上。把任务拆小别让它一口气干太复杂的事。优先用 Continue 或 Cline 这类相对宽容的 IDE 界面而不是直接接 Codex 这类对模型“挑剔”的 CLI。另外 Claude Code 走的是 Anthropic 协议Ollama 目前没有/anthropic接口需要额外加一层请求转换。有些切换工具可以改配置指向不同服务商但本质上它只是帮你改环境变量和配置文件解决不了“Ollama 不提供 Anthropic 协议”的问题。直接硬指过去会报错。我的建议是新手别在这个方向上死磕性价比太低。6. Web 接入Open WebUI 和自建前端页面6.1 一条命令启动 Open WebUIWeb 界面最省事的方案是 Open WebUI。它内置用户管理、多模型切换、联网搜索、附件上传、RAG 能力而且可以直接对接 Ollama。使用 Docker 启动docker run -d \ --name open-webui \ -p 3000:8080 \ -e OLLAMA_BASE_URLhttp://host.docker.internal:11434 \ -v open-webui:/app/backend/data \ --add-hosthost.docker.internal:host-gateway \ ghcr.io/open-webui/open-webui:main启动后访问http://localhost:3000注册管理员账号然后在设置里连接 Ollama 地址。如果 Ollama 和 Open WebUI 在同一台机器上Docker 容器内访问宿主机要用host.docker.internal不能用localhost这也是最容易被卡住的地方。没有 Docker 环境的话也可以直接用 Python 装pip install open-webui open-webui serveOpen WebUI 最大的优点是开箱即用。它就差把整个聊天界面、文件上传、知识库检索全给你了比较适合团队内部快速搭建一个“私有 ChatGPT”。6.2 让局域网能访问 Web 服务要让局域网同事访问 Open WebUI除了容器端口映射还需要保证 Ollama 服务不在127.0.0.1上。先设置OLLAMA_HOST0.0.0.0:11434并重启服务然后在另一台电脑的浏览器访问http://你的局域网IP:3000。如果页面能打开但聊天时报连接错误通常不是 Web 界面的问题而是 Open WebUI 容器内访问 Ollama 的地址不对。记住一个原则容器内看宿主机要用宿主机的局域网 IP 或host.docker.internal不能直接用localhost。6.3 纯前端页面调用 Ollama API有时候只是想在个人网页里加一个 AI 问答功能不想搭 Open WebUI 这种大型应用。那可以直接用 fetch 调 Ollama 的 API。最简单的 HTML 页面!DOCTYPE html html langzh-CN body h3本地模型测试/h3 input idinput placeholder输入问题 stylewidth:60% button onclickask()发送/button pre idoutput/pre script async function ask() { const prompt document.getElementById(input).value; const resp await fetch(http://localhost:11434/api/chat, { method: POST, headers: { Content-Type: application/json }, body: JSON.stringify({ model: qwen2.5:7b, messages: [{ role: user, content: prompt }], stream: false }) }); const data await resp.json(); document.getElementById(output).textContent data.message.content; } /script /body /html直接双击 HTML 文件打开通常就能工作因为 Ollama 默认允许来自localhost的浏览器跨域请求。但如果你把页面部署到别的端口比如http://localhost:5173浏览器跨域请求就会失败。这时需要设置 CORS 允许来源export OLLAMA_ORIGINShttp://localhost:5173,http://127.0.0.1:5173Windows 里同样是设置系统环境变量后重启 Ollama。如果你不清楚 CORS 是什么可以简单理解成“浏览器不允许一个页面随便访问另一个服务器的接口”。Ollama 默认只放行很少的来源你要手动把前端页面的地址加进白名单。6.4 本地 Web 项目的前后端分离经验如果你正在开发一个正式的 Web 项目后端最好还是通过服务端调用 Ollama API而不是让浏览器直接连11434。原因有几个浏览器环境无法保护 API 地址和参数别人打开 F12 就能看到你的模型名和请求参数。后端服务可以统一处理鉴权、限流、日志而不是把 Ollama 裸给前端。流式输出在 Node/Python 后端做转发会更容易控制。以 Node.js 后端转发为例核心就是代理 Olama 的/api/chatconst base http://localhost:11434; app.post(/api/chat, async (req, res) { const upstream await fetch(${base}/api/chat, { method: POST, headers: { Content-Type: application/json }, body: JSON.stringify({ model: req.body.model || qwen2.5:7b, messages: req.body.messages, stream: true, }), }); res.setHeader(Content-Type, text/event-stream); const reader upstream.body.getReader(); while (true) { const { done, value } await reader.read(); if (done) break; res.write(value); } res.end(); });这样前端只跟你自己的后端交互后端的模型池、鉴权、日志都握在自己手里。7. 常见问题排查与避坑速查7.1 高频问题对照表现象可能原因处理方式模型下载一直卡在 0%网络链路慢或中断换网络环境用镜像下载 GGUF 后本地导入ollama serve提示端口占用已有 Ollama 实例在运行直接访问localhost:11434确认不要重复启动IDE 插件连不上 OllamaAPI 地址或环境变量没配置检查OLLAMA_HOST重启 IDE 与 Ollama 服务网页跨域报错OLLAMA_ORIGINS没包含页面地址设置OLLAMA_ORIGINS后重启服务显存不够但想跑大模型模型参数太大或上下文太长换 Q4 量化小模型调小num_ctxAPI 报 400 context length请求参数里上下文长度超出上限调低num_ctx或max_tokens局域网访问不了服务监听了127.0.0.1或防火墙拦截设置OLLAMA_HOST0.0.0.0:11434放行防火墙端口推理速度奇慢部分层跑在 CPU 上换小模型减少上下文长度确认 GPU 驱动正常多个模型抢占显存未及时释放空闲模型用ollama stop或设置OLLAMA_KEEP_ALIVE安装后找不到ollama命令安装路径不在 PATH 里手动将安装目录加入系统 PATH7.2 模型服务没起来时的排查思路很多“连不上”的问题本质都是服务没起来或者监听地址不对。排查顺序我一般是这样在终端执行ollama list。能列出模型说明服务正常。执行curl http://localhost:11434。能返回Ollama is running说明 HTTP 服务正常。执行netstat -ano | findstr 11434Linux 用ss -lntp | grep 11434。确认监听地址是0.0.0.0还是127.0.0.1。如果是后者局域网访问肯定不行。看 Ollama 日志。Windows 上如果在服务里跑日志在事件查看器如果前台跑终端里会直接打印。7.3 我的几个习惯性设置最后分享几个我踩过坑后固定下来的配置都是为了让日常使用更省心设置OLLAMA_KEEP_ALIVE5m避免模型长时间占用显存。设置OLLAMA_MAX_LOADED_MODELS1防止多个模型自动加载把显存挤爆。模型放独立目录并用环境变量OLLAMA_MODELS指定坚决不占 C 盘。在项目里用 Modelfile 统一维护模型的系统提示词和推理参数不做“裸模型”直接上生产。对需要共享的服务永远在前面放一层带鉴权的反向代理不把 Ollama 裸奔到公网。本地大模型的部署本身是一件很简单的事真正花时间的往往是后续的工程化接入。Ollama 把最难的环境问题解决了剩下能走多远就看你怎么把 API、IDE 插件和 Web 项目串起来。如果你只是刚入门先老老实实跑起来一个 7B 模型再按照文章里的代码把 API 打通最后再决定要不要上 Open WebUI 和 Agent 工作流。一步步来别一上来就想搞个全自动 AI 编程助手那样的结果多半是连踩三四个坑然后放弃。