ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

本地部署大模型实战:Ollama、llama.cpp、vLLM 怎么选(附完整命令)

本地部署大模型实战:Ollama、llama.cpp、vLLM 怎么选(附完整命令) 本地部署大模型实战Ollama、llama.cpp、vLLM 怎么选附完整命令LLM 系列又一篇。之前讲过模型科普开源阵营能自己部署和 Jev闭源托管 API——这篇补上另一半怎么把开源模型跑在自己机器上。最近阅读榜上「本地推理」「AI Agent 托管家里电脑」这类主题一直在涨这篇把完整路线走一遍。一、什么时候本地部署先说本地部署不是免费的你的显存就是你的模型上限。它换来的三样东西是 API 给不了的数据不出门私有文档、客户数据、内部代码不经过任何第三方离线可用断网也能跑边缘设备和内网环境的唯一选项边际成本为零跑多少次都不按 token 计费成本篇的账本地版直接归零判断口诀数据敏感或高频调用本地要最强效果API。两者可以混着来——成本篇讲的分级路由本地小模型正好当那个「便宜的分诊层」。二、三条路线怎么选工具定位适合Ollama一行命令跑模型大多数人的默认选择最省心llama.cpp纯 C 推理资源占用最小低配机器、CPU 推理、端侧设备vLLM生产级推理服务高吞吐并发场景、服务器部署、团队共享一句话个人玩选 Ollama旧电脑选 llama.cpp真要服务多人选 vLLM。本文用 Ollama 走全流程另外两个思路完全一样拉模型 → 起服务 → 调 API。三、先看硬件显存决定你能跑多大选模型前先看显存粗略对照量化后模型规模Q4 量化显存体验7B~5GB轻量任务分类、摘要、简单代码14B~9GB日常够用写作、中等代码32B~20GB接近小旗舰70B~45GB需要多卡或高端卡经验法则显存比模型参数量的量化文件大 1~2GB留给上下文。显卡不够怎么办上更狠的量化Q3/Q2质量有损、或直接用小一档的模型——跑得动的 14B 好过硬撑的 70B。量化GGUF 格式的 Q4/Q8一句话理解把权重的精度压低16 位浮点压到 4 位整数文件小 4 倍、速度快 2~3 倍质量掉一点点——本地部署 90% 的场景 Q4 就够。四、Ollama 全流程1. 安装# Windows / macOS官网下载安装包 # Linux一行命令 curl -fsSL https://ollama.com/install.sh | sh # 验证 ollama --version2. 拉模型、跑起来# 拉一个 14B 的开源模型自动选 Q4 量化 ollama pull qwen3:14b # 直接聊天 ollama run qwen3:14b 用一句话解释 KV Cache # 看本地已有哪些模型 ollama list3. OpenAI 兼容 API现有代码零改动Ollama 起着的时候自带OpenAI 兼容端点http://localhost:11434/v1——系列前面所有代码换个 base_url 就能用from openai import OpenAI client OpenAI(base_urlhttp://localhost:11434/v1, api_keyollama) # key 随便填 resp client.chat.completions.create( modelqwen3:14b, messages[{role: user, content: 用一句话解释 RAG}], ) print(resp.choices[0].message.content)这一步的意义比看起来大成本篇的分级路由、评测篇的 runner、第一篇的 60 行 Agent——全部原样指到本地模型上零改动。4. 验证闭环装完先验证再继续老规矩# API 层验证curl 打一发看返回结构 curl -s http://localhost:11434/v1/chat/completions \ -H Content-Type: application/json \ -d {model:qwen3:14b,messages:[{role:user,content:说 OK}]} # 质量层验证问一个你领域内的具体问题人肉判断它行不行页面能打开、curl 有返回、回答像人话三关都过才算部署完成——只验证第一关不算。五、远程访问分清链路加好授权本地跑通后想在外面用手机、公司电脑连家里的机器链路是两层别混为一谈外部设备 → 内网穿透隧道 → 家里机器的 11434 端口 → Ollama先本地后远程本地 curl 验证通了再配隧道出问题才能分清是服务还是网络内网穿透frp / cpolar 这类工具把 11434 映射出去公网地址约 24 小时变一次长期用要预留固定域名必须加授权Ollama 的 API没有登录机制裸露到公网等于把算力白送——隧道层开 basic auth用户名密码或者只绑固定 IP 白名单这一步的提醒和参考原文里声音克隆那篇一致服务背后的算力和数据都是你的公网入口不设防就是裸奔。六、踩坑提醒模型文件别放含中文/空格的路径启动报错先查路径Ollama 默认目录无所谓手动指定模型路径时尤其注意首次拉模型要等几 GB 的文件网络慢就先拉小模型7B跑通全流程再换大的上下文长度吃显存模型能跑 ≠ 长上下文能跑32k 上下文的显存开销比 4k 大得多——按实际需要设num_ctx别拿本地模型直接上生产先过一遍评测篇的评测集本地部署的模型也是要评测的跑得动和答得好是两回事总结步骤一句话选型个人 Ollama低配 llama.cpp并发 vLLM显存7B 约 5GB、14B 约 9GB跑得动的 14B 优于硬撑的 70B量化Q4 是默认答案文件小 4 倍质量掉一点APIOllama 自带 OpenAI 兼容端点系列代码零改动接上远程先本地后隧道公网入口必加授权到这里模型这条线闭环了怎么来的模型科普→ 怎么调微调篇→ 怎么选Jev 篇的闭源 vs 开源→ 怎么自己跑本篇。数据敏感的场景从此不再依赖任何第三方 API。觉得有用点个关注。
返回列表