ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

把本地大模型接进内网:Ollama 加一层反向代理的最小可用配置

把本地大模型接进内网:Ollama 加一层反向代理的最小可用配置 一个人在自己电脑上跑 Ollama默认配置基本就够用了。麻烦出现在第二种场景同一间办公室里四五个人都想用同一台机器上的那张显卡。默认装完Ollama 只监听127.0.0.1:11434也就是只有本机能访问。同事想用得先连你的电脑不现实。给每台机器各装一套四五个人一起跑显存当场就满了。我后来选的做法是模型只在一台机器上跑前面加一层反向代理把服务暴露在内网里其他人用浏览器或脚本连过来。这篇写的就是这套最小配置以及我自己配的时候踩过的几个默认值。一、先让 Ollama 监听内网地址Ollama 的服务地址由环境变量控制。Windows 下在「系统属性 → 环境变量」里加Linux 下写进 systemd 的Environment变量作用建议值OLLAMA_HOST监听地址与端口0.0.0.0:11434或指定内网网卡 IPOLLAMA_ORIGINS允许跨域的来源浏览器直连必配你的内网域名如http://ollama.lanOLLAMA_MAX_LOADED_MODELS同时驻留几个模型显卡够大就 2不够就 1OLLAMA_NUM_PARALLEL单模型并发请求数48按显存反推OLLAMA_KEEP_ALIVE空闲多久卸载模型30m避免来回重载改完重启服务本机用下面这条命令能拿到模型列表说明模型服务本身没问题curl http://127.0.0.1:11434/api/tags⚠️ 一个高频坑OLLAMA_HOST改成0.0.0.0之后不要顺手把 11434 端口映射到公网。Ollama 自身没有鉴权暴露到公网等于把显卡送人。二、加一层反向代理代理层解决三件事统一入口和域名、加访问控制、统一超时。Nginx 最核心的一段location / { proxy_pass http://127.0.0.1:11434; proxy_http_version 1.1; proxy_set_header Host $host; proxy_set_header X-Real-IP $remote_addr; # 流式输出必须关缓冲 proxy_buffering off; proxy_cache off; # 大模型首 token 慢读超时给足 proxy_read_timeout 600s; proxy_send_timeout 600s; }这里有两个参数很容易漏漏了就会出现「模型明明在跑但页面一直转圈」proxy_buffering off大模型是流式吐 token 的开着缓冲会把内容攒住前端只能等全部生成完才看到第一个字proxy_read_timeout默认 60s长回答或大 context 很容易超直接提到 600s内网里想再省事Caddy 两行就够ollama.lan { reverse_proxy 127.0.0.1:11434 { flush_interval -1 } }flush_interval -1等价于关缓冲是 Caddy 里跑流式接口的固定动作。三、把并发和显存对上代理修好之后第二个瓶颈一定是显存。显存和并发的关系大致是这样显存模型规模量化后建议NUM_PARALLEL68 GB7B / Q4121216 GB14B / Q42424 GB32B / Q4 或 14B / Q848并发给多了通常不会报错只会变慢——请求排队、模型被反复换入换出反而比单请求更糟。所以「并发数」不是越大越好它应该由显存反推出来而不是拍脑袋定。四、访问控制别省内网不等于可以裸奔。最少做两件事给代理加一层 Basic Auth或用 Nginx 的allow/deny只放行内网网段如需外网访问走 VPN 或内网穿透 认证不要直接把端口开到公网allow 192.168.1.0/24; deny all; auth_basic ollama; auth_basic_user_file /etc/nginx/.htpasswd;五、配完按这五条过一遍[ ] 本机curl直连 11434 正常排除模型服务本身的问题[ ] 从另一台机器curl代理域名正常说明监听和代理链路通了[ ] 浏览器里流式输出是「一个字一个字出」不是「等半天一次全出」否则就是缓冲没关[ ] 长回答不中断否则就是读超时没提[ ] 换一个不在白名单的网段访问被拒绝说明访问控制生效小结这套配置的全部内容就是让模型监听内网地址 → 前面加一层关掉缓冲、放大超时的反向代理 → 用显存反推并发 → 加上访问控制。没有一步需要改 Ollama 的源码也不需要额外的调度中间件。真正会让人卡住的从来不是配置本身而是那几个「文档里不会特意写」的默认值默认只监听本机、默认开缓冲、默认 60 秒超时、默认没有鉴权。把这四个默认值改掉多人在内网共用一个本地模型这件事就成立了。关于作者我是信可维在做「软件著作权申请材料的辅助整理」工具。上面这些是自己在内网搭本地模型时记下来的配置流水不是通用教程模板。
返回列表