ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

本地离线部署AI大模型:OpenClaw + Ollama + Qwen3.5:cloud/Qwen3:0.6b 超详细教程(无需GPU)

本地离线部署AI大模型:OpenClaw + Ollama + Qwen3.5:cloud/Qwen3:0.6b 超详细教程(无需GPU) 1. 无 GPU 也能跑大模型OpenClaw Ollama 本地离线部署到底解决什么问题很多人第一次听到「本地离线部署 AI 大模型」脑子里冒出来的第一反应是得有一张 RTX 4090 吧显存不够是不是直接跑不起来我一开始也这么想直到把 Ollama 装到一台只有 16GB 内存、核显办公本上跑通了 Qwen3:0.6b 和 Qwen3.5:cloud才发现门槛比想象中低得多。先把概念说清楚。Ollama是一个本地大模型运行与管理工具你可以把它理解成「模型界的 Docker」——一条命令拉取模型、一条命令启动服务它负责把模型加载进内存、暴露一个本地 HTTP 接口。OpenClaw则是一个本地 AI 可视化交互界面作用是把命令行里冷冰冰的提示符换成类似在线聊天工具的对话框让你不用记命令也能对话。Qwen3.5:cloud和Qwen3:0.6b是通义千问系列的两个不同定位的模型前者对话能力更强作为主力后者参数量只有 0.6B内存占用极低8GB 内存的老机器也能扛住作为轻量备选。这套组合适合谁我总结了三类一是想学 AI 本地部署但没有任何 GPU 的新手二是对数据隐私敏感、不希望对话内容上传到任何云端的人三是学生或开发者想在自己电脑上搭一个免费、无流量限制、可断网使用的对话助手。它的核心价值就四个字离线、免费。模型下载完之后运行时可以完全断网数据不出本机。不过这里有个现实问题需要提前说清楚纯本地模型在低配机器上能力和速度都有天花板。Qwen3:0.6b 胜在轻但复杂推理会力不从心Qwen3.5:cloud 在本地跑虽然流畅可一旦你想调用更强的云端模型比如更大的 Qwen 版本、Claude 系列本地这套是接不上的。所以本文除了讲透本地部署还会在最后告诉你一个扩展思路把 OpenClaw 或 Ollama 的 endpoint 指向统一的 API 通道用同一个 Key 同时管理本地模型和云端模型需要爆发力的时候切云端需要隐私的时候切本地。这个通道我用的是 TaoToken后面会给具体配置。下面进入实操。整个过程分四步装 Ollama、拉模型、装 OpenClaw、连起来验证。每一步我都会给完整命令和预期输出你照着敲就行。2. 前置准备Ollama 安装与 Qwen3.5:cloud / Qwen3:0.6b 模型拉取这一节是整篇的地基地基没打好后面 OpenClaw 连不上全是白搭。我踩过的坑基本都集中在这里所以写得细一点。2.1 环境要求与 Ollama 安装先对一下你的机器。操作系统 Windows 10 或 Windows 11 都行内存最低 8GB推荐 16GB。不需要独立显卡CPU 就能跑。硬盘留出至少 10GB 空间给模型文件。网络只在下载模型时需要运行阶段可以断网。安装 Ollama 的步骤很直白打开官网https://ollama.com/点 Download 下载 Windows 版本双击安装包一路下一步。安装完成后 Ollama 会自动在后台常驻运行你会在任务栏右下角看到它的图标。验证安装是否成功打开 CMD 或 PowerShell输入ollama --version能打印出版本号就说明装好了。如果提示ollama 不是内部或外部命令说明安装时没把路径写进环境变量最省事的办法是重启一次终端或者重新跑一遍安装包。2.2 拉取并运行 Qwen3.5:cloud主力模型确认 Ollama 在跑之后直接拉主力模型ollama run qwen3.5:cloud第一次执行会自动下载模型文件下载完成后出现提示符就代表模型已经加载进内存、可以对话了。你可以直接输入测试你好介绍一下自己模型能正常回答说明 Qwen3.5:cloud 部署成功。这个模型在低配电脑上运行也比较流畅日常问答、写文案、解释代码都够用。2.3 拉取并运行 Qwen3:0.6b轻量备选如果你的机器只有 8GB 内存跑 Qwen3.5:cloud 时风扇狂转、输入卡顿那就换超轻量的 Qwen3:0.6bollama run qwen3:0.6b同样出现就是启动成功。它的内存占用只有 1GB 到 1.5GB 左右启动速度 1 到 3 秒非常适合老机器。测试命令和上面一样输入「你好介绍一下自己」看它是否正常回复。两个模型都拉完之后用一条命令确认它们都在本地ollama list输出里应该能同时看到qwen3.5:cloud和qwen3:0.6b两行以及各自的体积和修改时间。这一步很关键后面 OpenClaw 找不到模型八成就是这里没拉全。2.4 让 Ollama 对外暴露服务关键配置默认情况下 Ollama 只监听127.0.0.1:11434本机访问没问题。但如果你想让局域网内其他设备、或者容器里的 OpenClaw 也能连上就需要改一下监听地址。Windows 下通过环境变量设置# Ollama 服务配置Windows 环境变量方式 OLLAMA_HOST0.0.0.0:11434 OLLAMA_ORIGINS* OLLAMA_KEEP_ALIVE5mOLLAMA_HOST改成0.0.0.0:11434表示监听所有网卡OLLAMA_ORIGINS*放开跨域限制避免浏览器端调用被拦OLLAMA_KEEP_ALIVE5m表示模型空闲 5 分钟后卸载省内存。设置完记得重启 Ollama 服务任务栏右键图标 → Quit再重新打开。注意OLLAMA_ORIGINS*只建议在可信的本地网络里用。如果你把机器暴露在公网务必收紧这个值否则任何人都能调用你的模型。配置改完后用一条命令验证服务是否正常监听curl http://localhost:11434/api/tags返回一段 JSON里面列出你本地所有模型就说明 Ollama 服务已经就绪可以进入下一步接 OpenClaw 了。3. 可复制配置OpenClaw 接入 Ollama 与 TaoToken 统一通道这一节是全文的核心操作区我会给出 OpenClaw 连接本地 Ollama 的完整参数以及如何把 endpoint 扩展到 TaoToken 统一 Key/API 通道让你一套界面同时管本地和云端模型。3.1 OpenClaw 安装与基础设置OpenClaw 的发布页在https://github.com/sqzw-x/OpenClaw找到最新版本的 Windows 安装包下载后解压或安装打开软件。首次进入是空的对话界面右上角进设置。在设置里模型来源选 Ollama地址保持默认{ provider: ollama, baseUrl: http://localhost:11434, model: qwen3.5:cloud, fallbackModel: qwen3:0.6b, timeout: 120 }这段 JSON 就是 OpenClaw 连接本地 Ollama 的最小配置。baseUrl必须和 Ollama 实际监听地址一致多一个斜杠、少一个端口都会连不上。model填主力模型fallbackModel填轻量备选主模型加载失败时自动降级。timeout给到 120 秒是因为低配机器首次加载模型可能比较慢超时设太短会误报失败。保存后回到主界面模型下拉框里应该能选到qwen3.5:cloud和qwen3:0.6b。如果下拉框是空的先别急着怀疑软件往下看第 5 节的排查。3.2 把 endpoint 扩展到 TaoToken 统一通道本地模型有个绕不开的局限能力上限就在那。当你需要更强的推理、更长的上下文或者想用 Claude 系列模型时本地这套接不上。这时候可以把 OpenClaw 的模型来源从「纯 Ollama」扩展成「Ollama 云端 API 双通道」。TaoToken 提供统一的 Key 和 API 通道Base URL 是https://taotoken.net/api一个 Key 就能调用多种云端模型。配置片段如下{ provider: openai-compatible, baseUrl: https://taotoken.net/api, apiKey: sk-你的TaoToken密钥, model: claude-sonnet-4-5, localFallback: { provider: ollama, baseUrl: http://localhost:11434, model: qwen3:0.6b } }这里provider选openai-compatible因为 TaoToken 的接口兼容 OpenAI 格式绝大多数支持自定义 endpoint 的客户端都能直接接。baseUrl填https://taotoken.net/api注意不要多加/v1之类的后缀具体路径以接入文档为准。apiKey换成你在控制台生成的 Key。localFallback是本地兜底云端不通时自动切回本地 Qwen3:0.6b保证对话不中断。如果你用的是 Claude Code 这类工具配置方式类似核心三件套永远是Base URL API Key Model ID。三者缺一不可任何一个填错都会报 401 或模型不存在。3.3 用 CC Switch 管理多套配置如果你同时维护本地 Ollama、TaoToken 云端、以及别的通道手动改配置文件很容易乱。可以用 CC Switch 这类配置切换工具把每套配置存成一个 profile一键切换。每个 profile 里同样写全三件套# profile: taotoken-cloud base_url https://taotoken.net/api api_key sk-你的TaoToken密钥 model claude-sonnet-4-5 # profile: local-ollama base_url http://localhost:11434 api_key ollama model qwen3.5:cloud本地 Ollama 的api_key随便填一个占位符就行它不校验。这样你在 OpenClaw 里切换 profile就等于在本地和云端之间切换体验很顺。提示TaoToken 的 API Key 在控制台的 API Keys 页面生成模型列表和接入细节看官方文档。地址统一用https://taotoken.net/api不要自己拼路径。配置写完后OpenClaw 的模型列表里应该同时出现本地模型和云端模型。接下来就是验证它们是否真的能通。4. 验证请求逐条命令确认本地与云端模型都能正常响应配置写完不代表能用必须逐条验证。这一节我给出一套从底层到上层的验证命令任何一环出问题都能快速定位。4.1 验证 Ollama 服务本身第一步确认 Ollama 在监听curl http://localhost:11434/api/tags返回 JSON 里能看到qwen3.5:cloud和qwen3:0.6b说明服务正常、模型已注册。第二步直接调 Ollama 的生成接口确认模型能出字curl http://localhost:11434/api/generate -d {\model\:\qwen3:0.6b\,\prompt\:\用一句话解释什么是大模型\,\stream\:false}如果返回的 JSON 里response字段有内容说明模型推理链路完全打通。这一步绕过了 OpenClaw能排除界面层的干扰。4.2 验证 OpenClaw 到 Ollama 的连接打开 OpenClaw在对话框输入「你好介绍一下自己」。预期结果是模型在几秒内开始逐字输出。如果长时间转圈看第 5 节的local proxy failed排查。同时观察任务管理器的内存占用跑 Qwen3:0.6b 时大约增加 1GB 到 1.5GB跑 Qwen3.5:cloud 时大约 2GB 到 4GB。如果内存占用没变化说明模型根本没加载多半是模型名填错了。4.3 验证 TaoToken 云端通道切到 TaoToken profile发一条测试消息。如果返回 401说明 Key 不对或没带上如果返回模型不存在说明 Model ID 写错了。正确的响应应该是正常的对话内容。你也可以直接用 curl 验证云端通道curl https://taotoken.net/api/chat/completions \ -H Authorization: Bearer sk-你的TaoToken密钥 \ -H Content-Type: application/json \ -d {\model\:\claude-sonnet-4-5\,\messages\:[{\role\:\user\,\content\:\你好\}]}返回带choices字段的 JSON就说明云端通道打通了。注意这里的choices是 OpenAI 兼容格式的标准字段如果报reading choices相关错误通常是响应体不是预期格式检查 Base URL 是否写成了别的路径。4.4 验证本地与云端自动切换最后测一下兜底逻辑把网络断开再发一条消息。如果配置了localFallbackOpenClaw 应该自动切到本地 Qwen3:0.6b 继续回答。这一步验证的是整套方案的鲁棒性——云端不可用时本地依然能顶上。到这里本地离线部署和云端扩展两条链路都验证完毕。你可以根据场景自由切换处理敏感数据时用本地需要强推理时切云端。5. 本篇常见报错排查401、local proxy failed、reading choices、OAuth这一节把最容易撞上的四类报错拆开讲每条都给现象、原因、解决动作。5.1 401 Unauthorized现象调用 TaoToken 云端通道时返回 401。原因通常是三种Key 没填、Key 填错、或者请求头里没带Authorization。解决动作检查配置文件里的apiKey字段确认是sk-开头且没有多余空格用上面的 curl 命令单独测一次排除客户端问题如果 Key 刚生成确认没有复制漏字符。5.2 local proxy failed / 连不上 127.0.0.1:11434现象OpenClaw 报local proxy failed或连接被拒绝。原因Ollama 没在运行或者地址写错。解决动作看任务栏右下角有没有 Ollama 图标没有就重新启动任务栏右键 Ollama → Restart检查baseUrl是否为http://localhost:11434注意不要写成https也不要多加/v1。用curl http://localhost:11434/api/tags确认服务活着。5.3 reading choices 报错现象云端返回解析失败日志里出现reading choices。原因响应体不是 OpenAI 兼容格式通常是 Base URL 路径写错请求打到了非预期端点。解决动作确认baseUrl是https://taotoken.net/api不要自己拼/v1/chat/completions之类的完整路径具体以接入文档为准用 curl 直接测一次看返回 JSON 里有没有choices字段。5.4 OAuth 相关报错现象某些工具如 Claude Code提示 OAuth 失败或未授权。原因这类工具默认走 OAuth 登录流程而你用的是 API Key 模式两者冲突。解决动作在工具设置里切换到 API Key 认证方式填全三件套 Base URL、API Key、Model ID如果工具支持auth.json配置直接写入{ baseUrl: https://taotoken.net/api, apiKey: sk-你的TaoToken密钥, model: claude-sonnet-4-5 }5.5 模型列表为空 / 不显示模型现象OpenClaw 下拉框里没有qwen3.5:cloud或qwen3:0.6b。原因模型没拉全或 OpenClaw 缓存了旧列表。解决动作命令行跑ollama list确认模型存在重启 OpenClaw 重新加载进设置重新选模型并保存。如果还是不行检查 Ollama 版本是否过旧升级到最新版。5.6 内存不足、电脑卡顿现象跑 Qwen3.5:cloud 时系统卡死。原因内存不够。解决动作关掉浏览器、视频软件、后台下载工具切换到 Qwen3:0.6b或者用更小参数的qwen3.5:4b。命令ollama run qwen3:0.6b如果 0.6b 还卡那基本是机器太老建议直接用 TaoToken 云端通道把推理放到远端本地只负责显示。6. 从本地到云端一套 Key 打通 OpenClaw 的模型调用链路把上面几步走完你手里其实已经有了两套能力一套是完全离线、数据不出本机的本地模型Qwen3.5:cloud 主力 Qwen3:0.6b 备选另一套是通过 TaoToken 统一通道调用的云端模型。两者在 OpenClaw 里共存按场景切换。本地这套的价值在于隐私和免费。模型下载完之后断网可用对话记录只存在你硬盘上适合处理合同、代码、个人笔记这类不想外传的内容。Qwen3:0.6b 在 8GB 内存机器上也能跑启动 1 到 3 秒日常问答够用。云端这套的价值在于能力上限。当你需要更强的推理、更长的上下文或者要用 Claude 系列模型时把 endpoint 切到https://taotoken.net/api用同一个 Key 就能调用。配置三件套记牢Base URL 填https://taotoken.net/apiAPI Key 在控制台生成Model ID 按文档填。三者填全401 和模型不存在的问题基本都能避免。如果你打算长期做编码或 Agent 类任务可以考虑 Coding Plan把云端通道的额度用得更充分如果只是想先验证模型效果直接进模型对话页面试几条接入过程中卡在报错上去 API Keys 页面重新生成 Key再对照接入文档逐项核对配置。最后给一个实用建议把本地和云端的配置都存成 profile用 CC Switch 一键切换。日常轻量问答走本地 Qwen3:0.6b省资源遇到硬骨头切云端。这样一套界面、一个 Key本地和云端都不耽误。
返回列表