ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

Ollama本地部署大模型实战:安装、模型管理与报错排查

Ollama本地部署大模型实战:安装、模型管理与报错排查 1. Ollama到底解决了什么问题1.1 从一条报错说起打开终端敲下ollama run qwen3.5:2b屏幕上蹦出来一行红字Error: 500 internal server error: llama-server process。我猜不少第一次接触 Ollama 的人就是被这句报错劝退的。先别急着关页面这个工具本身没那么玄乎报错原因翻来覆去也就是那几件事后面我会单独开一节专门讲排查。Ollama 是一个用来在本地跑大语言模型的推理工具。不管是 Windows、macOS 还是 Linux装上它之后你不需要手动配 Python 环境、装 CUDA、折腾 transformers 这些依赖只需要几条命令就能把一个对话模型跑起来它还会自动帮你把模型转换成可用的服务接口方便其他程序调用。它的核心设计思路和 Docker 很像模型就是“镜像”ollama run就类似docker run一条命令拉起一个服务。这个思路极大地降低了本地部署门槛也让它成了目前私有大模型部署方案里最省心的工具之一。这篇文章适合这些读者第一次听说 Ollama、想本地跑一个词模型体验一下的小白被 conda 和 CUDA 折磨过、就想赶紧把模型跑起来的开发以及想把 Ollama 接入知识库、自动化工具链的进阶玩家。看完你应该能独立完成安装、下载模型、调参、排查报错这一整套流程。1.2 为什么偏偏是 Ollama本地跑大模型的方案不少但 Ollama 能成为事实标准靠的是三个别人没做好的点。第一模型管理足够简单。官方维护了一个模型库所有模型按“模型名:版本号”来标识比如qwen2.5:7b、llama3.1:8b。你不需要自己去 HuggingFace 翻目录、对比文件格式一条ollama pull把模型拉下来它会自动处理量化、路径、校验这些脏活。第二装完就是服务。Ollama 安装成功后默认在 11434 端口起一个 REST API 服务。这意味着你不需要额外写一套 Web 封装前端、后端、脚本全部可以通过 HTTP 请求调用模型。对“要把模型集成到自己的应用里”这种需求来说这个设计太重要了。第三量化选择足够智能。官方模型库默认提供的都是带量化精度的版本比如 Q4_K_M这类格式在显存占用和推理质量之间取了一个平衡点。普通用户不需要理解“什么是 KV Cache”“什么是 Q8_0 量化”直接用默认版本就行。踩过的坑也在这里提一句Ollama 的模型版本 tag 五花八门有人图省事直接ollama run qwen3.5:2b结果拉下来的是旧版或者根本不存在的 tag报错信息还特别迷惑。建议去 ollama.com/library 先看模型卡片确认你需要的 tag 确实存在再动手。1.3 和 LM Studio 比怎么选热词里有人问“LM Studio 和 Ollama 哪个好”这俩不是替代关系更像是两条路线。LM Studio 是一个带图形界面的桌面应用下载模型、加载模型、聊天、调参数全在窗口里点按完成对新手极其友好尤其是看不上命令行的用户。它的缺点是自动化能力弱命令行调用、脚本集成、Docker 部署这些场景都不如 Ollama 顺手。如果你想有一款“装完就能点开聊天”的工具LM Studio 更合适。Ollama 则是把重心放在“引擎”上命令行、API、Docker 无处不在。图形界面不是它的强项但你可以拿它接 Open WebUI、AnythingLLM 这类前端项目组合出一套比 LM Studio 更灵活的方案。我个人的使用习惯是日常聊天用 Open WebUI 这种 Web 界面API 全部指向 Ollama偶尔想快速试一个新模型就直接在终端ollama run跑一下。真要二选一我更愿意推荐 Ollama因为它的上限更高留给你折腾的空间更大。2. 安装与部署从官网卡死到镜像秒下2.1 先搞清楚“下载慢”的根源安装 Ollama 最常见的一个痛点就是下载慢。有人从官网点下载按钮等了半小时还在转圈有人ollama pull一个 4GB 的模型进度条几乎纹丝不动。先说结论这不是你网的问题是资源托管位置的问题。Ollama 的官方安装包和模型文件默认都放在国外的对象存储和 CDN 上。国内直连这些地址延迟高、丢包多速度自然惨不忍睹。模型文件动不动几个 GB磕磕绊绊下载到一半断了又要从头再来体验非常崩溃。理解了这一点你就知道解决方向了要么换下载源要么用镜像站要么整体换成离线安装包。下面几个方案都是我实测过、身边朋友也在用的按需选择即可。2.2 国内镜像源与离线安装包先说 Windows 安装包。国内有不少 GitHub Releases 镜像平台会把 Ollama 的安装包同步一份速度比官网直连快得多。比如https://cnb.cool/hex/ollama/-/releases/latest/download/ollamasetup.exe这类地址其实就是把最新 release 的OllamaSetup.exe镜像了一份直接用浏览器或下载工具拉下来就能装。macOS 用户对应找.dmg或.zip的镜像版本Linux 用户通常是下载ollama-linux-amd64.tgz这个压缩包。无论哪个平台认准一个原则从镜像站把安装包下载到本地后后续安装完全离线进行不再依赖网络。这就是典型的离线安装包方案。内网环境、离线机器、公司电脑没法访问外网的场景只要提前下载好对应平台的安装包带进去就能完成安装。安装完成后连模型文件都能提前拷贝到指定目录做到真正意义上的全离线运行。清华、中科大等开源软件镜像站有时候也会收录 Ollama 的安装包不过时效性不如专门做 GitHub 镜像的平台。2.3 安装到 D 盘模型目录优先迁移热词里有个高频问题“Ollama 怎么安装在 D 盘”。这里要说清楚一件事Ollama 安装完有两部分东西——程序本体和模型数据。程序本体通常只有几百 MB装在 C 盘问题不大真正占空间的是模型文件一个 7B 模型动辄 4~6GB装多了 C 盘肯定爆。所以我的建议是不用纠结程序本体装哪把模型目录迁走就够了。Windows 下模型默认存放在C:\Users\你的用户名\.ollama\models。要迁移到 D 盘打开系统环境变量设置新建一个用户变量OLLAMA_MODELSD:\ollama\models设置完后重启 Ollama 服务托盘图标右键退出再重新启动新下载的模型就会全部写入 D 盘。如果你想把已经下载好的旧模型也搬过去直接把.ollama\models目录下的文件剪切到 D 盘对应目录再把环境变量指过去就行。Linux 用户同理默认路径是/usr/share/ollama/.ollama/modelsroot 用户或~/.ollama/models改OLLAMA_MODELS环境变量即可。2.4 Docker 部署 Ollama服务器环境、或者不想在宿主机上装一堆东西的朋友用 Docker 部署 Ollama 会更干净。官方镜像就是ollama/ollama一条命令就能起服务docker run -d -v ollama:/root/.ollama -p 11434:11434 --name ollama ollama/ollama这条命令把数据卷ollama挂载到容器内的模型目录宿主机端口 11434 映射到容器之后你在宿主机上直接访问http://localhost:11434就是 Ollama 的 API。注意一点容器内执行ollama run需要用docker exec进容器操作或者不映射模型目录也行但那样容器一删模型就没了。我更推荐的做法是宿主机上再装一个 Ollama 客户端或直接用后面要讲的 API 调模型模型管理全走 Docker。Docker 部署的另一个好处是版本回滚容易。Ollama 更新翻车了直接把镜像 tag 改回旧版本重启容器就恢复了比卸载重装省事得多。2.5 三步验证安装结果安装完别急着跑大模型先做三个快速检查。第一步终端执行ollama --version能输出版本号说明安装成功。第二步执行ollama list查看当前已经下载了哪些模型这里应该还是一片空白。第三步跑一个最小的验证模型我建议用ollama run qwen2.5:0.5b这个模型只有几百 MB下载快、启动快专门用来验证链路通不通。等它出现对话提示符安装部署这一关就算过了。这里有个小技巧验证用的最小模型尽量保留在本地以后改配置、调参数、排查问题时用它来测试最快不用每次都拉一个 7B 大模型等半天。3. 模型拉取与文件管理3.1 模型仓库怎么找Ollama 的模型仓库就是官方 Library地址是 ollama.com/library。你不需要注册任何账号也不需要绑定手机号直接浏览搜索就行。每个模型页面都会列出可用的 tag常见的有7b、8b、70b这些参数规模以及q4_k_m、q8_0这些量化方式。新手选模型时有一个很容易踩的坑看到70b就觉得“模型越大越聪明”直接ollama run结果要么显存崩溃要么慢到没法用。比较现实的建议是根据你的显存和内存来选8GB 显存附近选 7B~8B 的量化版16GB 选 14B 左右32GB 以上再考虑 30B 以上的大模型。宁可模型小一点也要保证推理速度能接受。3.2 几个高频命令速记Ollama 的命令不多能把下面这些用熟日常就够用了。ollama pull qwen2.5:7b # 下载模型到本地 ollama run qwen2.5:7b # 运行模型进入交互对话 ollama list # 查看本地已下载的模型 ollama ps # 查看当前正在运行的模型进程 ollama stop qwen2.5:7b # 停止某个正在运行的模型 ollama rm qwen2.5:7b # 删除本地模型 ollama show qwen2.5:7b --modelfile # 查看模型配置详情有一个容易忽略的点ollama stop不常用但当你同时跑多个模型、显存被占满想卸载其中一个的时候它会非常有用。另外模型用完不会自动卸载Ollama 会默认保活一段时间想要省内存就手动 stop。3.3 怎么查看下载了哪些模型、文件在哪ollama list能告诉你本地有哪些模型但如果你想看物理文件位置注意了模型并不是按“模型名”存成一个文件夹的而是以 sha256 哈希值存放在 blobs 目录下。Windows 默认路径是C:\Users\你的用户名\.ollama\models\blobsLinux 是/usr/share/ollama/.ollama/models/blobs或~/.ollama/models/blobs。第一次翻这个目录的人基本都会懵“这都什么文件名”没有关系正常情况下你不需要操作这些文件。但如果你要把模型整个备份、迁移到另一台电脑直接把.ollama整个目录拷贝过去就行目标机器上ollama list就能识别出来。这个做法在离线环境很实用。两台机器都是内网不能下载模型那就从有网的机器上把.ollama目录打包拷贝过去解压后设置好OLLAMA_MODELS指向这个目录模型列表瞬间就齐了。3.4 下载太慢的补救GGUF 文件手动导入如果你拉模型的速度实在感人还有一条路手动下载 GGUF 文件然后用ollama create导入。GGUF 是大模型社区通用的量化模型格式HuggingFace 上有大量现成文件。具体步骤是先从镜像站比如 hf-mirror.com注意用国内可直连的镜像域名下载你想要的 GGUF 模型文件放到本地一个目录里。然后写一个 Modelfile内容大概是FROM /path/to/your-model.gguf TEMPLATE {{ .Prompt }}保存后执行ollama create mymodel -f Modelfile这样mymodel就出现在ollama list里了使用方式和其他模型完全一样。粗看起来比ollama pull多几步但在网络不稳定的环境里它反而更可控——下载中断了可以用下载工具续传不用从头再来。3.5 Context 长度怎么设置热词里有人问“Ollama 模型 context 设置”先解释一下概念Context 是模型能“看到”的上下文窗口长度值越大它能记住的对话内容越多但显存和内存占用也随之上涨。Ollama 默认的 context 通常是 2048 或 4096对于长文档分析、长篇对话这种场景明显不够用。设置方法有三种。第一种临时设置进入交互对话后输入/set parameter num_ctx 8192这种方式只对当前会话有效适合临时测试。第二种永久生效把参数写进 Modelfile然后重新ollama create这种方式适合你确定这个模型就是要用长上下文。第三种设置全局环境变量OLLAMA_CONTEXT_LENGTH8192设置后所有模型的默认 context 都会被修改。我的建议是先明确自己最大内存余量再决定 context 大小。7B 模型在 8GB 显存下context 开到 8192 通常还能跑开到 16384 就可能内存告急。不要盲目贪大。4. 日常使用与周边生态4.1 终端交互的实用姿势ollama run进入的是交互式对话界面。很多人只知道在里面打字聊天其实还有几个隐藏操作值得掌握。输入/help可以调出完整指令列表。输入/bye退出对话。输入/set可以在会话中修改参数比如刚才说的num_ctx。如果你开了一个大模型又不想退出重开可以用/save把当前参数保存到模型配置里。批量处理场景下可以不用交互模式直接带参数执行ollama run qwen2.5:7b 用一句话解释什么是递归这个用法非常适合脚本里调用不用维护交互会话跑完自动退出。4.2 REST API 才是重头戏Ollama 安装后默认就是 API 服务直接通过 HTTP 请求就能调用。比如生成一次对话curl http://localhost:11434/api/chat -d { model: qwen2.5:7b, messages: [ {role: user, content: 你好} ] }Python 里用 requests 访问也是一样import requests resp requests.post(http://localhost:11434/api/chat, json{ model: qwen2.5:7b, messages: [{role: user, content: 你好}] }) for line in resp.iter_lines(): if line: print(line.decode(utf-8))响应是流式返回的每一行都是 JSON。理解了这一点前端页面、自动化脚本、微信机器人、飞书机器人接 Ollama 就完全没障碍了。这是 Ollama 最大的价值所在——它不是一个大号聊天窗口而是一个可以被任何程序调用的本地模型引擎。4.3 Open WebUI 和 AnythingLLM终端和 API 是硬核玩家的玩法普通用户想要 ChatGPT 那样好看的界面就得搭配其他前端。最常见的是 Open WebUI一个开源项目装上之后就是一个完整的 Web 对话界面支持多用户、文件上传、知识库管理等。Docker 部署方式docker run -d -p 3000:8080 \ --add-hosthost.docker.internal:host-gateway \ -e OLLAMA_BASE_URLhttp://host.docker.internal:11434 \ -v open-webui:/app/backend/data \ --name open-webui \ ghcr.io/open-webui/open-webui:main启动之后浏览器访问http://localhost:3000把 Ollama 地址填进去本机就是http://localhost:11434就能在 Web 界面里选择模型对话了。AnythingLLM 则是另一个思路它是一个面向知识库问答的桌面应用支持接入 Ollama 作为底层模型。安装 AnythingLLM 后设置里的 LLM Provider 选 Ollama填上模型名和地址它就能用你本地的模型做文档问答。这个组合特别适合不想写代码、只想快点把文档丢进去做问答的人。Open WebUI 也有中文便携版流传通过开源镜像下载解压即用适合那些不想用 Docker、也不想手动配环境的人。我个人的偏好是 Docker 部署 Open WebUI升级方便数据也好备份。4.4 零基础搭一个本地知识库热词里有一条“Ollama 简易本地 RAG 知识库零基础可复制教程”这个组合也是 Ollama 最常见的进阶玩法。RAG 的原理不复杂先把你的文档切片、用 embedding 模型转成向量存入向量数据库提问时把问题也转成向量到数据库里检索最相关的片段最后把这些片段连同问题一起交给对话模型生成答案。用 Ollama 做这个链路需要的组件是一个 embedding 模型比如nomic-embed-text一个对话模型比如qwen2.5:7b一个向量数据库比如 Chroma。先拉取 embedding 模型ollama pull nomic-embed-text然后 Python 里写个最简单的流程import ollama import chromadb # 初始化向量库 client chromadb.Client() col client.create_collection(docs) # 文档切片后逐条写入 chunks [第一章内容……, 第二章内容……] for i, chunk in enumerate(chunks): emb ollama.embed(modelnomic-embed-text, inputchunk)[embeddings] col.add(ids[str(i)], embeddingsemb, documents[chunk]) # 提问时检索生成 question 这个文档讲了什么 q_emb ollama.embed(modelnomic-embed-text, inputquestion)[embeddings] result col.query(query_embeddingsq_emb, n_results3) context \n.join([doc for doc in result[documents][0]]) resp ollama.chat(modelqwen2.5:7b, messages[ {role: user, content: f请根据以下资料回答问题\n{context}\n问题{question}} ]) print(resp[message][content])这里贴的是最核心的骨架实际使用还要处理 PDF 解析、切片大小、去重等细节。我从实操里总结几个经验第一embedding 模型尽量选对中文友好的nomic-embed-text表现及格但不是最优第二切片不要太大256~512 字左右比较合适切大了检索不精准切小了上下文碎片化第三检索结果给模型时记得在 Prompt 里明确要求“只依据给定资料回答不要编造”能明显减少幻觉。4.5 接入自动化工具链Ollama 还能接入不少自动化工具。比如 Goose这是一个开源的 AI Agent 命令行工具你可以在配置里把 LLM Provider 指向本地 Ollama。这样 AI 操作文件、执行命令时全走本地模型数据不出内网对数据敏感的场景是很大的优势。另外像 LangChain 也原生支持 Ollama。把ChatOllama作为一个组件接进工作流上层继续用 ReAct 这类 Agent 模式就能在本地搭建一个完全可控的自动化体。这块玩法非常多后面可以单独开文章细说。5. 进阶配置与硬件适配5.1 Intel GPU 到底能不能用热词里问“Ollama 支持 Intel GPU”的人不少。先说结论能但体验分情况。Ollama 的底层推理引擎对 Intel Arc 独显和较新核显已经有了一定支持。如果你用的是 Intel Arc 系列独显在较新版本的 Ollama 里它有一定概率自动识别到显卡并加载到 GPU 上。如果没识别到可以通过环境变量OLLAMA_INTEL_GPU1尝试强制开启。启动后执行ollama ps看显存占用那栏就能确认模型是否跑在 GPU 上。但注意Intel GPU 的兼容层还在快速迭代驱动版本、Ollama 版本、模型大小都会影响效果。我实测下来Intel Arc 跑 7B 模型能明显比 CPU 快但跟同价位 N 卡还是有差距核显Iris Xe 这类能跑但性能提升有限。如果你的主力设备是 Intel 核显建议不要抱太高期待老老实实用小参数模型更稳妥。5.2 为什么暂时不支持 NPU这个问题的答案其实很简单Ollama 底层是基于 llama.cpp 的这个开源推理库的优化重心放在 CUDA、ROCm、Metal 这三类主流 GPU 平台上。NPU 这类专用 AI 芯片各家驱动和算子库完全不同llama.cpp 要适配需要投入大量精力而 NPU 本身主要面向低功耗、端侧推理场景和 Ollama 主打的“家用 PC / 服务器跑模型”需求重合度不高。再加上 NPU 的软件生态封闭厂商 SDK 各自为战连“一套代码到处跑”都做不到。所以短期内指望 Ollama 自动调度 NPU 不太现实。如果你的设备只有 NPU可以先查一下厂商是否提供了自己的推理框架很多手机和笔记本厂商都有原生的端侧模型方案体验不一定比 Ollama 差。5.3 怎么让 Qwen 这类模型“别思考”用 Qwen3 这类带推理能力的模型时很多人遇到一个头疼的事模型每次回答前都要输出一大段“思考过程”既费时间又占上下文。有时候你就想让模型直接给答案它偏要先剖析一遍。最直接的办法是在 Prompt 里明确告诉它“直接回答不要输出任何思考或分析过程”。这个指令对绝大多数模型都有效。更系统一点Ollama 支持设置推理强度。运行模型前设置环境变量OLLAMA_REASONING_EFFORTlow这个变量会把模型的推理深度降到最低思考过程变短或直接省略。也可以进入交互界面后用/set parameter reasoning_effort low临时设置。注意具体变量名会在不同版本有变化如果你在某个版本里设置了没生效最简单可靠的还是 Prompt 大法。5.4 多模型并行与显存控制本地跑多个模型时默认 Ollama 会按需加载但加载进内存的模型通常不会立刻卸载导致显存被多个模型分食。ollama ps可以立刻看到当前加载了哪些模型、占了多少显存。如果你希望动态控制并发可以设置OLLAMA_NUM_PARALLEL1这个值控制同时处理的请求数对单用户场景没必要调大。如果显存不够还能强制模型部分层跑 CPUOLLAMA_GPU_LAYERS20这个变量限制加载到 GPU 的层数数字越小显存占用越低但速度也越慢。实测调参的时候可以从OLLAMA_GPU_LAYERS0完全 CPU 模式开始确认能跑了再逐步增加层数找到显存和速度的平衡点。6. 典型报错与排查实录6.1 500 internal server error: llama-server process回到开头那条报错Error: 500 internal server error: llama-server process。这个 500 不是模型在嚷嚷而是背后负责推理的llama-server进程崩溃了。什么情况下会崩按我遇到的概率排个序一是显存或内存不足。小参数模型如qwen3.5:2b报这个错多半不是模型本身不够用而是你的机器同时跑着其他程序占满了内存或者 Ollama 版本对某些模型的内存估算有偏差。排查方法很简单关掉其他吃内存的应用或者换更小的量化版本试试。二是模型文件损坏。下载一半断了、磁盘空间不够、强制关机都可能让模型文件不完整。这时ollama rm删掉模型重新ollama pull就好。三是端口或服务冲突。有时候你手动改过OLLAMA_HOST或者另一个程序占了 11434 端口服务起不来但 API 请求还是打到老地址就会报 500。用netstat -ano | findstr 11434看看端口占用情况。四是老版本兼容问题。Ollama 更新很频繁某些模型 tag 需要新版支持。遇到 500 先升级 Ollama 到最新版能解决一批问题。给一条排查铁律看到 500 先看ollama serve的终端日志。日志里写着明确的错误原因比如CUDA out of memory、failed to allocate、model not found比在界面上猜一百遍都管用。6.2 下载永远卡在某个百分比ollama pull下载大模型时断断续续是常态。先说好消息Ollama 的下载支持断点续传中断后重新执行ollama pull会从断点继续不用从头再来。如果卡在 0% 完全不动多半是网络连不上模型存储源。这时候不要死磕ollama pull换成前面说的 GGUF 手动导入方案或者直接换一个镜像源重试。还有一个偏方如果公司网络对国外存储限速可以试试把 DNS 换成公共 DNS或者换条热点很多“卡死”的问题其实是网络链路问题。6.3 显存不足与 CUDA 报错CUDA out of memory这类错原因直接模型需要的显存超出你有的显存。不要硬等按这个顺序处理先看当前谁占着显存Windows 打开任务管理器性能页或命令行nvidia-smi确认显存是否被其他程序吃光。再设置OLLAMA_GPU_LAYERS0强制模型完全用 CPU 推理先确认链路没问题再逐步把层数加回去。最后换个更小的量化版本比如把7b q8_0换成7b q4_k_m显存占用能缩将近一半。有一点容易忽略Ollama 默认会把模型的部分层加载到 GPU部分层加载到 CPU两者之间的搬运需要内存带宽。如果你发现 GPU 占用不高但速度很慢反而是 CPU 内存瓶颈这时的调节方向是增加 GPU 层数而不是减少。6.4 服务起不来、端口被占另一种常见情况是ollama serve提示端口被占用或者你启动后访问http://localhost:11434没反应。处理流程先看服务进程是否活着Windows 任务管理器找 OllamaLinux 用ps aux | grep ollama。再查端口netstat -ano | findstr 11434如果发现被其他进程占用要么杀掉那个进程要么改端口。改端口的方式是设置环境变量OLLAMA_HOST127.0.0.1:11435然后重启服务。这里提醒一下改了端口之后所有依赖 Ollama 的程序都要同步改地址包括 Open WebUI 的OLLAMA_BASE_URL、AnythingLLM 的配置、Python 代码里的 URL。改完端口忘了改上游配置是最隐蔽的“怎么都不通”的原因。6.5 常见问题速查表症状主要原因快速解决500 llama-server process显存不足 / 模型损坏 / 端口冲突看ollama serve日志定位先强制 CPU 模式再逐层调模型无法拉取一直 0%网络链路问题换镜像源 / 手动下载 GGUF 导入CUDA out of memory模型过大OLLAMA_GPU_LAYERS0起步再逐步加模型回答前总是思考过程推理模型默认行为Prompt 强制直接回答或设置低推理强度列表里有模型但 run 报不存在tag 写错ollama list确认名称用完整 tag11434 端口不通服务未启动 / 端口被占ollama serve手动启动或换端口老 CPU 跑新模型直接崩指令集不支持换小模型 / 换旧版模型表格没有覆盖的场景建议直接看日志。Ollama 的日志信息质量在同类工具里算很不错的报错里通常直接写着解决方案。我在实际使用中最大的体会是Ollama 作为一个本地推理工具价值不在“模型多强”而在“能用最小成本把模型变成服务”。很多人觉得自己电脑配置差、跑不了大模型其实 8GB 内存的机器上跑 0.5B~4B 的小模型依然有实用价值用来做文本分类、格式化输出、离线翻译完全够用。与其一直盯着最大的模型焦虑不如先把一套小模型跑通再逐步往里追加资源。最后分享一个实用习惯每次装完 Ollama 先做一次备份把.ollama目录打包存到移动硬盘或 NAS 上以后换电脑、重装系统把目录拷回去半小时内就能恢复所有模型环境。这个习惯我吃了不少甜头建议你也试试。
返回列表