ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

Ollama本地部署GLM大模型实战:从环境搭建到API集成

Ollama本地部署GLM大模型实战:从环境搭建到API集成

1. 从“云端神话”到“桌面现实”:为什么我们需要本地部署大模型?

最近几个月,AI圈子里最热闹的话题,除了各家闭源模型的“神仙打架”,就是开源模型的“军备竞赛”了。大家讨论的焦点,已经从“哪个模型最聪明”逐渐转向了“我能不能自己跑起来”。这背后其实反映了一个非常现实的需求:我们不再满足于仅仅当一个API的调用者,而是希望把能力握在自己手里。无论是出于数据隐私的考量、对网络延迟的零容忍,还是单纯想摆脱每月订阅费的束缚,本地部署都成了越来越多开发者和技术爱好者的首选路径。

就在这个当口,一个名字被反复提及:GLM-5。它被冠以“世界上最强大的开源模型”之名,这个头衔本身就充满了吸引力。但“强大”这个词在AI领域太抽象了,它可能意味着在某个基准测试上刷了个高分,也可能意味着在特定任务上表现惊艳。对于我们这些想实际用起来的人来说,更关心的是:它到底能干什么?写代码利索吗?理解中文语境够深吗?在我那台不是顶配的电脑上,跑起来是“如丝般顺滑”还是“如拖拉机般轰鸣”?

而另一个名字,Ollama,几乎成了“本地大模型部署”的代名词。它就像一个万能容器,把下载模型、配置环境、启动服务这些繁琐的步骤打包成了几条简单的命令。更妙的是,Ollama不仅支持本地运行,还提供了云端模型的免费访问通道。这相当于给了我们一把“万能钥匙”:既能在自己的地盘上当家作主,也能在需要时,免费借用一下远方的“超级计算机”算力。

所以,当“GLM-5”遇上“Ollama”,这个组合的想象空间就打开了。我们今天要做的,就是亲手把这个组合搭建起来,从零开始,完成一次完整的本地部署实测。我会带你走过从环境准备、模型拉取、到实际对话测试的全过程,并分享我在这个过程中踩过的坑和总结出的技巧。无论你是想搭建一个私人的AI助手,还是为你的应用寻找一个可靠的后端大脑,这篇实测指南都能给你提供一份可靠的“路书”。

2. 战前准备:理清概念、备好“粮草”

在真正动手之前,我们得先花点时间把几个核心概念和准备工作理清楚。这就像打仗前的侦察和后勤,能让你在后面的操作中少走很多弯路。

2.1 GLM-5:它到底“强”在哪里?

GLM-5,这个名字听起来像是某个系列的第五代产品。事实上,它源自智谱AI的GLM(General Language Model)系列。当我们说“世界上最强大的开源模型”时,通常指的是该系列中某个参数量巨大、在多项评测中表现突出的版本,例如GLM-4-9B或更早的GLM-130B。但“GLM-5”这个称呼在官方文档中并不常见,它更像是一个社区或媒体用来指代其最新、最强版本的俗称。

我们需要透过营销词汇看本质。一个模型是否“强大”,可以从几个维度衡量:

  1. 基准测试成绩:在MMLU(大规模多任务语言理解)、GSM8K(数学推理)、HumanEval(代码生成)等权威评测集上的分数。一个顶尖的开源模型,在这些榜单上应该能稳定地名列前茅。
  2. 多语言与中文能力:对于中文用户,模型对中文的理解深度、生成质量以及文化语境把握至关重要。GLM系列由国内团队开发,在这方面通常有先天优势。
  3. 上下文长度:能处理多长的文本?128K、200K还是更长?这决定了它能否处理长文档分析、超长对话等任务。
  4. 多模态能力:是否支持图文理解(VLM)?GLM-4V就是其视觉语言模型版本。
  5. 工具调用与函数执行:能否根据指令调用外部工具、执行代码?这是构建智能体(Agent)应用的基础。

在本次实测中,我们不会纠结于“GLM-5”这个具体指代哪个检查点(Checkpoint),而是聚焦于通过Ollama来部署和体验GLM系列中一个具有代表性的、能力较强的开源版本。我们的目标是验证这套技术栈的可行性和易用性。

2.2 Ollama:你的本地大模型“管家”

你可以把Ollama理解为一个针对大语言模型的“Docker”。它的核心价值在于简化

  • 一键部署:无需手动下载庞大的模型文件(动辄数十GB),再配置复杂的Python环境、CUDA驱动和推理框架(如vLLM, llama.cpp)。Ollama通过一条命令ollama run <model-name>就能完成从拉取到运行的全过程。
  • 统一接口:无论底层运行的是什么模型(Llama 3, Mistral, GLM, Qwen等),Ollama都通过统一的REST API(默认端口11434)提供访问。这意味着你的前端应用不需要为每个模型写不同的适配代码。
  • 资源管理:Ollama能帮你管理多个模型版本,方便地切换和运行。它也提供了一些基本的运行参数配置。
  • 跨平台:支持macOS, Linux, Windows。对于macOS Apple Silicon (M1/M2/M3) 用户,Ollama能直接利用Metal框架进行GPU加速,体验友好。

更重要的是,Ollama提供了一个“模型库”(类似Docker Hub)。除了托管官方支持的模型,社区也可以贡献模型配置文件(Modelfile)。这意味着即使某个模型不在Ollama官方列表里,只要有热心开发者创建了Modelfile,你也能轻松运行。

2.3 硬件要求:你的电脑跑得动吗?

这是本地部署最现实的问题。大模型对硬件,尤其是显存(GPU内存)的要求很高。

  • 量化技术是救星:原始的全精度(FP16/BF16)模型对显存需求巨大。例如,一个70亿参数(7B)的模型,全精度就需要约14GB显存。通过量化(Quantization),将模型权重从16位浮点数压缩到4位整数(如Q4_K_M, Q4_0),可以将显存占用降低到原来的1/4甚至更少,同时性能损失在可接受范围内。Ollama拉取的模型基本都是量化后的版本。
  • 粗略估算
    • 7B参数模型:4位量化后约需4-6GB显存。这意味着拥有一张8GB显存的消费级显卡(如NVIDIA RTX 3070/4060 Ti, AMD RX 6700 XT)或苹果M系列芯片(统一内存通常8GB起)就可以较为流畅地运行。
    • 14B参数模型:4位量化后约需8-10GB显存。需要RTX 3080(10G)/4080(12G)或更高规格的显卡,或者苹果16GB及以上统一内存的设备。
    • 70B及以上参数模型:通常需要24GB+显存,属于专业级显卡领域(如RTX 3090/4090)。对于普通用户,可以考虑通过Ollama的“云端”功能免费体验,或者使用CPU运行(速度会慢很多)。

我的实测环境:一台搭载Apple M2 Pro芯片(16GB统一内存)的MacBook Pro,以及一台配备NVIDIA RTX 4070(12GB显存)的Windows台式机。这两者都属于当前中高端消费级硬件,能够很好地代表大多数有兴趣尝试本地部署的用户的设备水平。

行动建议:在开始前,请先确认你的设备可用显存/内存。在Windows上可以通过任务管理器查看,在macOS上可以通过“活动监视器”,在Linux上可以用nvidia-smi(N卡)或rocm-smi(A卡)。

3. 实战第一步:搭建Ollama运行环境

理论准备就绪,现在开始动手。Ollama的安装过程极其简单,但针对不同平台和网络环境,有一些细节需要注意。

3.1 下载与安装:绕过网络“慢”的坑

Ollama官网提供了各平台的安装包。但很多朋友卡在了第一步:下载慢,甚至无法下载。这是因为其下载服务器位于海外。

解决方案:使用国内镜像源

这是提升安装体验最关键的一步。国内一些高校和机构提供了Ollama的镜像。

  • 对于macOS和Linux用户(推荐命令行安装): 打开终端,直接运行以下命令。它会自动从国内镜像下载安装脚本并执行。

    curl -fsSL https://ollama.com/install.sh | sh

    如果上述命令依然慢,可以尝试指定镜像源。但更常见的问题是后续拉取模型慢,我们下一步解决。

  • 对于Windows用户: 直接访问Ollama官网下载.exe安装程序可能是最直接的。如果下载缓慢,可以尝试使用一些知名的软件下载站(需注意安全),或者借助具备加速功能的浏览器/下载工具。

安装后的验证: 安装完成后,打开终端(macOS/Linux)或命令提示符/PowerShell(Windows),输入:

ollama --version

如果正确显示版本号(如ollama version 0.1.xx),说明安装成功。同时,Ollama服务应该已经作为后台进程启动。

3.2 配置模型拉取镜像:加速下载的关键

安装Ollama只是第一步,拉取模型才是真正的“带宽杀手”。一个几GB甚至十几GB的模型,如果从海外源直接拉,速度可能只有几十KB/s。

Ollama允许配置自定义的模型拉取镜像。国内目前有一些可用的镜像站。

配置方法(以Linux/macOS为例,Windows原理相同):

  1. 打开或创建Ollama的环境配置文件。通常位于~/.ollama/目录下,但更通用的方法是设置系统环境变量。

  2. 在终端中执行:

    export OLLAMA_HOST="0.0.0.0" # 可选,使服务在所有网络接口上监听 export OLLAMA_MODELS="/path/to/your/models" # 可选,自定义模型存储路径

    但最重要的是设置镜像源。由于镜像地址可能变化,建议通过搜索“Ollama 国内镜像”查找当前可用的地址。假设找到一个镜像地址https://mirror.example.com,则可以这样设置:

    export OLLAMA_ORIGINS=https://mirror.example.com

    为了使环境变量永久生效,你需要将上述export行添加到你的 shell 配置文件中(如~/.bashrc,~/.zshrc, 或~/.bash_profile)。

    对于Windows用户: 右键点击“此电脑” -> “属性” -> “高级系统设置” -> “环境变量”,在“系统变量”或“用户变量”中新建变量,变量名OLLAMA_ORIGINS,变量值为镜像地址。

重要提示:镜像源的安全性和稳定性需要自行甄别。在无法找到可靠镜像时,原始的拉取方式虽然慢,但最为稳定。也可以考虑在网络条件好的时候预先下载好模型文件。

3.3 运行你的第一个模型:测试流程

在配置好镜像(或决定直面原始速度)后,我们可以先用一个轻量级模型测试整个流程是否通畅。

Ollama官方维护了一个模型库,可以通过ollama list查看,但更常用的是直接运行。我们用一个经典的、体积较小的模型来测试,比如llama3.2:1b(仅10亿参数,下载快)。

ollama run llama3.2:1b

执行这条命令后,Ollama会做以下几件事:

  1. 检查本地是否有llama3.2:1b模型。
  2. 如果没有,则从配置的源(或默认源)拉取该模型。
  3. 拉取完成后,自动加载模型并进入一个交互式聊天界面。

如果你能看到>>> Send a message (/? for help)这样的提示符,并且可以与之对话得到回复,那么恭喜你,Ollama环境已经完美运行!输入/bye可以退出交互界面。

4. 核心任务:拉取与运行GLM模型

测试环境没问题,现在我们来处理主角:GLM模型。

4.1 在Ollama中寻找GLM模型

Ollama官方库中的模型名称是有规范的。截至我实测时,Ollama官方库可能还没有直接名为glm-5的模型。我们需要寻找GLM系列的其他可用版本。

可以通过Ollama的官网查看模型列表,或者在命令行使用搜索功能(但CLI的搜索功能较弱)。更有效的方法是访问Ollama的官方模型库网站,那里有更详细的列表和说明。

经过查找,我发现了以下几个与GLM相关的、社区贡献的模型,它们可以通过Ollama运行:

  • glm-4b: 一个较早的40亿参数版本。
  • glm-4b:latest: 同上。
  • glm-4b:4bit: 量化版本。
  • chatglm3: 智谱开源的ChatGLM3-6B模型,这是一个对话优化版本,在中文场景下表现很好。
  • qwen系列:虽然这不是GLM,但通义千问也是顶尖的中文开源模型,常被拿来比较。例如qwen2.5:7b,qwen2.5:14b

那么,我们如何运行一个“强大”的GLM模型呢?如果官方库没有,我们可以利用Ollama的Modelfile功能,从Hugging Face等平台拉取模型文件并自行创建。但这需要一定的动手能力。为了本次实测的普适性,我们选择Ollama官方库中已有的、且能力较强的模型作为代表进行体验。我选择了chatglm3,因为它是一个经过充分对话微调、中文能力强、且社区热度高的模型,足以体现“强大开源模型”在本地部署下的效果。

4.2 拉取与运行chatglm3

命令非常简单,和之前测试一样:

ollama run chatglm3

首次运行会自动拉取模型。chatglm3模型大约6B参数,量化后大小在4GB左右。下载时间取决于你的网络。

拉取完成后,会自动进入交互界面。你会看到模型输出的欢迎信息。现在,你可以开始用中文和它对话了。问它一些常识问题、让它写一段代码、或者进行逻辑推理,直观感受它的能力。

我的初体验

  • 响应速度:在M2 Pro(16GB)上,响应速度很快,几乎感觉不到延迟,token生成速度可观。
  • 中文能力:对中文的理解非常自然,成语、俗语、网络用语都能很好地处理,回答符合中文表达习惯。
  • 基础能力:代码生成、逻辑推理、文本总结等任务完成得中规中矩,符合一个6B参数模型的水准。

但这只是开始。交互式对话只是最基础的用法。要真正把它用起来,我们需要通过API来调用。

4.3 通过API调用本地模型

退出交互界面(输入/bye)后,Ollama服务仍在后台运行。它提供了一个标准的OpenAI兼容的API接口。

基础API调用示例(使用curl)

curl http://localhost:11434/api/generate -d '{ "model": "chatglm3", "prompt": "用Python写一个快速排序函数,并添加详细注释。", "stream": false }'

这条命令会向本地的Ollama服务发送一个请求,指定使用chatglm3模型,生成关于快速排序的代码,并以非流式(stream: false)的方式返回完整结果。

更常用的方式:在代码中调用这才是本地部署的价值所在。你可以在你的Python、JavaScript、Go等任何能发送HTTP请求的程序中集成这个AI能力。

这里是一个Python示例,使用requests库:

import requests import json def ask_ollama(prompt, model="chatglm3"): url = "http://localhost:11434/api/generate" payload = { "model": model, "prompt": prompt, "stream": False, "options": { "temperature": 0.7, # 控制创造性,越低越确定 "num_predict": 512 # 生成的最大token数 } } try: response = requests.post(url, json=payload) response.raise_for_status() # 检查请求是否成功 result = response.json() return result["response"] except requests.exceptions.RequestException as e: return f"请求出错: {e}" except KeyError: return "响应格式异常" # 使用函数 answer = ask_ollama("解释一下量子计算的基本原理。") print(answer)

这段代码定义了一个简单的函数,你可以轻松地将其嵌入到你的自动化脚本、Web应用后端或桌面应用中。options参数可以控制生成文本的“性格”(temperature)和长度(num_predict),让你根据需要调整模型行为。

5. 性能实测与调优:让模型跑得更快更稳

把模型跑起来只是成功了一半,让它跑得好、用得爽才是关键。这部分我们来深入性能实测和调优。

5.1 量化等级与性能权衡

Ollama在拉取模型时,默认会选择一个平衡性能和精度的量化版本(例如Q4_K_M)。但你也可以指定其他量化等级。模型名称中的Tag表明了这一点,比如llama3.2:3bllama3.2:3b:q8_0就是不同量化版本。

  • Q2_K / Q3_K:极低比特量化,显存占用最小,但精度损失较大,可能影响复杂任务的表现。
  • Q4_K_M / Q4_0:最常用的平衡选择,在精度和速度/显存上取得了很好的平衡。Ollama默认通常选这个。
  • Q6_K / Q8_0:更高精度的量化,甚至接近半精度(FP16),效果更好,但显存占用也更大。
  • F16:半精度浮点数,非量化,效果最好,显存需求最大。

如何选择?对于chatglm3这类6B模型,在12GB显存的RTX 4070上,甚至可以尝试q8_0F16来获得最佳质量。而在16GB统一内存的M2 Pro上,Q4_K_M是更稳妥的选择,能保证在运行模型的同时,系统和其他应用仍有足够内存。

Ollama目前拉取模型时似乎不能直接指定量化等级,它默认会拉取一个推荐版本。如果你需要特定版本,可能需要寻找社区提供的特定Tag的模型,或者使用Modelfile从原始GGUF文件创建。

5.2 关键运行参数解析

通过API或命令行,我们可以调整一些核心参数来影响模型的行为和性能:

  • num_ctx:上下文窗口大小。默认可能是2048或4096。如果你需要处理很长的文本,可以将其调大,例如--num_ctx 8192。但请注意,更大的上下文会显著增加每一次处理的内存/显存占用,并可能降低推理速度。
    ollama run chatglm3 --num_ctx 8192
  • num_gpu:指定使用GPU的层数。对于多GPU系统,可以分配更多层到GPU以加速。对于大多数单卡用户,这个参数通常不需要调整。
  • num_thread:当使用CPU推理时,用于计算的线程数。设置为你的CPU物理核心数通常是个好主意。

这些参数可以在运行模型时指定,也可以通过Ollama的ollama run命令的--options传递,或者在创建自定义Modelfile时设定。

5.3 多模型管理与服务化

当你尝试了多个模型后,就需要管理它们。

  • 列出所有已拉取模型

    ollama list
  • 复制一个模型(用于创建不同参数的版本):

    ollama cp chatglm3 chatglm3-custom
  • 删除一个模型(释放磁盘空间):

    ollama rm chatglm3

    注意:删除操作需要谨慎,确认模型名称无误。

  • 将Ollama作为后台服务运行: 在Linux/macOS上,Ollama安装后通常已注册为系统服务(systemctl status ollama)。在Windows上,它也会安装为服务。这意味着开机后Ollama会自动在后台启动,随时等待API调用。你无需手动在终端保持一个ollama run的会话。

5.4 我遇到的坑与解决方案

  1. 首次拉取模型失败(网络问题)

    • 现象ollama run卡在pulling manifest或下载进度条不动,最后报超时错误。
    • 解决:这是最常见的问题。核心就是配置国内镜像源。如果找不到稳定镜像,可以尝试在深夜或清晨网络空闲时下载。也可以搜索是否有热心网友分享的通过其他方式(如网盘)下载的模型文件,将其放置到Ollama的模型目录(通常在~/.ollama/modelsC:\Users\<用户名>\.ollama\models)下对应的文件夹里。
  2. 显存/内存不足

    • 现象:运行模型时,Ollama进程崩溃,或系统卡顿,或报错提示内存不足。
    • 解决
      • 尝试更小的模型(如从7B换到3B)。
      • 确保没有其他大型应用占用大量显存。
      • 在Ollama运行命令中尝试更激进的量化参数(如果支持),但通常Ollama拉取的已是量化版。
      • 对于macOS,关闭不必要的应用,确保有足够的可用统一内存。
      • 考虑使用--num_ctx减小上下文长度。
  3. API调用返回空或错误

    • 现象:通过curl或代码调用API,返回404model not found
    • 解决
      • 首先确认Ollama服务正在运行(ollama list能正常执行)。
      • 确认API调用中指定的model名称与ollama list列出的名称完全一致,包括大小写。
      • 检查端口是否正确,默认是11434
  4. 生成速度慢

    • 现象:Token生成速度很慢,对话不流畅。
    • 解决
      • 确认是否在使用GPU。在终端运行ollama run时,观察启动日志,看是否有GPU加速相关的提示。在Windows上,可以打开任务管理器,查看GPU是否被Ollama进程占用。
      • 如果用的是CPU,速度慢是正常的。考虑升级硬件或使用更小的模型。
      • 检查是否无意中设置了num_thread过低。

6. 超越本地:Ollama的“云端”模型与生态整合

Ollama的“本地优先”理念很吸引人,但它也提供了一个令人惊喜的功能:免费运行云端模型。这让你可以在本地硬件跑不动大模型时,有一个备选方案。

6.1 运行云端模型

Ollama官方提供了一些云端运行的模型,例如llama3.1:8b。运行方式与本地模型几乎无异:

ollama run llama3.1:8b

当你首次运行一个云端模型时,Ollama会提示你需要创建一个账户(免费),并登录。之后,模型推理将在Ollama的服务器上进行,结果流式传输回你的终端。

云端模型的优缺点

  • 优点:无需担心本地硬件限制,可以体验参数量更大的模型(如70B)。对于临时性、轻量级的测试或演示非常方便。
  • 缺点:依赖网络,有延迟;输入的数据会发送到Ollama服务器(需注意隐私条款);免费额度可能有限制(需查看最新政策)。

6.2 与现有生态集成:让ChatGPT客户端连接你的本地模型

本地部署了强大的模型,难道只能通过命令行或自己写代码调用吗?当然不是。一个非常酷的用法是,让那些你习惯使用的ChatGPT客户端(如OpenCat for Mac, ChatGPT-Next-Web等)直接对接你的本地Ollama服务。

原理:这些客户端大多支持自定义API端点(API Endpoint)和API Key。而Ollama提供的API是OpenAI兼容的。

配置步骤(以OpenCat为例)

  1. 在OpenCat中,进入设置。
  2. 找到“自定义API”或“第三方服务”配置项。
  3. API端点填写:http://localhost:11434/v1(注意是/v1路径,这是Ollama提供的OpenAI兼容端点)。
  4. API Key可以任意填写(如ollama),因为本地服务通常不验证Key。
  5. 模型名称填写你在Ollama中运行的模型名,如chatglm3
  6. 保存后,你就可以在OpenCat的界面中,像使用ChatGPT一样与你的本地GLM模型对话了!

意义:这极大地提升了本地模型的使用体验。你获得了:

  • 熟悉的优秀UI:历史记录、对话管理、Markdown渲染等。
  • 系统级集成:比如全局快捷键呼出。
  • 多模型切换:可以在客户端里快速切换不同的本地模型。

6.3 进阶玩法:使用Modelfile创建自定义模型

如果Ollama官方库没有你想要的模型,或者你想对现有模型进行微调(需要专业知识)并集成到Ollama中,Modelfile是你的工具。

一个简单的Modelfile示例(从Hugging Face的GGUF文件创建):

FROM /path/to/your/model-q4_k_m.gguf # 或者从网络拉取 # FROM https://huggingface.co/username/model-name/resolve/main/model-q4_k_m.gguf TEMPLATE """{{ .Prompt }}""" PARAMETER temperature 0.8 PARAMETER stop "<|endoftext|>"

将上述内容保存为Modelfile,然后在同一目录下运行:

ollama create my-custom-model -f ./Modelfile ollama run my-custom-model

这样,你就创建并运行了一个自定义模型。这为高级用户提供了极大的灵活性。

7. 总结与展望:本地AI时代的个人起点

走完这一整套流程,从环境准备到API集成,我们完成了一次完整的“世界上最强大的开源模型”的本地部署实测。虽然我们最终运行的chatglm3可能并非标题中那个具象的“GLM-5”,但这个过程本身的价值,远大于运行某一个特定模型。

这次实测的核心收获

  1. 技术民主化:Ollama这样的工具,极大地降低了本地运行大模型的门槛。它把复杂的工程问题封装成了几条简单的命令,让每个开发者都能在几分钟内拥有一个私人的、功能强大的AI助手。
  2. 数据主权与隐私:所有数据在本地处理,无需上传至云端。这对于处理敏感信息、企业内部数据或单纯注重隐私的用户来说,是决定性的优势。
  3. 成本可控:一次性的硬件投入(如果你已有符合条件的电脑),替代了持续的API调用费用。对于高频使用或开发调试场景,长期来看可能更经济。
  4. 可定制与集成:本地部署的模型可以无缝集成到你的任何应用中,无论是自动化脚本、桌面工具还是Web服务。你可以完全控制它的行为、上下文和输出。

关于“强大”的再思考:通过这次实测,我深刻体会到,“强大”不仅仅体现在基准测试的分数上。一个能在自己电脑上稳定、快速、低成本运行,并且能通过标准API轻松调用的模型,其“实用意义上的强大”对于个体开发者和小团队而言,可能比一个需要昂贵云端算力才能运行的千亿参数模型更有价值。chatglm3在中文对话、代码生成上的表现已经足够应对很多日常辅助编程、写作、学习的场景。

给尝试者的最后建议:如果你的电脑拥有8GB以上的可用显存或16GB以上的统一内存,我强烈建议你花上半小时,按照本文的步骤尝试一下。从ollama run llama3.2:1b这个最简单的命令开始,感受一下本地AI的响应速度。然后,再挑战一下chatglm3qwen2.5:7b,体验更强大的能力。这个过程中你获得的对大模型部署、调用的直观理解,远比阅读十篇理论文章更有价值。

本地AI的浪潮已经到来,它不再是大型科技公司的专属。Ollama和GLM这样的优秀开源项目,正在把能力的钥匙交到我们每个人手中。下一步是什么?也许是尝试用本地模型为你的个人知识库构建一个智能检索接口,也许是创建一个自动处理文档的桌面工具。可能性,现在真正掌握在你的本地环境里了。

返回列表