ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

大模型-新手安装Ollama以及大模型调用

大模型-新手安装Ollama以及大模型调用

文章目录

    • 电脑配置
    • 下载安装Ollama
      • 更改模型存放地址
    • 使用ollama 下载 LLM 和 Embedding 模型
    • API 调用
      • 使用Ollama 的http服务接口调用
      • 在代码中调用
        • 方式1:通过 Python 调用http接口
        • 方式2:直接引入ollama Python 包(推荐)调用
        • 方式3:自定义API调用,这里使用FastApi自定义http服务接口
    • 拓展-Ollama 配置文件Modelfile
    • python3安装环境依赖[为下一篇RAG开发做准备]

电脑配置

配置项最低配置推荐配置(个人笔记本)生产配置
💻 CPU4 核8 核16 核+
🧠 RAM8GB16GB32GB+
🎮 GPU❌ 不需要⚡ 可选 (加速推理)🚀 NVIDIA A100
💾 磁盘10GB50GB200GB+
🕒 响应速度5-10秒1-3秒< 1秒

这里我用的是个人笔记本配置

下载安装Ollama

在官网选择对应的版本下载
https://ollama.com/download

OllamaSetup.exe

Windows直接双击启动时,它默认安装C盘,无法界面选择。当我需要装到D盘时使用如下命令,在下载路径中打开CMD

.\OllamaSetup.exe /DIR="D:\Ollama"

可以看到它的安装日志已经显示是D盘了

直到下图说明安装完成

CMD命令行验证安装完成,版本号如下

ollama--versionollama version is0.32.1

更改模型存放地址

默认它会存放在
Linux/macOS系统
默认路径通常为 ~/.ollama/models (用户主目录下的隐藏文件夹)。

  • 验证方法:终端执行 ls -la ~/.ollama/models ,若存在则显示模型文件列表。

Windows系统
默认路径为 %APPDATA%\Ollama\models (如 C:\Users<用户名>.ollama\models )。
◦ 验证方法:Win+R输入 %APPDATA% ,导航至 Ollama\models 文件夹。

使用ollama 下载 LLM 和 Embedding 模型

常见大模型特点

模型大小特点推荐用途
llama3.21B / 3BMeta 出品,轻量快速英文日常对话、简单问答,大小4GB
qwen3.50.8B/2B/4B/9B/35B/122B阿里出品,中文能力强,Instruct集成版性能要求低中文写作、代码生成
deepseek-r11.5B / 7B / 14B / 32B推理能力突出逻辑推理、数学计算
mistral7B欧洲开源,英文强英文写作、翻译

qwen3.5:2b-q4_k_m这里是2B量化压缩版本,普通16G笔记本可以使用,磁盘空间占用1.6G;4b版本需要磁盘空间3.2G集显运行时间大约45秒一个简短思考。

这里使用最小版本下载,毕竟笔记本的性能有限,如果你的电脑配置高可以选择更好的模型下载

# 1. 下载对话模型(Llama 3.1 8B,约 4.7GB)ollama pull llama3.1:8b# 2. 下载 Embedding 模型(用于向量化文本)ollama pull nomic-embed-text# 验证模型ollama list# 应显示:# NAME SIZE MODIFIED# llama3.1:8b 4.7 GB ...# nomic-embed-text 274 MB ...

国内下载速度还是挺快的

如上图说明下载完成

查看已经安装的模型

ollama list NAME ID SIZE MODIFIED llama3.1:8b 46e0c10c039e4.9GB15hours ago nomic-embed-text:latest 0a109f422b47274MB15hours ago

启动模型并使用模型对话

llama run llama3.1 pulling manifest pulling 667b0c1932bc:100% ▕███████████████████████████████████████████████████████████████████████▏4.9GB pulling 948af2743fc7:100% ▕███████████████████████████████████████████████████████████████████████▏1.5KB pulling 0ba8f0e314b4:100% ▕███████████████████████████████████████████████████████████████████████▏12KB pulling 56bb8bd477a5:100% ▕███████████████████████████████████████████████████████████████████████▏96B pulling 455f34728c9b:100% ▕███████████████████████████████████████████████████████████████████████▏487B verifying sha256 digest writing manifest success>>>hello Hello!How are you today? Is there something I canhelpyou with or would you like to chat?>>>你好 You're speaking Chinese!(I think)Hello, nǐ hǎo!

API 调用

使用Ollama 的http服务接口调用

Ollama 启动后会自动在本地运行一个 API 服务,地址是 http://localhost:11434。这意味着你可以通过 HTTP 请求调用模型,就像使用 OpenAI API 一样

curlhttp://localhost:11434/api/generate-d'{ "model": "qwen2.5:7b", "prompt": "什么是 Transformer?用一句话解释。", "stream": false }'

也可以在postman中直接测试

在代码中调用

方式1:通过 Python 调用http接口
importrequests url="http://localhost:11434/api/generate"payload={"model":"qwen2.5:7b","prompt":"用 Python 写一个计算 Fibonacci 数列的函数","stream":False}response=requests.post(url,json=payload)print(response.json()["response"])

本地使用比较直接,无token限制

方式2:直接引入ollama Python 包(推荐)调用
##下载ollma包pipinstallollamaimportollama# 简单对话response=ollama.chat(model="qwen2.5:7b",messages=[{"role":"system","content":"你是一个专业的程序员"},{"role":"user","content":"用 Python 实现一个快速排序算法"}])print(response["message"]["content"])

项目内部提供模块化服务使用,无token限制,token检查有专门的模块服务负责

方式3:自定义API调用,这里使用FastApi自定义http服务接口
from fastapiimportFastAPIimportollama app=FastAPI()@app.post("/chat")def chat(prompt: str): response=ollama.chat(model="qwen2.5:7b",messages=[{"role":"user","content":prompt}])return{"answer":response["message"]["content"]}

一般项目服务产品,或者给第三方提供服务SAAS采用此种方式,可以在每次调用前校验用户权限,用户的token余额是否足够

如果只是简单使用这里已经全部完成了,无非就是根据你的电脑配置,你可以使用更大更新更快的模型而已。

下面的章节为开发做准备,如果你要研究RAG等可能需要开发环境和依赖包

拓展-Ollama 配置文件Modelfile

Modelfile 是 Ollama 用来定义和构建自定义模型的配置文件,类似于 Dockerfile。你可以通过它:

  • 基于已有模型创建新模型
  • 修改系统提示(System Prompt)
  • 调整推理参数
  • 自定义输入输出格式
  • 加载微调适配器(LoRA)
  • 预设对话历史
  • 打包成可分享的模型镜像

Ollama 超详细配置教程之Modelfile

https://blog.csdn.net/weixin_74256690/article/details/151353588

python3安装环境依赖[为下一篇RAG开发做准备]

具体安装方式参考我之前的blog
https://blog.csdn.net/zjcjava/article/details/100751958

安装完成cmd查看当前版本如下

>python Python3.13.7(tags/v3.13.7:bcee1c3, Aug142025,14:15:11)[MSC v.194464bit(AMD64)]on win32 Type"help","copyright","credits"or"license"formoreinformation.

依赖包说明如下

包名用途是否必需
langchainRAG编排框架核心必需
langchain-ollamaOllama集成(LLM+Embeddings)必需
chromadb本地向量数据库;必需
pypdfPDF文档解析按需
python-docxWord 文档解析按需
streamlitWeb UI框架可选
tiktokenToken计数(分块优化)推荐

安装命令如下(根据系统命令不同替换不同的换行符)

# 创建虚拟环境(推荐)python-mvenv rag-env rag-env\Scripts\activate# Windows# source rag-env/bin/activate # macOS/Linux# rag-env\Scripts\activate # Windows# 安装依赖 windows下 powershellpipinstall-Upip pipinstall`langchain>=0.3.0`langchain-ollama>=0.2.0`langchain-community>=0.3.0`chromadb>=0.5.0`sentence-transformers>=3.0.0`pypdf>=1.13.0`python-docx>=1.1.0`streamlit>=1.39.0`tiktoken>=0.8.0`rank-bm25>=0.2.2`--index-url https://pypi.tuna.tsinghua.edu.cn/simple##pip 如果是mac,centos则`替换为\# CMD则`替换为^
返回列表