ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

从微调到部署:使用LLaMA-Factory与Ollama打造私有化大模型服务

从微调到部署:使用LLaMA-Factory与Ollama打造私有化大模型服务 1. 这篇文章真正要解决的问题你是否遇到过这样的困境手头有一个开源大语言模型比如 Qwen、Llama 或 ChatGLM但它的回答风格、知识范围或专业术语总和你团队的特定需求差那么一点直接使用通用模型就像让一个博学的通才去解决一个高度专业的问题效率低下且容易出错。微调就是为这个“通才”进行定向“特训”的关键一步。然而从“知道要微调”到“成功部署一个可用的微调后模型”中间横亘着一条让许多开发者和运维人员望而却步的鸿沟。这条鸿沟通常由几个具体的技术断点构成如何选择一个简单高效的微调框架来降低上手门槛如何将微调后的模型转换成一种易于分发和部署的格式以及最终如何将这个私有模型像使用 ChatGPT 那样方便地集成到自己的应用或提供给团队成员使用本文要解决的正是这条从“模型微调”到“服务部署”的完整链路问题。我们将聚焦于一个被广泛验证的黄金组合使用 LLaMA-Factory 进行低门槛的模型微调然后将微调产物转换为 Ollama 支持的格式最后通过 Ollama 实现一键本地部署和 API 化。这个组合的核心价值在于它将原本需要深厚机器学习工程背景和复杂运维技能的工作简化成了几个清晰的、可脚本化的步骤特别适合中小团队、个人开发者以及希望将 AI 能力私有化的企业。读完本文你将能清晰地掌握为什么是 LLaMA-Factory Ollama 这个组合如何从零开始准备环境、准备数据并完成微调最关键的是如何将微调得到的.pth或.safetensors文件“打包”成 Ollama 能直接拉取和运行的模型文件Modelfile并最终通过一个简单的命令让模型服务跑起来对外提供兼容 OpenAI 的 API。我们不仅会讲通流程更会指出每个环节中最容易踩坑的地方比如显存不足、格式转换失败、Ollama 加载报错等并提供经过验证的解决方案。2. 基础概念与核心原理在深入实操之前我们需要统一几个关键概念的理解这能帮助你在后续步骤中明白每一步在做什么以及为什么这么做。1. 模型微调 (Fine-tuning)微调不是从头训练一个模型那需要海量数据和算力。微调是在一个预训练好的大模型基础模型基础上使用你特定的、规模较小的数据集进行额外训练让模型适应你的特定任务或领域。你可以把它想象成模型已经学会了人类的通用语言和逻辑预训练你现在要用专业教材你的数据教它成为某个领域的专家微调。LLaMA-Factory 等工具极大地简化了这个过程的工程复杂度。2. LLaMA-Factory这是一个功能强大且用户友好的大语言模型微调框架。它的核心优势在于统一接口支持众多主流开源模型Llama、Qwen、ChatGLM、Baichuan等。高效微调技术默认支持 LoRA、QLoRA 等参数高效微调方法能大幅降低显存消耗使得在消费级显卡如 RTX 4090/3090上微调 7B/13B 模型成为可能。Web UI 与 CLI既提供了直观的图形界面进行实验和调试也支持命令行脚本便于自动化集成。丰富的训练策略支持全参数微调、仅微调特定层、以及上述的 LoRA 等。3. OllamaOllama 是一个用于本地运行大语言模型的工具。它解决了模型部署的“最后一公里”问题模型管理像docker pull一样使用ollama pull拉取模型。简化运行一个命令ollama run model-name即可启动模型并进入交互对话。API 服务运行后默认在11434端口提供兼容OpenAI API 格式的接口让你的应用程序可以像调用 ChatGPT API 一样调用本地模型。格式封装Ollama 使用自定义的Modelfile来定义如何构建和运行一个模型其中包含了模型文件、模板、参数等信息。4. 流程核心从微调到 Ollama 部署的转换这是本文的技术关键点。LLaMA-Factory 微调后的输出通常是 PyTorch 的.pth检查点文件或更安全的.safetensors文件。而 Ollama 无法直接使用这些文件。它需要的是GGUF格式的模型文件一种高度优化和量化的格式便于在 CPU/GPU 上高效推理以及一个描述它的Modelfile。 因此整个流程的核心转换步骤是LLaMA-Factory 微调产出 → 合并为完整模型文件 → 转换为 GGUF 格式 → 创建 Modelfile → Ollama 加载部署。为了更清晰地对比传统方式与本方案请看下表环节传统手工流程LLaMA-Factory Ollama 方案微调编写复杂训练脚本处理数据加载、损失函数、优化器、分布式训练等。通过 Web UI 配置或 CLI 命令专注数据准备和参数调整框架处理底层复杂性。格式转换需手动编写脚本合并 LoRA 权重再使用复杂工具如llama.cpp项目进行量化转换。LLaMA-Factory 内置导出功能可导出为 Hugging Face 格式再通过llama.cpp工具链标准化转换。部署服务需要自行搭建类似 FastAPI 的服务器编写模型加载、推理、并发处理代码并管理 GPU 内存。使用ollama serve自动提供高性能推理服务和标准 API无需编写服务端代码。应用集成需要自定义客户端与自研服务器的通信协议。直接使用 OpenAI SDK只需修改base_url和api_key即可无缝切换。3. 环境准备与前置条件工欲善其事必先利其器。以下是完成本教程所需的软硬件环境。请确保你的 Linux 系统满足以下条件这将避免绝大多数因环境问题导致的失败。硬件要求CPU建议 x86_64 架构。ARM如 Mac M系列也可运行但部分工具链可能需要额外编译。内存至少 16GB RAM。微调 7B 模型时系统内存最好不低于 32GB。GPU强烈推荐用于微调和高效推理。微调根据模型尺寸选择。使用 QLoRA 技术显存需求大幅降低。7B 模型至少 8GB 显存如 RTX 3070/4060Ti。13B 模型建议 16GB 以上显存如 RTX 3090/4090。推理对显存要求低于微调但 GPU 能极大加速响应速度。磁盘空间至少预留 50GB 可用空间用于存放基础模型、微调数据、训练产出和转换后的模型。软件与系统环境操作系统Ubuntu 20.04/22.04 LTS 或 CentOS 7/8 等主流 Linux 发行版。本文以 Ubuntu 22.04 为例。Python版本 3.8 - 3.10。推荐使用 3.10。避免使用 3.11可能遇到某些依赖包兼容性问题。CUDA 工具包如果你使用 NVIDIA GPU需要安装与显卡驱动匹配的 CUDA。推荐 CUDA 11.8 或 12.1。可通过nvidia-smi查看驱动支持的最高 CUDA 版本。Git用于拉取代码。Docker可选但推荐用于运行 Ollama。虽然 Ollama 有原生 Linux 安装包但 Docker 方式更干净便于隔离和管理。关键依赖安装在开始前我们先在终端中完成基础依赖的安装。# 1. 更新系统包并安装基础工具 sudo apt update sudo apt upgrade -y sudo apt install -y python3-pip git curl wget build-essential # 2. 验证 Python 环境 python3 --version # 应显示 3.8, 3.9 或 3.10 pip3 --version # 3. 安装 PyTorch请根据你的 CUDA 版本选择命令 # 访问 https://pytorch.org/get-started/locally/ 获取最新安装命令。 # 例如对于 CUDA 11.8 pip3 install torch torchvision torchaudio --index-url https://download.pytorch.org/whl/cu118 # 4. 安装 llama-cpp-python用于后续的 GGUF 转换和推理推荐使用 GPU 加速版 # 先安装 cmake sudo apt install -y cmake # 使用 cuBLAS 后端编译安装以启用 GPU 加速 CMAKE_ARGS-DGGML_CUDAon pip3 install llama-cpp-python --force-reinstall --upgrade --no-cache-dir完成以上步骤你的基础环境就准备好了。接下来我们将进入核心环节使用 LLaMA-Factory 进行微调。4. 使用 LLaMA-Factory 进行模型微调我们将以微调一个Qwen2.5-7B-Instruct模型让其适应“技术文档问答”场景为例演示完整流程。4.1 获取 LLaMA-Factory 与基础模型首先克隆 LLaMA-Factory 仓库并安装其依赖。# 克隆项目 git clone https://github.com/hiyouga/LLaMA-Factory.git cd LLaMA-Factory # 安装项目依赖推荐使用虚拟环境 pip3 install -r requirements.txt # 安装额外用于训练和推理的依赖 pip3 install transformers datasets accelerate sentencepiece protobuf scipy peft接下来我们需要下载要微调的基础模型。你可以从 Hugging Face Model Hub 下载。这里以Qwen2.5-7B-Instruct为例。# 在 LLaMA-Factory 项目外创建一个目录存放模型 cd ~ mkdir -p models cd models # 使用 huggingface-cli 下载需先登录huggingface-cli login # 或者直接使用 git lfs git lfs install git clone https://huggingface.co/Qwen/Qwen2.5-7B-Instruct # 如果下载慢可以考虑使用镜像站或者先下载到本地再上传到服务器。4.2 准备微调数据LLaMA-Factory 支持多种数据格式最常用的是alpaca格式JSON和sharegpt格式。我们以简单的alpaca格式为例创建一个技术问答数据集。创建一个文件~/data/tech_doc_qa.json内容如下[ { instruction: 在 Linux 中如何查看当前目录下所有文件的详细列表包括隐藏文件, input: , output: 可以使用 ls -la 命令。其中 -l 表示长格式显示详细信息-a 表示显示所有文件包括以点开头的隐藏文件。 }, { instruction: 解释 Docker 容器和虚拟机的主要区别。, input: , output: 主要区别在于架构和资源开销\n1. **虚拟机**在每个 VM 中运行完整的客户操作系统通过 Hypervisor 虚拟化硬件。开销大启动慢。\n2. **Docker容器**与主机共享操作系统内核将应用及其依赖打包在隔离的进程中。开销小启动快更轻量。 }, { instruction: 如何在 Python 的 requests 库中处理 HTTPS 证书验证, input: , output: 可以通过 verify 参数控制。\n- 默认验证requests.get(https://example.com, verifyTrue)\n- 忽略证书验证不安全仅用于测试requests.get(https://example.com, verifyFalse)\n- 指定自定义 CA 证书包requests.get(https://example.com, verify/path/to/cert.pem) } ]这是一个极简的示例实际微调需要数百甚至上千条高质量数据。数据质量直接决定微调效果。4.3 启动 Web UI 进行微调推荐新手LLaMA-Factory 的 Web UI 非常直观是快速上手的最佳方式。# 在 LLaMA-Factory 目录下 cd ~/LLaMA-Factory # 启动 Web UI指定主机和端口 python3 src/train_web.py --host 0.0.0.0 --port 7860在浏览器中访问http://你的服务器IP:7860。模型在“模型”标签页选择“模型路径”点击文件夹图标找到你下载的基础模型路径如/home/yourname/models/Qwen2.5-7B-Instruct。训练切换到“训练”标签页。数据集选择“新增数据集”填写数据集名称如tech_qa在“训练文件”中上传或选择你准备好的tech_doc_qa.json文件。训练类型选择lora参数高效节省显存。微调方法保持默认的lora。模板选择qwen2.5必须与基础模型匹配。学习率可以保持默认如5e-5。最大样本数根据你的数据量调整我们示例数据少可以填100。最大序列长度根据模型能力设置Qwen2.5-7B可设2048或4096。设备选择你有 GPU 的选项如cuda:0。开始训练点击“开始”按钮。你可以在“输出”区域看到训练日志。训练完成后LoRA 权重会默认保存在./saves/Qwen2.5-7B-Instruct/lora/tech_qa这样的目录下。4.4 使用 CLI 进行微调适合自动化对于需要复现或集成的场景命令行更合适。创建一个训练配置文件train_qlora.yaml# train_qlora.yaml model_name_or_path: /home/yourname/models/Qwen2.5-7B-Instruct dataset: tech_qa data_files: - /home/yourname/data/tech_doc_qa.json template: qwen2.5 finetuning_type: lora lora_target: all output_dir: ./saves/qwen_tech_lora overwrite_cache: true per_device_train_batch_size: 2 gradient_accumulation_steps: 4 lr_scheduler_type: cosine logging_steps: 10 save_steps: 100 learning_rate: 5e-5 num_train_epochs: 3 max_samples: 100 max_length: 2048 quantization_bit: 4 # 使用 QLoRA4bit量化进一步降低显存需求 fp16: true然后运行训练命令cd ~/LLaMA-Factory python3 src/train_bash.py \ --stage sft \ --do_train \ --model_name_or_path /home/yourname/models/Qwen2.5-7B-Instruct \ --dataset_dir /home/yourname/data \ --dataset tech_doc_qa \ --template qwen2.5 \ --finetuning_type lora \ --lora_target all \ --output_dir ./saves/qwen_tech_lora \ --overwrite_cache \ --per_device_train_batch_size 2 \ --gradient_accumulation_steps 4 \ --lr_scheduler_type cosine \ --logging_steps 10 \ --save_steps 100 \ --learning_rate 5e-5 \ --num_train_epochs 3 \ --max_samples 100 \ --max_length 2048 \ --quantization_bit 4 \ --fp16训练完成后你会在./saves/qwen_tech_lora目录下找到适配器权重文件如adapter_model.safetensors和配置文件。5. 将微调后的模型转换为 Ollama 格式这是连接微调和部署的核心步骤。Ollama 不能直接使用 LoRA 权重需要先将 LoRA 权重与基础模型合并然后转换成 GGUF 格式。5.1 合并 LoRA 权重到基础模型LLaMA-Factory 提供了导出脚本可以将 LoRA 权重合并并导出为完整的 Hugging Face 格式模型。cd ~/LLaMA-Factory # 使用 export_model.py 脚本进行合并导出 # 假设你的 LoRA 权重保存在 ./saves/qwen_tech_lora python3 src/export_model.py \ --model_name_or_path /home/yourname/models/Qwen2.5-7B-Instruct \ --adapter_name_or_path ./saves/qwen_tech_lora \ --template qwen2.5 \ --finetuning_type lora \ --export_dir ./merged_models/qwen2.5-7b-tech \ --export_size 2 \ --export_legacy_format false关键参数解释--model_name_or_path: 原始基础模型路径。--adapter_name_or_path: 训练得到的 LoRA 权重路径。--export_dir: 合并后模型的输出目录。--export_size: 指定导出模型的精度2表示 FP16半精度在精度和文件大小间取得平衡。也可选4INT4等。--export_legacy_format: 设为false以导出为 transformers 库直接可加载的格式。执行成功后./merged_models/qwen2.5-7b-tech目录下就是一个完整的、包含了微调后权重的 Hugging Face 模型。5.2 将 Hugging Face 模型转换为 GGUF 格式我们需要使用llama.cpp项目中的convert.py脚本进行转换。首先安装llama.cpp。# 克隆 llama.cpp 仓库 cd ~ git clone https://github.com/ggerganov/llama.cpp.git cd llama.cpp # 编译项目启用 GPU 支持 make LLAMA_CUBLAS1 # 安装 Python 依赖 pip3 install -r requirements.txt现在使用convert.py将我们合并后的模型转换为 GGUF 格式。GGUF 是llama.cpp使用的格式Ollama 也基于此。# 在 llama.cpp 目录下操作 cd ~/llama.cpp # 运行转换脚本 python3 convert.py \ ~/LLaMA-Factory/merged_models/qwen2.5-7b-tech \ --outtype f16 \ --outfile ~/models/qwen2.5-7b-tech.gguf参数解释第一个参数输入的 Hugging Face 模型目录。--outtype: 指定输出量化类型。f16表示 FP16保持较高精度。如果你想获得更小的模型文件以在 CPU 上运行可以考虑q4_04位整数量化或q8_08位整数量化。但量化会带来一定的精度损失。--outfile: 输出的 GGUF 文件路径。转换完成后你就得到了一个关键的qwen2.5-7b-tech.gguf文件。这个文件就是 Ollama 可以直接加载的模型权重文件。6. 创建 Ollama Modelfile 并运行模型Ollama 通过一个名为Modelfile的配方文件来定义如何构建和运行一个模型。我们需要为我们的微调模型创建这个文件。6.1 编写 Modelfile在~/models目录下创建Modelfile.qwen-tech文件# ~/models/Modelfile.qwen-tech FROM ~/models/qwen2.5-7b-tech.gguf # 设置模型的对话模板。这是关键必须与微调时使用的模板匹配 TEMPLATE {{- if .System }}|im_start|system {{ .System }}|im_end| {{- end }} |im_start|user {{ .Prompt }}|im_end| |im_start|assistant # 设置系统提示词可以引导模型行为 SYSTEM 你是一个专业的IT技术支持助手精通Linux运维、编程和云计算。请用准确、清晰、简洁的语言回答用户的问题。 # 模型参数设置 PARAMETER temperature 0.7 PARAMETER top_p 0.9 PARAMETER num_predict 2048重要提示TEMPLATE字段是最容易出错的地方。它必须与原始模型Qwen2.5的对话格式以及你在 LLaMA-Factory 微调时指定的模板qwen2.5严格一致。格式错误会导致模型输出乱码或无法理解指令。上述模板是 Qwen2.5-Instruct 系列的标准模板。6.2 使用 Ollama 创建并运行模型首先确保 Ollama 已经安装。这里我们使用 Docker 方式安装和运行最为简洁。# 1. 安装 Docker如果尚未安装 curl -fsSL https://get.docker.com -o get-docker.sh sudo sh get-docker.sh sudo usermod -aG docker $USER newgrp docker # 或重新登录终端 # 2. 拉取 Ollama 官方镜像并运行服务 docker run -d \ --name ollama \ -p 11434:11434 \ -v ~/.ollama:/root/.ollama \ -v ~/models:/models \ ollama/ollama # 检查容器是否运行 docker ps | grep ollama现在进入容器内部使用我们创建的Modelfile来构建一个 Ollama 模型。# 进入容器 docker exec -it ollama bash # 在容器内切换到挂载的模型目录 cd /models # 使用 ollama create 命令从 Modelfile 创建模型命名为 qwen-tech ollama create qwen-tech -f ./Modelfile.qwen-tech # 创建成功后运行模型进行测试 ollama run qwen-tech如果一切顺利你会看到提示符现在可以输入问题测试了例如输入“如何查看 Linux 隐藏文件”看看模型的回答是否与你微调数据中的一致。6.3 通过 API 访问模型Ollama 服务在后台运行时提供了兼容 OpenAI 的 API。这意味着你可以使用任何 OpenAI SDK 来调用你的私有模型。退出容器的交互模式按 CtrlD模型服务仍在后台运行。现在我们可以在宿主机上使用curl或 Python 脚本进行测试。# 在宿主机上使用 curl 调用 API curl http://localhost:11434/api/generate -d { model: qwen-tech, prompt: 解释 Docker 容器和虚拟机的主要区别。, stream: false }更常见的是在 Python 项目中使用就像调用 OpenAI 一样# test_ollama_api.py from openai import OpenAI # 注意base_url 指向本地 Ollama 服务api_key 可任意填写非空即可 client OpenAI( base_urlhttp://localhost:11434/v1, api_keyollama, # 可以是任意字符串 ) response client.chat.completions.create( modelqwen-tech, messages[ {role: system, content: 你是一个专业的IT技术支持助手。}, {role: user, content: 如何在 Python 的 requests 库中处理 HTTPS 证书验证} ], streamFalse, temperature0.7, ) print(response.choices[0].message.content)运行这个 Python 脚本你应该能得到符合微调内容的回答。至此你已经完成了从微调到私有化部署的完整闭环。7. 常见问题与排查思路在实际操作中你几乎一定会遇到一些问题。下表列出了从微调到部署全流程中最常见的“坑”及其解决方法。问题现象可能原因排查方式解决方案训练时 CUDA Out of Memory1. 批次大小太大。2. 模型太大显存不足。3. 未使用量化或 LoRA。1. 观察nvidia-smi显存占用。2. 检查训练脚本中的per_device_train_batch_size。1. 减小per_device_train_batch_size。2. 启用--quantization_bit 4(QLoRA)。3. 使用更小的模型如 7B-3B。4. 使用梯度累积 (gradient_accumulation_steps)。LLaMA-Factory Web UI 无法访问1. 防火墙或安全组未开放端口。2. 命令中未指定--host 0.0.0.0。3. 服务未成功启动。1.netstat -tlnp | grep 7860查看端口监听。2. 检查命令行输出有无错误。1. 确保命令包含--host 0.0.0.0。2. 检查服务器防火墙设置sudo ufw allow 7860。3. 查看进程日志。模型转换失败Unrecognized model1. 模型路径错误。2. 模型架构不被llama.cpp的convert.py支持。3. 模型文件不完整。1. 确认路径存在且是 Hugging Face 格式目录。2. 查看convert.py的错误信息。1. 使用ls -la确认路径。2. 确保使用最新版llama.cpp。3. 尝试用--outtype q8_0等不同量化类型。Ollama 创建模型失败invalid templateModelfile中的TEMPLATE格式错误与模型不匹配。对比原始模型的官方文档或 tokenizer_config.json 中的聊天模板。修正TEMPLATE。对于 Qwen2.5使用上文提供的模板。对于其他模型查找其官方示例。Ollama run 时输出乱码或胡言乱语1.TEMPLATE错误最常见。2. 系统提示词与微调数据冲突。3. 模型文件在转换或合并过程中损坏。1. 首先检查TEMPLATE。2. 尝试在Modelfile中注释掉SYSTEM行。3. 用原始基础模型的 GGUF 文件测试。1. 严格校正TEMPLATE。2. 简化SYSTEM提示词或留空。3. 重新执行合并和转换步骤。API 调用返回 404 或连接拒绝1. Ollama 服务未运行。2. 端口被占用或映射错误。3. Docker 容器未启动。1.docker ps检查容器状态。2.curl http://localhost:11434/api/tags测试基础 API。1. 重启容器docker restart ollama。2. 检查 Docker 命令的端口映射-p 11434:11434。3. 查看容器日志docker logs ollama。API 响应速度极慢1. 模型在 CPU 上运行。2. 使用了高精度如 f16的大模型硬件性能不足。3. 未启用 GPU 加速。1. 进入容器运行ollama run时观察是否有GPU字样。2. 使用nvidia-smi查看 GPU 是否被 Ollama 进程使用。1. 确保宿主机有 NVIDIA GPU 并安装了驱动。2. 确保启动 Docker 容器时加载了 GPU 运行时需添加--gpus all参数。3. 考虑使用量化程度更高的 GGUF 文件如q4_0。8. 最佳实践与工程建议将技术跑通只是第一步要将其用于实际项目还需要遵循一些工程最佳实践。数据质量至上微调的效果 80% 取决于数据。确保你的数据准确无误指令和输出必须正确。格式一致严格遵循你选择的模板格式。覆盖场景尽可能覆盖你期望模型处理的所有问题类型。规模适中对于领域适配几百到几千条高质量数据往往比数万条噪声数据更有效。版本化管理一切数据将微调数据集放入 Git 仓库或版本化存储。配置将 LLaMA-Factory 的训练配置YAML 文件和 Ollama 的Modelfile纳入版本控制。脚本将数据预处理、训练、转换、部署的步骤编写成 Shell 或 Python 脚本实现一键化流水线。建立模型评估流程 微调后不要只凭感觉测试。构建一个小的评估集Eval Set包含未见过的测试问题用脚本批量调用模型 API 并评估回答质量。可以结合精确匹配、BLEU 分数或使用 GPT-4 作为裁判进行评分。Ollama 生产部署资源限制在 Docker 运行命令中使用--cpus、--memory、--gpus限制容器资源防止单个模型吃光所有资源。高可用对于关键服务考虑使用 Docker Compose 或 Kubernetes 部署多个 Ollama 实例并通过 Nginx 等做负载均衡。监控为 Ollama 服务添加监控如 Prometheus Grafana关注请求延迟、错误率和 GPU 利用率。安全Ollama API 默认无认证。在生产环境暴露时务必在前端配置 API 网关如 Kong, APISIX进行认证、限流和审计。模型优化与量化策略推理优化在创建Modelfile时可以调整PARAMETER num_ctx上下文长度和PARAMETER num_gpu使用的 GPU 层数来平衡速度和内存。量化选择GGUF 格式支持多种量化级别。权衡速度、内存和精度q4_0高压缩速度快内存占用小精度损失相对明显。q8_0较好的精度和速度平衡。f16原始半精度精度最高文件大速度慢。 建议为同一模型保留不同量化版本开发调试用f16生产部署用q4_0或q8_0。通过本文的梳理你应该已经掌握了使用 LLaMA-Factory 微调大模型并将其转化为可通过 Ollama 便捷部署的私有化服务的完整技能链。这套组合拳的核心优势在于标准化和自动化它将开源大模型的应用门槛从“算法研究员”降低到了“全栈开发者”甚至“运维工程师”的层面。你可以基于此流程为自己的知识库、客服系统、代码助手等场景打造定制化的 AI 能力。接下来你可以探索如何将这套流程与你的 CI/CD 系统集成实现模型的自动化训练、评估和部署真正让 AI 能力成为你业务中稳定、可控的一环。
返回列表