ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

Unsloth 微调 构建自己的大模型 没有GPU也能微调

Unsloth 微调 构建自己的大模型 没有GPU也能微调 这次我们使用unsloth框架来微调模型将模型微调成一个垂直领域的模型先说问题This environment is externally managed ╰─ To install Python packages system-wide, try apt install python3-xyz, where xyz is the package you are trying to install.从 Python 3.11 开始一些 Debian/Ubuntu 系统默认启用保护机制——目的是保护系统级的 Python 环境这个问题主要是 系统不再允许使用 pip 直接安装全局包我们需要用虚拟环境安装sudo apt update sudo apt install python3-venv根目录执行 python3 -m venv .venv然后再根目录会生成一个.venv/ 的文件夹安装时指定环境目录.venv/bin/pip3 install 包名 .venv/bin/python3 脚本.py 于是安装就变成了 .venv/bin/pip3 install unsloth也可以使用激活python环境来安装这样就不用指定目录但是记得安装完要关闭环境source .venv/bin/activate pip3 install 包名 python3 脚本.py deactivate安装CPU版PyTorch官方安装 一般比较慢 pip3 install torch torchvision torchaudio --index-url https://download.pytorch.org/whl/cpu 国内镜像安装 pip3 install torch torchvision torchaudio --index-url https://download.pytorch.org/whl/cpu -i https://pypi.tuna.tsinghua.edu.cn/simple 如果需要指定特殊版本 pip3 install torch2.4.0cpu torchvision0.19.0cpu torchaudio2.4.0 --index-url https://download.pytorch.org/whl/cpu验证CPU安装成功python3 -c import torch; print(fVersion: {torch.__version__}); print(fCUDA Available: {torch.cuda.is_available()}); print(fCUDA Build: {torch.version.cuda}); x torch.rand(2,2); print(fDevice: {x.device}) 大概输出 Version: 2.4.0cpu CUDA Available: False CUDA Build: None Device: cpu 如果出现的是 PyTorch Version: 2.14.1cu130 这个cu130意思是CUDA 13.0 的 GPU 加速版本 需要重新安装CPU版本的PyTorch安装unslothpip3 install --upgrade pip pip3 install unsloth unsloth_zoo如果设备没有GPU使用CPU进行微调则会出现以下问题raise NotImplementedError(Unsloth cannot find any torch accelerator? You need a GPU.) NotImplementedError: Unsloth cannot find any torch accelerator? You need a GPU.只使用CPU进行微调需要这样安装unslothpip3 install --upgrade pip apt-get update apt-get install -y git pip3 install unsloth[colab-new] githttps://github.com/unslothai/unsloth.git -U pip3 install bitsandbytes0.44.0 --force-reinstall 如果安装不成功使用以下方法 pip3 install --upgrade pip git clone https://github.com/unslothai/unsloth.git cd unsloth pip3 install .[colab-new] --no-deps pip3 install .[cpu] pip3 install trl0.12.2 peft0.13.2 accelerate1.2.1 bitsandbytes0.44.0bitsandbytes在CPU模式下必须使用0.44.2或更低版本高版本如0.45移除了CPU支持会导致ImportError: cannot import name MatmulLtState如遇此错请降级强制重装 pip3 install bitsandbytes0.44.0 --force-reinstall如果依然出现这个错误需要重装CPU版本的PyTorch说明安装时候是GPU版本raise NotImplementedError(Unsloth cannot find any torch accelerator? You need a GPU.) NotImplementedError: Unsloth cannot find any torch accelerator? You need a GPU.验证安装成功python3 -m unsloth能看到版本和欢迎信息就说明核心部分已经就绪微调#引入依赖 from unsloth import FastLanguageModel, is_bfloat16_supported from transformers import TrainingArguments from trl import SFTTrainer from datasets import load_dataset #加载模型 max_seq_length 8192 # 模型处理文本的最大长度 model, tokenizer FastLanguageModel.from_pretrained( model_name ckpts/qwen-1.5b, max_seq_length max_seq_length, dtypeNone, # 自动检测合适的类型 load_in_4bit True, # device_mapbalanced # 多卡训练时均衡分布模型权重默认为sequential )垂直领域举例娱乐运势模型# 定义训练数据格式化字符串模板 train_prompt_style请遵循指令回答用户问题。 在回答之前请仔细思考问题并创建一个逻辑连贯的思考过程以确保回答准确无误。 ### 指令: 你是一位精通八字算命、紫微斗数、风水、易经卦象、塔罗牌占卜、星象、面相手相和运势预测等方面的算命大师。 请回答以下算命问题。 ### 问题: {} ### 回答: think{}/think {} # 加载数据集 dataset load_dataset(data/fortune-telling, splittrain) def formatting_data(examples): questions examples[Question] cots examples[Complex_CoT] responses examples[Response] texts [] for q, c, r in zip(questions, cots, responses): text train_prompt_style.format(q, c, r) tokenizer.eos_token texts.append(text) return {text: texts} dataset dataset.map(formatting_data, batchedTrue) 添加 LoRA 权重 model FastLanguageModel.get_peft_model( model, r 16, # Rank of the LoRA matrix target_modules [q_proj, k_proj, v_proj, o_proj, gate_proj, up_proj, down_proj,], # Layers to apply LoRA to lora_alpha 16, # LoRA alpha value lora_dropout 0, # Supports any, but 0 is optimized防止过拟合0 表示不drop任何参数 bias none, # Supports any, but none is optimized use_gradient_checkpointing unsloth, # True or unsloth for very long context random_state 3407, use_rslora False, # We support rank stabilized LoRA loftq_config None, # And LoftQ ) #定义 trainer trainer SFTTrainer( model model, tokenizer tokenizer, train_dataset dataset, dataset_text_field text, max_seq_length max_seq_length, dataset_num_proc 2, packing False, # Can make training 5x faster for short sequences. args TrainingArguments( per_device_train_batch_size 2, # 每个GPU上的batch size gradient_accumulation_steps 4, # 梯度累积步数 warmup_steps 10, # max_steps 200, # 最大训练步数 num_train_epochs3, # 训练轮数 和 max_steps 二选一 learning_rate 2e-4, # 学习率默认值是 2.0e-5 fp16 not is_bfloat16_supported(), bf16 is_bfloat16_supported(), logging_steps 2, output_dir outputs, optim adamw_8bit, seed 3407, ), ) #开始训练 train_stats trainer.train() #模型保存 model.save_pretrained(ckpts/lora_model) tokenizer.save_pretrained(ckpts/lora_model) #注这里只会保存 LoRA 权重在adapter_config.json会指定原始模型位置Unsloth 会根据加载的模型和设备情况自动选择 GPU 数量。默认device_mapsequential只有当单卡显存不够时才占用其他卡如果device_mapbalanced会占用所有卡并均衡分布模型权重# 模型测试 # 加载模型 model, tokenizer FastLanguageModel.from_pretrained( model_name ckpts/lora_model, max_seq_length max_seq_length, load_in_4bit True, ) FastLanguageModel.for_inference(model) question 1995年七月初十生今年是2025年了解未来五年的运势 inputs tokenizer([prompt_style.format(question)], return_tensorspt, max_lengthmax_seq_length).to(cuda) outputs model.generate(inputs[input_ids], attention_maskinputs[attention_mask], max_lengthmax_seq_length, use_cacheTrue) answer tokenizer.batch_decode(outputs, skip_special_tokensTrue)[0] print(answer)如果单卡放不下模型权重会报错因为模型权重切分了但 inputs 并没有切分这篇文章写的有点复杂而且由于只是用CPU进行微调所以在匹配上会出现各种各样的问题如果大家有任何问题欢迎留言讨论
返回列表