ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

lm-evaluation-harness 如何用 vLLM 后端评估模型并配置 tensor_parallel_size 与 data_parallel_size

lm-evaluation-harness 如何用 vLLM 后端评估模型并配置 tensor_parallel_size 与 data_parallel_size lm-evaluation-harness 如何用 vLLM 后端评估模型并配置 tensor_parallel_size 与 data_parallel_size【免费下载链接】lm-evaluation-harnessA framework for few-shot evaluation of language models.项目地址: https://gitcode.com/GitHub_Trending/lm/lm-evaluation-harnesslm-evaluation-harness 支持用 vLLM 作为推理后端来跑评估任务适用于模型跑在单卡或多卡上、希望利用 vLLM 加速推理的场景。本文覆盖一条完整的操作路径安装 vLLM 后端依赖、用--model vllm发起评估、通过--model_args配置tensor_parallel_size把单个模型切到多张 GPU和data_parallel_size跑多份模型副本并行分数据最后说明如何验证结果、以及这两个参数各自附带的硬性限制。准备条件安装 vLLM 后端基础安装提供核心评估框架模型后端需要单独安装。安装方式见 README.mdgit clone --depth 1 https://github.com/EleutherAI/lm-evaluation-harness cd lm-evaluation-harness pip install -e .再安装 vLLM 后端依赖pyproject.toml 中该 extra 要求vllm0.18pip install lm_eval[vllm]如果之后要使用data_parallel_size1还需要额外安装 ray见后文说明pip install rayvLLM 后端支持的模型类型是 vLLM 所支持的绝大多数 HF Causal Language Models具体支持列表以 vLLM 官方文档为准vLLM 后端支持generate_until、loglikelihood、loglikelihood_rolling三类请求。基本用法单卡跑一次 vLLM 评估--model_args用keyval,key2val2的形式传参其中pretrained是必填的模型名或本地路径。docs/interface.md 给出的 vLLM 示例lm-eval run --model vllm \ --model_args pretrainedEleutherAI/gpt-j-6B \ --tasks arc_easy,arc_challenge \ --num_fewshot 5这里--model_args中省略了tensor_parallel_size和data_parallel_size因为 vllm_causallms.py 中两者的构造函数默认值都是1即默认就是单卡单副本运行。正式跑任务前可以先用--limit只抽少量样例验证流程该参数文档标注 For testing only不要用于正式评估lm-eval run --model vllm \ --model_args pretrainedEleutherAI/gpt-j-6B \ --tasks gsm8k \ --limit 10 \ --log_samples \ --output_path ./results/smokeREADME 建议对生成类任务先用--limit 10检查若干样本输出确认答案抽取与打分符合预期再跑全量。--log_samples会保存模型输入/输出供事后分析--output_path写入结果不传--output_path时结果只打印到标准输出。配置 tensor_parallel_size把模型切到多张 GPUREADME 中 vLLM 的完整示例命令原文使用了{...}占位符下面已替换为具体值{model_name}、{GPUs_per_model}、{model_replicas}分别对应模型名、每个模型副本占用的 GPU 数、副本数lm_eval --model vllm \ --model_args pretrainedEleutherAI/gpt-j-6B,tensor_parallel_size2,dtypeauto,gpu_memory_utilization0.8,data_parallel_size1 \ --tasks lambada_openai \ --batch_size auto参数用途说明均按文档字面tensor_parallel_size每个模型副本的张量并行度即模型权重切分到几张 GPU 上默认1。data_parallel_size模型副本数默认1。dtypeautodtype的默认值就是auto这里显式写出与文档示例保持一致。gpu_memory_utilization0.8透传给 vLLMLLM构造器的参数文档示例中取0.8。vLLM 后端的--model_args中除已知参数外的任意键值都会透传给 vLLM 的LLM构造函数self.model_args.update(kwargs)所以 vLLM 支持的引擎参数都可以这样传。两点需要注意不要给 vLLM 后端传--device。vllm_causallms.py 中检测到device参数时会打警告并丢弃提示改用CUDA_VISIBLE_DEVICES环境变量在运行前指定 vLLM 可用的 GPU。--batch_size auto是文档推荐的 vLLM 用法用于利用 vLLM 的 continuous batching对data_parallel_size1则是强制要求见下节。配置 data_parallel_size多副本并行分数据把上面的命令改为data_parallel_size2即启动两个模型副本每个副本各占tensor_parallel_size张 GPU请求以交错方式分发到各副本源码中的分发逻辑见 vllm_causallms.py 的_model_generate。例如 4 张 GPU 上跑 2 个 TP2 的副本lm_eval --model vllm \ --model_args pretrainedEleutherAI/gpt-j-6B,tensor_parallel_size2,dtypeauto,gpu_memory_utilization0.8,data_parallel_size2 \ --tasks lambada_openai \ --batch_size autodata_parallel_size1的硬性条件与行为全部来自 README 和 vllm_causallms.py必须已安装 ray否则启动时直接抛ModuleNotFoundErrordata_parallel_size1时每个副本被调度为独立的 ray actor每个 actor 通过num_gpustensor_parallel_size预留 GPU。缺 ray 时的报错信息即ray is required for data parallelism. Please install ray using pip install ray。手动 batch size 与数据并行不兼容源码在data_parallel_size1时会把 batch size 强制改为auto并打印Manual batching is not compatible with data parallelism.因此命令中应使用--batch_size auto。权重下载提示开启数据并行时源码会打印警告——权重尚未下载缓存时可能出现下载问题建议先用data_parallel_size1跑一次把权重下载缓存下来再切到data_parallel_size1。与enable_expert_parallel互斥data_parallel_size1且传入enable_expert_parallelTrue会抛ValueError报错信息建议改为tensor_parallel_size1搭配data_parallel_size1。GPU 总量要满足data_parallel_size × tensor_parallel_size否则 ray 会因预留不出 GPU 而失败——这一点由 ray actor 的num_gpus预留机制决定配置前先算好卡数。结果验证确认 vLLM 与 HuggingFace 结果一致README 明确说明 vLLM 偶尔会与 HuggingFace 输出不一致项目把 HuggingFace 当作参考实现并提供 scripts/model_comparator.py 用于核对 vLLM 结果的有效性。脚本内部对同一模型分别用vllm和hf后端跑相同任务然后对acc,none与acc_stderr,none做双尾 z 检验输出每个任务的 HF/vLLM 准确率、z-score、p-value以及 p-value 是否大于显著性水平默认--alpha 0.05。脚本参数默认值--pretrained EleutherAI/pythia-70m、--tasks arc_easy,hellaswag、--limit 100、--device cuda、--batch 8。按文档中的用法跑一次核对python scripts/model_comparator.py \ --pretrained EleutherAI/pythia-70m \ --tasks arc_easy,hellaswag \ --limit 100核对时看输出表格中p 0.05列p-value 大于alpha表示两个后端的准确率差异在统计上不显著。注意该脚本要求环境同时具备 hf 与 vLLM 后端依赖lm_eval[hf]与lm_eval[vllm]并且会先后跑两遍评估、显存占用较高。日常跑任务时的验证路径用--output_path保存结果、--log_samples保留样本检查指标量级是否与同模型 HF 后端的历史结果一致对生成类任务再用--limit 10抽看原始生成文本。性能与内存相关的调参项README 给出的两条针对 vLLM 的建议尽可能用--batch_size auto利用 continuous batching 获得最快性能。通过--model_args传max_model_len4096或其他合理值可能带来加速或在使用自动 batch size 时避免 OOM。文档给出的例子是 Mistral-7B-v0.1 默认最大长度 32k此时设置max_model_len4096有助于规避 OOMlm_eval --model vllm \ --model_args pretrainedEleutherAI/gpt-j-6B,tensor_parallel_size2,dtypeauto,max_model_len4096 \ --tasks lambada_openai \ --batch_size auto注意源码中max_length与max_model_len二者只能传其一同时传会触发 assert 报错。限制汇总vLLM 后端的--device参数无效GPU 选择靠CUDA_VISIBLE_DEVICES。data_parallel_size1依赖 ray、强制batch_sizeauto且与enable_expert_parallel互斥。项目文档声明目前不原生支持多节点评估README 中的多节点说明针对 hf 后端建议外部部署推理服务或自行做分布式集成因此tensor_parallel_size/data_parallel_size都是单机多卡内的切分方式。更细的 vLLM 参数行为以 vLLM 官方文档为准本仓库内实现细节可查看 lm_eval/models/vllm_causallms.py。【免费下载链接】lm-evaluation-harnessA framework for few-shot evaluation of language models.项目地址: https://gitcode.com/GitHub_Trending/lm/lm-evaluation-harness创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表