ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

Transformers 快速上手:3 个真实例子跑通文本生成、图像分类与语音识别

Transformers 快速上手:3 个真实例子跑通文本生成、图像分类与语音识别 Transformers 快速上手3 个真实例子跑通文本生成、图像分类与语音识别【免费下载链接】transformers Transformers: the model-definition framework for state-of-the-art machine learning models in text, vision, audio, and multimodal models, for both inference and training.项目地址: https://gitcode.com/GitHub_Trending/tra/transformers你想在自己的项目里用 GPT、Whisper 这类模型却总在环境安装、tokenizer 配置、预处理器调用上卡壳Transformers 是覆盖文本、视觉、音频与多模态模型推理和训练的模型定义框架核心是一个统一入口pipeline一行代码加载预训练模型并自动处理输入输出。读完本文你能在 30 秒内跑通一次文本生成再用 3 个基于仓库真实测试用例的例子完成图像分类和语音转写并知道显存、缓存、示例脚本各坑怎么避。快速上手安装到第一次输出只需 30 秒 先装环境。要求 Python 3.10、PyTorch 2.5建议在虚拟环境里安装pip install transformers[torch] # 需要跟进仓库最新提交时改为从源码安装 # git clone https://gitcode.com/GitHub_Trending/tra/transformers # cd transformers pip install .[torch]装好后三行代码拿到第一次输出模型首次运行自动下载并缓存之后可复用from transformers import pipeline pipe pipeline(tasktext-generation, modelQwen/Qwen2.5-1.5B) print(pipe(the secret to baking a really good cake is ))输出形如[{generated_text: ...is 1) to use the right ingredients and 2) to follow the recipe exactly...}]——预处理、token 生成、解码全部被pipeline包掉了你只给提示词。能力速览一张表看懂 4 个常用任务 pipeline(task, model)的两个参数就是全部抽象任务名决定怎么调模型名决定用什么权重。仓库 README 和测试脚本里最常见的 4 个任务如下模型名均直接取自仓库内真实代码任务类别调用任务名仓库示例模型典型用途文本生成text-generationQwen/Qwen2.5-1.5B续写、对话、问答图像分类image-classificationfacebook/dinov2-small-imagenet1k-1-layer打标签、内容审核语音识别automatic-speech-recognitionopenai/whisper-large-v3会议转写、字幕零样本目标检测zero-shot-object-detectioniSEE-Laboratory/llmdet_large开放词框物体定位背后是上千个模型架构每个架构的定义放在 src/transformers/models/ 下统一的调用与加载逻辑在 src/transformers/pipelines/这是它一次定义、到处复用的来源。实战案例3 个落在仓库测试用例上的真实例子 用自带 COCO 测试图做图像分类问题给一张图让它输出是什么 多大概率。仓库测试目录里自带一张 640x480 的 COCO 图上节沙发上的两只猫多个模型测试如tests/models/beit/test_modeling_beit.py都直接打开这个文件作为输入from transformers import pipeline clf pipeline(taskimage-classification, modelfacebook/dinov2-small-imagenet1k-1-layer) print(clf(tests/fixtures/tests_samples/COCO/000000039769.png))README 的同类用例里第一项输出{label: macaw, score: 0.9978...}第二项置信度 0.0017分数随排名快速衰减——按阈值截取前几项就是可上线的分类结果。零样本检测不训练直接检测任意物体问题想检测猫、遥控器、沙发这种自定义类别又不想标注数据训练。pipeline(zero-shot-object-detection)直接接受文本类别列表仓库的 tests/pipelines/test_pipelines_zero_shot_object_detection.py 用的正是[cat, remote, couch]这组类别——对应的就是上节那张 COCO 图里的内容。返回的每个预测都带score与boxxmin/ymin/xmax/ymax四个坐标按threshold过滤后直接画框即可详见 docs/source/en/tasks/zero_shot_object_detection.md。语音转写一个 URL 换一整段文字问题把音频转成文字。ASR 的 pipeline 可以直接吃音频 URL 或本地文件from transformers import pipeline asr pipeline(taskautomatic-speech-recognition, modelopenai/whisper-large-v3) print(asr(https://huggingface.co/datasets/Narsil/asr_dummy/resolve/main/mlk.flac))README 给出的真实输出是{text: I have a dream that one day this nation will rise up and live out the true meaning of its creed.}——输入一个 flac 文件返回整句转写文本。进阶与源码导览常用配置项与目录地图 ⚙️需要更细的控制时pipeline 透传这些参数dtype如torch.bfloat16省显存、device_mapauto大模型自动切分到多卡、生成类的max_new_tokens、检测分类类的threshold。想脱离高层封装手动加载用 Auto 类对AutoProcessor.from_pretrained(model_name) 对应AutoModelFor...与 processor 配对使用各架构的手动调用写法在 docs/source/en/model_doc/ 下按模型分篇给出。仓库内部结构以相对路径指向src/transformers/pipelines/pipeline 实现src/transformers/generation/生成逻辑src/transformers/trainer.py训练循环tests/全部测试其中 tests/fixtures/tests_samples/COCO/ 存放上文用到的测试图examples/pytorch/分类、检测、摘要等任务训练示例避坑清单 ⚠️环境隔离只支持 Python 3.10 与 PyTorch 2.5用虚拟环境装transformers[torch]不要污染系统 Python。首次运行慢模型权重默认下载并写入缓存目录离线部署要提前规划缓存位置别把下载时间算进接口超时。示例脚本不是成品官方明确 examples 只是参考生产代码应基于pipeline或 Auto 类自行组装数据流。显存不足先降dtype如 bfloat16再加device_mapauto分卡或直接换小一号的模型。检测误报threshold过低会返回一堆低置信框先按分数排序再过滤别直接全画出来。Transformers 让换模型变成换一个模型名同一套 pipeline 定义跨文本、视觉、音频与多模态复用从推理切到训练、从 PyTorch 切到其他框架都不用重写模型代码。【免费下载链接】transformers Transformers: the model-definition framework for state-of-the-art machine learning models in text, vision, audio, and multimodal models, for both inference and training.项目地址: https://gitcode.com/GitHub_Trending/tra/transformers创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表