
Ultralytics 平台数据管理全指南数据集上传、标注、分析与版本化实战【免费下载链接】ultralyticsUltralytics YOLO26, YOLO11, YOLOv8 — object detection, instance segmentation, semantic segmentation, image classification, pose estimation, object tracking项目地址: https://gitcode.com/GitHub_Trending/ul/ultralytics本指南系统讲解 Ultralytics 平台Ultralytics PlatformData 版块的数据管理能力覆盖从图片/视频/压缩包上传、URL 与云存储导入、7 类 YOLO 任务的标注与类管理到统计图表、嵌入聚类、NDJSON 版本快照与导出的完整闭环并深入源码解析ul://数据集 URI 在本地与云端训练中的底层解析机制。读完你将掌握如何在平台上一站式完成数据准备并用一套数据集配置从任意环境发起可复现的 YOLO 训练。概述数据准备是视觉模型的基石在构建计算机视觉模型的过程中数据准备直接决定最终精度与迭代效率。Ultralytics 平台将从原始素材到可训练数据集的整条链路整合为一个可视化管理界面核心能力包括上传图片、视频与数据集压缩文件ZIP、TAR含.tar.gz/.tgz、NDJSON从 URL 导入直接粘贴指向压缩包或 NDJSON 导出的直链或从 Roboflow 一键迁移连接云端存储通过 Google Cloud Storage、Amazon S3、Azure Blob Storage 原地使用数据而无需上传副本本地化部署On Premise企业工作区可通过 On Premise 的 CPU/GPU 工作节点让像素数据不出内网智能标注手动绘制工具之外支持基于 SAM 2.1 与新一代 SAM 3 的 SAM 智能标注类Class管理对全数据集的类别进行重命名、重设颜色、合并与删除数据分析提供统计图表、可视化与基于嵌入向量的聚类NDJSON 导出以 Ultralytics NDJSON 格式下载用于本地训练。数据管理核心工作流平台数据集从原始素材到模型训练遵循 Upload → Annotate → Analyze / Train 的流水线阶段说明Upload上传导入图片、视频或压缩归档平台自动完成格式校验、归一化与统计Annotate标注用手动工具标注 detect / segment / semantic / OBB或用 SAM 智能辅助标注Analyze分析查看类别分布、空间热力图、尺寸统计与嵌入聚类散点图Export导出以 NDJSON 格式 下载供离线训练与数据迁移一个数据集在满足三个条件——处理完成、train划分内至少一张图、val或test划分内至少一张图、且至少有一张已标注图片——之后即为训练就绪状态数据集头部会显示Ready徽章否则显示Not Ready点击徽章可查看具体缺失项。支持的 7 类任务与对应标注工具平台数据集覆盖 YOLO 的全部 7 类任务创建数据集时选定任务类型即决定可用的标注工具任务说明标注工具Detect检测边界框目标检测矩形工具Segment实例分割像素级实例掩码多边形工具Semantic语义分割逐类像素区域多边形工具Depth深度估计逐像素公制深度图导入目标图Classify分类图像级分类类别选择器Pose关键点内建与自定义骨架模板的关键点估计关键点工具OBB旋转框面向旋转目标的有向边界框定向框工具任务类型选择提示任务类型在创建数据集时设定并决定可用的标注工具集合。此后可在数据集头部的任务选择器处切换但切换后不兼容的标注不会被展示。注意普通任务间切换会保留每张图片上同时存储的 6 类标注数据而深度任务由于其真值是成对文件而非标注对象因此仅在数据集为空时允许切入或切出详见编辑数据集。关于标注编辑器本身它为 6 类任务分别提供 Rectangle、Polygon、Class Selector、Keypoint、Oriented Box 工具其中 Pose 支持 Person、Hand、Dog、Face、Box 及自定义骨架模板深度数据集的编辑器以只读方式打开因为其真值来自成对的深度图而非人工绘制详见标注编辑器文档。智能存储与数据安全平台对存储的管理策略直接影响数据集质量与账单去重Deduplication同一数据区域内完全相同的图片仅存储一份完整性Integrity上传时校验数据完整性效率Efficiency存储优化且处理快速克隆数据集复用已存图片而非复制字节区域性Regional数据保存在所选区域US、EU、AP。数据集 URIul://任何机器上直接训练平台数据平台数据集可通过标准data参数引用格式为ul://username/datasets/dataset-slug在 CLI 与 Python 中均可用yolo train dataul://username/datasets/my-datasetfrom ultralytics import YOLO model YOLO(yolo26n.pt) model.train(dataul://username/datasets/my-dataset, epochs100)只要本机配置了 API keyul://URI 即可在任何环境使用——本地机器、Google Colab 笔记本、远程云服务器均可数据会自动下载。直接粘贴平台数据集或模型的网页 URL如https://platform.ultralytics.com/username/datasets/dataset-slug也会被自动改写成ul://URI。还可以传入数据集列表让一个基础模型在多个数据集上串行微调model.train(data[ul://username/datasets/a, ul://username/datasets/b])。源码层面ul://是如何被解析的从源码结构看ul://的整条解析链路在训练基础设施中被完整打通支持它的关键函数集中在 ultralytics/utils/checks.pyURI 归一化normalize_platform_uri()把形如https://platform.ultralytics.com/user/datasets/slug的网页 URL 重写为ul://user/datasets/slug否则原样返回鉴权换取签名 URLresolve_platform_uri()按parts[1] datasets判断资源类型——数据集走datasets/{username}/{slug}/export端点换取 NDJSON 文件的签名 URL模型则走models/{username}/{project}/{model}/download端点换取.pt签名 URL。请求头携带Authorization: Bearer api_key其中 api_key 取ULTRALYTICS_API_KEY环境变量或SETTINGS中的api_key缺失时会抛出明确错误下载与本地缓存check_file()处理ul://前缀的文件请求将解析出的签名 URL 下载到按user/dataset/slug组织的唯一目录结构中对.ndjson数据集会每次重新下载成本低确保拿到数据更新后的最新版本格式转换convert_ndjson_to_yolo_if_needed()识别.ndjson结尾或含/datasets/的ul://数据异步调用convert_ndjson_to_yolo转成本地 YOLO 目录结构后再交给训练流程训练时序保障在 ultralytics/engine/trainer.py 中on_pretrain_routine_start回调特意在get_dataset()之前运行以保留原始args.data即ul://URI确保云训练上报等平台回调拿到的是未转换的 URI。数据集版本化可复现训练的前提版本化功能允许你为数据集创建不可变的 NDJSON 快照每个版本在创建时刻记录图像数、类别数与标注数从而支撑完全可复现的训练实验。每个版本按 v1、v2、v3… 顺序编号创建后不可编辑或删除仅描述可修改随时可下载或一键还原。完整操作见数据集管理文档的 Versions Tab。关键约束与建议还原操作会用快照整体替换当前数据集的图片、划分、类与标注且不可撤销——除非先为当前状态另存一个版本。数据集在重建期间处于processing锁定状态在云训练对话框中开启Save Dataset Version可把模型与训练时使用的精确数据集版本绑定数据未变化时平台复用已有版本变化时才新建版本建议在重大变更新增图片、修正标注、重排划分前后各建一个版本便于横向比较模型性能版本功能仅在数据集进入ready状态后可用且不支持 云存储连接型 与 On Premise 数据集快照大小统计的是 NDJSON 导出文件含图片 URL 与标注不含图片字节本身但仍计入工作区存储配额。数据集页面的六个 Tab数据集页面根据数据集状态与权限最多展示六个 TabTab说明Images以网格、紧凑或表格视图浏览图片带标注叠加层Classes查看、重命名、换色、合并、删除类显示逐类标注计数Charts自动统计划分分布、类计数、热力图等Models基于该数据集训练出的模型及其指标与状态Versions创建、下载、还原不可变 NDJSON 快照保证可复现性Errors处理失败的图片附错误详情与修复指引Tab 显隐规则Classes在数据集有图片且其任务含类别时出现Charts只要有图片即出现Errors仅在存在处理失败时出现Versions在你拥有编辑权限时出现只读模式下若已存在版本也会展示。各类操作的完整说明见数据集管理文档。类管理实操要点直方图按频次排序展示逐类标注数的柱状图支持线性/对数刻度切换——类别极不均衡如 person 上万、bicycle 仅几十时用Log Scale更直观合并类勾选多行后Merge into one指定目标类源类的全部标注被改归目标类不删除任何标注总数不变。适合把car/automobile/vehicle等冗余标签归一删除类删除类会连带删除其全部标注分类数据集仅移除标签图片保留为未标注注意类索引位移类 ID 是位置性的合并或删除类会使后续类索引前移历史导出与标签文件将不再对齐新索引因此需要旧编号时先创建版本统计基于最多 100,000 张图片的子集计算大数据集会在直方图上方提示。Charts Tab自动统计与可视化只要数据集有图片即自动计算下列统计图按固定顺序无对应数据时省略例如原始图片数据集不显示标注类图Points per Instance仅出现在 segment/pose 数据集图表说明Split Distributiontrain/val/test 图片数与标注占比的环形图Top Classes出现最多的 10 个标注类的环形图其余归入 OtherImage Dimensions图片宽高分布叠加直方图含均值Image File Size图片文件大小分布直方图Image Dimensions 2D宽×高的 2D 热力图带宽高比参考线Annotation Locations边界框中心点位置的 2D 热力图Image Formats源图格式JPG、PNG 等分布Bounding Box Dimensions边界框宽高叠加直方图Objects per Image每张图片标注数量直方图Points per Instance多边形顶点数或关键点数分布segment/pose平台会缓存统计结果并在图片、标注、类或划分变化时自动失效重建超过 100,000 张图片时基于子集计算网格上方会有说明。详见 Charts Tab 文档。嵌入聚类2D 散点探查数据分布Clustering面板将数据集投影到交互式 2D 散点图视觉相似的图片彼此靠近用于发现簇、重复项与离群样本并直观观察划分与类别在数据中的分布。支持套索Lasso圈选散点区域画廊自动过滤出对应图片以便复检、重新标注、移动或删除。分析过程后台分计算嵌入与聚类两阶段执行需要 20 到 200,000 张无错误图片且暂不支持云存储连接型与 On Premise 数据集。详见 Clustering 文档。面板顶部可用Color by下拉切换着色维度Splits / Classes / Width / Height / Size / Annotations散点支持滚轮平移、Cmd/CtrlScroll缩放、按住空格拖拽。数据集变化后Re-analyze按钮限 owner/editor可从头重算嵌入与投影。单次套索最多解析 1,000 张图片。上传格式、数据源与自动处理管线支持的输入格式与文件上限图片JPEG、PNG、WebP、BMP、TIFF、HEIC、AVIF、JP2、DNG、MPO单张最大 50MB。视频MP4、WebM、MOV、MKV、M4V最大 1GB。处理时以1 FPS抽帧单视频最多抽取 100 帧并转存为video_frame_001.webp形式的 WebP 帧超过 100 秒的长视频会拉宽采样间隔以保持在 100 帧内。AVI 不被接受需先转封装为 MP4。扩展名只是必要条件——解码器不支持同样会失败最稳妥的是 MP4 容器 H.264 编码libx264yuv420p。数据集归档ZIP 或 TAR含.tar.gz、.tgz可嵌套目录、可混装图片/视频/标签也可携带深度数据集的depth/树。配额按套餐区分Free 10GB / Pro 20GB / Enterprise 50GB。密码保护的加密归档会被拒绝。目录结构与格式自动识别平台支持 YOLO、COCO、深度数据集、Ultralytics NDJSON 及纯图片raw上传并对格式自动识别含names/train/val键data.yaml的按 YOLO 处理含images/annotations/categories数组 COCO JSON 的按 COCO 处理.ndjson导出按 Ultralytics NDJSON 导入只有图片无标注的按 raw 处理。经典 YOLO 布局含data.yaml与 COCO 布局每划分目录下_annotations.coco.json均可直接上传COCO 的检测bbox、分割多边形与姿态keypoints标注会在上传时自动转换类别 ID 被重新映射为跨文件的稠密 0 起始序列。分类数据集通过split/class/image.jpg、class/split/image.jpg等目录结构自动识别。深度归档要求 RGB 图与配对真值平行放在images/与depth/目录真值可为米制浮点 NPY 数组或 uint16 灰度 PNG值除以depth_scale默认 1000 即毫米见深度图格式。需要转换标签格式时可参考格式转换工具。注意Pascal VOC XML 标签会被检测到但不会导入——上传前平台会提示 Pascal VOC labels detected请先转换为 YOLO 或 COCO 格式。标签引用了类 ID 但未提供类名时平台生成class0、class1… 占位名稍后在 Classes Tab 重命名即可。四种数据来源New Dataset对话框提供四个来源 Tab来源说明Upload拖拽或浏览本地图片、视频、归档或 NDJSONURL粘贴.zip/.tar/.tar.gz/.tgz/.ndjson直链平台服务端下载并摄取链接必须可通过 HTTP(S) 公开访问Cloud通过 GCS/S3/Azure Blob 原地使用数据Pro/EnterpriseOn Premise通过 On Premise 工作节点索引本地数据Enterprise上传前校验与上传后自动处理浏览器端会先完成校验归档损坏/为空/加密、YAML 语法、超大文件列名随后可能出现两类对话框归档声明了类名而数据集已有类时出现Map imported classes逐行选择并入已有类 / 新建类 / 跳过向已有图片的数据集上传出现Handle ConflictsSkip 保留旧图丢弃新图 / Keep Both 同时保留 / Replace 覆盖旧图。上传后平台自动执行五步处理管线Validation格式与尺寸校验→Normalization大图缩放到最长边不超过 4096px、最短边不低于 28px灰度扩为 RGB、透明铺白、应用 EXIF 方向→Thumbnails生成 256px WebP 预览→Label Parsing抽取 YOLO/COCO/NDJSON 标签→Statistics计算类分布与图片尺寸。预处理可以在本地先行验证from ultralytics.data.utils import check_det_dataset; check_det_dataset(path/to/data.yaml)。存储编码方面AVIF 与 WebP 原图在无需缩放或改色时按字节原样存储其余格式统一重编码——WebP 保持 WebPJPEG/PNG/BMP/TIFF/HEIC/JP2/DNG/MPO 转为 JPEG质量 92原始文件名与来源扩展名作为元数据保留。NDJSON 导出与离线训练NDJSONNewline Delimited JSON把数据集元数据与逐图记录存进单文件每行一个 JSON 对象首行是 dataset 记录含 task、name、class_names、版本、时间戳等随后每行一个 image 记录含 file、签名 URL、宽高、split、metadata、annotations。例如{type: dataset, task: detect, name: my-dataset, description: ..., bytes: 12345678, url: https://platform.ultralytics.com/..., class_names: {0: person, 1: car}, version: 1, created_at: 2026-01-15T10:00:00Z, updated_at: 2026-02-20T14:30:00Z} {type: image, file: img001.jpg, url: https://..., width: 640, height: 480, split: train, metadata: {location: {site: factory-1}, reviewed: true}, annotations: {boxes: [[0, 0.5, 0.5, 0.2, 0.3]]}} {type: image, file: img002.jpg, url: https://..., width: 1280, height: 720, split: val}导出要点详见数据集管理文档的导出章节点击数据集头部的下载图标即可拿到当前 NDJSON 快照需要可重复下载的编号快照则走 Versions TabNDJSON 中图片 URL 为签名 URL有效期 7 天数据未变化时平台最多复用 6 天的缓存导出因此新下载通常至少剩余 1 天有效Pose 数据集在 dataset 行携带由标注推断出的kpt_shape深度导出声明task: depth与depth_scale: 1000每行含depth.url指向成对 uint16 PNGUltralytics 会并发下载图片与深度 URL 并写出同尺度训练 YAML因此 NDJSON 可直传model.train(data...)可选元数据对象在重新导入平台时保留也可从单图信息面板查看/编辑On Premise 数据集不支持导出像素从未进入平台完整规格见 Ultralytics NDJSON format。把平台数据集用于本地训练同样简单export ULTRALYTICS_API_KEYYOUR_API_KEY yolo train modelyolo26n.pt dataul://username/datasets/my-dataset epochs100import os os.environ[ULTRALYTICS_API_KEY] YOUR_API_KEY from ultralytics import YOLO model YOLO(yolo26n.pt) model.train(dataul://username/datasets/my-dataset, epochs100)或者直接下载 NDJSON 导出文件用于跨工作区迁移元数据、划分、标注与签名图片 URL。配额与使用限制速查存储上限Free 100GB / Pro 500GB / Enterprise 不限。单文件上限图片 50MB、视频 1GB数据集归档 Free 10GB / Pro 20GB / Enterprise 50GB。硬性限制每数据集类数 25,000每图标注数 10,000每标注坐标数 10,000数据集名 100 字符描述 1,000 字符自定义元数据序列化后 500,000 字符顶层键 128 字符。连接型数据集不可用的功能云连接/On Premise 数据集因像素不驻留平台不支持智能标注Smart annotation、聚类分析、克隆、版本快照NDJSON 导出在云连接下可用、On Premise 下不可用。浏览、手动标注、类管理、划分、统计与训练均不受影响。常见问题FAQ上传支持哪些文件格式图片为 JPEG/PNG/WebP/BMP/TIFF/HEIC/AVIF/JP2/DNG/MPO各 50MB视频为 MP4/WebM/MOV/MKV/M4V1GB1 FPS 抽帧最多 100 帧数据集为 ZIP/TAR含.tar.gz/.tgz/NDJSONFree 10GB / Pro 20GB / Enterprise 50GB内含可选 YOLO 或 COCO JSON 标签。Pascal VOC XML 会被识别但不导入。数据集最大能多大存储配额随套餐Free 100GB、Pro 500GB、Enterprise 不限单文件另有上表所示的上限。平台数据集能用于本地训练吗能。可用ul://username/datasets/my-datasetURI 配合ULTRALYTICS_API_KEY在 CLI/Python 中直接训练也可 NDJSON 导出后转移元数据、划分、标注与签名图片 URL。上传后我的数据经历了什么校验格式与尺寸 → 最短边低于 28px 拒绝 → 超过 4096px 等比缩放 → 去重存储相同图仅一份→ 生成 256px WebP 缩略图全程数据留在所选区域US/EU/AP。同一个数据集能为多个任务标注吗可以。每张图同时存储 detect、segment、semantic、classify、pose、OBB 六类标注切换数据集任务类型不丢失既有标注仅切换编辑器与训练/导出所见深度任务除外成对真值文件仅空数据集可切入切出。延伸阅读数据集管理 datasets.md上传、管理、导出训练数据全流程标注编辑器 annotation.md手动与 AI 辅助标注工具详解云训练 cloud-training.md在标注好的数据集上训练模型平台 API / 使用平台数据集ul://URI 的程序化用法API Keys获取与配置ULTRALYTICS_API_KEY【免费下载链接】ultralyticsUltralytics YOLO26, YOLO11, YOLOv8 — object detection, instance segmentation, semantic segmentation, image classification, pose estimation, object tracking项目地址: https://gitcode.com/GitHub_Trending/ul/ultralytics创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考