
先说一个反常识的判断智能驾驶的竞争早已不是谁跑的里程多而是谁的数据闭环转得快。一支量产车队每天回传的数据以 TB 计一年攒下来就是 PB 级——但行业里真正被用于训练、验证和模型迭代的数据普遍不到 5%。剩下 95% 不是没价值而是「没有被工程体系接住」找不到、看不懂、不敢用。接住这 95%靠的不是某一个大模型而是两套彼此咬合的架构一套是承载全量数据的湖仓底座一套是从数据里淘金的数据挖掘平台。过去 23 篇文章我们把这两套架构的每个零件拆开讲了一遍这一篇把它们装回去——用一篇文章讲完整体设计数据从车端出发如何一路变成训练集、变成模型、再通过 OTA 回到车上完成一圈闭环。全文较长建议先收藏再读。文末有全部系列的导航地图以及获取完整设计文档的方式。 全文导读 · 九章结构一、总蓝图两套架构一个闭环二、湖仓底座四层骨架与 11 个数据域三、数据进出湖三通道入湖与双路查询四、数据挖掘平台控制面与数据面分离五、AI 挖掘流水线从抽帧到文搜图六、两套架构如何咬合闭环发动机七、十条设计哲学八、行业坐标系九、系列导航与下一步一、总蓝图两套架构一个闭环整个方案的素材来自两份设计文档《智驾数据闭环湖仓架构设计文档》约 1,600 行回答「数据放在哪、怎么管」《数据挖掘与多模态检索平台架构设计》约 1,100 行回答「数据怎么用、怎么变聪明」。两份文档加起来覆盖 8 大业务环节、11 个数据域、90 余张表、16 个平台章节——它们不是两个孤立系统而是一个闭环的两半。先看骨架。智驾数据闭环共8 大环节采集 → 回传 → 标注 → 挖掘 → 训练 → 仿真 → 部署 → OTA再回到采集。湖仓底座横贯全部 8 个环节是每个环节的数据中枢挖掘平台则深耕其中「挖掘」一环并向上游反哺采集、向下游供给训练。下面这张动图就是整个体系的心跳▲ 智驾数据闭环 8 环节每转一圈就是一次模型进化两套架构的分工可以用一句话概括湖仓是骨架让数据可存、可查、可治理挖掘是大脑让数据可发现、可检索、可回补。后面八章就是沿着数据流动的方向把这两半逐层拆开、再装回去。二、湖仓底座四层骨架与 11 个数据域▲ ODS → DWD → DWS → ADS 四层骨架11 个数据域沿闭环环节铺开湖仓底座以Apache Paimon为存储与建模内核采用经典四层架构ODS 贴源层原样承接车端与各业务系统数据DWD 明细层做清洗、拉平与标准化是全湖体量最大的一层DWS 汇总层按主题聚合出日粒度指标ADS 应用层直面业务11 张数据产品表开箱即用——从闭环大盘、产线瓶颈到存储成本看板管理者要的答案都在这里。四层之上按业务切分出11 个数据域10 个业务过程域与闭环 8 环节一一对应含采集、标注、挖掘、训练等外加 1 个跨域闭环域专管全链路追溯与效率度量。域间关系一句话一环主环、一反馈环、一跨域支撑——10 个业务域沿主环单向流转挖掘域双路回补数据资产域与采集域闭环域贯穿全程做度量。全湖共90 余张表统一遵循四段式命名公式层级_数据域_业务主题_粒度分区与 Bucket 策略逐表定制。把散落的数据串成一条链的是贯穿 7 个环节的三级 ID 体系data_id采集单元一个 clip、clip_id标注/挖掘片段、image_id(单帧且内嵌 data_id 免查表回溯)。任何一个训练样本都能凭 ID 一路回溯到车端原始数据——这是后面血缘追溯、Badcase 复盘的地基。三、数据进出湖三通道入湖与双路查询骨架立起来之后数据怎么进来、怎么出去是湖仓的两道大门。▲ 三道入湖通道各管一类数据双路查询出口各管一类场景入口是三通道①Flink CDC 通道实时同步业务库变更断点续传 Exactly-Once平台配置秒级入湖②Kafka 通道消费车端回传的元信息与事件流③OSS 通道承接采集大文件视频/点云走「车端脱敏 → 合规室上传 → 合规云脱密 → 智驾云入湖」的五步合规链路。所有数据进门前都要过一道五步质量门禁完整性 → 格式 → 业务规则 → 异常告警 → 隔离重放坏数据进不了主环。出口是双路查询①External Catalog 外部表即席查——StarRocks 直查 Paimon湖数据零搬迁②ADS 内表物化毫秒直查——高频场景由 StarRocks 离线物化为内表双路互为降级。治理上则配齐三件套血缘追溯Paimon Neo4j 湖图双引擎表级到字段级、质量门禁、生命周期管理五级存储分层预热/降冷/淘汰让成本增速远低于数据量增速。四、数据挖掘平台控制面与数据面分离镜头转向第二份文档。数据挖掘平台要解决的矛盾很尖锐挖掘是重计算的但平台绝不能成为第二份数据副本——一旦平台自持主数据两套数据迟早走向不一致闭环就断了。于是整个平台最重要的一条架构决策是控制面与数据面分离。▲ 平台只存任务与配置主数据全部沉淀湖仓具体切法运行态任务、配置、调度状态留在平台侧 MySQL轻量、高频、随改随用所有主数据抽帧明细、标签、向量、挖掘结果全量沉淀湖仓MySQL 里的配置也通过 Flink CDC 实时同步入湖。平台拆分为 11 个组件服务、K8s 三区部署GPU 资源分时复用白天跑 VLM 推理凌晨 6 点前跑 Embedding 向量化——一份算力两种产出。这条决策还带来一个副产品挖掘域顺带为湖仓贡献了9 张新表1 ODS 6 DWD 1 DWS 1 ADS从规则配置到标签覆盖度指标全部登记在册。平台与湖仓不是「对接」关系而是长在一起。五、AI 挖掘流水线从抽帧到文搜图挖掘平台内部是一条五站流水线。TB 级采集数据进来可检索的场景资产出去▲ 抽帧 → 统一标签 → 双引擎挖掘 → 向量化 → 多模态检索第一站分层抽帧。不是所有帧都值得看均匀抽帧保底、事件触发抓关键时刻前后各 10 秒窗口、场景感知按质量分挑帧三级闸门把 TB 级数据压缩成高价值帧集合。第二站统一标签。采集、规则、VLM 三个来源的标签统一收口字典映射到五大类别受控词表、幂等去重、血缘填充四态状态机candidate/active/deprecated/merged管住词表不爆炸。第三站双引擎挖掘。规则引擎走「规则即数据」——SQL 可视化双模表达批流双模执行T1 Spark 批跑亿级 4 小时内 Flink 准实时擅长结构化条件VLM 推理引擎让多模态大模型看图说话输出结构化标签 caption 双结果专补规则够不着的长尾语义场景。两者互为补充共同构成「规则粗筛 → 模型细筛 → 检索扩散」的三级漏斗。第四站向量化。CLIP 双塔模型每日凌晨批量生产 Embedding标签变了图片不变就不重算向量带版本灰度切换。第五站多模态检索。一句「雨天夜间行人横穿」五步之内查询向量化 → 标量过滤 → ANN 检索 → 重排 → 结果组装返回相似场景P95 ≤ 2 秒。六、两套架构如何咬合闭环的发动机单看两半都清楚真正的功夫在咬合处。这套体系的咬合点有四个缺一个闭环就转不起来▲ 单一事实源、ID 贯穿、结果回写、覆盖度反哺——四个咬合点咬合点一单一事实源。平台不持有任何主数据副本湖仓DLF Paimon是唯一的权威存储StarRocks 只做加速——所有消费方读到的永远是同一份数据。咬合点二ID 贯穿。挖掘产出的每一行明细都携带 data_id / clip_id / image_id与采集、标注、训练各域天然对齐跨域 JOIN 不靠猜。咬合点三结果回写。挖掘命中的场景双写回统一标签服务与湖仓结果表同时异步触发事件补抽帧——挖出一个 Badcase自动召回它的完整上下文。咬合点四覆盖度反哺。标签覆盖度日指标dws_mining_tag_coverage_daily暴露「哪类场景还没挖到」直接反哺采集策略指挥车队去该去的地方。数据从被动产物变成主动指令闭环才算真正闭上。七、十条设计哲学架构背后的为什么技术选型会过时设计原则不会。把两份文档里的关键决策抽出来浓缩成十条是这个体系真正的「干货」#原则一句话解释1湖仓单一事实源主数据只在湖仓平台只存运行态杜绝双副本漂移2两流合一数据流与服务流同图设计每个环节既有数据落点又有服务支撑3ID 贯穿全链路三级 ID 打通采集到训练 7 环节任何样本可回溯原始数据4规则即数据挖掘规则配置化入湖可版本化、可审计、可批量执行5未审核不进训练集标签候选池四态治理质量门禁是训练数据的唯一闸门6三级漏斗挖掘规则粗筛 → 模型细筛 → 检索扩散算力花在刀刃上7双路查询出口外部表即席查 内表毫秒直查互为降级永不断路8血缘先行每张表落地的同时登记血缘湖图双引擎支撑字段级追溯9成本生命周期化五级存储分层 自动预热降冷PB 级数据成本可控收敛10度量反哺采集闭环效率与标签覆盖度指标直接驱动采集策略闭环自加速八、行业坐标系头部厂商在做什么这套设计不是闭门造车。 特斯拉的 Data Engine 用触发器 影子模式实现百万车队全自动回传其「自动标注 挖掘驱动训练」与本方案的三级漏斗同源 Momenta 的数据飞轮强调量产数据反哺算法迭代速度 Waymo 以每周数千万英里的仿真验证构筑安全门禁 蔚来的群体智能与 小鹏的众包采集则展示了量产车队作为采集网络的两条路径。共同点只有一个没有一家把宝押在「多跑车」上全押在「闭环转速」上。下一站我们就会逐环节拆解特斯拉的完整引擎。九、系列导航与下一步本文收拢了三个系列共 23 篇的精华。想深挖某个模块按图索骥系列篇数核心内容系列一 · 智驾数据闭环7 篇8 环节全景、行业对标、四层架构、三级 ID、ADS 数据产品、闭环度量、存储治理系列二 · 湖仓实战8 篇Paimon 分层建模、表命名规范、双路查询、Flink CDC 入湖、血缘追溯、质量门禁、向量索引、合规入湖系列三 · 智驾数据挖掘7 篇平台架构、分层抽帧、统一标签、规则挖掘、VLM 推理、向量化流水线、多模态检索 本文要点① 湖仓是骨架、挖掘是大脑两套架构靠单一事实源、ID 贯穿、结果回写、覆盖度反哺四个咬合点连成闭环发动机② 数据进门三通道、出门双路查询治理三件套保质量保成本③ 挖掘五级流水线抽帧→标签→双引擎→向量化→检索把 TB 级数据炼成可检索的场景资产④ 十条设计哲学是比选型更长久的资产。 下一篇预告全景收拢完毕下一站进入「行业对标」系列——S4-01《特斯拉 Data Engine 深度拆解触发器、影子模式与数据飞轮》。百万级车队的数据引擎是怎么全自动运转的我们逐环节对标本方案看看「别人家的闭环」到底强在哪。