ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

AI Infra与Data Agent交汇:2025数据智能落地关键趋势与工程实践

AI Infra与Data Agent交汇:2025数据智能落地关键趋势与工程实践 明天就是正式开幕的日子了。从第一届追到现在金猿大数据产业发展论坛基本成了我每年观察行业风向的固定坐标今年直接把主题切到“AI InfraData Agent趋势论坛”信号已经拉满——大数据、AI Infra、Data Agent这三条线在2025年终于正面交汇了。如果你正准备明天进场或者还在观望要不要关注这个论坛我建议你把注意力放在三个问题上数据基础设施到底怎么支撑AI应用数据智能体是不是真有落地的土壤以及行业里那些真正赚钱、真正省成本的案例到底长什么样。这篇就趁开场前把我认为最值得听、最值得聊的内容拆开揉碎讲一遍。1. 这个论坛为什么值得看数据底座与智能体浪潮的正面交汇1.1 从“平台建设”到“数据智能落地”金猿论坛这几年在追什么复盘一下历届金猿论坛的主题走向就很有意思。前几届大家还在聊数据中台怎么搭、数仓怎么分层、BI报表怎么做得更好看属于典型的基础设施补课阶段。到第6届之后话题明显向“数据智能”倾斜模型怎么用起来、标签体系怎么反哺业务、指标体系怎么统一这类问题开始占据议程。今年更直接一个“AI Infra”一个“Data Agent”等于把话挑明了基础建设已经完成一轮接下来的主战场是让数据和AI形成闭环。这背后的产业逻辑其实不难理解。过去两年大模型突飞猛进但真正落到企业里很多团队会遇到一个尴尬模型能力挺强数据却喂不进去。数据散落在不同数据库、不同表格、不同文件格式里格式不统一、口径对不上、权限管不住模型再强也无从下手。这时候大家才发现AI的上限其实由数据基建的质量决定。AI Infra解决的就是“数据怎么高质量、低成本地供给到模型面前”的问题Data Agent解决的则是“模型能力怎么回到业务场景里干活”的问题。两条线拧在一起才是今年论坛真正想讲的故事。1.2 三类人现场最值得关注的内容参会人群我可以按经验分三类各看各的门道。第一类是数据平台/基础架构的开发者。你们最该听的是AI Infra相关议题里的存储选型、计算引擎演进、资源调度优化以及湖仓一体架构在真实生产环境中的表现。这类内容通常带着具体参数和踩坑记录比看官方文档高效得多。第二类是数据团队负责人、架构师。你们的核心诉求是选型和权衡。现场嘉宾分享时重点听他们为什么放弃某套方案、为什么留下某套方案成本模型怎么算迁移过程踩了哪些雷。这些“为什么”才是最有价值的干货。第三类是企业CTO、CIO以及关注技术投资的决策者。你们更关心的是趋势判断和ROI。AI Infra的投入产出怎么衡量Data Agent在企业里的实际ROI曲线长什么样哪些行业真的跑通了——颁奖典礼的获奖案例很大程度上就是你们的参考样本。2. AI Infra大数据基础设施正在经历的三层重构2.1 存储层湖仓一体从“口号期”进入“交付期”先说存储层。过去几年大家都在提“湖仓一体”但真正落到生产环境愿意把数据湖和数据仓库打通的团队并没有想象中多。原因很简单技术选型不成熟迁移成本高团队能力跟不上。到了2025年情况变了。以Iceberg、Hudi、Paimon为代表的表格格式已经相当成熟ACID事务、时间旅行、增量读取这些能力基本成了标配。存储底座的选择从“数据湖数据仓库”两套并行慢慢走向“一个湖仓底座多种负载并存”。论坛上如果听到嘉宾聊“某一张Paimon表支撑了实时写入和批量分析两种负载”这基本代表湖仓一体已经从演示走向了生产。选型逻辑我补充一下自己的理解。Iceberg生态最稳适合Hive存量体系平滑演进Hudi在近实时写入和增量处理上更激进适合有较强流式需求的团队Paimon是Flink社区亲儿子实时数仓链路里优势明显。如果你的团队深度绑定FlinkPaimon基本是绕不开的选项。但要注意表格式只是存储层的一部分真正决定体验的是文件布局、小文件合并策略、分区裁剪效率和元数据服务稳定性。论坛上有嘉宾讲这类细节的话值得掏出手机拍下来。存算分离也是今年绕不开的词汇。独立部署计算集群、存储下沉到对象存储弹性扩缩容变得容易成本也更透明。但存算分离不等于银弹缓存命中率和数据本地性仍然是性能的关键变量。听分享时留意嘉宾是否提到了具体的数据量级和查询延迟数字只有量化指标才说明是真实践。2.2 计算层批流一体、OLAP选型与调度进化计算层的变化同样剧烈。批流一体这个概念提了很多年今年算是真正有点落地的意思。基于Flink的流式数仓加上基于Spark的批量处理已经在很多中型公司跑通了“一套数据、两种口径”的架构。论坛上如果能把Shuffle优化、状态管理、checkpoint稳定性这些深水区的经验讲透那价值非常高。OLAP选型更是各花入各眼。ClickHouse胜在单表查询极快Doris和StarRocks在实时更新、多表关联、联邦查询上各有拥趸。我的建议是不要迷信任何单一引擎关键看业务负载特征。你如果主要是多维分析、报表加速Doris或者StarRocks的运维友好度更高如果主要是日志分析和单表大宽表查询ClickHouse依旧能打。论坛现场多听听踩坑分享比看benchmark有用。资源调度同样值得关注。YARN时代正在慢慢让位给Kubernetes尤其当AI任务和数据任务混部的时候K8s在弹性、GPU调度、多租户隔离上的优势就开始显性化。但要提醒一点K8s调度大数据负载的复杂度远比想象中高Shuffle服务、节点亲和性、网络带宽规划都是坑。听到这类实战经验分享建议直接记入自己的架构备忘。2.3 数据集成与治理管线AI Infra里最容易被低估的部分很多人提起AI Infra第一反应是GPU、是模型推理服务但做过生产系统的人都知道真正决定AI落地效率的往往是数据供应链的完整度。数据从业务系统到大模型之间要经过采集、同步、清洗、质量校验、血缘追踪、指标标准化这一长串流水线任何一个环节断裂模型效果都会打折。CDC工具现在基本成了标配Flink CDC、SeaTunnel、DataX各有生态位。数据质量这块不再只是跑几个规则校验空值和唯一性而是开始引入数据可观测性——延迟、新鲜度、分布漂移这些指标都要实时监控。血缘解析也越来越重要不然Data Agent生成的报表出了问题你都说不清数据源头在哪儿。如果论坛有嘉宾分享“数据Pipeline的SLA治理”别嫌基础这才是AI Infra最扎实的地基工程。数据供给不稳定上面跑的Agent再聪明也是空中楼阁。3. Data Agent深度拆解从“取数工具”到“数据同事”3.1 NL2SQL的进化路线与落地边界Data Agent最典型的应用场景就是自然语言查数也就是NL2SQL。这条技术路线走到今天已经明显分成三个阶段。早期是规则和模板匹配只能应付“销售额是多少”这类固定句式后来引入RAG和Schema Linking先把用户问题匹配到正确的表和字段再生成SQL准确率有了质变现在则进入Agent阶段模型不仅能写SQL还能自己感知查询结果、发现数据异常、决定下一步是继续下钻还是换一种查询思路真正有了“自主性”。但要泼一盆冷水NL2SQL在复杂业务口径面前依然脆弱。同一个指标财务口径和运营口径可能完全不一样模型不知道你属于哪个部门。所以论坛上如果有人说他们的Data Agent准确率有多高一定要追问一句在什么范围的数据字典和指标口径下测的。脱离了指标平台的NL2SQL就是花架子。3.2 一个数据分析需求在Agent手中如何被拆解为了讲明白Data Agent的工作方式我拿一个具体的网约车数据分析需求来拆解。假设业务方提出“帮我分析一下这个月不同时段的完单率变化趋势找出完单率最低的时段和可能原因。”一个合格的Data Agent会先拆解这个任务第一步确认指标口径完单率定义是完单量/订单量还是完单量/接单量第二步定位数据范围明确时间和城市维度第三步准备数据找到对应的订单明细表、司机状态表做必要的清洗和聚合第四步生成分析逻辑按小时/时段分组计算完单率排序找到最低位第五步结合上下文原因分析比如异常天气、运力不足等最后才是生成可视化图表和自然语言结论。如果用技术语言来描述这背后是Plan-and-Execute的Agent架构大模型负责生成任务拆解计划工具调用模块负责执行取数SQL代码解释器负责跑分析逻辑RAG负责注入业务上下文和数据字典。论坛上如果演示了这类完整链路一定要看他们如何处理分支条件和异常情况比如SQL执行报错之后Agent能不能自我纠正这才是工程成熟度的分水岭。网约车这个场景很适合做Data Agent的样例因为它数据链路完整从订单库、司机轨迹、天气数据到实时调度日志层级多、维度多、口径多特别能检验Agent的理解和调度能力。现场如果有类似行业的案例分享对做出行、本地生活、零售方向的朋友都会有直接参考价值。3.3 权限设计是Data Agent落地的生死线Data Agent自动写SQL、自动取数听起来很爽但权限管控一旦不到位就是一场安全事故。这也是我非常想在论坛上听到单独议题的部分。底层逻辑上行级权限和列级权限是两道必须守住的闸门。行级权限决定了一个用户能看哪些部门、哪些城市、哪些时段的数据常见实现方式是RLS行级安全或者在SQL解析阶段自动注入数据范围条件列级权限则决定了一个用户能看哪些字段敏感字段比如用户手机号、身份证、收入信息直接脱敏或者彻底屏蔽。Data Agent生成的SQL必须经过一个统一的权限拦截层自动拼接行级过滤条件、检测列级敏感字段再下推到执行引擎。开源社区在行列权限设计上已经有不少可参考的实现。Doris和StarRocks都提供了比较成熟的行级权限方案列级权限则通常靠视图、物化视图或者网关层动态改写SQL来实现。如果你的团队要自建RAG知识库供Data Agent查询记住一点给Agent的知识不是越全越好超出授权范围的数据字典就不该出现在Agent的检索范围里。权限控制不是“事后审计”而是“事前不可见”。论坛上如果哪位嘉宾能把这个链路讲清楚从模型层、解析层、到引擎层的权限拦截设计再配合真实审计日志案例这基本就是今年Data Agent领域最值得听的分享之一。4. 参会前夜给数据人的一份自查与学习地图4.1 从“八股文”到“系统能力”大数据学习路线的再思考每年都会看到有人问大数据学习路线今年论坛临近后台又收到不少类似问题。很多人习惯去找“大数据开发八股文”把HDFS原理、MapReduce流程、Spark内存管理背得滚瓜烂熟但到了真实项目里依然手足无措。我的观点很直接八股文用来应付面试可以用来建立系统能力远远不够。我建议的学习路线分七段每一段都有明确产出。第一段是SQL这是数据领域的通用语言必须达到能写复杂窗口函数、多表Join调优的水平第二段是Linux和Python前者是操作环境后者是写UDF和数据分析脚本的必备技能第三段是Hadoop生态重点理解HDFS存储原理和YARN调度机制不需要会重写源码但要能说清一条数据从写入到被查询的完整链路第四段是Hive数仓重点掌握建模方法论事实表、维度表、拉链表怎么设计而不是只会建表第五段是Spark和Flink重点理解流批处理的核心抽象和调优思路第六段是调度和数据治理DolphinScheduler、数据质量、血缘这是从“会写任务”到“会管数据”的跨越第七段才是OLAP引擎和可视化Doris、StarRocks、ECharts这类直接服务业务的手段。你拿这个路线去对照论坛议题就会发现每一个方向基本都能在议程里找到对应嘉宾。带着自己的学习阶段去听比漫无目的逛一天收获大得多。4.2 新人如何从课程项目走向真实平台工程很多学生和转行者的困惑是我做过网约车大数据综合项目用Hive做过分析用Spark做过数据清洗用FlaskECharts做过可视化但感觉离真实大数据平台还很远。这个困惑非常真实课程项目练的是“数据链路”真实平台考验的是“工程体系”。举个具体例子。课程项目里你用Spark清洗一份网约车订单数据文件是老师给好的CSV跑完输出结果就算完事。真实生产环境里数据是从Kafka实时流过来的Schema可能昨天还在变脏数据比例远超想象你还要考虑清洗任务挂了怎么重试、数据延迟了怎么告警、上下游依赖怎么调度。这些工程问题才是平台类岗位真正考察的能力。那新人怎么补这个差距建议三件事并行一是把课程项目“容器化”和“调度化”哪怕自己单机部署一套DolphinScheduler或者Airflow把清洗链路编排进去体验一次“定时调度失败告警”的完整流程二是把项目里的数据量人为放大用脚本生成千万级数据逼自己去思考分区、索引、参数调优而不是满足于百万级数据跑通三是主动去读优秀开源项目的部署文档和源码片段比如StarRocks的部署架构、Flink CDC的配置实践不用精通但要对真实系统长什么样有体感。这样再去听论坛上的架构分享你才有能力听懂嘉宾在讲什么。4.3 现场听会方法像做技术选型一样听分享最后给一个非常实用的参会技巧不要用“听讲座”的心态去听论坛要用“做技术选型”的心态去听。具体做法是进场之前先列出自己团队或自己学习中最头疼的三个问题比如“实时数仓的延迟抖动怎么解决”“Agent生成的SQL命中率怎么提升”“数据大屏的加载性能怎么优化”。带着这三个问题去匹配议题分享嘉宾讲到相关内容时不只要记结论还要记前提条件——他们是在什么数据量级、什么业务场景、什么团队规模下得出这个结论的。分享结束后留出提问时间很多人不敢问怕问题太基础。实际上问一个“您刚才提到存算分离在XX场景下有性能回退具体是哪一层出现了瓶颈”远比泛泛而谈更能获得嘉宾的共鸣和实打实的回答。会后的茶歇时间更是金矿拿自己的问题去和演讲者一对一交流往往能听到PPT里不会写的真实心得。这也是线下论坛相比线上直播最大的价值所在。5. 颁奖典礼与产业风向榜单里藏着2025年的预算流向5.1 什么样的案例更容易从评审中脱颖而出金猿论坛的颁奖典礼历来是大数据圈子的年度盘点今年在AI Infra和Data Agent主题下获奖案例的方向会更有指向性。以我观察历届评审的偏好来推测今年更容易获奖的案例大概有四个特征第一业务价值可量化不是“我们建了一个平台”而是“我们通过数据优化将调度效率提升了18%”第二技术栈有先进性湖仓一体、实时计算、数据智能体这些关键词会比传统数仓更有竞争力第三路径有可复制性评审往往更青睐那些别的企业也能借鉴的解决方案而不是完全定制化的项目第四数据安全和合规做得扎实尤其在Agent自动取数的场景里权限管控设计是否周密很可能是加分项。听获奖案例分享的时候不要只关注他们做了什么多问一句“他们没做什么”。每个项目都有妥协和放弃的部分那些取舍背后往往藏着更真实的行业规律。比如说有些团队放弃了全链路实时选择实时批量混合这未必是技术不行很可能是成本和稳定性的最佳平衡。5.2 从榜单看2025年的实际投入方向结合近期搜索热度和行业交流2025年企业的数据预算流向已经比较清晰了大致可以归为五个方向。方向一数据安全与权限治理尤其是行列级权限设计和数据脱敏热度上升非常快这和Data Agent的落地需求直接相关方向二AI Infra的基础设施改造包括存算分离、资源混部、GPU调度优化目的是把算力成本压下来方向三Data Agent应用重点在NL2SQL、智能归因、报表自动生成这些能直接替代重复人工的场景方向四数据集成和数据可观测性CDC管道、数据质量监控、血缘追踪属于AI落地之前必须补的课方向五数据可视化与数据大屏这个方向看起来传统但在运营和指挥决策场景里需求依然旺盛FlaskECharts这类轻量方案在中小团队里尤其流行。如果你正在规划明年的技术方向或者团队预算可以对照这个榜单审视自己的布局。我个人体会是很多团队在数据可视化上投入有余在数据安全和数据供给稳定性上投入不足这个错配在AI Infra时代会越来越危险因为Agent的自动化程度越高出错的代价就越大。明天论坛开场后我也会把现场听到的值得记录的细节整理出来。对于不在上海的朋友后续的案例复盘和技术解读同样值得关注——毕竟行业每年真正往前迈的那一步往往就藏在这些论坛的间隙里。
返回列表