ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

Large Language Models in the Data Science Lifecycle: A Systematic Mapping Study

Large Language Models in the Data Science Lifecycle: A Systematic Mapping Study 文章总结与翻译一、文章主要内容该研究是一项关于大型语言模型(LLMs)在数据科学生命周期中应用的系统性映射研究(SMS),旨在全面梳理LLMs在数据科学各阶段的应用现状、评估方法、模型类型、应用领域、影响及研究缺口。1. 研究基础与框架数据科学生命周期:采用五阶段模型,即问题定义、数据收集与准备、数据探索与分析、模型构建与评估、部署与维护,以此作为分析LLMs应用的框架。LLMs背景:基于Transformer架构,常见类型包括GPT系列、Llama、Gemini等,除文本生成外,在数据预处理、查询、交互式分析等数据科学任务中展现出潜力。2. 研究方法文献检索:在Scopus和IEEE数据库中,使用包含“数据科学”“大型语言模型”“数据可视化”等关键词的检索式,共获取172篇初始文献,经筛选(纳入2020年后发表、聚焦LLMs在数据科学生命周期应用等标准,排除非英文、聚焦软件工程等文献)后,最终确定66篇核心文献,并通过滚雪球法补充相关研究。分析维度:围绕6个研究问题(RQ1-RQ6)展开,分别关注LLMs覆盖的数据科学阶段与任务、评估技术与数据集、涉及的LLM类型、应用领域、正负影响、研究缺口。3. 核心研究结果
返回列表