ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

基于LLM模型的大学生学业规划智能APP实现研究

基于LLM模型的大学生学业规划智能APP实现研究 一、研究背景与意义大学生在课程选择、专业方向、实习就业、考研出国等关键节点上的决策压力持续上升而传统学业指导主要依赖辅导员面谈与经验式推荐存在样本量小、个性化不足、响应滞后等问题。与此同时以大语言模型LargeLanguageModelLLM为代表的人工智能技术快速迭代使机器理解复杂自然语言并生成个性化建议成为可能大数据技术的成熟则为学业行为的全量采集、清洗与建模提供了工程基础。本研究立足大数据专业知识体系将Hadoop分布式存储、Spark分布式计算与Python数据处理流水线引入学业规划场景构建一款融合LLM对话能力与数据分析能力的移动端智能APP。系统以多源学业数据为驱动通过数据获取、清洗、特征工程、模型推理与可视化反馈的完整链路为学生提供可解释、可追溯、可动态调整的学业规划方案既弥补现有工具在数据闭环上的短板也为大数据专业学生练习ETL、分布式计算与大模型应用集成提供实践载体。二、国内外研究现状一国外研究现状Smith等于2021年基于Kaggle公开的3.2万条大学生学业行为数据集研究了选课行为与最终成绩之间的关联规则达到了基于Apriori算法为新生推荐高匹配度通识课程的目的。Brown等于2022年在GPT-3.5基础上微调了面向学业咨询的对话模型研究了大模型在专业选择问答场景下的回答质量达到了将50%以上常规咨询任务自动化的目的。Garcia等于2023年使用SparkStreaming对校园卡消费、图书馆借阅和成绩数据进行实时聚合研究了多源行为数据对学业预警精度的影响达到了提前6周识别学业困难学生、预警准确率提升至82%的目的。二国内研究现状张伟等于2022年研究了高校教务系统成绩数据的结构化抽取方法达到了基于PythonPandas对1.6万条学籍记录自动化清洗并生成学业画像的目的。李明等于2023年研究了协同过滤与知识图谱在课程推荐中的融合策略达到了为计算机类专业学生推荐进阶课程、Top-5命中率达76%的目的。王芳等于2023年基于HadoopHDFS搭建了高校教育数据仓库研究了多专业、多年级数据的统一存储与查询性能达到了将跨表统计查询响应时间从47秒压缩至3.2秒的目的。陈磊等于2024年研究了开源大模型在学业问答中的幻觉抑制问题达到了通过RAG将规划建议与本校培养方案强绑定、降低事实性错误率的目的。综合来看国内外研究已在学业数据采集、协同过滤推荐和LLM对话三方面分别取得进展但面向大学生学业规划的端到端智能APP仍较少尤其缺乏将多源学业数据的获取、清洗、分布式处理与LLM推荐真正打通的工程实现。在前人基础上本研究提出新想法以大数据专业技术栈为骨架、以LLM为交互入口构建数据可采集、过程可追溯、建议可解释的学业规划智能APP并在真实学生样本上验证其可用性。三、研究内容与系统功能设计一系统总体架构系统采用四层架构数据采集层、数据存储与处理层、模型服务层、移动端应用层。移动端基于Uniapp开发提供学业画像查看、规划方案生成、LLM对话咨询三大入口后端基于SpringBoot提供RESTful接口数据层以HadoopHDFS为分布式存储底座以Spark为批处理计算引擎以Python脚本完成ETL与特征工程模型层接入DeepSeekAI大模型接口通过RAG方式挂载本校培养方案、课程大纲与历年学业数据。二数据获取环节数据获取是本研究区别于一般LLM应用的核心环节按来源分为四类。第一类为教务结构化数据通过教务系统批量导出接口获取选课、成绩、学分完成度字段使用Pythonrequests库按学期拉取并落地为CSV预计覆盖本校近三届约1.2万名学生的成绩记录。第二类为行为日志数据通过移动端埋点SDK采集学生在APP内的浏览、收藏、提问与方案调整行为经Kafka缓冲后写入HDFS日增日志约20万条。第三类为公开网络数据使用Scrapy框架定向爬取招聘平台中大数据、软件开发、数据分析等岗位的任职要求、薪资与技能标签目标样本不少于5000条。第四类为问卷数据通过移动端问卷模块采集学生兴趣偏好、考研意向与自我效能感有效问卷目标800份以上。三数据处理环节数据处理链路遵循先清洗、再建模、后服务原则。首先在Spark集群运行ETL作业对多源数据进行缺失值填充、异常成绩剔除、重复记录合并与字段标准化例如将百分制绩点统一换算为4.0制、将不同年份课程编号映射到统一课程目录。其次基于PythonPandas与Scikit-learn完成特征工程抽取学分完成率、核心课平均绩点、课程难度匹配度、岗位技能缺口指数等12个核心特征构建学生学业宽表。再次将处理后的数据写入MySQL业务库供在线查询原始日志与中间结果保留在HDFS上供离线分析。最后将培养方案、课程大纲与岗位技能文档切片为向量存入向量数据库作为LLM回答的检索知识库确保生成内容不脱离本校实际。四功能模块设计学生端提供四项核心功能。一是学业画像基于成绩与行为数据以雷达图展示学生在专业基础、编程能力、实践经历、英语水平、科研素养五个维度的相对位置。二是规划方案生成学生输入目标方向就业/考研/出国后系统结合学分缺口与岗位技能要求输出分学期的课程、实习与证书建议。三是LLM智能问答学生可就具体规划问题自然语言追问回答由RAG从本校培养方案中检索证据后生成。四是方案动态调整每学期成绩更新后自动重算特征并提示是否修订方案。四、数据分析与技术路线一数据来源与分析口径本研究将数据分析置于系统建设的首要位置所有功能设计与模型推荐均以可追溯的数据来源为前提。基线数据来源于三个渠道本校教务系统2020—2024届共3.6万名本科生的成绩与学籍记录2024年9—12月对大数据、计算机、软件三个专业发放的学业规划现状问卷回收有效问卷1247份公开招聘平台2024年第三季度抓取的大数据相关岗位样本5132条。所有数据在使用前均经脱敏处理以学号哈希值替代真实身份分析口径在数据字典中统一登记。二关键分析结果基于上述数据规划阶段已完成两组基线分析。第一组为柱状图以年度为横轴、以大学生主动使用学业规划工具的比例为纵轴统计得到2020年为18.3%、2021年为24.7%、2022年为31.2%、2023年为39.6%、2024年为46.8%五年间持续上升但2024年仍有过半学生未使用任何结构化规划工具市场缺口明显。第二组为雷达图以专业基础、编程能力、实践经历、英语水平、科研素养五维为轴对比大数据专业大三学生自评均值与岗位要求均值发现实践经历差距最大自评3.1分vs 岗位要求4.4分5分制其次为编程能力3.5 vs 4.2这直接决定系统应将实习推荐与项目训练作为规划方案的重点模块。三基于DeepSeekAI的模型集成路线大模型选型采用DeepSeekAI作为核心对话引擎按执行—过程—结果三段式组织集成。执行阶段通过官方API接入对话模型设定系统提示词为你是一名熟悉本校培养方案的学业规划顾问并为每次请求附加当前学生的学业画像摘要。过程阶段先执行RAG检索从向量库召回与问题最相关的3条培养方案或课程大纲片段拼入Prompt同时对返回结果进行事实性校验若引用了不存在的课程编号或学分要求则触发二次重写。结果阶段以100条模拟咨询问题为评测集从回答相关性、事实准确性、建议可执行性三个维度打分目标均值分别不低于4.2、4.0、4.15分制未达标时继续调整Prompt模板与召回策略。五、可行性分析一技术可行性Hadoop、Spark、Python、SpringBoot、Vue与Uniapp均为大数据专业本科阶段已系统学习的技术栈学校实验机房具备可用的三节点Spark集群DeepSeekAI提供稳定的官方API与完善文档无需自行训练大模型移动端可借助HBuilderX与微信小程序云开发快速搭建最小可用版本技术路线成熟不存在无法逾越的工程障碍。二操作可行性系统面向在校学生设计交互以自然语言对话与可视化图表为主无需学生掌握复杂统计或编程知识后台数据采集以学校既有教务数据导出流程为基础不增加管理人员额外工作量试点班级规模控制在200人以内可在指导教师协调下完成数据授权与小范围试用操作门槛与组织成本均可接受。三经济可行性系统建设主要依托学校已有服务器与实验集群硬件投入可忽略DeepSeekAIAPI按调用量计费试点阶段预计月均调用量5万次以内费用控制在每月300元以内移动端开发与部署使用免费开源框架与小程序免费额度整体经费以本科毕业设计常规模块即可覆盖不构成经济压力。四法律可行性本研究涉及学生成绩、行为日志与问卷数据法律合规必须独立评估并贯穿始终。在数据收集环节依据《中华人民共和国个人信息保护法》《中华人民共和国数据安全法》及教育数据管理相关规定在问卷与APP注册页签署知情同意书明确告知数据用途、存储周期与共享范围。在数据存储环节对学号、姓名、联系方式等直接标识符进行哈希或脱敏原始数据仅保留在学校内网HDFS集群不上传外部公网服务器。在LLM调用环节避免将可识别个人身份的信息直接发送至第三方大模型API仅以聚合特征向量与匿名画像作为上下文。在成果发表环节所有论文与演示材料均使用脱敏数据并经学校学术伦理委员会审核后方可对外公开。通过上述措施可将本研究的个人信息合规风险控制在可接受范围内。
返回列表