ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

LLM Zoomcamp 2025 课前直播问答全解读:预备知识、课程体系、成本预算与报名全流程

LLM Zoomcamp 2025 课前直播问答全解读:预备知识、课程体系、成本预算与报名全流程 LLM Zoomcamp 2025 课前直播问答全解读预备知识、课程体系、成本预算与报名全流程【免费下载链接】llm-zoomcampLLM Zoomcamp - a free online course about real-life applications of LLMs. In 10 weeks you will learn how to build an AI system that answers questions about your knowledge base. Register here 项目地址: https://gitcode.com/GitHub_Trending/ll/llm-zoomcamp本文以 LLM Zoomcamp 2025 课前直播问答纪要cohorts/2025/pre-course-q-a-stream-summary.md为主体结合仓库内的课程模块文档与源码系统梳理这门免费开源课程的核心信息学什么、不学什么、需要什么基础、花多少钱、投入多少时间以及如何完成报名、作业与结业项目拿到证书。读完本文你将能准确评估这门课是否适合自己并掌握完整的参与路径。直播背景与文档定位课前直播问答Pre-Course Live QA是 LLM Zoomcamp 每一届开课前的重要环节负责解答潜在学员最关心的问题。2025 届的问答纪要整理为 18 个问题覆盖技术前景判断、预备知识、课程内容边界、基础设施成本、时间投入与报名流程六大类。与之配套的 cohorts/2025/course-launch-stream-summary.md 则从课程架构、模块拆解、评分机制等角度做了更完整的补充两者共同勾勒出 2025 届课程的全貌。在进入具体问答前先明确一个基调课程的主线目标是在 10 周内构建一个生产级 RAG检索增强生成聊天机器人用其回答 Zoomcamp 系列课程的 FAQ 问题最终每个学员再基于自己的数据完成一个端到端结业项目。这一目标在 cohorts/2025/README.md 的模块清单和 project.md 的项目要求中均有明确体现。技术判断LLM 是长期技术还是昙花一现问答 1直接回应了LLM 是否像元宇宙、NFT 一样只是一时热度的疑虑。结论是围绕 LLM 确实存在炒作但它已经深度嵌入日常开发工作流——用于编码、个人效率工具和原型开发。即使炒作退潮底层工具与技术如 RAG 流水线和向量搜索依然具有长期价值未来的模型与交互界面会演进但 LLM 的核心能力不会消失。这一判断与课程的设计取向完全一致课程不押注某一个模型或厂商而是聚焦 RAG 流水线、检索、提示词构建与响应处理这些可迁移能力。从 cohorts/2025/01-intro/README.md 可以看到模块 1 既演示 OpenAI API 调用也明确给出本地运行 LLM 的替代方案如 Ollama并在 awesome-llms.md 中维护 OpenAI API 的替代品清单体现了技术会变、能力持久的课程哲学。预备知识什么基础足够开始问答 2明确了课程对预备知识的要求门槛并不高通用编程能力最好是 Python命令行工具的使用连接外部服务的能力例如启动 Elasticsearch 或类似服务不需要深入的机器学习或高级软件工程背景但熟悉基本脚本编写和包安装会让课程推进更顺畅。cohorts/2025/course-launch-stream-summary.md 对此做了更细的拆解Python 基础一天的复习足够、命令行与 Git 的熟练度、已安装且可用的 Docker。仓库根目录 README.md 中 2026 届的预备要求进一步印证了这一点能自信地写 Python 代码、熟悉终端、了解 Docker 基础即可不要求ML/LLM 背景也不需要 GPU。入门模块 01-intro/README.md 给出的环境准备命令也只需要常规 Python 库pip install tqdm notebook7.1.2 openai elasticsearch8.13.0 pandas scikit-learn ipywidgets2025 课程体系改版要点与模块构成老学员是否值得再来一年问答 3的答案是肯定的。2025 届课程做了明显改版模块数量减少但每个模块更深评估/监控工具换新用 Phoenix 替代 Grafana向量检索后端也换了新实现。此外学员还能体验最新的 LLM 并参加全新的挑战练习。从仓库证据看这些说法均有对应实现监控改用 Phoenix04-monitoring/README.md 的模块 4 明确围绕 PhoenixArize 出品的开源 LLM 可观测性平台展开4.2 节讲解用 OpenTelemetry 对 LLM 流水线进行插桩4.3 节讲解 LLM 流水线评估。向量检索更换后端03-evaluation/README.md 明确注明2025 届使用 Qdrant 进行向量搜索而非 ElasticSearch02-vector-search/README.md 给出了 Qdrant 的安装与运行方式pip install -q qdrant-client[fastembed]1.14.2 docker pull qdrant/qdrant docker run -p 6333:6333 -p 6334:6334 \ -v $(pwd)/qdrant_storage:/qdrant/storage:z \ qdrant/qdrant评估模块重组原本属于模块 4 的部分视频离线 RAG 评估相关被并入评估模块模块 4 只专注监控原本的向量搜索排序评估改为课后作业。2025 届模块总览结合 cohorts/2025/README.md 与 course-launch-stream-summary.md2025 届的正式内容如下模块主题仓库位置模块 1LLM 与 RAG 入门01-intro模块 2向量搜索02-vector-search工作坊dlt 数据接入workshops/dlt.md模块 AAgents实验性附加模块0a-agents模块 3评估03-evaluation模块 4监控04-monitoring明确不在课程范围内的话题问答 5、6、8划清了课程的边界Agentic AI 开发不在核心模块中。问答 5说明当时计划在 6 月开设一个可选的并行工作坊但 agent 开发不正式纳入当年课程。仓库印证了这一安排0a-agents/README.md 将 Agents 定位为bonus moduleexperimental module以直播工作坊形式进行启动直播纪要也解释了个中原因agent 框架每天都在变化将课程锁定在不稳定的 API 上有风险。MCPModel Context Protocol问答 8明确不在当年教学大纲内。与 agentic AI 一样这些新兴协议可能在行业实践稳定后以专门课程形式出现。完整 MLOpsLM Ops问答 6说明监控模块会覆盖关键的 LM Ops 实践指标、成本追踪、查询日志但完整的部署与持续训练流水线留给独立的 Open Source LLM Zoomcamp 课程。启动直播纪要补充道该配套课程安排在 2025 年 6/7 月主题包括量化、vLLM、LoRA 微调并由 Saturn Cloud 与 AMD 提供免费 GPU 配额。课程覆盖的技术深度评估、护栏与分块评估检索指标与 LLM 作裁判问答 9确认评估是课程的重点内容你将学习经典信息检索IR指标如 MRR、recall来评估搜索并学会用 LLM 本身作为裁判LLM-as-a-Judge对端到端 RAG 进行评估。仓库提供了完整的技术支撑。评估模块的指标文档 03-evaluation/search_evaluation/evaluation-metrics.md 系统罗列了课程涉及的检索指标及其公式Pk前 k 个结果中相关文档的比例Pk 前k个结果中的相关文档数 / kRecall检索到的相关文档数占总相关文档数的比例MAP各查询平均精度的均值NDCG按结果位置衡量文档增益NDCG DCG / IDCGMRR第一个相关文档排名的倒数MRR (1/|Q|) * Σ(1/rank_i)F1精确率与召回率的调和平均Hit Rate (HRk)至少有一个相关文档出现在前 k 个结果中的查询占比在实操层面03-evaluation/search_evaluation/ 目录提供了完整的数据与 Notebookground-truth 数据集ground-truth-data.csv、带 ID 的文档documents-with-ids.json、文本检索评估 Notebookevaluate-text.ipynb。RAG 端到端评估则在 rag_evaluation/offline-rag-evaluation.ipynb 中实现包含余弦相似度评估A→Q→A 流程与 LLM-as-a-Judge 两种方式并附有多组 GPT-4o、GPT-3.5-Turbo、GPT-4o-mini 的实际评估结果 CSV。护栏无正式框架靠监控兜底问答 9的另一半是护栏guardrails课程不包含正式的护栏框架但监控最佳实践会帮助你发现并响应不良行为。这一设计与模块 4 的内容吻合——04-monitoring/README.md 强调在评估部分我们评估整个 RAG 系统上线前的质量在监控部分我们收集、存储并可视化指标以评估已部署 LLM 的回答质量同时收集聊天历史与用户反馈。也就是说课程用可观测性而非硬性拦截来处理模型输出风险启动直播纪要提到的 LLM 特有监控指标每次调用的成本/令牌数、幻觉检测、提示词/响应漂移、PII 泄露与毒性检测可以作为理解这一思路的背景。分块讲最佳实践实现在项目中问答 10对分块chunking给出了既覆盖又不深入的定位课程会展示示例仓库中的数据如何被预先分块并讲解分块大小与策略的最佳实践但分块的实现与实验留给学员在结业项目中完成。仓库根目录的 etc/chunking.md 专门讨论了分块相关内容结业项目要求中也将数据清洗与分块列为项目准备阶段的早期任务见 course-launch-stream-summary.md 的 Capstone 项目指南。RAG课程核心覆盖从数据库到生产流水线问答 11毫不含糊RAG 就是课程的中心——索引、检索、提示词构建、响应处理都是核心模块学员将从头构建完整的流水线。问答 4进一步回答了能否基于线上数据库实现 RAG无论数据在事务型数据库还是知识库存储中课程都会教你连接数据源、分块与索引内容、构建 RAG 应用具体工作流可能因数据库类型而异但原理是通用的。这一核心地位在仓库中有充分体现入门模块以 FAQ 文档为知识库构建 QA 系统01-intro/README.md先使用课程自建的 minsearch 搜索引擎再替换为 Elasticsearch。入门作业 01-intro/homework.md 完整走了一遍检索流水线拉取 FAQ 数据、建立索引、执行带字段加权的multi_match查询、构造提示词模板、用tiktoken统计 token 数最后加分项将提示词发送给 OpenAI 生成答案。向量搜索模块将检索升级为语义搜索02-vector-search/README.md 下的sematic_search.ipynb、rag-starter.ipynb、rag.ipynb形成关键词检索 向量检索两条路线。评估模块则针对上述检索与生成环节提供全套离线评估工具见上文。关于数据库接入project.md 的结业项目技术要求明确允许任何文本、关系型或向量数据库包括课程中实现的内存版或 SQLite并将把数据接入知识库或连接提供数据的 API列为项目必要步骤佐证了原理可迁移到任意数据源的说法。编程语言与项目自由度问答 12指出课程示例使用 Python但你完全可以用其他语言如 JavaScript实现项目只需提供清晰的安装与使用说明npm 命令、环境搭建让同伴能运行并评审你的工作。问答 13回应了项目复杂度问题复杂度由你自己决定。课程提供历届优秀学员项目作为范例food-search RAG、recipe recommender 等以展示规模与质量水准你随后挑选自己的数据将 RAG 概念扩展到感兴趣的领域。仓库 project.md 给出了项目评分的详细标准涵盖问题描述、检索流程、检索评估、LLM 评估、交互界面、数据接入流水线、监控、容器化、可复现性、最佳实践混合检索、重排序、查询改写以及云端部署等加分项——这套标准同时就是什么是一个好项目的答案。成本与基础设施本地跑与云端调用的账单问答 7与问答 17给出了清晰的成本画像完全本地运行100% 可行。可以使用 Llama.cpp 等工具在自有机器上跑模型。直播中提到可用本地工具运行模型启动直播纪要 course-launch-stream-summary.md 也确认主课程不需要 GPU托管模型使用 OpenAI、Anthropic、Groq 等并说明配套的开源 LLM 迷你课程会提供免费 GPU 配额来跑 Llama 3、DeepSeek 等本地模型。云端 API 成本开销温和。OpenAI 大约 100 万输入/输出 token 合计约 10 美元问答 7 口径问答 17 则给出约 10–20 美元/百万 token输入输出的区间实际花费通常远低于你的 API 配额Groq 提供免费档适合初期实验。启动直播纪要的综合结论是约 10 美元的 OpenAI 额度即可覆盖整个课程。仓库还提供了自己动手核算成本的素材01-intro/homework.md 的加分题给出了 gpt-4o 的价格示例输入 $0.005/1K token、输出 $0.015/1K token并引导学员按每次请求平均发送 150 token、接收 250 token的假设估算 1000 次请求的成本。需要说明的是这些价格是课程当时2025 年 6 月 17 日的快照API 定价会随时变化以服务商最新价格为准。时间投入与课程节奏问答 15给出了每周约10 小时的预估模块视频 阅读约 4 小时作业/项目约 6 小时问答 16说明课程总时长为10 周入门模块 2 周模块 2–5 各 1 周结业项目期 3 周预计夏末完成启动直播纪要的排期略有不同内容交付约 5 周 2 周项目 1 周同伴评审并以每个模块上线后 3 周为作业截止期限的机制运行说明具体时间表以当届课程平台公告为准。作业通过 courses.datatalks.club 平台提交此链接为课程管理平台见 cohorts/2025/README.md。仓库导航新学员如何上手问答 14给出了 GitHub 仓库的浏览路径打开仓库 README按顺序跟随模块链接点击每个模块文件夹查看视频与作业使用Project Attempts项目提交部分浏览历届学员项目与同伴评审指南。以 2025 届为例入口是 cohorts/2025/README.md其中列出了每个模块的 Homework 链接、课程平台与视频播放列表各模块文件夹内部结构统一为README含视频、代码链接与安装命令 Notebook 数据 作业。启动直播纪要还强调了一个社区协作细节遇到问题时按FAQ 文档 → Slack 历史 → Slack 机器人 → 频道提问的顺序求助不要直接 讲师。报名与完成课程的全流程问答 18汇总了参与课程的完整步骤Star 并 ForkGitHub 仓库以示支持在仓库落地页点击 Sign up 注册加入社区Telegram/Slack获取公告参加启动直播5 月 27 日了解内容概览每周观看当周模块视频、完成作业、通过课程平台提交结业项目构建并文档化你的 RAG 应用并评审他人项目证书成功提交项目并完成同伴评审后获得。关于证书project.md 补充了硬性规则必须评审 3 个同伴项目否则项目视为不完整证书还需要在课程平台更新证书姓名。结业项目有两次提交机会Attempt #1 与 Attempt #2见 cohorts/2025/project.md评分标准与同伴评审指南在根目录 project.md 中统一维护。需要提醒的是FAQ 文档不能作为结业项目的数据集——项目文档明确要求挑选不同的语料。总结综合 18 个问答与仓库证据LLM Zoomcamp 2025 的画像非常清晰它是一门零门槛、低预算、重实战的 RAG 课程——只需 Python 与命令行基础约 10 美元 API 额度即可走完全程核心模块聚焦 RAG 流水线、向量搜索、离线评估MRR/recall 与 LLM-as-a-Judge与基于 Phoenix 的监控明确将 agentic AI、MCP 与完整 MLOps 排除在正式大纲之外每周约 10 小时、总计 10 周的节奏以结业项目 同伴评审作为拿到证书的最终关卡。对于想亲手构建一个生产级 RAG 系统、并把它做成可展示作品集的开发者来说这份课前问答已经给出了全部关键信息——剩下的就是打开 cohorts/2025/README.md 开始第一课。【免费下载链接】llm-zoomcampLLM Zoomcamp - a free online course about real-life applications of LLMs. In 10 weeks you will learn how to build an AI system that answers questions about your knowledge base. Register here 项目地址: https://gitcode.com/GitHub_Trending/ll/llm-zoomcamp创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表