
示例工程【免费下载链接】notebooks250 Fine-tuning RL Notebooks for text, vision, audio, embedding, TTS models.项目地址https://gitcode.com/GitHub_Trending/notebooks24/notebooks点击查看免费下载本文以仓库根目录 README.md 为骨架系统性讲解该仓库如何组织 250 个覆盖文本、视觉、音频、Embedding 与 TTS 模型的微调Fine-tuning和强化学习RLNotebook从按模型家族组织的完整索引到 Colab / Kaggle / AMD ROCm / molab 四种运行平台的变体分发再到基于update_all_notebooks.py的自动化生成、依赖钉扎与贡献流程。读完本文你将能够快速定位任意模型的可用 Notebook、理解仓库目录结构与生成管线并掌握如何用模板向仓库贡献一个新 Notebook。仓库定位一个 Notebook 的全集散装库README.md 开门见山地定义了仓库性质Fine-tuning Notebooks——按模型组织的 Colab Notebook 集合。每个 Notebook 都能在本机运行且自带完整闭环数据准备data prep、训练training与推理inference。这与仓库顶层目录一一对应目录 / 文件职责nb/面向 Colab 的主 Notebook 集合.ipynbREADME 中绝大多数链接指向这里kaggle/面向 Kaggle 平台的 Notebook 变体如 Gemma4_(31B)-Text.ipynb-Text.ipynb)molab/面向 Marimo molab 的响应式 Notebook.py源码如 Qwen3_(14B)-Reasoning-Conversational.py-Reasoning-Conversational.py)python_scripts/由 Notebook 转换而来的纯 Python 脚本nbconvert产物original_template/已命名待处理的原始模板入库目录是贡献流程的入口scripts/生成管线辅助脚本molab 生成、清单、修复、库存分析等tests/57 个测试文件构成的自动化校验套件Template_Notebook.ipynb所有 Notebook 的标准结构模板update_all_notebooks.py一键生成与同步的核心脚本7172 行pyproject.toml项目元数据与生成工具链依赖marimo、ruff 等README 同时说明这些 Notebook run locally即代码可在本地 GPU、Colab 或 Kaggle 上运行核心依赖是 Unsloth 微调框架安装指南与 Notebook 文档详见仓库维护的announcement文本中的官方文档链接。核心索引按模型家族组织的 Notebook 目录README 的主体是一个大型索引全部 Notebook 按模型家族 × 任务类型两维组织。首先是一张手写的 Main Notebooks 精选表README 第 18-40 行代表当前主推的模型入口模型类型Notebook 路径Unsloth StudioChat UInb/Unsloth_Studio.ipynbGemma 4 (E2B)Visionnb/Gemma4_(E2B)-Vision.ipynb-Vision.ipynb)Qwen3.5 (4B)Visionnb/Qwen3_5_(4B)_Vision.ipynb_Vision.ipynb)Qwen3.5 (2B)Visionnb/Qwen3_5_(2B)_Vision.ipynb_Vision.ipynb)gpt-oss (20B)Fine-tuningnb/gpt-oss-(20B)-Fine-tuning.ipynb-Fine-tuning.ipynb)gpt-oss (20B)GRPOnb/gpt-oss-(20B)-GRPO.ipynb-GRPO.ipynb)Qwen3 (14B)Conversationalnb/Qwen3_(14B)-Reasoning-Conversational.ipynb-Reasoning-Conversational.ipynb)Qwen3-VL (8B)Visionnb/Qwen3_VL_(8B)-Vision.ipynb-Vision.ipynb)Qwen3-Embedding (0.6B)Embeddingsnb/Qwen3_Embedding_(0_6B).ipynb.ipynb)Qwen3 (4B)GRPO高级nb/Qwen3_(4B)-GRPO.ipynb-GRPO.ipynb)Gemma 3 (4B)Visionnb/Gemma3_(4B)-Vision.ipynb-Vision.ipynb)Gemma 3N (4B)Audionb/Gemma3N_(4B)-Audio.ipynb-Audio.ipynb)EmbeddingGemma (300M)Embeddingsnb/EmbeddingGemma_(300M).ipynb.ipynb)Ministral 3 (3B)Visionnb/Ministral_3_VL_(3B)_Vision.ipynb_Vision.ipynb)Mistral v0.3 (7B)Alpacanb/Mistral_v0.3_(7B)-Alpaca.ipynb-Alpaca.ipynb)Llama 3.1 (8B)Alpacanb/Llama3.1_(8B)-Alpaca.ipynb-Alpaca.ipynb)Llama 3.2 (1B 3B)Conversationalnb/Llama3.2_(1B_and_3B)-Conversational.ipynb-Conversational.ipynb)Phi-4 (14B)Conversationalnb/Phi_4-Conversational.ipynbOrpheus-TTS (3B)TTSnb/Orpheus_(3B)-TTS.ipynb-TTS.ipynb)在精选表之后README 用一行 HTML 注释标记了一个关键事实接下来的所有分区表格都是update_all_notebooks.py自动生成的README 第 41-42 行DO NOT EDIT MANUALLY THIS SECTION/GENERATED BY update_all_notebooks.py AUTOMATICALLY。这解释了为什么 README 中的链接结构高度规律——每个链接都是nb/文件名.ipynb的 Colab badge。自动生成的分区包括Gemma 4 NotebooksE2BSudoku GRPO、Auto Kernel Creation、2048 Game、Vision/Conversational/Audio、E4BVision/Conversational/Audio、31B、26B A4B 等GRPO Reinforcement Learning NotebooksMuse Glimmer 30B Sudoku、Llama3.1 8B GSM8KvLLM、NeMo Gym、gpt-oss 20B 的 2048/扫雷/Auto Kernel、Qwen3 8B DAPO、Llama3 8B ORPO、Zephyr 7B DPO、OpenEnv Wordle、Qwen2.5-VL 7B Vision Math、Gemma3/Phi4/Gemma4 各尺寸 GRPO 等Tool CallingQwen2.5-Coder 1.5B、FunctionGemma 270M 的 Multi-Turn / Mobile Actions / Inference / ConversationalText-to-Speech (TTS)Spark TTS 0.5B、Llasa TTS 1B/3B、Orpheus 3B、Sesame CSM 1B、Oute TTS 1BVision (Multimodal)Qwen2.5-VL、Qwen3-VL、Qwen3.5、Gemma3/Gemma3N/Gemma4、Muse Glimmer、ERNIE 4.5-VL、Llama3.2 11B、Pixtral 12B、Ministral3-VL、LFM2.5-VL 等EmbeddingModernBert、Qwen3 Embedding 4B/0.6B、EmbeddingGemma 300M、ModernBERT Large、BGE M3、All MiniLM L6 v2Speech-to-Text (STT)Whisper Large Fine TuningOCRDeepseek OCR 3BFine Tuning / Evaluation / Eval、Deepseek OCR 2、Paddle OCR 1B其余按家族分组的 BERT、Deepseek、ERNIE、GLM、GPT-OSS、Gemma、Granite、Hybrid AttentionLFM2.5 / Liquid / Falcon、Llama、Mistral、Nemotron、Paddle、Phi、Qwen、Text Completion/CPT 分区以及 Specific use-case文本分类、KTO、ChatML、推理 Chat UI与 Other 分区。这个手写精选 脚本自动生成的双层结构是仓库可维护性的核心设计人工维护入口Main 表与机器维护出口自动表物理分离读者不会因误改自动区而破坏生成一致性。多平台分发同一内容四种运行形态同一个 Notebook 逻辑仓库以四种形态分发README 的四个大节Colabnb/、Kagglekaggle/、AMD ROCmnb/AMD-*.ipynb、molabmolab/*.py。Colab默认分发形态绝大多数链接指向nb/目录README 头部提供 Start Free Finetune 一键按钮。所有 Colab Notebook 都遵循同一条运行路径免费 Tesla T4 实例上点Runtime → Run all。这也体现在 update_all_notebooks.py 的general_announcement_content常量中To run this, pressRuntimeand pressRun allon afreeTesla T4 Google Colab instance!。KaggleT4 加速的折叠分区README 用details折叠块承载 Kaggle 变体每个链接带acceleratornvidiaTeslaT4参数即默认在 Kaggle 的 NVIDIA Tesla T4 加速器上打开。Kaggle 变体的安装块与 Colab 不同见 update_all_notebooks.py 第 322-341 行的installation_kaggle_content它通过 PyTorch 官方 cu128 索引安装 torch/torchvision/torchaudio/xformers再装unsloth与torchao0.16.0最后统一钉扎transformers与trl。AMD ROCm独立于 Colab 的 GPU 变体README 明确说明 AMD Notebook 面向AMD ROCm GPU不提供 Colab 入口需直接从仓库下载运行。AMD 变体的安装单元是单个规范%%bash单元update_all_notebooks.py 第 755-773 行的installation_amd_cell它依次完成探测 ROCm 版本依次尝试amd-smi、/opt/rocm/.info/version、hipconfig、dpkg-query/rpm→ 归一化到rocm6.x/rocm7.x标签 → 按标签从 PyTorch ROCm 索引安装 torch 全家 →unsloth[amd]/unsloth_zoo[amd]→ 钉扎tokenizers。GRPO 变体额外追加一行os.environ[UNSLOTH_VLLM_STANDBY] 1第 781-783 行。仓库甚至为 AMD 路径单独维护了例外清单例如Gemma3N_(2B)-Inference因 sglang 无 ROCm wheel 而不生成 AMD 版本AMD_SKIP_NOTEBOOKS第 1512-1514 行。molabMarimo 响应式 NotebookREADME 用!-- MOLAB:START --标记 molab 分区这些是 Marimo 托管的 GPU Notebook特点是响应式——修改某个 cell 的值下方依赖 cell 自动重算。molab 文件是.py而非.ipynb由 scripts/molab_generate.py 从nb/转换而来其核心函数_is_install_cell、_replace_colab_mentions、_modernize_run_instruction等见该文件第 105/255/302 行并在 pyproject.toml 的generatorextra 中钉扎marimo0.23.8与ruff0.15.16保证再生成字节级稳定。标准 Notebook 内容骨架数据准备 → 训练 → 推理 → 保存README 声明每个 Notebook feature data prep, training and inference。从 update_all_notebooks.py 第 71-80 行的general_announcement_content可看到每个 Notebook 的固定章节指引You will learn how to do data prep (#Data), how to train (#Train), how to run the model (#Inference), how to save it (#Save)。这构成了统一的信息架构安装单元%%capture!pip install按平台Colab/Kaggle/AMD/molab与模型家族换用不同安装块见下文数据准备加载数据集、构造对话模板、格式化 prompt训练调用 Unsloth 的模型加载 API 与SFTTrainer/GRPOTrainer等训练器推理FastLanguageModel.for_inference等快速生成路径保存save_pretrained_merged/push_to_hub_merged/ GGUF 导出save_pretrained_gguf等对应脚本中用正则维护的这些 API 调用模式update_all_notebooks.py 第 1229-1244 行的_RE_SAVE_GGUF、_RE_SAVE_MERGED等。依赖钉扎机制为什么每个 Notebook 的安装单元都长这样README 虽然不展示安装细节但仓库的生成脚本将其作为一等公民管理——这是所有 Notebook 可复现运行的地基。核心是 update_all_notebooks.py 顶部的一组PIN_*常量第 106-116 行常量值作用PIN_TRANSFORMERStransformers4.56.2全局默认 transformers 钉扎部分模型家族单独覆盖如 Gemma4 用 5.5.0、Qwen3-VL 用 4.57.1PIN_TRLtrl0.22.2--no-deps全局默认 TRL 钉扎PIN_TOKENIZERS_SPECtokenizers0.22.0,0.23.0与 transformers 5.x 配套的 tokenizers 区间约束围绕这些常量脚本为不同任务族组装安装块GRPO 家族启用UNSLOTH_VLLM_STANDBY且按是否为 T4 拆分 vLLM 钉扎vllm0.11.2vsvllm0.15.1第 385-410 行QAT 家族按 torch 版本从映射表动态解析torchao/fbgemm-gpu-genai并钉扎 numpybuild_qat_native_install_block第 247-283 行TTS 家族Orpheus、Spark、Oute、Llasa、Sesame在基础块上追加各自的 codec/依赖与上游 git 修订钉扎如PIN_SPARK_TTS_REF、PIN_OUTETTS_REF第 122-123 行。这套生成器持有真相的设计配合 tests/test_notebook_pin_consistency.py、tests/test_every_notebook_installs_its_stack.py 等测试保证 Notebook 内的钉扎永远与生成器同步。一键维护update_all_notebooks.py 的使用与实现命令行参数README 的贡献流程只展示了python update_all_notebooks.py一种调用但脚本实际支持一组完整 CLI 参数update_all_notebooks.py 第 6842-6896 行参数说明--to_main_repo面向 Unsloth 主仓库更新 Notebook 与 README--check_missing_files检查目标目录相对original_template的缺失文件--reverse反向检查以nb为基准检查original_template--disable_convert_to_script跳过 Notebook → Python 脚本转换默认会生成python_scripts/--news_only只更新所有 Notebook 的 News 区块跳过安装/README/拼写等全部其他更新--amd只重新生成 AMD Notebook 与 AMD Python 脚本--workers N并行 worker 数0按 CPU 自动检测1串行--executor {thread,process}并行执行后端默认 process--progress / --no-progress开关 tqdm 进度条处理流程main()第 5585 行的核心链路是扫描nb/*.ipynb剔除DONT_UPDATE_EXCEPTIONS第 1492-1504 行中 12 个手维护例外自定义安装、自定义 RL 环境等对每个 Notebook 执行_process_single_notebook第 5510 行更新安装/News 区块、执行文本修复、拼写检查SpellChecker与 AST 语法检查validate_notebook_syntax第 1980 行——拼写与语法问题会汇总打印convert_notebook_to_script第 6608 行用nbconvert的PythonExporter把 Notebook 同步导出为python_scripts/下的.pyupdate_readme第 5663 行根据ARCHITECTURE_MAPPING第 1356-1429 行如gemma4→Gemma 4、lfm→Hybrid Attention与KNOWN_TYPES_ORDERED第 1441-1488 行自动重写 README 的生成区并按priority_sectionsGemma 4、GRPO、Tool Calling、TTS、Vision、Embedding、STT、OCR 优先排序还会通过refresh_model_created_cache用 HF 模型创建时间排序行配合 scripts/model_created_at.csv 缓存完成后即可提交 PR。从源码结构看这套管线把人类维护内容与机器生成内容严格切分手写区Main 表、导读不受自动更新影响自动区由脚本全权负责且生成结果有测试守护如 tests/test_python_scripts_regen_parity.py 校验脚本再生成一致性、tests/test_molab_generation_parity.py 校验 molab 转换一致性。如何贡献一个新 NotebookREADME 官方流程README 末尾提供了标准的贡献四步曲全部在仓库内闭环完成找模板根目录的Template_Notebook.ipynb定义了所有 Notebook 的基础结构与格式规范创建 Notebook复制模板并重命名命名规范为Model Name-Type.ipynb例如Mistral_v0.3_(7B)-Alpaca.ipynbVision 类用Model Name-Vision.ipynbType的合法取值包括Alpaca、Conversational、CPT、DPO、ORPO、Text_Completion、CSV、Inference、Unsloth_Studio等放入original_template/把成品移动到该目录一键生成终端执行python update_all_notebooks.py脚本会自动完成三件事——把 Notebook 从original_template复制到nb、更新 Notebook 内部章节Installation、News 等保持一致、把该 Notebook 加入 README.md 的对应分区表随后提交 PR 即可。对贡献者而言第 4 步的加入 README正是上文update_readme与ARCHITECTURE_MAPPING的功劳脚本根据文件名自动推断模型家族与任务类型归入正确分区无需手改 README 表格。质量保障脚本辅助与测试套件仓库把生成与校验分置scripts/提供生成/修复辅助tests/提供回归保障。scripts/ 辅助脚本molab_generate.pyNotebook→marimo 转换核心函数见第 105/255/302 行、molab_readme.py/molab_manifest.pymolab 分区 README 与清单、notebook_inventory.py提供iter_notebooks、iter_code_cells、strip_jupyter_magics、extract_pip_pins_from_cell、read_pin_constants等共享工具被测试与 CI 复用、fix_html_tags.py/fix_templates.py历史修复、lint_exec_literals.py/lint_workflow_triggers.py安全 linttests/ 测试套件57 个文件覆盖 Notebook JSON 合法性test_notebook_json_validity.py、安装栈完整性test_every_notebook_installs_its_stack.py、钉扎一致性test_notebook_pin_consistency.py、vLLM/transformers 兼容test_pinned_vllm_can_import_pinned_transformers.py、molab 有效性test_molab_marimo_validity.py、AMD 安装一致性test_notebook_amd_install_parity.py以及安全类测试tests/security/下的恶意 wheel/sdist 扫描等。环境侧pyproject.toml 声明requires-python 3.13运行生成器需先执行pip install -e .[generator]获取 marimo 与 ruff。实操指引如何从 250 Notebook 中找到你需要的那个按模型找Gemma 系列3/3N/4 全家族、Qwen 系列2/2.5/3/3.5/3.6/3.8、VL、Embedding、MoE、Llama 系列3/3.1/3.2/3.3、Mistral 系列7B/Nemo/Small/Ministral/Pixtral/Magistral、gpt-oss、Phi、GLM、ERNIE、Nemotron、Granite、Falcon/Liquid/LFM2.5 等均可在 README 对应分区直接定位按任务找GRPO/DPO/ORPO 强化学习、工具调用、TTS、STT、OCR、Embedding、Vision、文本补全/CPT、知识蒸馏Qwen3 0.6B、QAT 量化感知训练、手机端部署Gemma3 270M / Qwen3 0.6B ExecuTorch、KG 级 500K 上下文微调gpt-oss 20B等README 分区名即任务名按平台找默认 Colab 用nb/无 GPU 预算用 KaggleT4AMD 显卡用AMD-*变体偏好响应式 Notebook 用molab/*.py按环境找文件名中的(A100)、(80GB)、(DGX Spark)、BF16、FP8、MXFP4、BNB后缀直接标注了目标硬件与精度例如 nb/gpt-oss-(120B)A100-Fine-tuning.ipynb_A100-Fine-tuning.ipynb) 面向 A100、nb/gpt_oss(20B)_Reinforcement_Learning_GRPO_Minesweeper_Game_BF16.ipynb_Reinforcement_Learning_GRPO_Minesweeper_Game_BF16.ipynb) 面向 BF16 扫雷 RL。综上本仓库的价值不在于某个单一实现而在于它把模型微调/RL 的现成可运行 Notebook做成了标准化、多平台、可自动维护的工程体系读者拿来即用贡献者按模板流水线化产出机器保证版本、钉扎与文档三者永远一致。这正是任何一个以示例代码库形态存在的开源项目最值得借鉴的工程范式。赞分享示例工程【免费下载链接】notebooks250 Fine-tuning RL Notebooks for text, vision, audio, embedding, TTS models.项目地址https://gitcode.com/GitHub_Trending/notebooks24/notebooks点击查看免费下载相关推荐vLLM-Omni 接入新 TTS 模型完全指南从三条架构路线到 CI 全绿vLLM Omni 接入新 TTS 模型完全指南从三条架构路线到 CI 全绿 读完本文你能独立做这些事 把一个新的文本转语音TTS模型接入 vLLM Om人工智能大模型模型推理服务多模态语音音频媒体生成本地部署基于 Unsloth 的 DeepSeek-R1-0528-Qwen3-8B GRPO 强化学习微调实战与 SwanLab 可视化监控基于 Unsloth 的 DeepSeek R1 0528 Qwen3 8B GRPO 强化学习微调实战与 SwanLab 可视化监控 话不多说直接开始 本教程大模型本地部署微调使用 Unsloth 高效微调 Qwen3从 SFT、QLoRA 到 MoE 与 GRPO 强化学习完整实战指南使用 Unsloth 高效微调 Qwen3从 SFT、QLoRA 到 MoE 与 GRPO 强化学习完整实战指南 本指南基于 Qwen3 官方仓库文档 doc人工智能大模型Qwen模型评测示例工程本地部署教程上一篇Happy 应用零依赖类型安全 i18n基于对象与函数的 t(key, params) 国际化实现详解下一篇抖音视频去水印批量下载完整指南创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考