人工智能基础
文章目录
- 一、机器学习四大学习范式
- 二、从人工智能到大模型的演变脉络
- 三、机器学习算法与任务分类
- 3.1 监督学习(带标签数据)
- 3.1.1 分类任务(输出离散类别)
- 3.1.2 回归任务(输出连续数值)
- 3.2 无监督学习(无标签数据)
- 3.2.1 聚类任务(样本自动分组)
- 3.2.2 关联规则挖掘(发现共现模式)
- 3.2.3 降维(高维数据压缩)
- 3.3 自监督学习(自动构造监督信号)
- 3.4 强化学习(交互反馈式学习)
- 3.5 深度学习(深度神经网络)
- 四、机器学习完整建模流程
- 4.1 数据预处理(清洗脏数据)
- 4.2 特征工程(建模核心步骤)
- 4.3 数据集划分
- 4.4 模型训练
- 4.5 模型评估与优化
- 五、拓展对比与核心要点
- 5.1 传统机器学习 vs 深度学习
- 5.2 过拟合与欠拟合(建模最常见挑战)
- 5.3 大模型时代的关键概念速览
一、机器学习四大学习范式
按训练信号来源划分,机器学习可分为四大主流范式:
| 学习范式 | 通俗注解 | 核心定义 | 典型任务与算法 | 应用场景 |
|---|---|---|---|---|
| 监督学习 | 人类给标准答案 | 训练数据包含「输入特征 + 人工标注标签」,模型学习输入到输出的映射关系 | 分类、回归;逻辑回归、SVM、决策树、随机森林 | 图像分类、房价预测、垃圾邮件识别 |
| 无监督学习 | 无标准答案,自主挖掘规律 | 数据无人工标签,模型挖掘数据内在分布与相似关系 | 聚类、降维、关联规则;K-Means、PCA、Apriori | 用户分群、购物篮分析、数据可视化 |
| 自监督学习 | 自己构造答案 | 基于无标注数据内部信息自动构造预测目标,是当前预训练的主流方案 | 掩码预测、对比学习;BERT、ViT、SimCLR | 大模型预训练、通用视觉/语言特征提取 |
| 强化学习 | 环境奖惩反馈 | 智能体与环境交互,依靠奖励/惩罚信号优化行为策略,最大化长期累积收益 | 策略梯度、DQN、PPO、RLHF | 游戏 AI、机器人控制、大模型对齐 |
辨析要点:自监督学习与无监督学习都不需要人工标注,区别在于——自监督会主动构造"伪标签"作为预测目标(如遮住一个词让模型猜),本质上仍是一种"有目标"的学习;无监督学习则完全不设预测目标,只关注发现数据结构。
二、从人工智能到大模型的演变脉络
四层从属关系,由外到内逐层聚焦:
| 层级 | 名称 | 定位 | 关键特征 |
|---|---|---|---|
| 第 1 层 | 人工智能(AI) | 总目标 | 让机器模拟人类感知、推理、决策能力;涵盖规则系统、搜索、知识图谱等 |
| 第 2 层 | 机器学习(ML) | AI 核心分支 | 不靠硬编码规则,通过数据自动学习规律 |
| 第 3 层 | 深度学习(DL) | ML 子集 | 多层深度神经网络,自动提取从底层到高层的特征 |
| 第 4 层 | 大模型(LLM/多模态) | DL 前沿应用 | 基于自监督预训练的超大参数模型,具备通用理解与生成能力 |
数学表达:AI ⊃ ML ⊃ DL ⊃ LLM \text{AI} \supset \text{ML} \supset \text{DL} \supset \text{LLM}AI⊃ML⊃DL⊃LLM
三、机器学习算法与任务分类
3.1 监督学习(带标签数据)
3.1.1 分类任务(输出离散类别)
- 目标:判断样本归属哪一类(二分类/多分类)
- 典型算法:逻辑回归、SVM、决策树、随机森林、CNN
- 案例:猫狗识别、疾病诊断、垃圾短信检测
3.1.2 回归任务(输出连续数值)
- 目标:预测连续实数值
- 典型算法:线性回归、多项式回归、梯度提升树(XGBoost、LightGBM)
- 案例:房价预测、销量预估、气温预测
3.2 无监督学习(无标签数据)
3.2.1 聚类任务(样本自动分组)
- 目标:按样本相似度自动划分群组
- 典型算法:K-Means、DBSCAN、层次聚类
- 案例:电商客户分层、文本主题聚类、异常检测
3.2.2 关联规则挖掘(发现共现模式)
- 目标:挖掘数据中频繁同时出现的组合关系
- 典型算法:Apriori、FP-Growth
- 案例:超市购物推荐(经典"啤酒与尿布")、商品搭配分析
3.2.3 降维(高维数据压缩)
- 典型算法:PCA、t-SNE、UMAP
- 作用:高维数据压缩与可视化、减少计算量、缓解维度灾难
3.3 自监督学习(自动构造监督信号)
- 核心思想:从未标注数据中设计"pretext task"(代理任务),让模型自己生成学习信号
- 主流范式:
- 掩码语言模型(MLM):随机遮住文本中的词,让模型预测——代表:BERT
- 掩码图像建模(MIM):遮住图像 patch 让模型重建——代表:MAE
- 对比学习:拉近同一样本不同增强视角,推远不同样本——代表:SimCLR、MoCo
- 意义:大模型时代预训练的基石,解决了人工标注成本过高的瓶颈
3.4 强化学习(交互反馈式学习)
- 核心要素:智能体(Agent)、环境(Environment)、状态(State)、动作(Action)、奖励(Reward)
- 主流算法:DQN、PPO、A3C、SAC
- 现代应用:RLHF(人类反馈强化学习,用于大模型价值观对齐)、AlphaGo、机器人运动控制、自动驾驶决策
3.5 深度学习(深度神经网络)
- 核心特点:多层神经网络自动提取"底层→高层"特征,无需人工特征工程
- 主流网络架构:
| 架构 | 擅长领域 | 代表模型 |
|---|---|---|
| CNN(卷积神经网络) | 图像、视频 | ResNet、EfficientNet |
| RNN / LSTM / GRU | 时序、语音 | Seq2Seq |
| Transformer | 文本、多模态(当前主流) | BERT、GPT、ViT、LLaMA |
| GAN / Diffusion | 图像生成 | StyleGAN、Stable Diffusion |
四、机器学习完整建模流程
完整链路:业务定义与数据采集 → 数据预处理 → 特征工程 → 数据集划分 → 模型训练 → 模型评估调优 → 部署上线与持续迭代
4.1 数据预处理(清洗脏数据)
解决原始数据缺陷,保证训练有效性:
| 步骤 | 操作 | 说明 |
|---|---|---|
| 缺失值处理 | 填充均值/中位数/众数,或删除高缺失字段 | 缺失比例 > 70% 的字段通常直接丢弃 |
| 异常值处理 | 箱线图(IQR)、3σ 原则 | 区分"真实极端值"与"录入错误" |
| 去重 | 删除完全重复样本 | 避免权重偏移 |
| 标准化/归一化 | Z-score 标准化、Min-Max 归一化 | 消除量纲影响,加速梯度下降收敛 |
| 类别编码 | One-Hot 编码、标签编码、Target 编码 | 将文本类别转为模型可计算的数值 |
4.2 特征工程(建模核心步骤)
将原始数据转化为有效预测特征:
- 特征构造:组合衍生新特征(如日均消费 = 总消费 / 天数;交互特征 = 特征A × 特征B)
- 特征选择:剔除无关、冗余特征,降低维度(方差过滤、互信息、L1 正则化)
- 特征变换:对数变换(处理偏态)、离散分箱、文本向量化(TF-IDF、Word2Vec)
经验法则:传统机器学习中,“数据和特征决定了模型上限,算法只是在逼近这个上限”。深度学习通过端到端学习弱化了人工特征工程,但在结构化数据(表格数据)场景中,精细的特征工程仍然关键。
4.3 数据集划分
标准三划分(通用比例 7:1:2 或 8:1:1):
| 数据集 | 比例 | 用途 | 注意事项 |
|---|---|---|---|
| 训练集 | 70%~80% | 模型学习参数 | — |
| 验证集 | 10%~15% | 调超参数、早停判断、模型筛选 | 可反复使用 |
| 测试集 | 10%~20% | 最终真实性能评估 | 只能在最终评估时使用一次 |
铁律:测试集禁止参与训练或调参,否则评估结果虚高,模型上线后性能将大幅退化(数据泄露)。
4.4 模型训练
- 根据任务类型选择对应算法(分类/回归/聚类/生成)
- 设置超参数(学习率、树深度、网络层数、Batch Size 等)
- 迭代优化:最小化损失函数,通过反向传播持续更新模型参数
- 早停策略(Early Stopping):验证集性能连续 N 轮不再提升时停止,防止过拟合
- 学习率调度:Warmup + Cosine Decay 等策略提升训练稳定性
4.5 模型评估与优化
分类任务核心指标:
| 指标 | 含义 | 适用场景 |
|---|---|---|
| 准确率(Accuracy) | 预测正确的比例 | 类别均衡时参考 |
| 精确率(Precision) | 预测为正中真正为正的比例 | 关注"误报"代价时(如垃圾邮件) |
| 召回率(Recall) | 实际为正中被正确识别的比例 | 关注"漏报"代价时(如疾病筛查) |
| F1-Score | 精确率与召回率的调和平均 | 综合衡量,类别不均衡时优先看 |
| AUC-ROC | 模型区分正负样本的整体能力 | 阈值无关的综合评估 |
回归任务核心指标:
| 指标 | 含义 |
|---|---|
| MSE(均方误差) | 对大误差惩罚更重 |
| MAE(平均绝对误差) | 对异常值更鲁棒 |
| R²(决定系数) | 模型解释方差的比例,越接近 1 越好 |
常用优化手段:网格搜索/随机搜索/贝叶斯优化调参、K 折交叉验证、正则化(L1/L2/Dropout)、集成学习(Bagging/Boosting/Stacking)、数据增强。
五、拓展对比与核心要点
5.1 传统机器学习 vs 深度学习
| 对比维度 | 传统机器学习 | 深度学习 |
|---|---|---|
| 代表算法 | 线性回归、SVM、决策树、XGBoost | CNN、Transformer、Diffusion |
| 特征工程 | 高度依赖人工设计 | 端到端自动学习特征 |
| 数据需求 | 小数据集(千~万级)即可工作 | 通常需要海量数据(百万级以上) |
| 算力需求 | CPU 即可 | 依赖 GPU/TPU 集群 |
| 可解释性 | 较强(可看特征权重、树结构) | 较弱(黑箱,需 SHAP/LIME 等辅助) |
| 适用场景 | 结构化表格数据、中小规模问题 | 图像、文本、语音、多模态等复杂任务 |
5.2 过拟合与欠拟合(建模最常见挑战)
| 问题 | 表现 | 常见原因 | 应对策略 |
|---|---|---|---|
| 过拟合 | 训练集表现好,验证/测试集差 | 模型过于复杂、数据量不足、训练过久 | 正则化、Dropout、早停、数据增强、增加数据 |
| 欠拟合 | 训练集和测试集表现都差 | 模型太简单、特征不足、学习率不当 | 增加模型复杂度、增加特征、延长训练 |
5.3 大模型时代的关键概念速览
| 概念 | 一句话解释 |
|---|---|
| 预训练(Pre-training) | 在海量无标注数据上用自监督任务学习通用表示 |
| 微调(Fine-tuning) | 在特定任务小数据集上继续训练,适配下游任务 |
| RLHF | 用人类偏好反馈训练奖励模型,再通过强化学习对齐模型输出 |
| Prompt Engineering | 通过设计输入提示词引导模型输出,无需修改参数 |
| RAG | 检索增强生成:先从知识库检索相关文档,再交给模型生成回答 |
| 多模态 | 模型同时理解文本、图像、音频、视频等多种信息形式 |