
[!tip] 知识图解先观察各环节之间的关系再阅读下面的详细解释。核心认识机器学习的本质是用数据调整一个数学模型让它在没见过的新数据上也能做出较好的预测。训练数据 → 模型预测 → 与正确答案比较 → 计算误差 → 调整参数 → 重复模型并不是像人一样读懂教材而是在大量练习中不断调整内部参数使错误逐渐变小。一个完整训练过程否是收集与清洗数据划分训练/验证/测试集选择模型训练并调整参数验证与调参达到指标部署推理监控真实效果三份数据为什么要分开数据集用途类比训练集模型用来学习参数平时练习题验证集选择方案和调整超参数模拟考试测试集最后评估泛化能力正式考试如果模型在训练数据上很好、遇到新数据却很差叫作过拟合。解决思路包括增加有效数据、减少模型复杂度、正则化和更严格的验证。三类常见学习方式监督学习每条数据都有标准答案例如“邮件 → 垃圾邮件/正常邮件”。常用于分类、预测和回归。无监督学习数据没有标准答案模型寻找相似性和隐藏结构例如客户分群、异常发现和降维。强化学习智能体采取行动环境给予奖励或惩罚模型逐渐学会取得更高长期奖励的策略。深度学习是什么深度学习是机器学习的一部分使用多层神经网络逐层提取特征图片像素 → 边缘 → 形状 → 眼睛/耳朵 → 猫 文本 Token → 词语关系 → 句子含义 → 上下文表示它适合图像、声音、文本等规则难以手写的复杂数据但通常需要更多数据、算力和工程投入。数据比算法更重要的情况标签错误会让模型学习错误规律样本不平衡会使少数情况被忽略历史偏见会进入模型输出训练数据与真实场景不同会造成分布偏移泄露测试答案会让评估看起来虚高。应该记住训练是调整参数推理是使用训练好的参数处理新输入。模型的价值看新数据表现而不是训练数据表现。高质量、代表性数据通常比盲目增大模型更重要。深度学习不是所有问题的最佳答案固定规则能解决时优先普通程序。