尧图网站设计 尧图网站设计YAOTU DESIGN
ARTICLE DETAIL

资讯详情

深耕网站设计与一线实操的经验洞察。

07 k-fold Cross Validation 中的 k 应该如何选择?

07 k-fold Cross Validation 中的 k 应该如何选择? 07 k-fold Cross Validation 中的 k 应该如何选择在 k-fold Cross Validation 中需要选择k常见取值包括5 10也有人使用3 20 甚至 N那么k 越大是不是越好答案是否定的。k 的选择本质上是在计算成本 评估方差 训练集大小 验证集大小之间做平衡。一、k 决定了什么假设总共有N个样本。k-fold 中每次 Validation Fold 大约包含Nk\frac{N}{k}kN​个样本。Training Fold 大约包含N×k−1kN\times\frac{k-1}{k}N×kk−1​个样本。例如N 1000 k 5则每轮大约Training 800 Validation 200如果k 10则Training 900 Validation 100二、k 越大训练集越接近完整数据当 k 增大时每轮 Training Data 更多例如5-fold → 80% Train 10-fold → 90% Train 20-fold → 95% Train因此模型每次训练时看到的数据越来越多。这可能减少由于训练样本不足造成的偏差。三、但是 k 越大计算成本越高如果k 5模型训练5 次如果k 10模型训练10 次如果还需要进行100 组超参数组合那么5-fold → 500 次训练 10-fold → 1000 次训练计算成本会迅速增长。四、为什么 5 和 10 最常见因为它们通常能够在下面几个因素之间取得较好平衡计算成本 训练数据比例 验证结果稳定性因此实践中经常使用5-fold 10-fold一个非常实用的默认选择是5-fold如果数据量不大并且计算资源允许10-fold也很常见。五、什么时候使用较小的 k例如k 3 k 5适合数据量比较大 模型训练成本高 需要大量超参数搜索此时减少 k 可以显著降低计算量。例如深度模型或者大型集成模型如果每次训练都很昂贵5-fold往往比 10-fold 更实际。六、什么时候可以使用较大的 k例如k 10 k 20适合数据集比较小 单次训练成本低 希望充分利用训练数据但是 Validation Fold 会变小。因此单个 Fold 的评估结果可能更加容易受到个别样本影响。七、Leave-One-Out Cross Validationk 最大的极端情况是k N也就是Leave-One-Out Cross Validation LOOCV每次N - 1 个样本训练 1 个样本验证例如100 个样本 → 训练 100 次每一次只留下 1 个样本进行验证。八、LOOCV 的优点LOOCV 每次几乎使用全部数据训练因此训练集非常接近完整数据集。在特别小的数据集中这看起来很有吸引力。九、LOOCV 的问题但是它有几个明显问题训练次数非常多 计算成本高 单次 Validation 只有一个样本 不同 Fold 之间高度相似因此它并不一定比5-fold 10-fold更实用。十、k 的选择与 Bias-Variance可以从 Bias 和 Variance 理解。较小 kTraining Set 较小 Validation Set 较大可能导致评估偏差更大 但单个 Validation Fold 更稳定较大 kTraining Set 更大 Validation Set 更小可能减小训练集规模带来的偏差但不同 Fold 的结果可能更加敏感。因此并不存在k 越大越好这样的规则。十一、类别不平衡时不要只考虑 k假设Positive 20 Negative 980如果k 20平均每个 Fold 只有约 1 个 Positive这会导致某些 Fold 的分类指标非常不稳定。因此类别不平衡时需要考虑每个 Fold 中至少有多少正样本这时Stratified k-fold往往比单纯增加 k 更重要。十二、分组数据需要 Group-wise Cross Validation如果同一个人、设备、患者或工厂批次产生多个样本那么不能让同一个实体的数据 同时出现在 Train 和 Validation否则模型可能只是记住实体特征。例如Patient 001 的数据 一部分在 Train 一部分在 Validation评估结果会过于乐观。应该按Patient Device User Batch Site进行分组划分。十三、时间数据不能随机打乱如果数据具有时间顺序2019 2020 2021 2022 2023普通 k-fold 可能导致未来信息泄漏。应该采用Train → Past Validation → Future例如Round 1: Train 2019 Validate 2020 Round 2: Train 2019-2020 Validate 2021 Round 3: Train 2019-2021 Validate 2022这类方法比选择 5-fold 还是 10-fold 更重要。十四、一个实用选择规则可以使用下面的经验流程。如果数据量较大 模型训练较慢优先5-fold如果数据量中等或偏小 模型训练成本可以接受可以10-fold如果数据非常小可以评估10-fold Repeated k-fold LOOCV但应该同时关注结果波动。十五、Repeated k-fold如果担心一次 k-fold 的随机划分仍然具有偶然性可以多次重复。例如5-fold 重复 10 次相当于得到50 个验证结果然后计算Mean Standard Deviation Confidence Interval这可以更加全面地观察模型稳定性但计算成本也更高。十六、Nested Cross Validation如果需要非常严格地估计模型选择 超参数搜索造成的偏差可以使用Nested Cross Validation 嵌套交叉验证结构为Outer CV → 估计泛化性能 Inner CV → 选择模型和超参数这是研究和严格模型比较中非常重要的方法。十七、最终建议在绝大多数普通机器学习任务中可以从5-fold开始。如果样本量不大 训练速度可以接受再考虑10-fold真正需要优先考虑的不是5 还是 10而是有没有 Data Leakage 类别比例是否合理 同一实体有没有跨 Fold 时间顺序有没有被破坏 评价指标是否符合任务目标这些问题通常比 k 本身更加重要。十八、总结k-fold 中的 k 是一个工程折中参数。常见默认k 5常见增强k 10但是最终选择必须结合数据量 训练成本 类别不平衡程度 分组结构 时间结构 模型稳定性进行判断。因此好的 Cross Validation 设计不只是选择一个 k而是让验证过程尽可能模拟模型未来真正面对的数据。
返回列表