我试图理解Gridsearchcv的逻辑是如何工作的。我看着
here
,这位官员说
documentation
,以及源代码,但我无法理解以下内容:
Gridsearchcv背后的一般逻辑是什么?
澄清
:
-
如果我使用默认的cv=5,那么输入数据的百分比分割是多少
分为:培训、验证和测试?
-
Gridsearchcv多久执行一次这样的拆分,它如何决定哪些观察结果属于训练/验证/测试?
-
既然正在进行交叉验证,那么在超参数调整中,平均值在哪里起作用呢?i、 e.最优超参数值是优化某种平均值的值吗?
这个问题
here
我也有同样的担心,但我不知道这些信息有多新,我也不确定我是否了解那里的所有信息。例如,根据OP,我的理解是:
-
测试集是输入数据集的25%,并且是创建的
一旦
.
-
这个
联盟
相应地创建了列车组和验证集
一旦
这个联合是原始数据的75%。
-
然后,程序创建5(因为cv=5)进一步将这75%分成60%序列和15%验证
-
优化的超参数值是优化这5个拆分上某些度量的平均值的值。
这种理解正确吗?现在仍然适用吗?那么这个过程是如何将原来的25%-75%分割的呢?