代码之家  ›  专栏  ›  技术社区  ›  Mikz

随机林中列车和测试数据拆分查询

  •  0
  • Mikz  · 技术社区  · 8 年前

    我使用随机森林建模。我的数据集目标是预测客户是否会接受特定产品。

    因此,我的输出变量有“Yes”、“No”和“”的因子。

    我的问题是,我是否有可能在随机森林中预测“是”或“否”?

    示例数据如下所示

    Outputvar <- c("Yes", "Yes", "No", "NO", "", "")
    Inputvar1 <- c("M", "F", "F", "M", "F", "M")
    Inputvar2 <- c("34","25","40","50","60","34")
    data <- data.frame(cbind(Outputvar,Inputvar2,Inputvar1))
    

    我是R新手,如果我的理解是错误的,那么有人能解释一下我能做些什么吗?

    编辑:这是我一直尝试的代码

    library(RandomForest)
    data$outvar <- factor(data$outputvar, exclude = NULL)
    ind0 <- sample(2, nrow(data), replace = TRUE, prob = c(0.7,0.3))
    train0 <- data[ind0==1, ]
    test0 <-  data[ind0==2, ]
    fit1 <- randomForest(outputvar1~., data=train0)
    print(fit1)
    plot(fit1)
    

    编辑2: 编号:3536 是:1061

    1 回复  |  直到 8 年前
        1
  •  1
  •   Community Mohan Dere    6 年前

    我的数据集目标是预测客户是否会接受特定产品。

    因此,我的输出变量有“Yes”、“No”和“”的因子。

    好 不 . 此处的实际上下文是:

    输出变量只有两个因素,“是”&“否”;在可用数据集的一部分中,您没有结果的值(“”),您希望对其进行预测。

    我的问题是,我是否有可能在随机森林中预测“是”或“否”?

    原则上,是的——这正是诸如随机森林之类的分类器的用途。一般来说,您只需要使用结果(是/否)确实可用的样本来训练模型(训练集,可以用作测试集的子集,以便评估模型性能);之后,您可以使用 predict 以预测结果。

    当然,这只是一个复合流程的四行摘要,其中涉及许多步骤和子步骤,此处无法详细分析,但希望能为您提供一个(非常)高层次的问题视图(可以说,这就是您所要求的)。我的答案 your other relevant question 也应该是有用的。