代码之家  ›  专栏  ›  技术社区  ›  Ray Zhang

Python statsmodels:回归概要,如何获取引用伪变量的p值?

  •  0
  • Ray Zhang  · 技术社区  · 7 年前

    我正在运行MNLogit(多项逻辑回归),如下所示:

    from statsmodels.formula.api import MNLogit
    model=MNLogit.from_formula("y ~ x", df).fit()
    model.summary()
    

    变量y是范畴的,似乎是由MNLogit函数自动进行伪编码的。摘要输出为除引用类别外的y的每个类别提供一行。

    1) 如何获取引用类别的标识?(由于y的类别很多,手动计算这一点很乏味)

    2) 由于参考类别没有z或P>| z |(P值),我如何评估参考类别的重要性?

    3) 如何更改将哪个类别视为参考类别?

    2 回复  |  直到 7 年前
        1
  •  0
  •   user2974951    7 年前
    1. 截获项是参考水平(即“缺失”类别)的结果, 您可以通过检查变量的第一级来检查引用是什么
    2. 检验统计量和p值在参考类别的截距项中
    3. 重新调整你的分类变量,你可以选择使用不同的对比度处理来设置你想要的对比度。
        2
  •  0
  •   jtweeder Todd Gardner    7 年前
    1. 我相信statmodels MNLogit是字符串排序列表中的第一个变量,其中列出了可能的y变量,这些变量通常用作引用。您可以使用 model.model._ynames_map 在你的例子中。这将返回一个字典和带有 0 键应该是用于引用的键。

    2. This site 提供了一些如何解释参照物的信息。我不想重打一遍来强调这一点。但在python语言中,不包含租户的统计信息。

    3. 由于第一个排序后的响应作为参照物,我相信您必须通过添加“AAAAA”或类似于响应的内容来更改响应,以确保它首先出现在列表中,但是一旦您能够知道引用对象是哪个并根据需要调整结论措辞,那么就没有必要了。