代码之家  ›  专栏  ›  技术社区  ›  rydberg

熊猫按组分组值

  •  1
  • rydberg  · 技术社区  · 4 年前

    我有以下数据:

    df = pd.DataFrame({
        "dim1":   [ "aaa", "aaa", "aaa", "aaa", "aaa", "aaa" ],
        "dim2":   [ "xxx", "xxx", "xxx", "yyy", "yyy", "yyy" ],
        "iter":   [     0,     1,     2,     0,     1,     2 ],
        "value1": [   100,   101,    99,   500,   490,   510 ],
        "value2": [ 10000, 10100,  9900, 50000, 49000, 51000 ],
    })
    

    然后我 groupby dim1/dim2,在所有迭代中,我选择value1/value2作为最小值1:

    df = df.groupby(["dim1", "dim2"], group_keys=False) \
        .apply(lambda x: x.sort_values("value1").head(1)).drop(columns=["iter"])
    

    返回:

    dim1    dim2    value1  value2
     aaa    xxx         99    9900
     aaa    yyy        490   49000
    

    我的问题:如何添加包含每个dim1组的最小值1的新列:

    dim1    dim2    value1  value2     new_col
     aaa    xxx         99    9900          99
     aaa    yyy        490   49000          99
    

    我试过这样的方法,但没有成功:

    df["new_col"] = df.groupby(["dim1"], group_keys=False) \
        .apply(lambda x: x.value1.head(1))
    
    1 回复  |  直到 4 年前
        1
  •  2
  •   Andrej Kesely    4 年前

    IIUC,你可以用 .groupby + .transform 之后:

    df["new_col"] = df.groupby("dim1")["value1"].transform("min")
    print(df)
    

    印刷品:

      dim1 dim2  value1  value2  new_col
    2  aaa  xxx      99    9900       99
    4  aaa  yyy     490   49000       99