代码之家  ›  专栏  ›  技术社区  ›  Laura

使用dplyr创建一个新变量,其中,基于一个变量是否具有特定值,而上一个或下一个值在R中是否具有不同的值

  •  0
  • Laura  · 技术社区  · 8 年前

    我有这样的数据

    df <- data.frame(
    ID = c(rep("A12345",5), rep("A23456",10), rep("A34567",5), "A45678", "A67891", rep("A78910",8), "A91011", 
           rep("A10111",4), rep("A11121",3), "A12131", "A16731"),
    medication = c(rep("colchicine",5), rep("febuxosat",9), "hosps", rep("colchicine",5), "hosps", "colchicine", 
                  rep("allopurinol",8), "allopurinol", 
                  rep("colchicine",3), "hosps", rep("colchicine",3), "colchicine", "allopurinol"),
    Date = c("2004-12-08", "2005-01-28", "2005-07-15", "2005-08-23", "2005-11-30", "2007-02-01", "2007-07-20", "2014-06-03", 
             "2008-04-17",
             "2008-12-19", "2009-09-09", "2010-02-24", "2010-11-01", "2010-12-03", "2011-08-10", "2012-11-05", "2012-12-17", 
             "2012-12-19", "2013-10-03", "2013-12-11", "2014-03-26", "2015-11-12", "2014-08-07", "2008-01-31", "2008-02-21", 
             "2008-09-19", "2008-11-06", "2009-01-06", "2009-01-14", "2009-03-25", "2009-03-27", "2009-06-18", "2009-08-18", 
             "2009-09-08", "2009-11-13", "2010-01-21", "2010-04-19", "2010-07-07", "2010-08-06", "2010-08-19")
    )
    

    df <- df %>%
    mutate(year = as.numeric(substr(Date, 1,4))) %>%
    group_by(ID) %>%
    mutate(meds_count = ifelse(medication %in% c("colchicine", "allopurinol", "febuxosat"), 1, 0)) %>%
    unite(ID_year, ID, year, sep = "_", remove = FALSE) %>%
    group_by(ID_year) %>%
    mutate(meds_sum = sum(meds_count)) %>%
    distinct(ID_year, .keep_all = TRUE) 
    

    然后我创建一个新变量‘gout’,如果meds_sum变量等于或大于4,则该变量为值1;否则为0。

    df <- df %>%
    mutate(gout = ifelse(meds_sum >= 4, 1, 0))
    

    然后,我要创建一个新变量gout2,如果meds_sum变量等于或大于4,则该变量为值1;如果meds_sum在前一年或后一年不为零,则该变量为值1。这是我在最后一步中要做的,但是lead()和lag()在这段代码中创建了NA值。

     df <- df %>% 
     mutate(gout2 = ifelse((meds_sum >= 4 & ((lead(meds_sum) >= 1 | lag(meds_sum)) >= 1)), 1, 0))
    

    有人能告诉我我做错了什么吗?

    这就是我希望输出的样子:

    df$gout2 <- c(0, 0, 0, 1, 1, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 1, 1, 0, 0)
    
    1 回复  |  直到 8 年前
        1
  •  0
  •   Akarsh Jain    8 年前

    在最后一步使用此代码,您需要使用group_by()对变量“ID”进行分组,以便产生所需的效果。

    df <- df %>% 
      group_by(ID)%>%
      mutate(gout2 = ifelse((meds_sum >= 4 & ((lead(meds_sum) >= 1 | lag(meds_sum)) >= 1)), 1, 0))
    

    推荐文章