代码之家 › 专栏 › 技术社区 › X.Jun

readr::read_csv问题:汉字变成乱码

readr tidyverse dplyr r

X.Jun · 技术社区 · 7 年前

我试图将一个数据集导入RStudio,但我一直在使用汉字,因为它们会变成杂乱的代码。代码如下:

library(tidyverse)
df <- read_csv("ä¸æ,è±æ\nè±æ,å¾·æ")
df
# A tibble: 1 x 2
  `\xd6\xd0\xce\xc4`            `Ó¢\xce\xc4`
               <chr>                  <chr>
1 "<U+04E2>\xce\xc4" "<U+00B5>\xc2\xce\xc4"

当我使用基函数read时。csv,它工作得很好。我想我一定是编码出错了。但是在read_csv中没有编码选项,我该怎么做?

1 回复 | 直到 7 年前

yutannihilation 7 年前

这是因为字符标记为 UTF-8 而实际编码是系统默认值(您可以通过 stringi::stri_enc_get() ).

因此,您可以执行以下任一操作:

1) 读取编码正确的数据:

df <- read_csv("ä¸æ,è±æ\nè±æ,å¾·æ", locale = locale(encoding = stringi::stri_enc_get()))

2) 读取编码不正确的数据,稍后用正确的编码进行标记(请注意,这并不总是可行的):

df <- read_csv("ä¸æ,è±æ\nè±æ,å¾·æ")
df <- dplyr::mutate_all(df, `Encoding<-`, value = "unknown")

推荐文章

Amp · 使用R ggplot2删除geom_radial中axis.line和panel.border之间的空格

5 月前

Hard_Course · 用另一列中的值替换行的最后一个非NA条目

5 月前

Mark R · 使用geom_sf()删除地球仪上不需要的网格线

5 月前

Joe · 根据对工作日和本周早些时候的日期的了解,找到一个日期

5 月前

Ben · 统计向量中的单词在字符串中出现的频率

5 月前

TheCodeNovice · R中符号格式的尾随零和其他问题[重复]

5 月前

katefull06 · 在R中使用terra修改范围时,会为单独的SpatRaster重写范围

5 月前

dez93_2000 · 在R管道子功能中引用管道对象的当前状态

5 月前

accibio · 在ggplot2中为同一变量创建两个连续的颜色渐变比例

5 月前

Mankka · 如何在Ggplot2中绘制均匀的径向图

5 月前