|
1
779
请参阅
pandas: IO tools
对于所有可用的
如果所有CSV文件都有相同的列,请尝试以下代码。
我已添加
或者,归因于以下评论 Sid .
导入和设置
选项1:
选项2:
选项3:
选项4:
或
|
|
|
2
363
替代方案 darindaCoder's answer :
|
|
|
3
114
|
|
4
80
这里几乎所有的答案要么不必要地复杂(glob模式匹配),要么依赖于额外的第三方库。您可以使用Pandas和Python(所有版本)已经内置的所有内容在两行中完成此操作。 对于几个文件-一行
对于许多文件
无标题如果你想用pd.read_csv更改特定的东西(即没有标头),你可以创建一个单独的函数,并用你的map调用它:
这个设置df的pandas行使用了三件事:
|
|
5
65
简单快捷导入两个或多个CSV文件,而无需列出名称。
|
|
|
6
60
Dask库可以从多个文件中读取数据帧:
(来源: https://examples.dask.org/dataframes/01-data-access.html#Read-CSV-files )
Dask数据帧实现Pandas数据帧API的一个子集。如果所有数据都存储在内存中,您可以
call
|
|
7
20
我用谷歌搜索了一下 Gaurav Singh's answer . 然而,最近我发现使用以下工具进行任何操作都会更快 NumPy 然后将其一次性分配给数据帧,而不是在迭代的基础上操纵数据帧本身,这似乎也适用于此解决方案。 我真诚地希望任何访问此页面的人都能考虑这种方法,但我不想将这段巨大的代码作为注释附加,使其可读性降低。 您可以利用NumPy来真正加快数据帧连接。
时间统计:
|
|
8
15
一个使用
注:
|
|
|
9
14
如果你愿意 递归搜索 ( Python 3.5或更高版本 ),您可以执行以下操作:
请注意,最后三行可以表示为一行 单线 :
您可以找到以下文档
EDIT:多平台递归函数: 你可以把上面的包裹成一个 多平台功能 (Linux、Windows、Mac),因此您可以执行以下操作:
功能如下:
|
|
|
10
9
笔记:
|
|
11
7
如果压缩了多个CSV文件,您可以使用 zip文件 全部阅读并连接如下:
|
|
12
7
另一个带有列表理解的单行线,允许使用参数 read_csv .
|
|
|
13
6
替代使用
这种方法避免了重复使用pandas
来自pandas文档:
|
|
14
4
基于 Sid's good answer . 识别缺失或未对齐列的问题
在连接之前,您可以将CSV文件加载到中间字典中,该字典根据文件名(格式为
导入模块并定位文件路径:
注:
将CSV文件加载到字典中。然后连接:
密钥是文件名
而不是使用
|
|
15
2
在哪里?
|
|
16
2
如果发生 未命名 列问题,使用此代码沿x轴合并多个CSV文件。
|
|
|
17
0
你也可以这样做:
|
|
|
18
0
考虑使用 convtools 库,它提供了大量的数据处理原语,并在后台生成简单的即席代码。 它不应该比熊猫/波兰更快,但有时确实可以。 例如,您可以将csv文件合并为一个文件以供进一步重用-以下是代码:
当然,如果你只想获得一个数据帧,而不想写入一个连接文件,这将需要
|
|
|
19
-2
|
|
20
-2
这就是你如何使用 Colaboratory 在 Google Drive :
|