|
|
1
12
R在寻找一个进行机器学习和统计的环境时的优势无疑是它的库的多样性。据我所知,SciPy+scikets不能替代CRAN。 关于内存使用,R使用的是pass-by-value范式,而Python使用的是pass-by-reference。传递值可以产生更“直观”的代码,传递引用可以帮助优化内存使用。Numpy还允许在数组上有“视图”(类似于没有复制的子数组)。 就速度而言,对于访问数组中的单个元素,纯Python比纯R快,但是在处理numpy数组时,这种优势就消失了( benchmark ). 幸运的是,Cython让一个人很容易得到严重的速度改善。 如果使用大数据,我发现使用Python(HDF5)可以更好地支持基于存储的阵列。
|
|
|
2
11
我每天都用NumPy和R。 对于繁重的数字运算,我更喜欢NumPy而不是R(包括R包,比如‘Matrix’)。我发现语法更干净,函数集更大,计算速度更快(尽管我并不觉得R慢)。例如NumPy的广播功能,我认为R中没有类似的功能。 例如,要从csv文件读入数据集并“规范化”它以输入到ML算法(例如,平均中心然后重新缩放每个维度),只需要以下步骤:
另外,我发现在编写ML算法时,我需要能够对元素进行操作并且也能理解线性代数的数据结构(例如,矩阵乘法、转置等)。NumPy可以很容易地创建这些混合结构(没有操作符重载或子类化等)。
所以,有几点建议——总体上,特别是,考虑到你问题中的事实: |
|
|
Hard_Course · 用另一列中的值替换行的最后一个非NA条目 1 年前 |
|
Mark R · 使用geom_sf()删除地球仪上不需要的网格线 1 年前 |
|
|
Joe · 根据对工作日和本周早些时候的日期的了解,找到一个日期 1 年前 |
|
Ben · 统计向量中的单词在字符串中出现的频率 1 年前 |
|
|
TheCodeNovice · R中符号格式的尾随零和其他问题[重复] 1 年前 |
|
dez93_2000 · 在R管道子功能中引用管道对象的当前状态 1 年前 |
|
|
Mankka · 如何在Ggplot2中绘制均匀的径向图 1 年前 |