代码之家  ›  专栏  ›  技术社区  ›  yukashima huksay

为什么在位编辑文件比创建新文件慢?

  •  1
  • yukashima huksay  · 技术社区  · 8 年前

    正如你在 this 答复似乎就地编辑文本文件比创建新文件、删除旧文件、从另一个文件系统中移动临时文件并重命名要花费更多的时间。更不用说在同一个文件系统中创建新文件并对其重命名了。我想知道这背后的原因是什么?

    2 回复  |  直到 8 年前
        1
  •  2
  •   yukashima huksay    8 年前

    因为当你在位编辑一个文件时,你正在打开同一个文件进行写入和读取。但当您使用另一个文件时。您只能读取一个文件,然后写入另一个文件。 当您打开一个文件进行读取时,它的内容会从磁盘移动到内存中。然后,当您想要编辑文件时,请更改磁盘中文件的内容,以便更新内存中的内容,以防止数据不一致。但当您使用新文件时。您不必更新内存中第一个文件的内容。您只需读取整个文件一次,然后写入另一个文件一次。不要更新任何内容。删除文件也需要很短的时间,因为您只需将其从文件系统中删除,而不会将任何位写入文件在磁盘中的位置。重命名也是如此。移动速度也可以非常快,具体取决于文件系统,但很可能不如删除和重命名速度快。

    还有另一个更重要的原因。

    当您从第一行开始删除数字时,所有其他字符都必须向后移动一点。然后,当您再次从第二行中删除数字时,该点之后的所有字符都必须向后移动,因为字符必须是连续的。如果您只想更改一些字符,就地编辑会更快。但是,由于每次删除时都要更改文件的长度,因此所有其他字符都必须移动,这需要很多时间。它并不完全像这样,而且更复杂,这取决于操作系统和文件系统的实现,但这就是它背后的想法。这就像是阵列操作。从数组中删除单个元素时,必须移动数组中的所有其他元素。因为它是一个数组。相反,如果要从链表中删除一个元素,则不需要移动其他元素,但文件的实现类似于数组,因此就是这样。

        2
  •  0
  •   klutt    8 年前

    虽然tgwtdt的回答可能提供了一些很好的见解,但它并不能解释一切。以下是140MB文件的反例:

    $ time sed 's/a/b/g' data > newfile
    real    0m2.612s
    
    $ time sed -i -- 's/a/b/g' data 
    real    0m9.906s
    

    你可能会问,为什么这是一个反例。因为我替换了 a 具有 b 这意味着替换文本具有相同的长度。因此,无需移动数据,但所需时间仍然是原来的四倍。

    虽然tgwtdt很好地解释了为什么就位通常需要更长的时间,但对于一般情况,这是一个无法百分之百回答的问题,因为它依赖于实现。

    推荐文章