|
|
1
2
首先收集集合中现有的,然后寻找缺失的。
|
|
2
1
我建议您只需逐行阅读输入文件,并分析每一行的文件号。然后使用该文件号作为布尔数组的索引,最初设置为False。 您不需要执行任何需要将文件存储在内存中的处理。这种方法适用于非常大的文件。
这将生成以下结果,您的
|
|
|
3
1
让我们看看你在这里实际做了什么:
这对于大量数据来说效率很低。而内存映射为您提供了一个字符串 对于文件来说,这不是魔术。您仍然可以在其中移动文件的加载块。同时,您正在对每个正则表达式进行传递,可能是对整个文件进行传递。正则表达式匹配也很昂贵。
这里的解决方案是逐行通过文件。如果需要搜索大量数字,则应预编译正则表达式,而不是每个数字编译一次。要在一次传递中获得所有数字,您可以
注意,正则表达式使用
reluctant quantifier
|