我将在索引之前和压缩方法之后存储数TB的信息。
我应该手动使用排序文件等编写二叉树数据库,还是使用MongoDB或MySQL之类的工具?
我很担心MySQL和其他DB之类的东西每记录的空间成本。我还知道有些数据库甚至允许压缩,但它们转换为只读表。这些表/记录需要经常访问并用新数据覆盖。我认为如果我在C++中编码一些东西,我就能把每一个记录的空间成本降到最低。
现在有一些新的非关系型数据库正在流行起来,它们专门用于管理大规模数据。
退房 Hadoop 或 Cassandra ,这两个都在Apache项目中。