代码之家  ›  专栏  ›  技术社区  ›  yves Baumes

如何比较市场数据源以改善质量和延迟?

  •  2
  • yves Baumes  · 技术社区  · 16 年前

    我正处于实施工具的第一阶段,比较两个市场数据源,以便向我的老板证明新开发源的质量(意味着没有回归、没有遗漏的更新或错误),并证明延迟改进。

    因此,我需要的工具必须能够检查更新的差异,并告诉哪一个源是最好的(就延迟而言)。

    确切地说,参考源可以是路透社,而另一个是我们内部开发的提要处理程序。有人警告我说,更新可能不会以路透社实施的相同顺序到达,这可能与我们的完全不同。因此,基于更新可能以相同顺序到达的事实的简单算法可能不起作用。

    我的第一个想法是使用指纹来比较饲料来源,就像shazaam应用程序找到你提交的试管的标题一样。谷歌告诉我它是基于FFT的。我想知道信号处理理论是否能很好地应用于市场准入应用。

    我想知道你在这方面的经验,有没有可能开发出一种非常精确的算法来满足需求?你自己的想法是什么?你觉得基于指纹的比较怎么样?

    2 回复  |  直到 16 年前
        1
  •  1
  •   Tim    16 年前

    如果提供数据的交换具有数据的某种唯一标识符,那么它提供的实现就相当简单,但也不是很简单。

    实际上,你有一个订阅两个提要的应用程序。(您也可以使用基于嗅探的软件来进行非侵入性监视/测量-我也可以尝试解决这个问题)

    您将保留两个不匹配数据/更新的列表(或记录每个提要中“不匹配”样本的任何其他方法)。当每次更新到来时,您都会从其他数据馈送中的其他列表中查找相应的项。成功匹配后,可以保存此配对。当每次更新到来时,您必须以某种方式为它分配一个“时间戳”——可能是本地机器时间。因为在这个简单的例子中,源站是相同的交换,所以确定相对延迟相当容易。

    此方法要求为数据编写订阅应用程序。

    有许多问题,例如处理丢失的更新和超时处理不匹配的数据,如何处理可能无法为更新提供唯一IDE的交换或提要,解决数据供应商在本地时间和UTC时间上的错误等。

    嗅探数据是类似的,但是您可以通过PCAP或硬件捕获卡捕获数据,然后根据包的端点解析流。这比直接订阅要困难一点,但是它的优点是不受干扰,并且对于您可以测量的数据集具有相当的灵活性。

        2
  •  0
  •   James Webster Jonathan Wood    16 年前

    我所看到的一种围绕多个公司行为数据源的反馈方法就是简单地保持一种启发式的通知,通过这种通知,反馈在历史上往往是最准确的,因此对其数据给予了更大的权重。

    当然,在所有类型的市场数据中,企业行为可能是最低数量之一,因此这种技术可能无法按比例调整数据!

    推荐文章