代码之家  ›  专栏  ›  技术社区  ›  Alan Simes

solr和.net过滤器

  •  3
  • Alan Simes  · 技术社区  · 16 年前

    我对索尔的神奇世界比较陌生,有以下问题。在提取文档结构并将其传递给solr进行索引方面,处理文档的最佳方法是什么?

    我希望能够从Word文档、PDF、电子表格、HTML页面等中提取文本。实际上,任何包含文本的文档都可以。

    我看了一下Windows过滤器,乍一看它们似乎提供了我需要的功能。

    你会这样做吗?

    锡姆

    2 回复  |  直到 16 年前
        1
  •  2
  •   Philip Rieck    16 年前

    你可能想看看 Solr Cell 项目。我假设您使用的是Cli-客户端——但是您可能需要用Java工具完成服务器的所有内容提取/映射。

    solr cell页面提供了如何使用的说明 Apache Tika 它可以包装从各种格式(如Word或PDF)中提取文本(和一些元数据)的库。

        2
  •  2
  •   Mauricio Scheffer    16 年前

    正如菲利普所说,solrcell是索引这些二进制文档类型的标准方法。但是,它仍然 not supported by SolrNet ,所以您的选择是:

    1. 实施并为项目做出贡献,或
    2. 解决这个问题,创建自己的HTTP请求发送到solr,避免使用solrnet实现特定的功能。

    也, some users preferred iTextSharp / Aspose instead of SolrCell due to performance issues .

    推荐文章