代码之家  ›  专栏  ›  技术社区  ›  Alex

将非英语文本转换为可读格式

  •  0
  • Alex  · 技术社区  · 16 年前

    我正在从web上获取字符串,这些字符串通常包含应用程序中无法识别的重音字符。

    编辑 -我正在使用HtmlAgilityPack获取我的字符串。我要走了 InnerText <title> 标签。在这样做的时候,包使用了不同于原始HTML文档的编码(我不知道是哪一个?)。

            // get the html title inner text and assign to htmlParts object
            HtmlNode titleNode = doc.DocumentNode.SelectSingleNode("//title");
            string docTitle = titleNode.InnerText;
            htmlParts.htmlTitle = docTitle.ToString();
    

    "(Subtitulado al español).avi" "(Subtitulado al español).avi" ?

    2 回复  |  直到 16 年前
        1
  •  2
  •   Michael Madsen    16 年前

    看起来你得到的是UTF-8,但处理为ISO-8859-1。

    在不了解系统的情况下,不可能给出更具体的信息。

        2
  •  0
  •   Ilia G    16 年前

    对读取的数据应用适当的编码。具体如何?问得好。为此,您至少需要首先提供导致问题的代码。

    推荐文章