|
|
1
39
|
|
|
2
16
使用 BeautifulSoup ! 它非常适合这种情况,因为你有可疑的优点,需要从中得到一些合理的东西。只需传入原始文本,提取所有字符串标记,并将它们连接起来。 |
|
|
3
6
虽然我同意Lucas的观点,正则表达式并不那么可怕,但我仍然认为应该使用专门的HTML解析器。这是因为HTML标准非常复杂(特别是如果您想解析从Internet上任意删除的“HTML”页面),您需要编写大量代码来处理这些情况。看来 python includes one out of the box . python bindings for TidyLib 它可以清理损坏的HTML,使得任何HTML解析的成功率都要高得多。 |
|
|
4
4
我会尝试一些书中描述的作者的作品 chapter 8.3 in the Dive Into Python book |
|
|
5
2
如果您使用django,您也可以使用 http://docs.djangoproject.com/en/dev/ref/templates/builtins/#striptags ;) |
|
|
6
1
您可能需要比正则表达式更复杂的东西。网页通常具有不属于标记的尖括号,如下所示:
作为一个单一的标签,并剥离它。 我建议寻找已经为您编写的代码。我搜索了一下,发现了这个: http://zesty.ca/python/scrape.html |
|
|
7
0
正则表达式并不可怕,但编写自己的正则表达式来剥离HTML肯定是一条疯狂之路(而且也行不通)。遵循智慧之路,使用众多优秀的HTML解析库之一。 Lucas的例子也被打破了,因为“sub”不是Python字符串的方法。您必须“导入re”,然后调用re.sub(pattern、repl、string)。但这不是这里也不是那里,因为你问题的正确答案并不涉及编写任何正则表达式。 |
|
|
8
0
恐怖的 |
|
|
code-geek · Jquery根据单选按钮选择隐藏或显示文本字段 1 年前 |
|
|
Jamie · 在CSS链接的文件名中添加Jinja占位符 1 年前 |
|
ptownbro · 重叠分区标签,同时保持以下所有分区和内容就位 1 年前 |
|
|
john Rizzo · 按钮背景颜色、悬停和活动状态存在问题 1 年前 |