python如何提取html文本(html,python,开发技术)

python如何提取html文本

导读：本文共3566.5字符，通常情况下阅读需要12分钟。同时您也可以点击右侧朗读，来听本文内容。按键盘←（左） →（右）方向键可以翻页。

摘要：假设我们需要从各种网页中提取全文，并且要剥离所有HTML标记。通常，默认解决方案是使用BeautifulSoup软件包中的get_text方法，该方法内部使用lxml。这是一个经过充分测试的解决方案，但是在处理成千上万个HTML文档时可能会非常慢。通过用selectolax替换BeautifulSoup，您几乎可以免费获得5-30倍的加速！这是一个简单的基准测试... ...

音频解说

假设我们需要从各种网页中提取全文，并且要剥离所有HTML标记。通常，默认解决方案是使用BeautifulSoup软件包中的get_text方法，该方法内部使用lxml。这是一个经过充分测试的解决方案，但是在处理成千上万个HTML文档时可能会非常慢。
通过用selectolax替换BeautifulSoup，您几乎可以免费获得5-30倍的加速！
这是一个简单的基准测试，可分析commoncrawl(`处理NLP问题时，有时您需要获得大量的文本集。互联网是文本的最大来源，但是不幸的是，从任意HTML页面提取文本是一项艰巨而痛苦的任务。
假设我们需要从各种网页中提取全文，并且要剥离所有HTML标记。通常，默认解决方案是使用BeautifulSoup软件包中的get_text方法，该方法内部使用lxml。这是一个经过充分测试的解决方案，但是在处理成千上万个HTML文档时可能会非常慢。
通过用selectolax替换BeautifulSoup，您几乎可以免费获得5-30倍的加速！这是一个简单的基准测试，可分析commoncrawl的10,000个HTML页面：

显然，这并不是对某些事物进行基准测试的最佳方法，但是它提供了一个想法，即selectolax有时比lxml快30倍。
selectolax最适合将HTML剥离为纯文本。如果我有10,000多个HTML片段，需要将它们作为纯文本索引到Elasticsearch中。（Elasticsearch有一个html_strip文本过滤器，但这不是我想要/不需要在此上下文中使用的过滤器）。事实证明，以这种规模将HTML剥离为纯文本实际上是非常低效的。那么，最有效的方法是什么？

PyQuery

selectolax

正则表达式

我编写了一个脚本来计算时间，该脚本遍历包含HTML片段的10,000个文件。注意！这些片段不是完整的<html>文档（带有<head>和<body>等），只是HTML的一小部分。平均大小为10,314字节（中位数为5138字节）。结果如下：

我已经运行了很多次，结果非常稳定。重点是：selectolax比PyQuery快7倍。

对于最基本的HTML Blob，它可能工作得很好。实际上，如果HTML是<p> Foo＆amp; Bar </ p>，我希望纯文本转换应该是Foo＆Bar，而不是Foo＆amp; bar。
更重要的一点是，PyQuery和selectolax支持非常特定但对我的用例很重要的内容。在继续之前，我需要删除某些标签（及其内容）。例如：

正则表达式永远无法做到这一点。

因此，我的要求可能会发生变化，但基本上，我想删除某些标签。例如：<div class =“ warning”> 、 <div class =“ hidden”> 和 <div style =“ display：none”>。因此，让我们实现一下：

PyQuery

selectolax

这实际上有效。当我现在为10,000个片段运行相同的基准时，新结果如下：

同样，selectolax击败PyQuery约6倍。

本文：python如何提取html文本的详细内容，希望对您有所帮助，信息来源于网络。

python如何提取html文本(html,python,开发技术)

目录

4 人围观 / 0 条评论 ↓快速评论↓

搜索

最新文章

猜你喜欢

特价优惠

标签

流量统计