阿布云

你所需要的，不仅仅是一个好用的代理。

简单的利用asyncio来快速抓取（二）

发表于 2018-03-16

数据抓取
现在我们知道了如何做异步HTTP请求，因此我们可以来写一个数据抓取器了。我们仅仅还需要一些工具来读取html页面，我使用了beautifulsoup来做这个事情，其余的像 pyquery或lxml也可以实现。

在这个例子中，我们会写一个小数据抓取器来从海盗湾抓取一些linux distributions的torrent 链路（海盗湾（英语：The Pirate Bay，缩写：TPB）是一个专门存储、分类及搜索Bittorrent种子文件的网站，并自称“世界最大的BitTorrent tracker（BT种子服务器）”，提供的BT种子除了有自由版权的收集外，也有不少被著作人声称拥有版权的音频、视频、应用软件与电子游戏等，为网络分享与下载的重要网站之一–译者注来自维基百科）

首先，需要一个辅助协同程序来获取请求：

解析部分。本文并非介绍beautifulsoup的，所以这部分我会简写：我们获取了这个页面的第一个磁链。

在这个协同程序中，url的结果通过种子的数量进行排序，所以排名第一的结果实际上是种子最多的：

最后，用下面的代码来调用以上所有的方法。

结论
好了，现在我们来到了这个部分。你有了一个异步工作的小抓取器。这意味着多个页面可以同时被下载，所以这个例子要比使用 requests 的相同代码快3倍。现在你应该可以用相同的方法写出你自己的抓取器了。

你可以在这里找到生成的代码，也包括一些额外的建议。

你一旦熟悉了这一切，我建议你看一看asyncio的文档和aiohttp的范例，这些都能告诉你 asyncio拥有怎样的潜力。

这种方法（事实上是所有手动的方法）的一个局限在于，没有一个独立的库可以用来处理表单。机械化的方法拥有很多辅助工具，这使得提交表单变得十分简单，但是如果你不使用它们，你将不得不自己去处理这些事情。这可能会导致一些bug的出现，所以同时我可能会写一个这样的库（不过目前为止无需为此担心）。

额外的建议：不要敲打服务器
同时做3个请求很酷，但是同时做5000个就不那么好玩了。如果你打算同时做太多的请求，链接有可能会断掉。你甚至有可能会被禁止链接网络。

为了避免这些，你可以使用semaphore。这是一个可以被用来限制同时工作的协同程序数量的同步工具。我们只需要在建立循环之前创建一个semaphore ，同时把我们希望允许的同时请求的数量作为参数传给它既可：

然后，我们只需要将下面

替换成被semaphore 保护的同样的东西。

这就可以保证同时最多有5个请求会被处理。

额外建议：进度条
这个东东是免费的哦：tqdm是一个用来生成进度条的优秀的库。这个协同程序就像asyncio.wait一样工作，不过会显示一个代表完成度的进度条。

新闻中心