Python爬虫入门教程 13-100 斗图啦表情包多线程爬取

时间 2020-01-21 标签 python 爬虫入门教程 13 100 斗图表情包多线程爬取

1.准备爬取斗图la写在前面

今天在CSDN博客，发现好多人写爬虫都在爬取一个叫作斗图啦的网站，里面不少表情包，而后瞅了瞅，各类实现方式都有，今天我给你实现一个多线程版本的。关键技术点 aiohttp ，你能够看一下我前面的文章，而后在学习一下。web

网站就不分析了，无非就是找到规律，拼接URL，匹配关键点，而后爬取。多线程

首先快速的导入咱们须要的模块，和其余文章不一样，我把相同的表情都放在了同一个文件夹下面，因此须要导入os模块async

import asyncio
import aiohttp
from lxml import etree
import os

编写主要的入口方法svg

if __name__ == '__main__':
    url_format = "http://www.doutula.com/article/list/?page={}"
    urls