今天在CSDN博客,发现好多人写爬虫都在爬取一个叫作斗图啦
的网站,里面不少表情包,而后瞅了瞅,各类实现方式都有,今天我给你实现一个多线程版本的。关键技术点 aiohttp
,你能够看一下我前面的文章,而后在学习一下。web
网站就不分析了,无非就是找到规律,拼接URL,匹配关键点,而后爬取。多线程
首先快速的导入咱们须要的模块,和其余文章不一样,我把相同的表情都放在了同一个文件夹下面,因此须要导入os
模块async
import asyncio import aiohttp from lxml import etree import os
编写主要的入口方法svg
if __name__ == '__main__': url_format = "http://www.doutula.com/article/list/?page={}" urls