100字范文,内容丰富有趣,生活中的好帮手!
100字范文 > python多线程爬取段子_Python爬虫实战之一秒爬取内涵段子

python多线程爬取段子_Python爬虫实战之一秒爬取内涵段子

时间:2018-07-18 15:36:30

相关推荐

python多线程爬取段子_Python爬虫实战之一秒爬取内涵段子

人生苦短,我用Python,今天来一起爬取一下内涵段子。

话不啰嗦直接代码,gogogog!

#coding=utf-8

import urllib2

import re

class Spider:

"""

内涵段子爬虫类

"""

def __init__(self, page, enable):

self.page = page

self.enable = enable

def loadPage(self, page):

url = '/article/list_5_' + str(page) + '.html'

#User-Agent头

user_agent = 'Mozilla/5.0 (compatible; MSIE 9.0; Windows NT6.1; Trident/5.0'

headers = {'User-Agent': user_agent}

req = urllib2.Request(url, headers = headers)

response = urllib2.urlopen(req)

html = response.read()

gbk_html = html.decode('gbk').encode('utf-8')

# 找到所有的段子内容

# re.S 如果没有re.S 则是只匹配一行有没有符合规则的字符串,如果没有则下一行重新匹配

# 如果加上re.S 则是将所有的字符串将一个整体进行匹配

pattern = pile(r'

(.*?)', re.S)

本内容不代表本网观点和政治立场,如有侵犯你的权益请联系我们处理。
网友评论
网友评论仅供其表达个人看法,并不表明网站立场。