-
Notifications
You must be signed in to change notification settings - Fork 0
Expand file tree
/
Copy pathgevent_demo.py
More file actions
85 lines (67 loc) · 1.82 KB
/
Copy pathgevent_demo.py
File metadata and controls
85 lines (67 loc) · 1.82 KB
1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
20
21
22
23
24
25
26
27
28
29
30
31
32
33
34
35
36
37
38
39
40
41
42
43
44
45
46
47
48
49
50
51
52
53
54
55
56
57
58
59
60
61
62
63
64
65
66
67
68
69
70
71
72
73
74
75
76
77
78
79
80
81
82
83
84
85
#!/usr/bin/env python
# -*- coding: utf-8 -*-
# @Time : 2018/3/20 14:01
# @Author : GuoChang
# @Site : https://github.com/xiphodon
# @File : gevent_demo.py
# @Software: PyCharm
from lxml import etree
import requests
from gevent import pool, monkey
monkey.patch_all()
headers = {
'User-Agent': 'Mozilla/5.0 (Windows NT 10.0; WOW64; rv:49.0) Gecko/20100101 Firefox/49.0',
'Connection': 'keep-alive'
}
def while_requests_get(page_url, times=100):
"""
循环请求
:return:
"""
while_times = 0
while True:
try:
result = requests.get(page_url, headers=headers, timeout=5)
# result = requests.get(page_url, headers=headers, proxies=proxies, timeout=5)
except Exception as e:
if while_times < times:
while_times += 1
print('**********', '尝试重新链接', while_times, '次:', page_url)
continue
else:
raise e
else:
return result
def parse_head_page(content):
"""
解析首页
:param content:
:return:
"""
selector = etree.HTML(content)
urls = selector.xpath('//div/h3/a/@href')
return urls
def requests_urls(urls):
"""
多协程请求
:param urls:
:return:
"""
gevent_pool = pool.Pool(50)
result_list = gevent_pool.map(while_requests_get, urls)
return result_list
def start():
"""
开始
:return:
"""
print('request head page ...')
result = while_requests_get(r'https://www.baidu.com/baidu?wd=%E7%AB%AF%E8%84%91')
print('get head page, parsing ...')
urls = parse_head_page(result.text)
print('head page parse OK, requests urls ...')
result_list = requests_urls(urls)
print('requests urls OK')
print(result_list)
if __name__ == "__main__":
start()