- # UTF-8
- # author wangyeuwen
-
- import requests
- from bs4 import BeautifulSoup
- import os
-
- headers = {
- 'User-Agent': 'Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/85.0.4183.102 Safari/537.36 Edg/85.0.564.51',
- 'Accept': 'text/html,application/xhtml+xml,application/xml;q=0.9,image/webp,image/apng,*/*;q=0.8,application/signed-exchange;v=b3;q=0.9',
- 'Accept-Encoding': 'gzip, deflate'
- }
- path = input('输入图片保存路径:')
- if not(os.path.exists(path)):
- os.mkdir(path) #创建文件夹爱
- print('路径不存在,已创建路径')
-
- count = 25 #总页数
- print('=========初始化成功,开始爬取=========')
- for c in range(1,count+1):
- os.chdir(path) # 设置文件夹
- url = 'http://tp.wcctv.top/index.php/page/{0}/'.format(c)
- resphonse1 = requests.get(url, headers=headers)
- html_soup1 = BeautifulSoup(resphonse1.text, 'lxml') # 解析网页
- for i in range(0,6):
- img_dir = html_soup1.select('.item img')[i].get('alt')
- os.chdir(path) # 设置文件夹
- os.mkdir(img_dir)
- os.chdir(path+'/'+img_dir)
- img_url = html_soup1.select('.item a')[i].get('href') #获取当前页面的url
- resphonse2 = requests.get(img_url,headers=headers)
- html_soup2 = BeautifulSoup(resphonse2.text,'lxml')
- all_img = html_soup2.select('.post-item-img')
- for x in range(0,len(all_img)):
- img = requests.get(all_img[x].get('src'),headers=headers)
- f = open(all_img[x].get('title') + '.jpg', 'ab')
- f.write(img.content)
- print(all_img[x].get('title')+' 下载成功!')
- f.close()
复制代码
|