冰糖葫芦 发表于 2021-11-7 11:27

爬取Wallpaper Abyss 高清壁纸

import requests
import re
from lxml import etree

url = "https://wall.alphacoders.com/search.php?"
p_main_url = "https://wall.alphacoders.com"
data = {
    "page": "2",   # 页数
    "lang": "Chinese",# 语言 没什么用
    "search": "landscape",   # 索引
    "view": "paged",      # 分页显示
    "min_resolution": "3840x2160",# 分辨率
    "resolution_equals": "=",   # 精准
    "sort_search": "relevance",   # 相关性
}
p_main_url_list = []
img_id_list = []
n_img_url_list = []
img_url_list = []
response_main = requests.post(url, data=data).text
html = etree.HTML(response_main)
# 获取每张图片主页后缀
p_url_list = html.xpath('//div[@class="center"]//div[@class="boxgrid"]//a//@href')
# 获取每张图片的主页完整URL
for a in p_url_list:
    img_main_url = p_main_url + a
    # print(img_main_url)
    p_main_url_list.append(img_main_url)
# 获取图片IDs
for b in p_url_list:
    img_id = re.findall(r"\d+\.?\d*", b)
    img_id_list.append(img_id)
# 获取图片编号
n_img_list = html.xpath('//div[@class="center"]//div//div[@class="boxgrid"]//img//@src')
for c in n_img_list:
    n_img = re.findall(r"https://*.*.*/*/", c)
    # print(n_img)
    n_img_url_list.append(n_img)
# 拼接图片 url
# print(n_img_url_list)
# print(img_id_list)
n = 0
for d in range(len(n_img_url_list)):
    img_url = n_img_url_list + img_id_list + ".jpg"
    img_url_list.append(img_url)
# 请求每张的图片的url 获取原图
n = 0
for e in img_url_list:
    response_img = requests.get(e).content
    with open("D:\\其他\\233\\Python\\爬虫入门到精通\\实战项目\\wallpaper\\img\\" + img_id_list + ".jpg", 'wb') as f:
      f.write(response_img)
    print('正在下载第{}张图片!'.format(n))
    n = n + 1
    if n == len(img_url_list):
      print("图片下载完成!")

soosoo 发表于 2021-11-7 11:46

谢谢大佬

a4532558 发表于 2021-11-7 12:06

6666

smartjin 发表于 2021-11-7 12:56

6666666666

YFD 发表于 2021-11-7 13:08

谢谢大佬分享

1054981050 发表于 2021-11-7 13:35

谢谢分享

小了白了兔。 发表于 2021-11-7 15:53


感谢楼主的分享

524888909 发表于 2021-11-7 20:15

先收藏了,万一用到呢

秦时明月 发表于 2021-11-7 21:10

谢谢分享!

七日书 发表于 2021-11-7 21:14

谢谢分享
页: [1] 2
查看完整版本: 爬取Wallpaper Abyss 高清壁纸