zwj 发表于 2022-1-10 09:01

某办公网站高清摄影图片爬取

本帖最后由 zwj 于 2022-1-10 09:02 编辑

import os
import requests
import re

def soushu(zzbds,html):
    ab = re.compile(zzbds, re.S)
    zml = re.findall(ab, html)
    return zml
def openwangye0(url):
    headers = {
      'cookie':'auth_token=VPu9LKcXvbqKjlosWxOLRM2aCWq4BrdF_VwKuWW64Yjb5tB4l-AHDlYhn59T6Cix0z9Xh1t4PtirXCbkp4vzNA',
    }
    htl = requests.get(url,headers=headers,timeout=10)   
    return htl
url = 'https://www.tukuppt.com/peitu/p199/'
html = openwangye0(url).text
zzbds = 'pid="(.*?)" issc="." isfrom="."></span>\r\n    <a href=".*?" target="_blank"><img title="(.*?)"'
pagetpml = soushu(zzbds,html)
print(len(pagetpml),pagetpml)
a = 0
for i in pagetpml:
    url = f'https://www.tukuppt.com/index/down?pid={i}'
    html = openwangye0(url)
    data = html.text
    zzbds = '"downurl":"(.*?)"'
    downurl = soushu(zzbds,data)
    print(data)
    downurl1 = re.sub('\\\\','',downurl)   
    data = openwangye0(downurl1).content   
    path = r'D:\xmbgtp'
    if not os.path.exists(path):
      os.mkdir(path)
    filname = os.path.join(path,f'{i}.jpg')
    with open(filname,'wb') as f:
      f.write(data)
    print(f'{i}下载完成')

duinieryan009 发表于 2022-1-10 09:03

谢谢分享

mengzhisuoliu5 发表于 2022-1-10 09:16

多谢楼主分享

2596 发表于 2022-1-10 09:26

6666

跳跃蘑菇 发表于 2022-1-10 09:32


支持楼主,谢谢分享。

telcom1981 发表于 2022-1-10 09:41

谢谢分享!

mlj2003318 发表于 2022-1-10 10:11

谢谢分享

zheng3021 发表于 2022-1-10 10:54

{:7_158:}

Beau 发表于 2022-1-10 12:56

感谢楼主分享!大牛有你更精彩!

笑东风丶 发表于 2022-1-11 06:12

感谢大佬分享,大佬666666
页: [1]
查看完整版本: 某办公网站高清摄影图片爬取