我很忙的 发表于 2021-5-8 20:42

Python爬取制服买家秀小姐姐

这个网站大概是1个月之前在水漫金山某位大神发出来的,当天我就写了爬虫,今天没事又去爬一下看更新了没{:1_318:},发现是空的,网站内容更改了。
所以刚刚又重新用scrapy写了一个整站爬虫,但还是不发出来,省的各位把网站给爬死了{:1_318:}。
复制出来改成单分类爬虫,剩下的想爬取,自己更改!!!


# from ip_proxy import ips
import requests, os, re, random
from lxml import etree


# ip_add = random.choice(ips())
if not os.path.exists('./zhifu'):
    os.mkdir('./zhifu')

headers = {
    'user-agent': 'Mozilla/5.0 (Windows NT 6.1; WOW64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/83.0.4103.116 Safari/537.36'
}
for i in range(1,4):
    url = 'https://www.ikmjx.com/index.php?g=portal&m=list&a=index&id=3&p=' + str(i)
    r = requests.get(url=url, headers=headers).text
    tree = etree.HTML(r)
    div_list = tree.xpath('/html/body/main/div/div/div')
    for li in div_list:
      a = 0
      src = 'https://www.ikmjx.com' + li.xpath('./div/a/@href')
      titles = li.xpath('./div/a/@title')
      title = titles.replace('?','')
      req = requests.get(url=src, headers=headers).text
      tree1 = etree.HTML(req)
      div1_list = tree1.xpath('/html/body/main/div/div/div/div/p')
      for p in div1_list:
            src_path = p.xpath('./img/@src')
            # print(src_path)
            for img in src_path:
                a = a+1
                img_data = requests.get(url=img, headers=headers).content
                img_path = './zhifu/' + title + '_' + str(a) + '.jpg'
                with open(img_path, 'wb') as fp:
                  fp.write(img_data)
                  # print(img_data, '下载完成!!!')

3396815a 发表于 2021-5-8 20:51

感谢楼主分享

张少 发表于 2021-5-8 21:04

6666666666

笑东风丶 发表于 2021-5-8 21:19

感谢大佬分享,大牛因有你而更精彩。

给你妈来两刀 发表于 2021-5-8 21:23

多谢楼主分享

1447015434 发表于 2021-5-8 21:45

谢谢@Thanks!

恶为 发表于 2021-5-8 21:58


支持楼主,谢谢分享。

丢雷楼某 发表于 2021-5-8 22:15

拥有这么强的技术,只用来看小姐姐

1913239648 发表于 2021-5-8 22:32

谢谢大牛

潜力君 发表于 2021-5-8 23:14

谢谢大佬分享
页: [1] 2
查看完整版本: Python爬取制服买家秀小姐姐