Jroke 发表于 2022-7-3 22:46

【web爬虫源码】php爬虫把整个彼岸网的壁纸图片都下载下来

前言

周末下雨,闲着没事干,打算上网下载张几张美女图做壁纸养养眼,于是百度美女壁纸,进入到一个叫彼岸网的壁纸网站,开始一张一张地挑选,突然心跳加速{:1_899:},终于找到自己喜欢的,当点击下载的时候,好家伙,下载居然要登录??作为一名”白嫖”侠,这显然不能忍,突然想如果写一只爬虫,把图片爬下来不就行了吗:keai,于是对网站进行分析,然后就有了这个程序。


实现效果

http://www.52luntan.xyz/vue_blog/php/upload/1656818215cursor1.gif

全部爬完
共有13911张壁纸,1.59G


使用技术
QueryList(php爬虫库),官网: http://www.querylist.cc/

实现核心步骤
本次爬的目标网站为彼岸网(https://pic.netbian.com/),打开网站首页如下:

使用审查元素功能,找到存放图片的html元素,图片存放在元素为clearfix的li元素里面如下:




只要爬取.clearfix li>a>img元素里面的src属性和alt属性即可获得图片url和图片标题,实现代码如下

// 采集规则$rules = [// 表示 获取类型为.clearfix li a img 元素的 alt属性值"title"=>[".clearfix li a img","alt"],// 表示 获取类型为.clearfix li a img 元素的 src属性值"link"=>[".clearfix li a img","src"],   ];
执行// $url 要爬取的页面网站$url = "https://pic.netbian.com/index_2.html";// 'UTF-8','GB2312':设置编码格式 ,执行获取数据$data = (new QueryList)->Query($url,$rules,'','UTF-8','GB2312')->data;
// $data 是一个数组,爬虫获得的数据如下[{"title": "澶澶 灏濂 缁杈瀛 姹借溅4kㄦ极澹绾","link": "/uploads/allimg/220702/224637-16567731978388.jpg"},{"title": "浠濂充 搴 缇濂 椴 辩e缇4k缇濂冲绾","link": "/uploads/allimg/220702/222610-1656771970e92c.jpg"},{"title": "杩ㄧ濂 缃 妤 娓扮濂4k澹绾","link": "/uploads/allimg/220702/222125-1656771685f559.jpg"
可以根据网址实现遍历爬取整个网站壁纸

// 第二页https://pic.netbian.com/index_2.html// 第三页https://pic.netbian.com/index_3.html// 依次次类推
我们只需 动态变更网站$url即可,爬网第一张后,$start + 1 开始爬取第二页,依次爬取,直到完成所有$start = $start + 1;$url = "https://pic.netbian.com/4k/index_".$start.".html";

获取完整代码: 阿里云=> https://www.aliyundrive.com/s/aNw54q6Wrbn

玻璃杯 发表于 2022-7-3 22:46

感谢楼主分享

gvgyy 发表于 2022-7-3 22:46

6666

mayi0215 发表于 2022-7-3 22:58

谢谢@Thanks!

191330752 发表于 2022-7-3 23:14

先收藏了,万一用到呢

807549858 发表于 2022-7-3 23:22

谢谢分享

jackiezhao 发表于 2022-7-3 23:31

多谢楼主分享

欲女心惊 发表于 2022-7-3 23:34

谢谢大牛

fyou579 发表于 2022-7-4 06:11

谢谢大佬

txh444 发表于 2022-7-4 08:39

谢谢大佬分享
页: [1] 2
查看完整版本: 【web爬虫源码】php爬虫把整个彼岸网的壁纸图片都下载下来