写点什么

爬虫练习题(一)

作者:张立梵
  • 2022 年 10 月 05 日
    江西
  • 本文字数:937 字

    阅读完需:约 3 分钟

爬虫练习题(一)

目标网站:https://www.1ppt.com/moban/

爬取要求:

1、 翻页爬取这个网页上面的源代码

2、 并且保存到本地,注意编码

"""

'''

1.分析网站:

https://www.1ppt.com/moban/ 第一页

https://www.1ppt.com/moban/ppt_moban_2.html 第二页

https://www.1ppt.com/moban/ppt_moban_3.html 第三页


import urllib.request
start = int(input("输入起始页")) # 转intend = int(input("输入结束页"))headers = { 'User-Agent': 'Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/98.0.4758.102 Safari/537.36'}for n in range(start, end + 1): url = 'https://www.1ppt.com/moban/ppt_moban_{}.html'.format(n) print(url) req = urllib.request.Request(url, headers=headers) # 实例化请求对象 response = urllib.request.urlopen(req) # 发送请求的方法 with open(f'第{n}页.html', 'a', encoding='gb2312') as f: f.write(response.read().decode('gb2312'))
复制代码

首先,我们打开网址,右击点开查看网页源代码,或者是右击检查抓包,Network 网络是展现网页数据包的地方,找网址相同的数据包,点开 response 响应内容,这也是页面源码。

我们在 pycharm 新建文件,第一步分析网页抓包,手动翻页,找到 url 规律,把网页链接拿下来复制并粘贴在 pycharm 工程文件中,我们可以看到第一页和后面的网页链接不一致,这里可以手动加上,后面可能会需要用到判断。

然后,我们用 import 导入 urllib.request 模块,Ctrl+Alt+L 可以让代码变规范。

构建 url,可以用循环,也可以一页一页构建,网址之前是 http(80)https(443)协议,括号内为端口,紧接着是域名,“?”后是 get 请求携带的一些参数,kw 搜索内容,pn 为页面,其他的参数可能不怎么影响爬取进程,就可以删掉。构建好 URL 后,可以打印

发起请求

zlf = urllib.request.Request(url,headers=headers),构建请求对象,实例化请求对象,并用变量接收

response = urllib.request.urlopen(zlf)

拿到响应内容,最后,用 with open 保存,文件名,'w'写入(模式默认只读'r'),encoding(编码格式,怎么解码怎么写),as 后面取别名,

read 把数据以字节形式提取出来,后面可以转码用 decode


发布于: 刚刚阅读数: 5
用户头像

张立梵

关注

还未添加个人签名 2022.07.02 加入

还未添加个人简介

评论

发布
暂无评论
爬虫练习题(一)_10 月月更_张立梵_InfoQ写作社区