python爬虫(02)

发布时间:2026/9/27 6:06:59
python爬虫(02) 爬虫的基础在上期我们成功的安装了相关的python环境折起我们来讲解爬虫从讲解到反爬讲解cookieUA等好了废话不多说我们开始吧在上期我们成功运行一下测试代码你已经超越很多人了import requests r requests.get(https://example.com) # 请求代码网站可以自行更换 print(r.status_code) # 输出状态码 print(r.text) # 输出网页源码我上期讲过.status_code200的时候证明爬虫与服务器之间的通信是正常的但是当我们拿这个请求去请求像百度这样没有robot.txt管理很松的网站是可以的但是当我们请求一些常规的网站会直接返回403这是因为你又很多参数没加被服务器识别成了爬虫那么又没有方法可以完成这样拿到请求呢。爬虫的进阶请求头请求头(User-Agent)一般里面包含有Referercookie主要是这俩个还有其他我们在就见到会说聪明的你灵机一动把浏览器的f12(开发者模式)打开了在里面找到了user-agent把user-agent加里面了这时候请变了成了import requests headers{Usre-Agent:Mozilla/5.0 (Windows NT 10.0; Win64; x64)} #这是请求头 r requests.get(https://example.com,headersheaders) # 请求代码网站可以自行更换 print(r.status_code) # 输出状态码 print(r.text) # 输出网页源码这时候聪明的你发现又可以请求了,兴致冲冲的你像一个里面有文章的页面发送请求但是又返回403(我滴乖乖,怎么回事)怎么访问不了了聪明的你又把我的博客往下扒了扒防盗链防盗链(Referer)顾名思义是常见的一种反爬手段一般常见是厂商为了防止Spider来的但是没啥大用但是很重要的一个设置那怎么获取呢在刚刚的f12下滑里找到Referer把它复制下来之后粘贴到headers里代码如下import requests headers{Usre-Agent:Mozilla/5.0 (Windows NT 10.0; Win64; x64), Referer : 你的防盗链 }#这是请求头 r requests.get(https://example.com,headersheaders) # 请求代码网站可以自行更换 print(r.status_code) # 输出状态码 print(r.text) # 输出网页源码这时候你再次兴致冲冲的去请求网页但是现实在次给你当头一棒依旧403依旧拿不下来这时候聪明的你在次在网页的f12往下扒了扒发现有一个叫cookie(曲奇)的一个东西曲奇曲奇(cookie)是一种检测Spider的一种手段之一一般由后端生成比较复杂原理如下正常浏览器请求A → 服务器种 Cookie → 浏览器保存 → 请求B 带上 Cookie → 通过 ✅Spider不带 Cookie请求A → 服务器种 Cookie → 没保存/没带回 → 请求B 没 Cookie → 拦截 ❌当你的爬虫不能爬取的时候一般是这个原因导致的但聪明的你把cookie复制下来添加进headers里代码如下import requests # 2. 设置请求头 headers { User-Agent: ( Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/120.0.0.0 Safari/537.36 ), # 防盗链 Referer告诉服务器我是从你的页面跳过来的 Referer: https://www.example.com/, # Cookie携带登录状态或追踪标识 Cookie: session_idabc123; tokenxyz789; uid10001, } # 3. 发送请求 url https://www.example.com/page resp requests.get(url, headersheaders) # 4. 检查结果 print(f状态码: {resp.status_code})这样你就可以爬取到网页了

关于本文作者

来自尧图内容编辑团队

尧图内容编辑团队 内容团队

尧图内容编辑团队

本文由尧图网络内容编辑团队执笔。团队由资深项目经理、前端工程师与设计师组成,所有内容均来自亲手交付的真实项目,先讲清问题、再给出可落地的解法。尧图深耕北京网站建设十年,服务过京华建材集团、智造科技等各行业客户,把一线经验沉淀为可复用的行业观察。

  • 十年建站经验,覆盖建材、制造、服务、文创等
  • 项目经理把关选题与事实准确性
  • 工程师与设计师联合撰写专业细节
  • 统一编辑规范,保证文风与排版一致
  • 每月复盘转化数据,迭代选题方向

延伸阅读

相关资讯与近期热门内容

深度阅读推荐

建站决策前值得细读的三篇

网站改版的5个关键决策
2024-08-12

网站改版的5个关键决策

什么时候该改版、改到什么程度、如何避免流量掉光,京华建材集团改版复盘给出答案。

获取专属建站方案

看完文章,把您的行业与预算告诉我们,免费获取一份量身定制的官网建设方案与报价。

立即免费咨询