Python 爬虫模拟登录教程:Cookie、JWT 与 Playwright 三种方案
Python 爬虫如何模拟登录?本文从 Network 抓包判断 Cookie、JWT/Token 与浏览器状态,给出 requests.Session、Authorization、Playwright 三种可运行方案,并附 401/403 排查清单。
Python 爬虫如何模拟登录?本文从 Network 抓包判断 Cookie、JWT/Token 与浏览器状态,给出 requests.Session、Authorization、Playwright 三种可运行方案,并附 401/403 排查清单。
爬虫遇到 403、验证码、IP 被封怎么办?本文从代理 IP 原理、requests proxies 写法、账号密码认证、短效代理和隧道代理选择、失败重试与合规边界讲清排查思路。
本文用 TraceCloud 第 15 到第 18 关串起 CSS 偏移、CSS content、固定字体映射和动态字体反爬,重点讲清自定义字体、Unicode 私有区、WOFF2、fontTools、cmap 和字形轮廓比对的完整处理思路。
本文从 requests.Session 的状态保持机制出发,说明 Cookie、验证码接口、失败重试和 403 排查之间的关系,适合需要处理登录态、验证码校验或翻页采集的 Python 爬虫场景。
aiohttp 怎么用?本文从 GET、POST、params、headers、响应读取讲到超时、异常处理、并发控制、连接池和重试封装,适合写 Python 异步爬虫和批量接口请求。
面向爬虫和 Web 自动化学习者的 Playwright Python 入门教程,覆盖安装、同步与异步模式、元素定位、等待策略、上下文管理、网络拦截、截图调试和实践建议。
XPath 是爬虫里精准定位网页元素的核心技能,本文从节点选取、谓语、轴运算到 Python lxml 实战,全面讲解 XPath 语法与避坑指南。
Python Parsel 怎么用?本文通过可运行示例讲清 Selector、CSS、XPath、正则提取、列表页解析及空结果排查,并给出 Parsel 配合 requests 的完整写法。
urljoin 是 Python 爬虫处理相对路径拼接的核心工具。本文从 URL 结构讲起,覆盖相对路径、绝对路径、./、../、urlparse、urlunparse 在爬虫中的实战用法,附 6 个实战案例与常见报错解决方案。
梳理 requests 异常的完整体系,按请求阶段逐一说明 URL 错误、连接失败、超时、状态码异常和重定向异常,帮你写出不容易崩的爬虫代码。
讲清网页源代码、Elements 面板和实时 DOM 的区别,说明为什么页面上看得到的数据,源代码里不一定有,以及如何判断静态页面和动态页面。
从地址栏输入 URL 开始,系统讲清浏览器如何补全地址、发起请求、解析 HTML、加载资源、执行 JavaScript,直到页面完成渲染。
讲清绝对路径、相对路径、协议相对路径和根路径的区别,并结合浏览器解析规则说明资源地址是怎么被补全成完整 URL 的。
系统梳理 HTTP 各版本演进逻辑:从短连接到长连接,从文本到二进制分帧,从应用层队头阻塞到传输层优化。
从爬虫初学者最常见场景出发,讲清 HTTP 请求与响应的结构、状态码的判断方法,以及抓包时应该优先看哪些字段。
聚焦爬虫开发最常用的 HTTP 头字段,讲清它们的作用、常见问题与排查顺序,帮你快速提升接口复现成功率。
从爬虫初学者视角讲清网页三件套:HTML 负责结构,CSS 负责样式,JavaScript 负责交互,以及为什么看懂网页结构是抓取数据的第一步。
用爬虫初学者能理解的方式讲清 DOM 树、节点、父节点、子节点和兄弟节点,帮助你看懂网页结构并准确定位数据。
系统讲解元素选择器、类选择器、ID 选择器、后代选择器、子元素选择器、兄弟选择器、属性选择器和伪类选择器,并说明它们在爬虫中的用法。
面向爬虫初学者,系统讲清客户端和服务器的通信关系、URL 的 6 个组成部分,以及 URL 编码在实战中的作用。