欢迎来到代码驿站!

Python代码

当前位置:首页 > 软件编程 > Python代码

Python爬虫实战之爬取携程评论

时间:2021-12-25 10:16:36|栏目:Python代码|点击:

一、分析数据源

这里的数据源是指html网页?还是Aajx异步。对于爬虫初学者来说,可能不知道怎么判断,这里辰哥也手把手过一遍。

提示:以下操作均不需要登录(当然登录也可以)

咱们先在浏览器里面搜索携程,然后在携程里面任意搜索一个景点:长隆野生动物世界,这里就以长隆野生动物世界为例,讲解如何去爬取携程评论数据。

 Image

页面下方则是评论数据

 Image

Image Image

从上面两张图可以看出,点击评论下一页,浏览器的链接没有变化,说明数据是Ajax异步请求。因此我们就找到了数据是异步加载过来的,这时候需要去network里面是查看数据包

二、分析数据包

在network中找到下面这个数据包

 Image

查看Preview里面的内容(请求返回内容)

Image

可以看到数据已经请求到了,下面看一下数据是否是正确的(和网页内容一致)。

 Image

ok,没问题之后,下面开始编写Python程序去请求数据。

1.请求地址

Image

可以获取到请求链接和请求方式。

Image

这里请求不用添加请求头header也是可以的。其中postUrl是请求链接,data_1是请求参数。

2.请求参数

在network里可以看到请求参数

Image

在程序中的构建如下:

Image

其中需要关注的是arg中的pageIndex(页数),pageSize(每页条数)。

Image

最终结果如下:

Image

该景点的评论就可以成功爬取下来了。

三、采集全部评论

上面只是采集了第一页的评论数据,通过改变arg中的pageIndex(页数),就可以遍历爬取全部的评论。

Image

比如这个景点一共是300页。现在把循环给加上

最终的完整代码如下:

Image

上一篇:Python接口自动化浅析unittest单元测试原理

栏    目:Python代码

下一篇:python turtle工具绘制四叶草的实例分享

本文标题:Python爬虫实战之爬取携程评论

本文地址:http://www.codeinn.net/misctech/188015.html

推荐教程

广告投放 | 联系我们 | 版权申明

重要申明:本站所有的文章、图片、评论等,均由网友发表或上传并维护或收集自网络,属个人行为,与本站立场无关。

如果侵犯了您的权利,请与我们联系,我们将在24小时内进行处理、任何非本站因素导致的法律后果,本站均不负任何责任。

联系QQ:914707363 | 邮箱:codeinn#126.com(#换成@)

Copyright © 2020 代码驿站 版权所有