程序员老鬼

WebScraper:最简单的数据抓取教程(附实操案例)

Web Scraper是一款免费且适用于普通用户的爬虫工具,能够通过简单的鼠标操作和配置来获取各种数据,例如知乎回答列表、微博热门、微博评论、电商网站商品信息、博客文章列表等。

Image

环境要求

Web Scraper对环境的要求非常简单,只需要一台能联网的电脑和一个版本不低于31的Chrome浏览器。越新版本的浏览器越好,目前Chrome的版本已经超过120了。

Image

安装

Chrome嘛,大家懂的都懂,所以在线安装可能需要魔法。但是别担心,我已经下载好了,获取方式放在文末了。

安装方式有两种:

安装完成后,你会在顶部工具栏看到 Web Scraper 的图标,点击即可开始使用。

原理

我们使用Web Scraper一般是为了批量获取数据,因为手工方式太耗时费力,甚至根本无法完成。例如抓取微博热门前100条,或知乎某个问题的所有答案,这些任务都需要工具的帮助。

Web Scraper是一款界面简单、操作简单的工具,可以导出Excel格式的数据,不懂开发的用户也可以很快上手。

数据爬取思路

  1. 通过一个或多个入口地址,获取初始数据。例如一个文章列表页,或带有分页的列表页。

  2. 根据入口页面的某些信息,例如链接指向,进入下一级页面,获取必要信息。

  3. 根据上一级的链接继续进入下一层,获取必要信息(此步骤可以无限循环下去)。

接下来,我们正式认识一下Web Scraper这个工具。

实例

初次打开 Web Scraper,你可以使用快捷键 F12(Windows)或 command+option+i(Mac)来打开开发者工具,或者鼠标右键点击检查。

Image

打开Web Scraper后,你将看到开发者工具的完整界面和Web Scraper区域,红色框部分即为Web Scraper。

Image

比如我们需要把https://www.j301.cn/这个导航网站的数据抓取下来,那么接下来,你可以按照以下步骤来使用Web Scraper:

这样,就轻松把数据抓取下来了,可以在本地进行后续操作。

这样一款无需编程知识,就能轻松抓取网页数据的插件,快来试试吧。那你们感觉这个工具怎么样,还有没有更牛的,欢迎留言哦。

如何获取今天的神器?

关注公众号:RPA教程教程
回复关键词:1049
Image

Image

Image

点分享

Image

点收藏

Image

点点赞

Image

点在看