办公问答网

 找回密码
 立即注册
搜索
热搜: 活动 交友 discuz
查看: 112|回复: 1

再也不用手写爬虫了!推荐5款自动爬取数据的神 …

[复制链接]

3

主题

6

帖子

12

积分

新手上路

Rank: 1

积分
12
发表于 2023-4-26 15:37:10 | 显示全部楼层 |阅读模式
大家好,我是菜鸟哥!今天给大家推荐一些不错的神器!
网络信息的时代,想要收集信息,爬虫是一项必不可少的工具。对于很多小伙伴们来说,只是想利用爬虫进行快速的内容抓取,而并不想太过深入的学习爬虫。
利用python编写爬虫程序虽然炫酷,但是需要耗费时间和精力去学习。学习成本非常高,有的时候就是为了几页的数据,学了几个月的爬虫,实在是伤不起
有没有啥好的办法,既快又省事,当然有!今天菜鸟哥今天就带领大家来分享五款免费的数据抓取工具,帮你省时又省力。

01.八爪鱼

八爪鱼是一款较为流行的爬虫软件,即便用户不会编程,也能够轻松抓取数据。八爪鱼对于数据抓取的稳定性较强,并且配备了详细的使用教程,可以很快的上手使用。
传送门:https://www.bazhuayu.com/


我们以采集名人名言为例,网址为:https://www.mingyannet.com/mingyan/234813297
打开八爪鱼软件后,打开网页,然后点击单个文本,选择右侧的“选中全部”,软件会自动识别所有的名言文本。接下来按照操作,选择采集文本,并启动软件进行采集。


采集完成后,选择文本导出的文件类型,点击确定,导出数据。



2.集搜客

集搜客针对于一些比较大众的热门网站设置了快捷的爬虫程序,但是学习成本相对于八爪鱼较高。传送门:https://www.jisouke.com/index.html


我们以知乎关键词作为抓取目标,网址为:https://www.zhihu.com/search?type=content&q=python 。首先需要按照爬取玩个类别进行分类,然后输入网址之后,点击获取数据,开始抓取。抓取的数据如下图所示:


可以看到,集搜客抓取信息是非常丰富的,但是数据的下载需要消耗积分,20条数据花费1个积分。集搜客会赠与新用户20积分。
以上介绍的两款都是非常好用的国产数据抓取软件,接下来菜鸟哥为大家介绍的则是chrome浏览器下的爬虫插件。

3.webscraper

Web scraper插件是一款非常好用的简易爬虫插件,对于Web scraper的安装,可以参考菜鸟哥之前分享的文章(牛逼的chrome插件,不用一行代码,轻松爬取各大网站公开信息!(附视频))。
对于简单的数据抓取,Web scraper可以很好的完成任务。我们同样以名人名言的网址数据抓取为例。


通过选中Multiple,来抓取页面中的所有名言。数据抓取完毕后,通过点击“Export data as CSV“来导出所有的数据。



4.AnyPapa

将网页翻到评价部分,然后点击AnyPapa插件下的”本地数据“,会自动跳转到AnyPapa的数据页面。


首先点击切换数据源,找到”京东商品评论“的数据源,此时界面中会显示出手机评论页面中的当前全部评论内容。点击”导出“,评论数据会以csv文件下载到本地。



5.you-get

you-get是GitHub上的一个非常火爆的爬虫项目,作者提供了近80个国内外网站的视频图片的抓取,收获了40900个赞!


传送门:https://github.com/soimort/you-get 。
对于you-get的安装,可以通过pip install you-get的命令进行安装。


我们以B站上的视频为例,网址为:https://www.bilibili.com/video/BV1y64y1X7YG?spm_id_from=333.851.b_7265636f6d6d656e64.3


通过命令:
you-get -o ./ 'https://www.bilibili.com/video/BV1y64y1X7YG?spm_id_from=333.851.b_7265636f6d6d656e64.3' --format=flv360可以实现视频的下载,其中-o 指的是视频下载的存放地址,--format是指视频下载的格式和清晰度。
6.总结

以上就是菜鸟哥今天为大家带来的五款自动提取数据的工具,如果对于偶尔一次的爬虫,或者很低频率的爬取需求,完全没有必要去学习爬虫的技术,因为学习成本很高。好比如果你只是想P几张图,直接用美图秀秀了,不需要学Photoshop 。
如果是对爬虫有很多定制的需求,需要对收集的数据进行分析和深度挖掘,而且是高频的,或者你想通过爬虫把Python技术运用的更深入,学习的更扎实,这个时候才考虑学爬虫。
好了,以上几个工具都是不错的,有兴趣的同学可以试试,我们下一篇见。
往期热门系列文章:
1)."7招秘籍: 教你玩转Python字符串"
2)."Python字典里的5个黑魔法"
3)."Python新手容易犯的4个错"
4)."5步教你搞清函数参数传递,就这么简单"
5)."Python函数里的4个小花招"
6)."一张图搞定-Python文件常用的场景和用法"
7)."精选2个小例子,带你快速入门Python文件处理"
8)."4招小技巧,带你迅速提升Python文件处理的逼格"
9)."精选2个小实例,带你轻松了解Python异常处理"
10)."异常处理的其他3个小技巧"
11)."很多书上都不告诉你,Python类中3个方法的秘密
12)."破解谜一样的正则表达式,从这9招开始"
13)."正则实战秘籍进阶-【温度转换小程序】"
趣味游戏文章: 太好玩了!用Python写个弹球游戏2.0
巧妙的Python数据结构玩法|实战德州扑克
手把手教你,菜鸟也能用Python写一个2048游戏
用Python做个美少女大战小怪兽
强烈推荐,用Python轻松打造定制款《植物大战僵尸》

Python心得和技巧:
零基础学了8个月的Python,到底有啥感悟
我珍藏的一些好的Python代码,技巧
菜鸟写Python程序,如何从新手变老手
菜鸟必收藏,13个Python惯用小技巧
数据分析和爬虫:
南京的房子卖的有多火|二手房成交数据分析上篇
南京的房子有多贵| 分析近20000套二手房的数据
爬取豆瓣短评,刘若英导演的电影《后来的我们》发现爱情原来是这样
震惊,区块链岗位薪资这么高,Python爬取300个区块链岗位深度分析,龙虎榜出炉!
懒人专用的奇淫技巧,用Python实现炫酷的语音操作电脑
Python里三个最高逼格的调试神器
九大神招,让Python里数据分析神器Jupyter,完美升华
推荐一款Python编辑器,集Pycharm和Sublime优点于一身的王者
更多原创的精彩干货可以去公众号【菜鸟学Python】找我们。目前原创近400个趣味原创案例(Python入门,进阶,经验技巧,爬虫,数据分析,机器学习,面试经验等),欢迎来公众号找我们交流
回复

使用道具 举报

3

主题

7

帖子

11

积分

新手上路

Rank: 1

积分
11
发表于 2023-4-26 15:37:16 | 显示全部楼层
对于第一个八爪鱼所提的例子,如果每一条点开,在新的网页某个位置都有1~n个附件,请问这样的可以把所有的记录对应的附件按顺序下载下来吗?谢谢!
回复

使用道具 举报

您需要登录后才可以回帖 登录 | 立即注册

本版积分规则

Archiver|手机版|小黑屋|办公问答网

GMT+8, 2025-3-15 15:22 , Processed in 0.123530 second(s), 23 queries .

Powered by Discuz! X3.4

© 2001-2013 Comsenz Inc. Templated By 【未来科技 www.veikei.com】设计

快速回复 返回顶部 返回列表