尧图网站设计 尧图网站设计YAOTU DESIGN
ARTICLE DETAIL

资讯详情

深耕网站设计与一线实操的经验洞察。

情报分析学习比赛准备

情报分析学习比赛准备 这篇笔记是为了准备这个比赛用的可以用八爪鱼也可以用python进行pa取pythonpa取的初赛三代码后续会同步更新在本片文章中。但是八爪鱼可以用无代码编程爬取更适合大部分初学者但是这个网站要充钱我也是暂时用了学生会员免费后续可能还是用python的selenium库会比较多。初赛二任 务 1采集**网站**栏目前10页的数据包含标题时间作者正文图片豆瓣书评任 务 2采集**网站**栏目的数据且这些数据包含******包含标题时间作者正文图片新闻网站任 务 3采集微博某个关健词的博文列表100条字段包含博文作者发布时间评论数量点赞数转发数首先网页打开微博进行关键词检索进行搜索后。再点击高级搜索进行选择之后点击搜索将网址复制到八爪鱼。点击自动识别左上角的灯泡。之后根据任务选择需要爬取的字段不过因为有的地方需要优化字段比如说我们有展开的肯定是要展开的文本。但是因为点击展开后八爪鱼会呈现两个文本的形式之后需要修改一下博文的元素定位为/descendant-or-self::P[contains(class,txt)][last()]。同时优化字段优化评论、转发、点赞数输入\d进行正则匹配从而只要数字任 务 4采集微博某个关健词的博文列表100条仅要原创的转发不要字段包含博文作者发布时间评论数量点赞数转发数在高级搜索添加原创的约束或者是网址最后加个scopeori进行限制原创搜索任 务 5采集指定帐号的百家号最近一周更新的文章。这个好像直接用自动识别网页就完成了主要是在于这个时间我是先用了格式化时间之后再用触发器限制了七天的时间参考链接利用八爪鱼爬取关键词搜索的微博数据_八爪鱼微博关键词爬取-CSDN博客
返回列表