尧图网站设计 尧图网站设计YAOTU DESIGN
ARTICLE DETAIL

资讯详情

深耕网站设计与一线实操的经验洞察。

MediaCrawler爬虫工具完整指南:3步跑通媒体数据采集环境

MediaCrawler爬虫工具完整指南:3步跑通媒体数据采集环境 MediaCrawler爬虫工具完整指南3步跑通媒体数据采集环境【免费下载链接】MediaCrawler小红书笔记 | 评论爬虫、抖音视频 | 评论爬虫、快手视频 | 评论爬虫、B 站视频 评论爬虫、微博帖子 评论爬虫、百度贴吧帖子 百度贴吧评论回复爬虫 | 知乎问答文章评论爬虫项目地址: https://gitcode.com/GitHub_Trending/me/MediaCrawler想批量抓取小红书笔记和抖音评论却被登录态和反爬机制卡住MediaCrawler是一款开源媒体数据采集工具一套配置就能抓小红书、抖音、B站、知乎等7个平台的笔记、视频和评论结果直接落成CSV或数据库。项目速览一句话定性它是基于Playwright浏览器自动化的多平台爬虫框架不做JS签名逆向——直接复用已登录的浏览器上下文拿签名参数技术门槛比传统逆向方案低很多。平台可抓数据共同能力小红书 / 抖音 / 快手 / B站笔记、视频、评论关键词搜索、按ID指定爬取微博 / 百度贴吧 / 知乎帖子、问答、评论二级评论、创作者主页七个平台统一支持登录态缓存、IP代理池、评论词云图存储可选CSV、JSON、SQLite、MySQL、MongoDB、Excel。快速上手环境要求先装好这三样Python uv包管理uv --version能出版本号即可Node.js 16.0 以上抖音、知乎的签名脚本依赖它Chrome 144 以上项目默认走CDP模式连接你本机浏览器复用真实登录态风控风险最低获取代码并同步依赖git clone https://gitcode.com/GitHub_Trending/me/MediaCrawler cd MediaCrawler uv sync最简配置跑起来打开config/base_config.py按中文注释填好平台、关键词、存储格式三项即可其余保持默认。然后让Chrome开启远程调试地址栏输入chrome://inspect/#remote-debugging勾选允许页面出现Server running at: 127.0.0.1:9222就就绪了。最后运行uv run main.py --platform xhs --lt qrcode --type search扫码登录数据就按配置落盘。不想碰命令行也可以起WebUI可视化界面后端api/ 前端webui/各起一个进程填参数、看实时日志、预览导出都在页面上完成WebUI界面左侧配置平台与登录方式右侧选存储格式下方终端实时滚动爬取日志工作机制拆解整个采集链路拆成请求、反爬、解析、存储四段每段独立成模块出问题时知道往哪找。入口与配置main.py接收命令行参数config/是所有开关的唯一出处浏览器与登录tools/browser_launcher.py管理Playwright/CDP浏览器登录态落盘缓存不用每次重扫请求与反爬media_platform/平台/client.py发请求proxy/维护代理IP池失效自动轮换解析field.py把各平台原始JSON映射成model/下的统一数据结构存储store/按平台分实现database/对接关系型与文档型数据库切换只改配置数据流转路径输入关键词或帖子ID → 浏览器带代理发请求 → 解析成结构化模型 → 写入文件或数据库 → 可选生成评论词云。代理池的完整请求流程见下图MediaCrawler爬虫工具代理IP池请求流程与失效轮换机制图代理IP池工作机制从服务商拉取IP、写入缓存、失效检测与轮换的完整链路各模块职责与调用关系的完整说明见项目架构文档。实战场景场景一连锁咖啡品牌盯新品口碑谁在用区域门店的运营负责人怎么配置--platform tieba和--platform weibo各跑一次关键词设为品牌名城市CSV存储每天定时执行拿到什么每日新增提及表和二级评论配送太慢杯套没送这类抱怨当天就能甩进运营群比刷论坛快一个数量级场景二短视频代投机构拆竞品钩子谁在用给食品品牌投流的广告优化师怎么配置--platform douyintype设为创作者主页填竞品账号打开评论词云生成拿到什么视频列表评论量词云高频词价格、成分、前后对比下一轮脚本直接照着用户嘴里的词写场景三研究生建问答语料库谁在用做文本分析方向的硕士生怎么配置--platform zhihutype设为detail配置里填目标问题ID列表存储切到MongoDB拿到什么整批答案加评论数据Python里直接读出来做统计不用手写一套知乎请求逻辑避坑清单采集任务频繁失败先查这两处登录态是否过期重新扫码和代理IP是否失效。别瞎猜控制台日志里会写明是哪种错误。连不上浏览器CDP模式要求Chrome 144以上且必须在chrome://inspect/#remote-debugging里开启远程调试端口9222。不想用CDP就在config/base_config.py里设ENABLE_CDP_MODE False并执行uv run playwright install装驱动细节见CDP模式使用指南。代理配了不生效依次核对三件事——config/base_config.py里的代理服务商选对没有、密钥是否通过环境变量注入以极速HTTP为例读jishu_key、服务商后台白名单有没有加你的出口IPproxy_ip_provider.py 中从环境变量读取代理密钥的位置红框处为极速HTTP的key注入点更多服务商接入方式见代理使用文档。平台接口变了导致解析失败只改对应平台的client.py/field.py其余六个平台互不影响这是模块化拆分的直接好处。数据量大、文件写不动在base_config.py把存储切到SQLite/MySQL/MongoDB选型建议看数据存储指南。结尾七个平台、五种存储、登录态和反爬都替你处理完这就是MediaCrawler的开箱即用。别光看文档先跑一条关键词搜索打开CSV确认数据落盘再按自己的场景往下扩。【免费下载链接】MediaCrawler小红书笔记 | 评论爬虫、抖音视频 | 评论爬虫、快手视频 | 评论爬虫、B 站视频 评论爬虫、微博帖子 评论爬虫、百度贴吧帖子 百度贴吧评论回复爬虫 | 知乎问答文章评论爬虫项目地址: https://gitcode.com/GitHub_Trending/me/MediaCrawler创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表