尧图网站设计 尧图网站设计YAOTU DESIGN
ARTICLE DETAIL

资讯详情

深耕网站设计与一线实操的经验洞察。

MediaCrawler:3 条命令跑通 7 大社媒平台数据采集

MediaCrawler:3 条命令跑通 7 大社媒平台数据采集 MediaCrawler3 条命令跑通 7 大社媒平台数据采集【免费下载链接】MediaCrawler小红书笔记 | 评论爬虫、抖音视频 | 评论爬虫、快手视频 | 评论爬虫、B 站视频 评论爬虫、微博帖子 评论爬虫、百度贴吧帖子 百度贴吧评论回复爬虫 | 知乎问答文章评论爬虫项目地址: https://gitcode.com/GitHub_Trending/me/MediaCrawler想采集小红书、抖音、快手、B 站、微博、贴吧、知乎的公开笔记、视频和评论逐个平台写爬虫太折腾。MediaCrawler 是一个开源的多平台媒体数据采集工具克隆仓库、改几行配置就能上手下面用采集一次小红书笔记的真实流程带你走一遍。先把项目跑起来先装好 uv 包管理器它会自动处理 Python 环境和依赖如果还要采集抖音、知乎另外装个 Node.js 16。git clone https://gitcode.com/GitHub_Trending/me/MediaCrawler cd MediaCrawler uv sync项目默认走 CDP 模式连接你本机的 Chrome复用浏览器里已有的登录态和 Cookie对风控更友好。运行前在 Chrome 地址栏打开chrome://inspect/#remote-debugging开启远程调试即可。然后执行第一条采集命令uv run main.py --platform xhs --lt qrcode --type search浏览器会自动弹出手机扫码登录它就按配置文件里的关键词逐页抓帖子和评论。Chrome 弹出确认框时点一下接受就行。换个平台只改一个文件参数都在 config/ 目录下各平台一份配置文件外加公共的 config/base_config.py全部带中文注释KEYWORDS是搜索关键词CRAWLER_TYPE在搜索、指定帖子详情、创作者主页三种模式里选CRAWLER_MAX_NOTES_COUNT控制单次采集多少条ENABLE_GET_COMMENTS控制要不要抓评论。想换到抖音把命令行参数改成--platform dy再改对应平台配置里的关键词爬虫代码一行都不用碰。数据最终存在哪默认落到data/目录下的 jsonl 文件一行一条数据方便后续处理。想直接看 Excel命令后加--save_data_option excel会生成带格式的多工作表文件想查重、做查询建议入库——先执行uv run main.py --init_db sqlite初始化再把存储选项指到 SQLite 即可更多组合见 docs/data_storage_guide.md。被限流、断网了怎么办一次采得多很容易触发平台风控。项目内置了代理 IP 池逻辑在 proxy/ 目录从代理提供商拉取 IP缓进 Redis请求时轮换使用。代理IP池工作流程图开启的话把基础配置里的ENABLE_IP_PROXY改成True再在IP_PROXY_PROVIDER_NAME里选提供商内置快代理、豌豆 HTTP 和静态代理三种。不想敲命令有可视化界面项目自带 WebUI两个终端分别启动后端 API 服务和前端开发服务浏览器打开就能选平台、选登录方式、设采集类型日志实时回显。改个平台、改个关键词同一套代码就能复用去 7 个站点学架构、做数据研究都够用了。【免费下载链接】MediaCrawler小红书笔记 | 评论爬虫、抖音视频 | 评论爬虫、快手视频 | 评论爬虫、B 站视频 评论爬虫、微博帖子 评论爬虫、百度贴吧帖子 百度贴吧评论回复爬虫 | 知乎问答文章评论爬虫项目地址: https://gitcode.com/GitHub_Trending/me/MediaCrawler创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表