尧图网站设计 尧图网站设计YAOTU DESIGN
ARTICLE DETAIL

资讯详情

深耕网站设计与一线实操的经验洞察。

几行代码搞定小红书数据采集:xhs 新手上手完整指南

几行代码搞定小红书数据采集:xhs 新手上手完整指南 几行代码搞定小红书数据采集xhs 新手上手完整指南【免费下载链接】xhs基于小红书 Web 端进行的请求封装。https://reajason.github.io/xhs/项目地址: https://gitcode.com/gh_mirrors/xh/xhs做内容选题、电商选品的朋友多半有过这种崩溃时刻想对比某个话题下几百条笔记的点赞、收藏、评论数只能开着网页一条一条手动复制进表格一下午就耗在了一个话题上。xhs是一个基于小红书 Web 端请求封装的 Python 库几行代码就能拿到笔记详情、用户资料、多级评论等公开数据把这种体力活变成几分钟就能跑完的操作。 先搞清楚xhs 能做什么不能做什么读公开数据get_note_by_id()拿笔记详情、get_note_by_keyword()关键词搜索、get_user_notes()拉用户发布列表、get_note_comments()与get_note_sub_comments()挖多级评论不止于读点赞、收藏、关注、评论等交互操作同一个客户端也能调签名已解决每个 Web 请求都要带 x-s 签名相当于给请求盖的防伪章项目内置playwright 模拟浏览器和独立签名服务两种方案不用自己研究算法边界要清楚它输出的是结构化 JSON不是现成报表清洗和汇总还得你自己做️ 新手安装步骤三步跑通第一个采集任务第一步装依赖。确保 Python 在 3.7 及以上pip install xhs pip install playwright playwright install另外需要下载一份stealth.min.js用来绕过浏览器环境检测docs/basic.rst 中有说明。第二步拿到入场券。登录小红书网页版从浏览器开发者工具复制 Cookie其中a1、web_session、webId 三个字段缺一不可。第三步跑示例脚本。项目里的example/basic_usage.py是最佳起点把脚本中的 cookie 换成自己的直接运行就能打印出指定笔记的标题、正文、点赞、收藏和图片链接。核心调用其实就两行from xhs import XhsClient xhs_client XhsClient(cookie, signsign) note xhs_client.get_note_by_id(note_id, xsec_token)看到 JSON 数据落出来的那一刻你就入门了。 进阶场景还能挖出哪些数据1. 关键词搜索做选题调研调用get_note_by_keyword()配合按热度或时间排序一眼看清某个话题下爆款笔记的标题和互动特征。 适合内容创作者和新媒体小编——发什么不再靠猜数据替你说话。2. 竞品账号节奏监控用get_user_notes()定期拉取对方发布列表再用get_note_by_id()补全每篇的互动数据横向一拉就能看出更新频率和内容规律。 适合品牌运营和电商从业者把竞品动向沉进自己的表里。3. 评论全量挖掘get_note_comments()配合get_note_sub_comments()把一级评论和子评论完整还原出来拼出一场完整的用户讨论。 适合做口碑分析、用户画像研究的产品和调研团队。⚠️ 排坑与合规须知签名偶发失败属正常现象示例代码已内置失败重试多试几次即可经常失败的话适当调大浏览器加载后的等待时间多账号共用签名服务官方进阶做法是把签名封装成 Flask 服务参考example/basic_sign_server.py多个账号共用时务必让 Cookie 里的 a1 与服务端一致否则签名会一直报错务必控制频率高频请求容易触发风控甚至 IP 封禁请求之间留出合理间隔细水长流才稳合规红线请只采集平台公开可访问的数据遵守相关法律法规与平台规则不要对目标网站施加压力 把重复劳动交给代码xhs 的价值不在于代码多惊艳而在于它把拿到公开数据的门槛打到了最低签名、反爬都不用你操心你只管想清楚拿到数据之后做什么。二维码登录example/login_qrcode.py、手机号登录example/login_phone.py等示例也都备好了。把复制粘贴的活儿交给代码把判断力的活儿留给自己。【免费下载链接】xhs基于小红书 Web 端进行的请求封装。https://reajason.github.io/xhs/项目地址: https://gitcode.com/gh_mirrors/xh/xhs创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表