小红书数据采集与自动化工具完整指南

发布时间:2026/7/24 18:02:20

小红书数据采集与自动化工具完整指南 小红书数据采集与自动化工具完整指南【免费下载链接】xhs基于小红书 Web 端进行的请求封装。https://reajason.github.io/xhs/项目地址: https://gitcode.com/gh_mirrors/xh/xhs小红书数据采集工具让你轻松获取小红书平台的公开数据为内容分析、市场研究和竞品监控提供强大支持。这个Python库封装了小红书Web端的请求接口让你能够以编程方式访问笔记、用户、搜索等数据无需手动操作网页。无论你是数据分析师、内容创作者还是产品经理都能通过这个工具快速获取所需的小红书数据。为什么选择小红书数据采集工具在当今社交媒体分析领域小红书已经成为不可忽视的内容平台。传统的网页爬虫开发需要处理复杂的反爬机制和频繁的接口变更而这个工具帮你解决了这些痛点功能特点传统方法xhs工具接口稳定性需要频繁维护封装官方接口稳定性高反爬处理手动处理验证码、签名自动签名验证机制数据完整性可能缺失字段完整的数据结构开发效率数天到数周几分钟上手维护成本持续投入开源社区维护重要提示本工具仅用于学习和研究目的请遵守小红书平台的使用条款不要对网站造成压力或进行未经授权的活动。快速开始5分钟上手小红书数据采集安装步骤超简单首先确保你已安装Python 3.7或更高版本然后只需要一行命令pip install xhs如果你想要最新版本可以直接从Git仓库安装pip install githttps://gitcode.com/gh_mirrors/xh/xhs获取必要的认证信息要使用这个工具你需要准备两个关键信息Cookie- 从小红书网站获取的登录凭证签名函数- 处理请求签名的函数别担心这些听起来复杂其实很简单Cookie可以通过浏览器开发者工具获取而签名函数项目已经提供了示例。第一个采集脚本让我们写一个最简单的示例获取单篇笔记的详细信息from xhs import XhsClient # 初始化客户端 cookie 你的小红书cookie xhs_client XhsClient(cookie) # 获取笔记详情 note_id 6505318c000000001f03c5a6 note_data xhs_client.get_note_by_id(note_id) print(f笔记标题{note_data.get(title, 无标题)}) print(f作者{note_data.get(user, {}).get(nickname, 匿名)}) print(f点赞数{note_data.get(likes, 0)})核心功能深度解析1. 笔记数据获取 小红书数据采集工具提供了多种获取笔记数据的方式按ID获取单篇笔记# 获取指定ID的笔记 note xhs_client.get_note_by_id(笔记ID) # 获取笔记中的图片URL from xhs import help image_urls help.get_imgs_url_from_note(note)获取用户发布的笔记列表# 获取用户的所有笔记 user_notes xhs_client.get_user_notes(用户ID, page1)按关键词搜索笔记# 搜索美妆相关的笔记 search_results xhs_client.get_note_by_keyword( keyword美妆, page1, sortgeneral # 排序方式general(综合)、time(时间) )2. 用户信息分析 了解创作者信息对于内容分析至关重要# 获取用户基本信息 user_info xhs_client.get_user_info(用户ID) print(f用户名{user_info[nickname]}) print(f粉丝数{user_info[fans]}) print(f获赞数{user_info[likes]}) print(f笔记数{user_info[notes]})3. 内容分类浏览 ️工具内置了多种内容分类让你可以按兴趣领域获取内容from xhs import FeedType # 获取穿搭类内容 fashion_notes xhs_client.get_home_feed(FeedType.FASION) # 获取美食类内容 food_notes xhs_client.get_home_feed(FeedType.FOOD) # 获取旅行类内容 travel_notes xhs_client.get_home_feed(FeedType.TRAVEL)支持的内容分类包括穿搭FASION美食FOOD彩妆COSMETICS影视MOVIE职场CAREER情感EMOTION家居HOURSE游戏GAME旅行TRAVEL健身FITNESS实际应用场景案例场景1竞品内容分析假设你是一家美妆品牌的市场人员想了解竞品在小红书上的表现import pandas as pd from datetime import datetime, timedelta def analyze_competitor_content(competitor_id, days30): 分析竞品最近30天的内容表现 all_notes [] current_page 1 while True: notes xhs_client.get_user_notes(competitor_id, pagecurrent_page) if not notes: break # 过滤最近30天的笔记 cutoff_date datetime.now() - timedelta(daysdays) recent_notes [ note for note in notes if datetime.fromtimestamp(note[time]/1000) cutoff_date ] all_notes.extend(recent_notes) current_page 1 # 创建数据分析表 df pd.DataFrame(all_notes) # 计算关键指标 avg_likes df[likes].mean() avg_comments df[comments].mean() avg_shares df[shares].mean() return { total_notes: len(df), avg_likes: round(avg_likes, 2), avg_comments: round(avg_comments, 2), avg_shares: round(avg_shares, 2), best_performing: df.loc[df[likes].idxmax()] }场景2热门话题追踪追踪特定话题的热度变化发现内容趋势def track_topic_trend(keyword, days7): 追踪话题7天内的热度变化 daily_data {} for i in range(days): date datetime.now() - timedelta(daysi) date_str date.strftime(%Y-%m-%d) # 搜索当天相关笔记 results xhs_client.get_note_by_keyword( keywordkeyword, page1, sorttime ) daily_data[date_str] { total_notes: len(results), avg_likes: sum(n[likes] for n in results) / max(len(results), 1), top_note: max(results, keylambda x: x[likes]) if results else None } return daily_data常见问题与解决方案Q1: 如何获取有效的CookieA: 登录小红书网页版后按F12打开开发者工具在Network标签中找到任意请求复制Request Headers中的Cookie字段即可。Q2: 遇到签名失败错误怎么办A: 签名失败通常是因为签名函数配置问题。项目提供了完整的签名示例你可以参考 example/basic_usage.py 中的实现。Q3: 请求频率有限制吗A: 为了避免对小红书服务器造成压力建议添加适当的请求间隔如1-3秒避免短时间内大量请求同一接口使用代理IP轮换如果需要大量采集Q4: 数据采集的合法性如何A: 请务必注意仅采集公开数据不要用于商业侵权用途遵守robots.txt协议尊重用户隐私Q5: 如何保存采集的数据A: 建议使用以下格式保存数据import json import csv # 保存为JSON格式 with open(notes.json, w, encodingutf-8) as f: json.dump(notes_data, f, ensure_asciiFalse, indent2) # 保存为CSV格式 import pandas as pd df pd.DataFrame(notes_data) df.to_csv(notes.csv, indexFalse, encodingutf-8-sig)进阶使用技巧1. 错误处理与重试机制from xhs.exception import DataFetchError, IPBlockError import time def safe_get_note(note_id, max_retries3): 安全获取笔记带重试机制 for attempt in range(max_retries): try: return xhs_client.get_note_by_id(note_id) except (DataFetchError, IPBlockError) as e: if attempt max_retries - 1: raise wait_time 2 ** attempt # 指数退避 print(f请求失败{wait_time}秒后重试...) time.sleep(wait_time)2. 批量处理与进度显示from tqdm import tqdm def batch_process_notes(note_ids): 批量处理笔记显示进度条 results [] for note_id in tqdm(note_ids, desc处理笔记): try: note xhs_client.get_note_by_id(note_id) results.append(note) time.sleep(1) # 避免请求过快 except Exception as e: print(f处理笔记 {note_id} 失败: {e}) return results3. 数据清洗与格式化def clean_note_data(raw_note): 清洗和格式化笔记数据 cleaned { note_id: raw_note.get(id, ), title: raw_note.get(title, ).strip(), author: raw_note.get(user, {}).get(nickname, ), publish_time: datetime.fromtimestamp( raw_note.get(time, 0) / 1000 ).strftime(%Y-%m-%d %H:%M:%S), likes: raw_note.get(likes, 0), comments: raw_note.get(comments, 0), shares: raw_note.get(shares, 0), collects: raw_note.get(collects, 0), tags: [tag.get(name, ) for tag in raw_note.get(tag_list, [])], image_count: len(raw_note.get(images, [])), video_url: raw_note.get(video, {}).get(url, ) if raw_note.get(video) else } # 计算互动率 total_interactions cleaned[likes] cleaned[comments] cleaned[shares] cleaned[interaction_rate] round(total_interactions / max(cleaned[likes], 1), 4) return cleaned最佳实践建议数据采集策略分时段采集避免在高峰时段集中请求增量更新只采集新增或更新的内容数据验证定期检查数据完整性和准确性备份机制定期备份已采集的数据性能优化优化方向具体措施预期效果请求优化合并相似请求减少请求次数30%缓存策略本地缓存已获取数据降低重复请求50%并发控制合理设置并发数提升采集速度2-3倍错误恢复实现断点续采避免重复工作合规使用指南✅可以做的采集公开的笔记数据进行研究分析用于个人学习和小规模项目遵守平台的robots.txt规则❌禁止做的大规模商业数据采集侵犯用户隐私对服务器造成压力违反平台用户协议资源与支持官方文档项目的完整API文档可以在 docs/source/xhs.rst 找到包含了所有类和方法的详细说明。示例代码项目提供了丰富的示例代码帮助你快速上手example/basic_usage.py - 基础使用示例example/login_qrcode.py - 二维码登录示例example/basic_sign_server.py - 签名服务器示例核心源码如果你想深入了解实现原理可以查看核心源码xhs/core.py - 主要功能实现xhs/help.py - 辅助函数测试用例项目包含完整的测试用例确保代码质量tests/test_xhs.py - 主要功能测试tests/test_help.py - 辅助函数测试总结小红书数据采集工具为你提供了一个强大而灵活的数据获取方案。通过这个工具你可以快速获取小红书平台的公开数据深度分析内容趋势和用户行为自动化处理重复的数据采集任务构建应用基于小红书数据的分析系统记住技术只是工具如何使用它才是关键。始终将合规性和道德考量放在首位用技术创造价值而不是问题。希望这个工具能帮助你在小红书数据分析的道路上走得更远、更稳如果你在使用过程中遇到问题或者有改进建议欢迎参与项目的开发和讨论。开源社区的力量能让这个工具变得更加强大和完善。【免费下载链接】xhs基于小红书 Web 端进行的请求封装。https://reajason.github.io/xhs/项目地址: https://gitcode.com/gh_mirrors/xh/xhs创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

相关新闻