尧图网站设计 尧图网站设计YAOTU DESIGN
ARTICLE DETAIL

资讯详情

深耕网站设计与一线实操的经验洞察。

GetQzonehistory 使用教程:一键导出 QQ 空间全部历史说说、评论与图片

GetQzonehistory 使用教程:一键导出 QQ 空间全部历史说说、评论与图片 GetQzonehistory 使用教程一键导出 QQ 空间全部历史说说、评论与图片【免费下载链接】GetQzonehistory获取QQ空间发布的历史说说项目地址: https://gitcode.com/GitHub_Trending/ge/GetQzonehistory如果你的 QQ 空间堆着上千条历史说说GetQzonehistory 能一次性把它们连同评论、转发、留言和配图全部搬进你的电脑免费、开源产出 6 张 Excel 表格、一个可双击打开的离线网页和一张张图片的本地文件夹。本文先带你逐项对账跑完能拿到什么再倒推数据是怎么抓下来的最后给出一套可以直接照抄的命令和一份常见卡点对照表。一次跑完能验收什么程序跑完后会自动打开resource/result/你的QQ号/文件夹控制台同时打印总条数、最早一条说说的时间、各类消息数量和图片张数。里面的东西可以逐项对账文件里面是什么怎么验收QQ号_全部列表.xlsx抓到的全部消息四列时间、内容、图片链接、评论QQ号_说说列表.xlsx你本人发布的说说内容与全部列表中属于你的行一致QQ号_转发列表.xlsx你转发过的每一条内容列含转发字样QQ号_留言列表.xlsx你留在空间留言板的互动时间、内容、图片链接三列QQ号_其他列表.xlsx好友出现在你动态里的消息三列无评论QQ号_好友列表.xlsx互动过的朋友昵称、QQ、空间主页三列QQ号_说说网页版.html说说转发按时间倒序的离线网页双击打开不联网也能看pic/全部配图文件名取自说说正文前 40 字每一行都带精确到秒的发布时间图片 URL 独立占一列评论按谁、何时、说了什么逐条拆开存。网页版还原了头像、昵称、正文、配图和评论区QQ 表情换成了图片显示渲染时缩略图参数会被替换成原图参数点开大图本地文件则直接落在pic/里哪天原链接失效图还在你机器上。抓取链路数据从哪来存到哪登录只扫码不打密码程序启动后在终端直接打印一个 ASCII 二维码实现在 登录模块手机 QQ 扫一下就算登录全程不输入密码。拿到的 Cookie 存进resource/user/下以 QQ 号命名的文件下次运行会列出已登录账号让你选序号输 0 才是重新扫码。抓取两路数据合并分批限速数据分两路。第一路是空间历史消息列表接口每批 10 条批与批之间刻意停 3 秒限速见 请求模块第二路是未删除的可见说说接口实现每页 30 条能补到 2014 年之前的老内容。两路按正文去重合并后才分类落盘。原始响应缓存在resource/fetch-all/QQ号/下重跑不重复拉取多账号互不串注意缓存命中时分类和图片下载仍会重新执行一遍。中断也不白跑按CtrlC时main.py 里注册的signal_handler会先把已抓到的内容存盘再退出。进度条走得慢就停掉下次接着跑已有数据不会丢。快速跑通六条命令从克隆到验收环境只需要 Python 3Windows、macOS、Linux 都能跑git clone https://gitcode.com/GitHub_Trending/ge/GetQzonehistory cd GetQzonehistory python -m venv myenv source myenv/bin/activate # Windows 改为 myenv\Scripts\activate pip install -i https://mirrors.aliyun.com/pypi/simple/ -r requirements.txt python main.py启动后终端出现二维码就是第一步扫完等进度条看到导出成功请查看 resource/result/...提示时去自动打开的文件夹对账。不想配环境的话仓库 release 里有打包好的单文件可以直接执行仓库里另有 fetch_all_message.py单独运行它能把可见说说另存成一份 Markdown图片也一并下载。常见卡点对照表现象多半原因处理办法pip 装依赖很慢或失败网络源问题换国内镜像源重装命令见上一节提示无法找到 zbar 共享库缺二维码识别组件RPM 系 Linux 执行sudo dnf install -y zbarmacOS 由登录模块引导你用 Homebrew 安装并自动建软链接扫码后二维码已失效或长时间无反应手机 QQ 未在线、二维码过期或系统时间不准重新运行生成新码刚被风控拦截时等几分钟再试只抓到一部分说说仅自己可见的内容不在消息列表网络抖动漏批属正常范围可多运行几次已抓到的部分会先存盘跑得特别慢批间停顿是刻意限速正常现象也可以分多次跑能力边界哪些拿不到为什么工具读的是消息列表 可见说说两个接口仅自己可见的说说、已删除的内容、点赞数、好友空间的动态详情天然不在结果里——这是数据来源决定的上限不是 bug别当 bug 排查。进阶玩法统计、定时任务与私人索引用 Pandas 算出你的年度话痨月Excel 列名是现成的几行代码就能出统计import pandas as pd df pd.read_excel(你的QQ号_说说列表.xlsx) df[时间] pd.to_datetime(df[时间], format%Y年%m月%d日 %H:%M:%S) print(df.groupby(df[时间].dt.to_period(M)).size()) # 每月发了几条 print(df[内容].str.len().sort_values(ascendingFalse).head(3)) # 最长的三条让备份自己按时跑Cookie 可复用定时任务不需要再扫码。Linux/macOS 在 crontab 里加一行每月 1 号凌晨 3 点跑一次0 3 1 * * cd /path/to/GetQzonehistory source myenv/bin/activate python main.pyWindows 用任务计划程序做同样的事即可。想找某条特定说说的先在 Excel 里按时间筛选定位再回网页版看配图和评论上下文比在空间里一页页翻快得多。 安全与合规红线数据只在你本地落地抓到的数据只写入你自己硬盘的resource/result/不经过任何第三方服务器。登录靠扫码不收集密码Cookie 就在resource/user/不放心就删掉文件重扫。全部代码开源可查登录在 util/LoginUtil.py请求在 util/RequestUtil.py说说解析在 util/GetAllMomentsUtil.py输出路径配置在resource/config/config.ini。红线只有一条只备份你自己账号的数据不要拿它去抓别人的空间。项目声明仅供学习与技术研究不得用于商业或非法用途。现在就能做完的五个动作克隆仓库git clone https://gitcode.com/GitHub_Trending/ge/GetQzonehistory建虚拟环境、装依赖卡住就换镜像源然后运行python main.py终端出现二维码手机 QQ 扫码完成登录等进度条走完到resource/result/你的QQ号/对账六张表、网页版、高清图用得顺手去项目主页点一颗 Star今晚花二十分钟走完一遍你空间里十年的数据就有了第二份本地存档。【免费下载链接】GetQzonehistory获取QQ空间发布的历史说说项目地址: https://gitcode.com/GitHub_Trending/ge/GetQzonehistory创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表