尧图网站设计 尧图网站设计YAOTU DESIGN
ARTICLE DETAIL

资讯详情

深耕网站设计与一线实操的经验洞察。

GetQzonehistory 免费一键导出 QQ 空间历史说说、评论与图片

GetQzonehistory 免费一键导出 QQ 空间历史说说、评论与图片 GetQzonehistory 免费一键导出 QQ 空间历史说说、评论与图片【免费下载链接】GetQzonehistory获取QQ空间发布的历史说说项目地址: https://gitcode.com/GitHub_Trending/ge/GetQzonehistoryGetQzonehistory 是一个免费开源的 Python 工具帮你想备份自己的 QQ 空间的人把历史说说、转发、留言和配图一次性抓下来产出 6 张 Excel 表、一个离线网页和一堆本地高清图片。它解决什么问题QQ 空间没有官方导出入口。十年前的说说在网页端翻几十页才见底想完整搬下来手抄不现实。GetQzonehistory 做的事就一件模拟登录你的 QQ 空间把历史消息一条一条拉下来按类型拆成表格和图片存进硬盘。跑完之后你会得到一个以自己 QQ 号命名的文件夹里面是结构化的数据——每条消息带精确到秒的发布时间、独立的图片链接列、逐条拆开的评论内容后面想做任何统计都方便。怎么跑起来环境要求只有一个装好 Python 3。Windows、macOS、Linux 都能跑。git clone https://gitcode.com/GitHub_Trending/ge/GetQzonehistory cd GetQzonehistory python -m venv myenv source myenv/bin/activate # Windows 用 myenv\Scripts\activate pip install -r requirements.txt python main.py如果 pip 下载依赖特别慢或失败把安装那条换成阿里云镜像源pip install -i https://mirrors.aliyun.com/pypi/simple/ -r requirements.txt启动后终端会打印一个二维码用手机 QQ 扫一下就完成登录全程不输密码。之后盯着进度条看到导出成功提示程序会自动打开resource/result/你的QQ号/文件夹同时打印总条数、最早一条说说的发布时间、各表数量和图片张数逐项对账就行。产物清单与验收一次完整导出后resource/result/你的QQ号/里的东西如下表文件里面是什么QQ号_全部列表.xlsx抓到的全部消息时间、内容、图片链接、评论QQ号_说说列表.xlsx你本人发布的说说QQ号_转发列表.xlsx你转发过的每一条内容QQ号_留言列表.xlsx你留在空间留言板的互动QQ号_其他列表.xlsx好友出现在你动态里的消息QQ号_好友列表.xlsx互动好友的昵称、QQ 号、空间主页地址QQ号_说说网页版.html说说加转发按时间倒序排列的离线网页pic/全部配图文件名取自说说正文方便对号网页版不用联网就能翻说说网页版.html还原了头像、昵称、发布时间、正文、配图和评论区QQ 表情也换成了图片显示。双击就能打开断网也不影响适合当一份随时翻的本地档案。图片直接落成本地文件pic/目录里存的是下载好的原图文件名就是说说正文的前 40 个字去掉非法字符和空格同一条说说有多张图就并排存。哪天原链接失效图还在你机器上。数据从哪来整条链路是四个动作看懂它你就知道这份备份的边界在哪。登录扫码拿 Cookie登录逻辑在 util/LoginUtil.py。程序在终端画出一个二维码手机 QQ 扫码后拿到的 Cookie 存进resource/user/下以 QQ 号命名的文件。下次运行会列出已登录账号让你输序号输 0 才是重新扫码——所以定时任务不用每次扫码。抓取两路数据合并自带限速数据分两路。第一路是空间历史消息列表每批取 10 条批与批之间程序主动停 3 秒是刻意的限速请求数量本身用二分查找估算先定位总数再逐批拉。第二路是未删除的可见说说接口util/GetAllMomentsUtil.py每页 30 条能补到消息列表里没有的老内容。两路合并、去重后再按说说 / 转发 / 留言 / 其他分类落盘。原始请求按 QQ 号缓存在resource/fetch-all/下重跑直接读缓存不会重复拉取多个账号之间互不串。按 CtrlC 也不白跑main.py 里注册了信号处理函数你按CtrlC时程序会先把已抓到的内容全部存盘再退出。进度条走得慢可以先停掉下次接着跑已有数据不会丢。拿不到的内容也说清楚工具读的是消息列表 可见说说。仅自己可见的说说、已经删除的说说天然不在结果里这属于数据来源决定的上限多跑几次也补不回来。报错速查现象多半原因处理办法pip 装依赖很慢或失败网络源问题换阿里云镜像源重装命令见上一节提示无法找到 zbar 共享库缺二维码识别组件RPM 系 Linux 执行sudo dnf install -y zbarmacOS 按提示用 Homebrew 安装程序会自动建软链接扫码后二维码已失效或长时间无反应手机 QQ 未在线、二维码过期或系统时间不准重新运行生成新码刚被风控拦截时等几分钟再试只抓到一部分说说仅自己可见的内容不在消息列表网络抖动漏批属正常范围可多运行几次已抓到的部分会先存盘跑得特别慢每批之间停 3 秒是刻意限速正常现象也可以分多次跑完进阶玩法用 Pandas 算出你的年度话痨月Excel 列名是现成的几行代码就能出统计import pandas as pd df pd.read_excel(你的QQ号_说说列表.xlsx) df[时间] pd.to_datetime(df[时间], format%Y年%m月%d日 %H:%M:%S) print(df.groupby(df[时间].dt.to_period(M)).size())再往下可以加词频统计、配图数量随时间的变化回忆就能变成一张图表。让备份自己按时跑Cookie 可以复用定时任务不用再扫码。Linux/macOS 在 crontab 里加一行每月 1 号凌晨 3 点跑一次0 3 1 * * cd /path/to/GetQzonehistory source myenv/bin/activate python main.pyWindows 用任务计划程序做同样的事即可。想要一份 Markdown 版仓库里另有 fetch_all_message.py单独运行它能把全部可见说说另存成一份 Markdown配图一并下载到resource/fetch-all/下转发和评论都带在条目里。安全与红线数据只写入你自己硬盘的resource/result/不经过任何第三方服务器。登录靠扫码不收集密码Cookie 就在resource/user/不放心就删掉重扫。全部代码开源可查登录逻辑在 util/LoginUtil.py请求构造在 util/RequestUtil.py输出路径配置在 resource/config/config.ini。只备份你自己空间的内容不要拿它去抓别人的数据。项目声明仅供学习与技术研究不得用于商业或非法用途。今晚花十几分钟走完一遍你空间里十年的数据就有了第二份存档。觉得顺手的话去项目主页点一颗 Star 支持一下。【免费下载链接】GetQzonehistory获取QQ空间发布的历史说说项目地址: https://gitcode.com/GitHub_Trending/ge/GetQzonehistory创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表