尧图网站设计 尧图网站设计YAOTU DESIGN
ARTICLE DETAIL

资讯详情

深耕网站设计与一线实操的经验洞察。

GetQzonehistory:2 个数据源、6 份产出,一次导齐 QQ 空间历史说说

GetQzonehistory:2 个数据源、6 份产出,一次导齐 QQ 空间历史说说 GetQzonehistory2 个数据源、6 份产出一次导齐 QQ 空间历史说说【免费下载链接】GetQzonehistory获取QQ空间发布的历史说说项目地址: https://gitcode.com/GitHub_Trending/ge/GetQzonehistoryGetQzonehistory 是一个 QQ 空间历史说说一键备份工具。扫码登录后它自动分页拉取你的全部说说、转发、评论与配图。产出是 Excel、本地图库和可浏览网页。适合想备份多年 QQ 空间内容或想对自己的历史动态做统计的人。跑通典型工作流从扫码到说说导出完成克隆仓库、安装依赖两行命令git clone https://gitcode.com/GitHub_Trending/ge/GetQzonehistory cd GetQzonehistory pip install -r requirements.txt接着运行python main.py后续全部由程序接管。完整流程分五步登录。首次运行终端打印黑白字符二维码。用 QQ 扫码。登录状态按 QQ 号写入resource/user/目录。下次运行选序号即可复用输入 0 重新扫码。拉消息列表。先查总条数再分批翻页每批 10 条批间等待 3 秒。终端进度条随抓取推进。合并说说列表。消息列表跑完后util/GetAllMomentsUtil.py 按每页 30 条翻页拉取未删除说说。该数据源能覆盖 2014 年之前的内容。去重后并入主列表。落盘输出。程序把内容分成说说、转发、留言、其他四类生成 6 份 Excel。全部说说配图下载到 pic/ 子目录。最后渲染「说说网页版.html」浏览器打开就是一条时间线式说说页。统计与中断保护。落盘后打印消息数、好友数、图片数等统计和最早一条说说的发布时间并自动打开结果目录。抓取中途按 CtrlC会先把已抓数据存盘半小时进度不丢。结果目录的规划见 README.MDresource/ 下分 config、result、temp、user 四个子目录。运行机制拆解数据进、处理、输出三层数据进两个分页数据源所有请求依赖两样东西登录 cookie 和 g_tk 签名。util/LoginUtil.py 完成扫码流程并从 cookie 里算出签名后续请求全部携带。两个数据源节奏不同。消息列表每页 10 条页间等 3 秒覆盖全部互动类型。说说列表每页 30 条页间隔 0.02 秒只负责未删除说说。拉取过程像老图书馆按架取书先看总页数再从第一页开始一次取几本。比喻到此为止。签名校验、限速等待、缓存复用都是真实的代码行为与图书馆无关。处理解析、去重、合并消息列表返回 HTML。程序定位列表项逐条提取时间、文字、图片链接三个字段。内容去重相同文本只留一条。两个数据源合并时多一步消息列表里的说说若内容已被未删除说说覆盖先剔除消息侧再追加说说列表。同一条说说不会重复计数。之后按内容是否带自己的昵称、是否出现留言转发字样划分说说、转发、留言、其他四类。输出6 份表格、1 个网页、1 个图库Excel 固定四列时间、内容、图片链接、评论。图片文件名由说说文本生成去掉非法字符和表情超过 40 字截断重名加时间戳后缀防覆盖。网页有个细节图片链接里的中画质标记被替换成高清标记。HTML 里渲染出的图比原始链接清晰一档。边界也要说清能拿到的是消息列表里的内容。仅自己可见的说说不会出现在消息列表中也就不会进入结果。按场景选路线从免环境直接跑到轻量取数路线 A没有 Python 环境只想尝鲜。到 release 页面下载打包好的单文件直接运行。零环境配置适合先验证产出形态。路线 B标准跑法产出最全。按上一章的克隆加虚拟环境流程走安装 requirements.txt 列出的依赖。多一个系统级依赖要注意二维码识别库 pyzbar 依赖 zbar 共享库。Fedora 等 RPM 系统执行sudo dnf install -y zbar即可。macOS 上程序会检测 Homebrew 并引导安装。路线 C只要未删除说说要轻量产出。运行 fetch_all_message.py。这条路不拉消息列表只分页取说说含 2014 年之前的。产出是一份「所有可见说说.md」加同目录图片。适合导入个人站或笔记工具。选择标准只有一条数据要全就选 B只要轻量就选 C只想尝鲜就选 A。算一笔账一次说说备份要多少时间和硬盘维度占用多少依据消息列表耗时约 100 条 30 秒每批 10 条等 3 秒纯等待说说列表耗时每页 30 条几乎无等待页间隔 0.02 秒磁盘空间图片库为主配图全部本地化按条数×单图均值预留硬件门槛普通 PC无需显卡系统级依赖仅 zbar网络持续稳定连接串行分页无并发人力成本约 1 分钟操作扫码、选用户序号其余自动数字可以换算。消息列表若有一万条等待约 50 分钟10000 ÷ 10 × 3 秒。放下不管即可。磁盘是唯一要提前算的项5000 张配图、平均每张 1 MB就要预留 5 GB。成长路径QQ 空间备份工具怎么参与和扩展README 自述代码尚有疏漏并明确欢迎用自己的想法来完善。代码风格直白是 Python 新手练手的合适入口。扩展方向有三个都基于现有接口不改动项目主流程数据侧。Excel 列固定为时间、内容、图片链接、评论。想做每月说说话数活跃时段这类统计数据已结构化接个 pandas 脚本即可。多账号侧。cookie 缓存和取数缓存都按 QQ 号隔离目录。登录选择机制支持切换。一个账号跑完再跑下一个。产出侧。现有 Excel、图片、网页、Markdown 四种形式。想输出到别的存储两个入口的取数—落盘切分都清晰容易分叉。协作走仓库的 Issue 区提问题和功能建议。免责声明值得先读一遍仅供学习和技术研究使用不要把它指向他人账号。自检清单收尾前核对 3 个可验证项✅产出是否齐全打开结果目录6 份「QQ号_*.xlsx」和 1 份「说说网页版.html」都在。打开 HTML配图与评论能正常渲染。✅数据是否对账程序打印的共有 N 条消息与全部列表 xlsx 的行数一致。pic/ 目录的图片数和屏幕输出的共有 N 张图片相同。✅状态是否可复用再次运行终端列出已登录用户。输入对应序号免扫码直接进入抓取。三项都通过备份链路才算可信。剩下的只是等下一个 QQ 号。【免费下载链接】GetQzonehistory获取QQ空间发布的历史说说项目地址: https://gitcode.com/GitHub_Trending/ge/GetQzonehistory创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表