尧图网站设计 尧图网站设计YAOTU DESIGN
ARTICLE DETAIL

资讯详情

深耕网站设计与一线实操的经验洞察。

WorkBuddy搭建AI资讯自动化流水线:Agent采集筛选与简报归档

WorkBuddy搭建AI资讯自动化流水线:Agent采集筛选与简报归档 1. 我为什么要给刷AI资讯这件事动刀每天早上睁眼第一件事不是刷牙是摸手机刷AI资讯。这个习惯我维持了差不多两年直到某天早上我盯着屏幕发呆发现自己已经记不清前一晚看的十几条推送里到底讲了什么。那种感觉挺挫败的——花了一个多小时信息从眼睛里过了一遍脑子里啥也没留下。相信很多同行都有类似的体验AI这个领域更新实在太快模型、工具、开源项目、论文、融资一天一个样不刷怕掉队刷了又消化不了。WorkBuddy这类AI工作台出现之后我意识到一个问题刷资讯这件事本质上就是一个采集—筛选—归纳—归档的信息处理流程而这类流程恰好是AI agent最擅长干的活。于是我花了大概两周时间把这套流程从手动刷改成了任务外包现在每天只需要花十分钟看一份已经处理好的简报。先说清楚这个东西适合谁。如果你是做AI产品、写AI相关内容的、搞研发跟踪前沿的、或者是投资/咨询里需要盯AI赛道的人那这套方案基本能直接抄。如果你只是想随便看看热闹那可能用不上这么重的配置手机推送就够了。WorkBuddy在这里扮演的角色是一个能装指令、能调工具、能定时干活的AI工作台它不是那种打开对话窗口聊两句就完事的聊天机器人而是一个可以让你把重复性信息劳动固化下来的执行环境。我之所以选它而不是自己写Python脚本是因为脚本我要维护、要改、要盯着跑而工作台把调度、指令、工具调用这些脏活都封装好了我只需要把要什么写清楚。坦白讲我一开始也没指望这套东西能有多好用。前几次跑出来的结果很糟糕摘要像机翻、资讯源重复、重要内容被漏掉。但迭代到第三版指令之后质量开始稳定现在它输出的简报我几乎不用二次编辑就能直接看。这篇文章就把这套东西拆开讲包括我为什么这么设计、指令怎么写才不废话、踩过哪些坑、以及后续还能怎么扩展。文章会比较长但每一步我尽量讲清楚为什么这么做让你改起来心里有数而不是照抄一堆自己都看不懂的配置。2. WorkBuddy的机制拆解它到底靠什么干活2.1 把WorkBuddy理解成一个能调工具的数字实习生很多人第一次打开WorkBuddy会有点懵因为它和普通聊天AI不太一样。普通对话式AI是你问一句它答一句而WorkBuddy更像一个工作台核心是任务这个概念。你可以给它一个目标它会自己规划步骤、调用工具、执行、然后给你结果。打个比方普通聊天AI是你问路它指路WorkBuddy是你说要去哪它自己开车带你去。这个差别在信息聚合任务上体现得特别明显——你不需要告诉它先打开A网站再复制链接再粘到B你只需要说帮我盯这几个方向的AI动态每天整理成简报。理解这一点很关键因为它决定了你该怎么用它。你写指令的时候不是在写一段话让它回答而是在描述一个工作流程。这里面有个思维转变把你自己每天刷资讯的动作拆解成步骤然后把这些步骤翻译成对它的要求。我当时的拆解是这样的第一步打开几个固定信息源第二步快速扫标题判断相关性第三步对相关的点进去看内容第四步提炼关键信息第五步记到笔记里。这五步里第一、四、五步完全可以自动化第二步可以半自动化让它按关键词初筛第三步最费时但也可以让它帮你做摘要。搞清楚了这一点后面的指令设计就顺了。2.2 自定义指令、Skill、Workflow三层结构的关系WorkBuddy里有一套分层的玩法我摸索下来大致是这么个结构理解它对你写配置很有帮助。最底层是自定义指令相当于你给这个实习生立的规矩告诉它你是谁、你关心什么、输出要什么风格、什么该做什么不该做。这一层是常驻的每次任务都会带上所以它决定了基础质量。中间层是Skill技能可以理解为具体的操作手册。比如抓取一个网页正文并提炼要点是一个技能把一个Markdown文件追加到Obsidian库是另一个技能。技能是可复用的积木你把常用的操作做成技能之后组合起来用。最上层是Workflow工作流也就是把多个技能和指令串成一条完整的流水线。比如每天8点触发—遍历信息源—初筛—摘要—生成简报—写入笔记—发通知这条链。三层各司其职缺一层都不太顺。我见过有人一上来就想写工作流结果指令没立好跑出来的东西风格全乱这就是底层没打好。2.3 为什么信息聚合任务特别适合丢给Agent信息聚合这件事有个特点它高度重复、规则相对明确、但对语义理解要求又不低。这三点叠在一起正好卡在纯脚本做不好、纯人工太累的区间里。纯脚本能抓页面但它判断不了这条资讯对我的研究方向重不重要它只能做关键词匹配很容易漏掉表述不同的重要内容。纯人工判断准确但慢一天几百条根本看不过来。Agent的价值在于它能在规则和判断之间找平衡。你给它关键词它做初筛你对初筛结果给几条反馈它就知道往哪个方向收敛。我实际跑下来的感受是第一周的筛选准确率大概六七成后面随着我不断调整指令里的判断标准能稳定到九成左右。这个过程中最重要的一步是把什么叫重要讲清楚比如涉及基础模型能力提升的优先纯商业融资消息次之工具类看是否有开源。这种优先级说清楚了它筛起来就靠谱得多。3. 动手搭一条AI资讯外包流水线3.1 安装与工作台初始化先把地基整平安装这块没什么玄学但有几个默认设置我建议你一开始就改掉不然后面会难受。装完之后第一件事是确认运行环境如果你在Ubuntu或者Linux环境下跑注意依赖和权限尤其是涉及文件读写和定时任务的部分权限没给够会出现任务跑了但没写进去的诡异现象。我自己是在一台常开的Linux小主机上跑的好处是定时任务不受电脑开关机影响。初始化阶段的几个关键动作我列一下第一配好模型接口。WorkBuddy本身可以接不同的大模型后端接国产模型或者本地部署的模型都行这一步决定了你后面处理速度和成本。第二设置好工作目录所有抓下来的原始数据、生成的简报、日志都放在一个固定目录里方便管理也方便备份。第三先把时区设对我一开始没注意结果定时任务在奇怪的时间点触发排查了半天才发现是时区问题。这三件事做完地基就算平了。这里给个经验工作目录的结构最好提前规划好。我现在的结构是三个子目录一个放原始抓取内容一个放处理后的简报一个放日志。原始内容保留是为了回溯有时候简报里一条信息我觉得可疑能翻回原文核对。日志目录别嫌麻烦出问题全靠它定位。注意定时任务和文件写入这两块最容易出静默失败也就是任务显示成功但实际没产出。养成看一眼日志的习惯比事后抓瞎强。3.2 自定义指令怎么写才不废话指令是整套东西的灵魂我前后改了七八版分享几条我觉得最值钱的原则。第一条先交代身份和场景再交代任务。开头就告诉它我是做AI技术跟踪的每天需要一份行业简报比直接说帮我整理AI资讯效果好太多。因为身份和场景给了它判断相关性的依据。第二条把输出格式写死。别让它自由发挥排版你会发现每次格式都不一样。我现在的简报格式固定为分板块模型进展/工具开源/行业动态、每条不超过八十个字、带原文链接、每条前面标优先级。格式定死之后我扫一眼就能抓重点。第三条明确不要什么。这一点很多人忽略。我明确写了不要泛泛而谈的宏观评论、不要没有具体信息的标题党、不要重复内容。把噪声挡在外面比事后手动删效率高得多。第四条给判断标准而不是给答案。别写把重要的一条留下要写涉及模型能力、开源工具、关键技术突破的算重要。判断标准越具体它筛得越准。下面是我指令核心部分的一个参考模板你可以根据自己的方向改角色你是一名AI行业信息助理服务于一名做AI技术跟踪的从业者。 任务基于我提供的原始资讯条目输出一份每日简报。 筛选标准 - 优先级高基础模型能力更新、重要开源项目发布、关键技术论文 - 优先级中有具体数据的行业动态、主流工具的重要更新 - 优先级低纯融资消息、无实质内容的预告 输出格式 - 分三个板块模型与论文 / 工具与开源 / 行业动态 - 每条不超过80字包含核心信息点 - 每条末尾附原文链接 - 每条前标注优先级 禁止项不输出宏观评论、不输出重复内容、不输出无信息量的标题这套模板我用了两个月稳定性很好。你可以先把这段丢进去跑几天看看哪里不对再微调比一开始就追求完美强。3.3 采集环节把信息源接进来采集是流水线的入口入口脏了整个流程都白搭。我的做法是把信息源分成三类分别处理第一类是RSS友好的站点直接用RSS抓稳定且干净第二类是只有网页的用网页抓取技能抓正文第三类是需要登录或者交互的这类我基本放弃自动抓取改成手动丢链接进去让它处理。别贪多我一开始接了三十多个源结果一半是垃圾后来精简到十来个高质量源效果好得多。这里有个坑要提醒网页抓取很容易把导航栏、广告、评论一起抓进来导致后面摘要质量下降。解决办法是在技能里加一步正文提取把主体内容单独拎出来。如果抓取质量还是差宁可换源也别硬处理。信息源的维护也有讲究。我每个月会花十分钟看一次各源的产出率也就是这个源贡献了几条有效信息贡献低的直接砍掉。信息源不是越多越好几个稳定的高质量源胜过一堆噪音源。这个习惯让我的简报质量稳步提升。3.4 处理环节接大模型做筛选和摘要处理环节是整套流程里最能体现价值的地方也是最容易出问题的地方。核心动作有两个初筛和摘要。初筛负责把几十上百条压到十几条摘要负责把每条压成几十个字。这两个动作我都交给大模型做但做了拆分不放在一次调用里。为什么拆开因为一次调用让它又筛又写容易顾此失彼筛得粗、写得也糊。拆成两步每步专心干一件事质量明显好。摘要这一步的提示词也有讲究。我要求它保留具体信息比如模型名、参数规模、开源协议、具体数字因为这些才是真正有用的信息点。如果让它自由发挥它很容易写成某团队发布了新模型性能有所提升这种废话。把必须保留具体信息写进要求输出的东西才不是空壳。成本这块也要算一算。如果你用的是按量计费的接口一次批量处理几十条消耗的额度不算小。我的做法是把低优先级的源先过滤只把可能相关的送进模型能用规则做的前置过滤就别浪费模型调用。实测下来这一步能省掉大半的无效消耗。3.5 落地环节归档到本地与Obsidian处理完的信息得有地方存不然等于白干。我现在的落地方式是双份一份以纯文本/Markdown格式按日期存到本地目录方便检索和回溯另一份追加到我的知识库笔记里用的是Obsidian。为什么选Obsidian因为它是本地Markdown不用担心数据在别人服务器上检索也快。WorkBuddy里可以配一个技能把当天简报自动追加到指定的笔记文件里按日期分标题这样时间线一目了然。追加上去的时候有个小技巧给每天的简报加一个固定的标题格式比如AI简报-2024-06-01这样笔记软件里的时间线是整齐的翻起来特别顺手。另外我建议在笔记里留一个待深挖的标签简报里看到有意思的但没时间细看的打个标签周末集中看。提示归档这一步做完一定要验证一次手动翻一下当天的笔记文件确认内容真的写进去了。我第一次配的时候任务日志显示成功结果写错目录了白等了一周。4. 常见问题排查与避坑实录4.1 一份能救急的问题速查表跑了这么久遇到过的毛病基本就那几类。我整理成一张表你遇到问题先对着查能省不少时间。现象可能原因排查方向任务显示成功但没有产出写入路径错误或权限不足检查工作目录权限手动看目标文件夹定时任务不在预期时间触发时区配置错误确认系统时区和任务时区一致抓到的内容全是导航广告正文提取没生效检查抓取技能是否包含正文提取步骤摘要全是空话没信息量提示词没要求保留具体信息在指令里强调保留模型名、数字、协议等同样内容反复出现信息源重复或去重没做加一步基于链接或标题的去重模型调用额度消耗过快前置过滤缺失把噪声也送了用规则先过滤低相关源再进模型简报风格每次都不一样输出格式没写死在指令里固定板块和字数这张表里的每一条基本都是我实际踩过之后总结的。你可以先收藏着出问题的时候对照着看。最常出现的其实是第一类和第三类一个关于写入一个关于抓取质量这两块搞定整套流程就稳了一大半。4.2 我踩过的几个坑说出来让你少走弯路第一个坑指望一次配好就永久运行。真实情况是信息源会变网页结构会改模型接口偶尔抽风所以这套东西需要你定期维护。我现在是每周花十分钟看一眼产出质量每月做一次小调整。把它当成一个需要偶尔打理的小系统心态会好很多。第二个坑信息源求全不求精。前面说过我一开始接了三十多个源结果自己看不过来噪音还多。后来砍到十来个质量反而上去了。这件事的教训是信息守恒你塞进去的噪声越多能提取的养分比例越低。第三个坑过度信任自动筛选。自动化再准也会漏。我现在的做法是每周抽一天手动扫一遍原始抓取的内容看看有没有被漏掉的重要信息。这个人工兜底环节看着多余但帮我捞回过几条关键动态。机器负责效率人负责兜底这个配合不能丢。第四个坑备份没做。有一次我的小主机硬盘出问题一周的简报全没了虽然原始数据还在但处理成果丢了。后来我加了一个简单的同步把简报目录定期备份到另一个位置。数据这东西丢了才知道疼。第五个坑把简报当成了终点。简报只是入口真正有价值的是你对信息的消化和思考。我一度沉迷于每天收到简报的仪式感后来发现光看不动脑和以前刷手机没本质区别。现在我会强制自己在简报里挑一到两条深挖哪怕只是写几句自己的想法这比看一百条摘要都管用。5. 效果盘点与几种值得试的进阶玩法跑到现在差不多三个月最大的变化是时间。以前每天早上一小时刷资讯现在压缩到十分钟看简报省下来的时间足够我深读一两篇论文或者动手试一个工具。更重要的是信息质量提升了以前刷完记不住现在简报里带链接能回溯看的时候也会带着问题看吸收率高了不少。准确率这块我给个诚实的数据目前稳定在九成左右剩下的一成靠每周的人工兜底补上。如果你已经跑通了基础版可以试试几个进阶方向。第一个是分类定制给不同方向分别建工作流比如模型论文一条线、工具开源一条线各自用不同的筛选标准输出也更聚焦。第二个是接入个人知识库做问答把历史简报存好之后配一个检索问答的能力需要查上个月某某模型发了什么的时候直接问不用翻笔记。第三个是加情绪和趋势判断让它在简报末尾写一两句这周最值得关注的方向虽然只是参考但有时候能帮你抓到大趋势。第四个是多端推送把简报推到手机上通勤路上就能看这个体验提升其实挺明显的。我个人还有个习惯就是每个月会回头翻一遍这个月的简报合辑看看哪些当时觉得重要的事后来真的成了哪些是虚火。这个过程挺有意思能帮我校准自己的判断力也算是这套系统带来的一个意外收获。最后分享一个小技巧如果你刚开始配别急着上完整流程先只做抓取摘要这一段跑几天看看质量满意了再加归档和定时。一步到位反而容易因为某个环节出问题而全盘放弃小步快跑才是这套东西的正确打开方式。这套方案没有什么高深的技术核心就是把一件重复又费神的事拆解清楚后交给合适的工具去执行自己退到定标准和做判断的位置上。至于它能帮你省下多少时间取决于你调整指令的耐心我这三个月的体会是前面多花点时间打磨指令后面就能一直省心。
返回列表