尧图网站设计 尧图网站设计YAOTU DESIGN
ARTICLE DETAIL

资讯详情

深耕网站设计与一线实操的经验洞察。

AI日报自动化流水线:信源分层、打分模型与人工编辑的工程实践

AI日报自动化流水线:信源分层、打分模型与人工编辑的工程实践 1. 一份AI日报的诞生从信息洪流到可读清单每天早上七点我的信息采集脚本会准时跑完一轮。屏幕上滚过几百条更新模型发布、论文预印、产品迭代、行业并购、开源项目提交、监管草案、算力价格波动……如果把这些原封不动丢给团队结果只有一个——没人看。所以“AI最新资讯日报”这件事表面上是内容聚合本质上是一套信息降噪与价值分级系统。它要解决的问题不是“信息不够”而是“信息过载下的决策瘫痪”。适合谁来参考如果你在带一个技术团队、做投资研究、写行业分析或者只是不想在饭桌上被问“最近AI有啥新东西”时哑口无言这套方法都能直接抄。我做了三年多的日报从最早的手工复制粘贴到半自动的RSS加人工筛选再到现在的“采集—去重—打分—成稿”四段式流水线踩过的坑比读过的论文还多。今天这篇就把整套逻辑拆开讲包括我为什么放弃全自动生成、打分模型怎么设计、哪些信源值得长期跟踪、以及日报写到最后怎么避免变成“正确的废话合集”。所有细节都来自实际运行中的取舍不是纸上谈兵。2. 信源分层为什么我砍掉了80%的订阅源2.1 信源不是越多越好而是越“可验证”越好刚开始做日报时我有个根深蒂固的误区信源越多覆盖面越广日报就越有价值。于是我订阅了上百个博客、几十个新闻站、一堆邮件列表和社交账号。结果呢每天采集回来的条目超过两千条其中大量是重复转载、标题党、以及同一件事被不同媒体换着说法报了三遍。真正有信息增量的内容可能不到5%。后来我做了一次彻底的断舍离。判断一个信源是否保留我只问三个问题第一它是不是一手信息比如模型发布看官方博客论文看预印本平台产品更新看更新日志而不是看二手解读。第二它有没有稳定的更新节奏那种半年不更、一更就是广告的源直接砍掉。第三它的内容能不能被交叉验证如果某个消息只有一家在说而且找不到原始出处那它进日报的优先级就要往后排。砍完之后我的核心信源从一百多个降到了二十个左右。数量少了但日报的质量反而上去了。因为省下来的筛选时间可以花在真正重要的条目上做深度核实。2.2 我实际在用的四类信源及其权重下面这张表是我目前信源池的简化版按类别和权重列出来。权重是我在打分模型里给的基础分后面会讲怎么用。信源类别具体例子基础权重更新频率备注官方发布渠道各大实验室博客、产品更新日志10不定期一手信息优先级最高学术预印平台预印本网站、顶会收录列表8每日需要人工判断成熟度开源社区动态代码托管平台趋势榜、版本发布7每日看star增量和提交活跃度行业媒体与分析垂直科技媒体、研究机构简报5每日用于补充背景和交叉验证这个权重不是拍脑袋定的。官方渠道给10分是因为它几乎不会出错而且往往是其他所有报道的源头。学术预印给8分是因为它有增量信息但很多论文离落地还有距离需要打折扣。开源动态给7分是因为代码不会说谎一个项目突然活跃起来通常有原因。行业媒体给5分不是说不重要而是它的内容往往需要回到前几类去验证所以基础分低一些靠后续的交叉验证加分。注意信源权重不是一成不变的。比如某个开源项目突然被大厂收购那它的权重会在接下来一段时间内临时上调。日报的筛选逻辑要跟着现实走不能一套参数用到底。2.3 去重这件事比想象中更耗精力去重听起来简单实际做起来很麻烦。同一个模型发布官方博客一条、科技媒体三条、社交平台五条、邮件列表两条内容大同小异但措辞不同。如果只靠标题匹配会漏掉很多如果靠全文相似度计算量又太大。我最后用的方案是三层去重。第一层是URL规范化把带追踪参数的链接统一成干净地址这一步能干掉大概三成的重复。第二层是标题指纹提取标题里的核心实体和动作词做模糊匹配能再干掉两成。第三层是人工快速扫一眼把剩下的疑似重复项合并。三层下来两千条能压到一百条以内再进入打分环节。这里有个经验去重不要追求100%自动化。最后那5%的模糊重复人工判断只要几秒钟但写规则可能要花几个小时。时间要花在刀刃上。3. 打分模型怎么让真正重要的条目浮上来3.1 四个维度决定一条资讯的“日报价值”去重之后剩下的一百条左右不可能全部写进日报。我需要一个打分模型来排序。这个模型我迭代了七八版现在稳定在四个维度上影响力、时效性、可验证性、读者相关性。影响力看的是这件事波及的范围。是一个实验室发了篇论文还是整个行业的基础设施变了时效性看的是它是不是“今天”的事昨天的旧闻除非有重大更新否则不进日报。可验证性看的是有没有原始出处能不能点进去看到一手信息。读者相关性看的是我的目标读者——技术团队负责人和投资研究者——会不会关心这件事。每个维度我按1到5分打分然后加权求和。权重分别是影响力0.35时效性0.25可验证性0.25读者相关性0.15。这个权重分配是经过多次调整的。最早我把时效性设得很高结果日报里全是“今天发生了什么”但很多事其实不重要。后来把影响力提上来日报的厚度才上来。3.2 一个具体的打分实例拿一个假设的场景来演示。某天有一条资讯“某开源推理框架发布新版本吞吐量提升40%支持新的量化格式。”影响力4分。推理框架是基础设施吞吐量提升40%不算小但也不是颠覆性的。时效性5分。当天发布新鲜度拉满。可验证性5分。官方发布日志代码可查。读者相关性4分。技术团队会关心部署成本投资研究者会关心生态变化。加权得分4×0.35 5×0.25 5×0.25 4×0.15 1.4 1.25 1.25 0.6 4.5分。这个分数在当天能排进前五值得写进日报而且值得多写几句。再拿另一条“某社交平台上线AI生成头像功能。”影响力2分时效性5分可验证性4分读者相关性2分。加权得分0.7 1.25 1.0 0.3 3.25分。这条可能就不进日报或者只在“一句话快讯”里带过。3.3 打分模型需要定期校准模型跑一段时间后会出现“分数漂移”。比如某类资讯连续几天高分但读者反馈说看腻了。这时候就要手动校准权重或者引入“多样性惩罚”——同一类事件如果连续出现后续条目的分数要打折。我一般每两周做一次校准。方法是把过去两周的日报翻出来看哪些条目当时打了高分但事后证明不重要哪些当时低分但后来被反复提及。根据这些反馈调整权重和阈值。这个习惯让日报的质量一直保持在一个稳定水平不会因为某天信息特别多就注水也不会因为某天信息少就凑数。4. 从清单到日报写作环节的取舍与节奏4.1 日报不是新闻联播要有“编辑视角”打分排完序前十条左右进入日报。但直接按分数从高到低罗列读起来会很枯燥。所以我加了一层“编辑视角”把条目按主题分组比如“模型与算法”“产品与工具”“行业与生态”“政策与标准”每组给一个小标题组内按分数排序。这样做的好处是读者可以按兴趣跳读。关心技术的看前两组关心商业的看后两组。而且分组之后条目之间可以形成对照。比如同一天有两个模型发布放在一起对比着写信息量比分开写大得多。4.2 每条资讯写多少字取决于它的“信息密度”我见过很多日报每条都是一两句话读完了跟没读一样。也见过每条都写成长文日报变成了周报。我的做法是按信息密度决定篇幅。信息密度高的条目比如一个重要的模型发布我会写三到五句它是什么、关键参数是什么、和之前比变了什么、对谁有影响。信息密度低的条目比如一个常规版本更新一句话带过谁发布了什么主要变化是什么。这里有个判断标准如果这条资讯我删掉之后读者不会错过任何关键信息那它就只配一句话。如果删掉之后读者会漏掉一个重要变化那就值得多写几句。4.3 标题怎么写才不浪费读者的时间日报的标题我坚持一个原则把最重要的信息放在最前面。不要用“某公司发布新模型”这种模糊表述而是直接写“某公司发布新模型推理成本降低一半”。读者扫一眼标题就知道这条要不要细看。另外标题里尽量带数字。数字是最容易抓眼球的信息也最容易验证。“提升40%”比“大幅提升”有用得多“支持三种新格式”比“支持多种格式”具体得多。当然数字必须来自原始出处不能自己估算。提示如果一条资讯的标题你写不出来具体信息只能写成“某机构发布新研究”那说明这条资讯本身的信息量就不够考虑降级处理或者不写。5. 自动化与人工的边界哪些环节坚决不能交给脚本5.1 采集和去重可以自动化判断和写作不行我的流水线里采集、URL规范化、标题指纹去重、基础打分这些都是脚本完成的。但到了“最终排序”和“写作”环节一定是人工。原因很简单脚本可以判断一条资讯“像不像重要”但判断不了它“对读者是不是重要”。举个例子。某天有一条资讯“某实验室发布新论文提出一种新的注意力机制。”脚本按关键词打分可能会给高分因为“注意力机制”是热门词。但人工一看这篇论文的实验规模很小只在几个小数据集上验证过离实用还有距离。这种资讯就不应该进日报或者只能放在“学术速递”里一句话带过。反过来有些资讯关键词不热门但人工判断很重要。比如某个冷门开源项目突然被大公司采用这种消息脚本可能扫不到但人工在扫社区动态时能发现。5.2 我踩过的“全自动日报”的坑早期我试过全自动生成日报脚本采集、脚本打分、脚本套模板生成文本。结果惨不忍睹。最典型的问题是模板化表达。脚本会把所有条目都写成“某机构发布了某产品该产品具有某功能预计将对某领域产生影响。”读起来像机器人在念稿而且“预计将产生影响”这种话没有任何信息量。还有一个问题是上下文缺失。脚本不知道昨天发生了什么所以它无法判断一条资讯是“新变化”还是“旧闻重提”。比如某模型更新脚本会当成新事件报但实际上这个更新上周就预告过了今天只是正式推送。人工编辑知道这个背景就会在日报里写“此前预告的更新今日正式推送”而不是当成突发新闻。所以我的结论是自动化负责“把信息搬过来”人工负责“把信息讲清楚”。两者缺一不可但边界要清晰。5.3 人工环节的时间分配我每天花在日报上的时间大约是一个半小时。其中采集和脚本运行不需要我盯着真正花时间的是三件事扫一遍去重后的清单约20分钟、给争议条目做交叉验证约30分钟、写作和排版约40分钟。这个时间分配是经过优化的。最早我花大量时间在采集上后来发现采集再全筛选不行也是白搭。现在我把最多时间花在“判断”上因为判断的质量直接决定日报的质量。6. 日报的长期价值从“信息搬运”到“趋势识别”6.1 单日日报看热闹连续日报看趋势如果只做一天日报它就是一个信息清单。但连续做三个月、半年日报就变成了一个趋势数据库。我开始做日报的时候只是想把每天的重要信息记下来。做了半年后我发现可以从中提取很多单条资讯看不出来的东西。比如某个技术方向连续两周出现在日报里说明它正在升温。某个公司连续一个月没有新动作说明它可能遇到了瓶颈。某个政策信号反复被提及说明它可能在酝酿更大的变化。这些判断单看任何一天的日报都得不出来但把时间轴拉长模式就浮现了。我现在每个月会做一次“日报回顾”把过去一个月的条目按主题重新聚合看哪些主题在持续出现哪些主题在消退。这个回顾比单日日报更有价值因为它过滤掉了日常噪音留下了真正的趋势。6.2 日报的存档和检索日报写完不是终点存档和检索同样重要。我用一个简单的本地数据库存所有条目每条打上日期、主题标签、来源、分数。这样以后想查“某技术是什么时候开始出现的”直接搜标签就行。这个习惯帮我省了很多时间。比如写行业分析时需要引用某个事件的时间线直接从数据库里拉出来不用再去翻聊天记录或者浏览器历史。而且因为每条都有原始链接引用的时候可以追溯到一手信息可信度也高。6.3 给想做日报的人几条实在建议第一先跑起来再优化。不要一开始就追求完美的信源池和打分模型。先用最简单的方案跑两周看看哪些环节最耗时间再针对性优化。我最早就是用几个RSS源加手工复制跑了一个月才上脚本。第二日报是给自己看的不是给别人看的。不要为了显得“全面”而堆砌条目。你的读者包括你自己时间有限只写真正重要的东西。宁可少写几条也不要注水。第三保持节奏比追求爆款重要。日报的价值在于连续性。今天写明天不写读者就流失了。我给自己定的规矩是哪怕今天没什么大事也要写三条简讯保持更新节奏。时间长了读者会形成习惯每天固定时间来刷。第四定期回看自己的日报。我每个月会翻一次上个月的日报看当时觉得重要的东西现在是不是还重要。这个习惯帮我不断校准判断标准也让日报的质量持续提升。最后分享一个我用了很久的小技巧在每条资讯后面加一个“一句话影响”标签用不超过十个字概括它对谁有影响。比如“利好推理部署”“关注合规风险”“开源生态受益”。这个标签写起来很快但读的时候非常省时间。读者扫一眼标签就知道这条跟自己有没有关系不用逐字读全文。这个习惯我坚持了两年多现在已经成为日报的固定格式之一。
返回列表