ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

AI日报自动化实战:信息聚合、筛选去重与编排全流程

AI日报自动化实战:信息聚合、筛选去重与编排全流程 1. 从一份日报说起为什么我要做 AI 日报这件事每天早上打开手机AI 圈的信息就像开了闸的水龙头公众号推文、技术社区热帖、开源项目更新、模型榜单变动、融资消息、监管动态……光是扫一遍标题就得花掉半小时更别提逐条点进去看细节了。我做 AI 日报这个项目最初的动机特别朴素给自己省时间。后来发现身边不少同行也有同样的困扰于是干脆把它做成了一套可以稳定运转的流程每天固定时间产出一份结构化的 AI 日报。这份 2026-09-29 的日报是我连续更新的第 N 期。它不是什么大厂出品也没有团队协作就是一个人、一套脚本、几个固定信息源加上一套自己摸索出来的筛选和编排逻辑。它能解决的问题很明确把一天内 AI 领域真正值得关注的信息压缩成一份 10 分钟内能读完的摘要并且保证不遗漏关键事件、不被标题党带偏、不浪费时间在重复内容上。适合谁来参考三类人。第一类是想自己做信息聚合但不知道从哪下手的独立开发者第二类是团队里被安排做技术周报、行业简报的同学可以把日报思路平移到周报第三类是对 AI 行业保持关注但没精力深挖的产品、运营、投资岗从业者直接看成品就行。下面我把整套东西拆开讲包括信息源怎么选、筛选逻辑怎么定、编排格式怎么设计、踩过哪些坑全部是实操层面的东西。2. 日报的整体设计与信息源选型2.1 为什么是日报而不是周报或实时流先说一个最容易被忽略的决策更新频率。我试过实时流推送也试过周报最后锁定日报原因有三个。第一AI 领域的信息半衰期很短。一个大模型发布、一个开源项目冲上热榜、一条重要政策落地基本 24 小时内就会发酵完毕等到周末再回顾热度已经过去了很多讨论上下文也找不到了。日报的节奏刚好卡在信息已经沉淀但还没凉透的窗口期。第二日报的心理负担低。周报容易拖因为总觉得还有几天可以补结果堆到最后一天手忙脚乱。日报是强制性的每日闭环今天的事今天清反而更容易坚持。我自己的经验是任何需要攒着做的信息整理项目最后大概率会烂尾。第三日报天然适合结构化模板。每天的内容板块基本固定——模型动态、开源项目、行业新闻、论文精选、工具推荐变的是内容不变的是框架。这种稳定性让脚本自动化变得可行也让我在状态不好的时候依然能保证基本质量。提示如果你刚开始做信息聚合不要一上来就追求实时。实时流的维护成本极高而且对筛选能力要求苛刻很容易变成什么都推的噪音源。从日报起步跑顺了再考虑提频。2.2 信息源的取舍逻辑少而精宁缺毋滥信息源的选择直接决定日报质量的上限。我前后试过大概四十多个源最后稳定保留的只有十来个。筛选标准就三条信噪比高、更新稳定、有独家价值。具体分类是这样的信息源类型代表渠道保留理由淘汰原因官方博客各大模型厂商、云厂商官方发布一手信息准确度高更新频率低需搭配其他源开源社区代码托管平台趋势榜、模型仓库能发现早期项目榜单噪音大需二次筛选技术社区开发者论坛、问答社区热帖有真实讨论和踩坑经验水帖多需按热度阈值过滤行业媒体垂直科技媒体、财经媒体覆盖融资、并购、人事标题党严重需交叉验证学术渠道论文预印本平台、顶会收录前沿方向风向标数量爆炸必须限量社交平台从业者聚集的讨论区一手爆料、现场感强真假混杂只作线索不作结论这里有个反直觉的经验信息源不是越多越好。我早期贪多接了三十多个源结果每天光去重和判断优先级就耗掉两小时而且大量内容重复——同一个模型发布五个源都在报。后来砍到十来个反而覆盖更全因为每个源都有明确的职责边界不重叠。还有一个细节给每个源打信任分。官方源信任分最高可以直接引用社区源信任分中等需要交叉验证社交平台信任分最低只能当线索。这个信任分在后续筛选环节会直接影响内容的处理方式。2.3 日报的板块结构设计一份日报的骨架决定了读者的阅读路径。我最终定下来的板块是这样的头条聚焦当天最重要的一件事通常 1 条配 2-3 句点评模型与产品动态新模型发布、版本更新、能力变化3-5 条开源项目精选值得关注的新项目或重大更新2-4 条行业与资本融资、并购、合作、人事2-3 条论文速览挑 1-2 篇有代表性的一句话讲清楚贡献工具与技巧实用向的小工具或使用技巧1-2 条这个结构不是拍脑袋定的是根据读者注意力曲线排的。头条放最重的因为大家刚打开日报时注意力最集中工具技巧放最后因为这类内容轻松、可随时中断适合收尾。中间几个板块按硬信息在前、软信息在后排列。注意板块数量不要超过 6 个。超过 6 个之后读者会产生这日报怎么这么长的压迫感打开率会明显下降。我试过 8 个板块的版本数据反馈是完读率掉了将近三成。3. 核心细节解析筛选、去重与编排的实操要点3.1 筛选逻辑三道漏斗把噪音挡在门外信息从抓取到进日报中间要过三道漏斗。这套逻辑是我踩了无数坑之后总结出来的核心思想是逐层收紧而不是一次性判断。第一道漏斗关键词初筛。抓取阶段用一组关键词做粗过滤比如模型名称、技术术语、公司名、产品名。这一步的目的是把明显不相关的内容比如纯广告、无关领域新闻先扔掉。关键词表需要定期维护因为 AI 领域新词层出不穷上个月还没有的词这个月可能就火了。第二道漏斗热度与质量评分。对初筛后的内容打分评分维度包括来源信任分、讨论热度评论数、转发数、内容完整度是否有实质信息而非标题党、时效性。综合得分低于阈值的直接淘汰。这一步能过滤掉大量看起来相关但没营养的内容。第三道漏斗人工终审。前两道是脚本自动跑的最后一道必须人工。原因很简单机器判断不了重要性。一个开源项目 star 数很高但可能只是营销刷的一条新闻热度一般但可能是某个重要趋势的起点。人工终审就是做这个价值判断通常花 15-20 分钟。三道漏斗跑下来每天从几百条原始信息里最终留下 10-15 条进日报淘汰率大概 95%。这个比例听起来夸张但实际跑起来你会发现真正值得读的确实就这么点。3.2 去重同一件事只讲一遍去重是日报质量的关键。同一件事被多个源报道如果不去重日报就会变成复读机。我的去重策略分两层第一层是标题相似度匹配。用简单的文本相似度算法把标题高度相似的内容聚成一簇。这一步能解决大部分同一新闻多源报道的问题。第二层是事件级去重。有些内容标题不一样但讲的是同一件事。比如某模型发布新版本和某公司更新旗舰模型能力其实是同一件事。这一层需要靠实体识别——提取内容里的核心实体公司、产品、人物、事件实体重合度高的归为一簇。去重之后每一簇只保留信息最全的那一条作为主条目其他源作为补充引用。这样既保证了信息完整又避免了重复。实操心得去重阈值不要设得太激进。我早期把相似度阈值调得很高结果把某模型发布和某模型开源这种其实是两件事的内容合并了闹过笑话。后来把阈值调低宁可少合并也不要错合并人工终审时再补一刀。3.3 编排让日报读起来像人写的脚本生成的日报容易有一个毛病信息堆砌没有节奏。每条都是标题 摘要 链接的三段式读起来像机器人在念清单。我在编排上做了几个调整让日报更像人写的。第一头条要有观点。头条不只是复述新闻还要加 2-3 句点评说清楚这件事为什么重要对谁有影响。这个点评是我自己写的也是日报里最有价值的部分——信息谁都能聚合判断力才是稀缺的。第二条目之间要有过渡。同一板块内的条目按重要性或逻辑关系排序必要时加一句串联的话。比如除了上面提到的模型更新今天还有两个开源项目值得一看这种过渡句能让阅读更顺。第三控制单条长度。每条摘要控制在 80-120 字超过就砍。读者的耐心有限一条超过 150 字就会开始跳读。宁可少说不要啰嗦。第四链接放在最后。每条末尾附原文链接但不要放在开头。开头放链接会让读者分心先看完摘要再决定要不要点进去体验更好。3.4 格式与排版Markdown 是性价比最高的选择日报的载体我试过好几种邮件、网页、PDF、Markdown 文档。最后锁定 Markdown理由是通用性最强。Markdown 可以一键转成网页、PDF、邮件正文也可以直接贴到各种协作工具里不挑平台。排版上有几个固定规则板块标题用二级标题条目用无序列表关键术语加粗方便扫读每条末尾用引用块或斜体标注来源全文控制在 2000-3000 字超过就说明筛选没做到位注意不要用花哨的排版元素。我试过加表格、加代码块、加各种符号结果发现读者根本不看反而增加了视觉负担。日报的核心是信息密度不是设计感。4. 实操过程从抓取到发布的完整流程4.1 抓取环节稳定比快更重要抓取是整个流程的起点也是最容易出问题的环节。我的原则是稳定优先速度其次。具体做法第一错峰抓取。不要所有源同时抓容易触发限流。我把源分成几组每组间隔几分钟分散在凌晨到早上的时间段。这样既避免了限流也保证了早上出日报时数据已经齐了。第二失败重试。任何抓取都可能失败网络抖动、源站维护、格式变化都会导致失败。我设置了三次重试间隔递增。三次都失败就跳过记录日志人工检查。第三原始数据落盘。抓到的原始内容先存下来不要直接进处理流程。这样万一后续处理出错可以回溯原始数据不用重新抓。这个习惯帮我省了很多事。抓取工具的选择上我用的是最基础的 HTTP 请求加解析库没有上重型框架。原因是维护成本——重型框架功能多但配置复杂出问题排查困难。基础工具虽然要自己写解析逻辑但可控性强出问题一眼就能定位。4.2 处理环节清洗、打分、去重抓到的原始数据是脏的需要清洗。清洗包括去 HTML 标签、去广告文本、去重复段落、统一编码。这一步看起来简单但细节很多。比如有些源站的正文里混着推荐阅读、相关链接这些都要识别出来去掉。清洗之后是打分。打分公式大概是这样总分 来源信任分 × 0.3 热度分 × 0.3 完整度分 × 0.2 时效分 × 0.2权重是我根据实际效果调的。来源信任分权重最高因为一手信息最可靠热度分次之反映关注度完整度和时效分作为辅助。这个公式不完美但够用而且容易调整。去重前面讲过了这里补充一个细节去重要在打分之后做。因为同一件事的多个报道里要保留分数最高的那条作为主条目。如果先去重再打分可能会把高质量的那条误删。4.3 人工终审15 分钟决定日报质量人工终审是整套流程里唯一不能自动化的环节也是决定日报质量的关键。我的终审流程是这样的第一步扫头条候选。从打分最高的几条里挑头条判断标准是影响面——这件事影响多少人、影响多深、是不是趋势性事件。第二步过一遍各板块。每个板块快速扫一遍删掉明显不行的补上遗漏的。这一步靠的是对行业的熟悉度没有捷径。第三步写点评。给头条和重要条目写点评这是最花时间但也最值钱的部分。点评要短2-3 句说清楚是什么和为什么重要。第四步通读一遍。从头到尾读一遍检查错别字、逻辑不通、重复内容。这一步经常能发现脚本没抓出来的问题。15 分钟是熟练之后的时长刚开始做的时候可能要 40 分钟以上。随着对信息源的熟悉和判断标准的固化速度会越来越快。4.4 发布与归档让日报可检索日报发布之后不是就完了还要归档。归档的目的是可检索——过一段时间想找某条信息能快速定位到是哪天的日报。我的归档方式是按日期命名文件同时维护一个索引文件记录每天的日报里有哪些关键条目。索引文件用简单的文本格式方便搜索。这样即使过了几个月想找某个模型发布的信息搜一下索引就能定位到具体日期。发布渠道上我主要用文档协作工具和邮件。文档协作工具方便分享和评论邮件方便订阅。两个渠道的内容是一样的只是格式略有调整。5. 常见问题与排查技巧实录5.1 抓取失败怎么办抓取失败是最常见的问题原因五花八门。我整理了一个排查表现象可能原因排查方法解决方式全部源失败网络问题或脚本崩溃检查网络、看日志重启脚本检查网络单个源失败源站维护或改版手动访问源站临时跳过改版则更新解析规则部分内容缺失解析规则失效对比原始数据和解析结果更新解析规则抓取变慢源站限流看响应时间降低频率错峰抓取这里有个经验源站改版是常态。不要指望一套解析规则用一年能稳定用三个月就不错了。所以解析规则要写得模块化改版时只改对应模块不要牵一发动全身。5.2 日报内容重复或遗漏重复和遗漏是筛选环节的典型问题。重复的原因通常是去重没做好遗漏的原因通常是关键词表没覆盖到。解决重复检查去重阈值看是不是设得太高导致该合并的没合并。同时检查实体识别是否准确有些内容实体提取错了导致去重失效。解决遗漏定期回顾关键词表把新出现的术语加进去。另外人工终审时要主动想今天有没有什么大事没进日报靠记忆和直觉补漏。实操心得我每周会花 10 分钟做一次漏报复盘把这一周错过的重大事件找出来分析是哪个环节漏的。坚持了几个月之后漏报率明显下降。5.3 坚持不下去怎么办这是最现实的问题。信息聚合项目最大的敌人不是技术难度是持续性。我见过太多人做了两周就放弃了。我的应对方法有三个第一降低单日成本。把流程尽量自动化人工环节压缩到 15 分钟以内。成本越低越容易坚持。第二允许简版。状态不好的时候出简版日报只保留头条和最重要的几条。宁可出简版不要断更。断更一次就会有第二次。第三找到反馈。有人看、有人反馈是坚持下去的最大动力。我早期把日报发给几个朋友他们的反馈让我知道这件事有价值才撑过了最难的起步期。5.4 质量波动的控制日报质量会有波动状态好时点评精彩状态差时就是干巴巴的复述。控制质量波动的方法建立模板固定板块、固定格式减少临时决策设定底线比如头条必须有点评每条摘要不超过 120 字这些底线不能破定期回顾每周挑一天回顾本周日报看哪些做得好、哪些做得差持续优化质量波动的根源往往是输入质量波动——某天信息源本身就没啥好东西日报自然平淡。这种情况要接受不要硬凑。宁可日报短一点也不要为了凑数塞垃圾信息。6. 工具选型与自动化程度的权衡6.1 自建脚本 vs 现成工具做信息聚合第一个决策就是自建还是用现成工具。我两个都试过最后选了自建脚本为主、现成工具为辅。现成工具的优势是上手快配置几个源就能跑。但劣势也很明显定制化程度低。筛选逻辑、去重规则、排版格式都是固定的想改很难。而且很多工具是订阅制长期成本不低。自建脚本的优势是完全可控。筛选逻辑想怎么调就怎么调排版想怎么改就怎么改。劣势是前期投入大要写代码、要维护。但从长期看自建的成本更低因为一次投入、长期使用。我的建议是先用现成工具跑通流程验证需求再决定要不要自建。如果只是临时用用现成工具够了如果打算长期做自建更划算。6.2 自动化程度的把握自动化程度不是越高越好。我的原则是能自动化的自动化不能自动化的不要硬自动化。能自动化的抓取、清洗、打分、去重、排版。这些环节规则明确脚本能做得比人好。不能自动化的价值判断、点评撰写、终审。这些环节需要人的判断力硬自动化只会降低质量。我见过有人试图用大模型全自动生成日报结果出来的东西看着像模像样但仔细一看全是正确的废话没有观点、没有判断、没有价值。信息聚合的核心价值在于筛选和判断不在于搬运。搬运可以自动化判断不行。6.3 成本核算时间都花在哪了做日报的时间成本我算过一笔账环节自动化程度每日耗时抓取全自动0后台跑清洗打分去重全自动0后台跑人工终审手动15 分钟点评撰写手动10 分钟排版发布半自动5 分钟归档全自动0总计每天 30 分钟左右。这个成本是可以接受的关键是把时间花在刀刃上——终审和点评是价值最高的环节其他环节尽量自动化。提示如果你的日报每天要花超过 1 小时说明自动化没做到位或者筛选标准太松导致信息量过大。先优化流程再考虑坚持。7. 内容价值的延伸日报之外还能做什么7.1 从日报到周报、月报日报跑顺之后可以自然延伸出周报和月报。周报是把一周的日报做二次聚合提炼出趋势和主线月报是更高维度的总结看整个月的走向。这个延伸的价值在于不同时间尺度的洞察。日报看单点周报看趋势月报看格局。三个尺度结合起来对行业的理解会立体很多。做周报的方法很简单把一周的日报条目汇总按主题聚类找出重复出现的主题和趋势。月报同理只是聚合周期更长。7.2 从信息聚合到知识库日报积累久了就是一个天然的知识库。每条日报都是一个信息点时间长了这些点会连成线、织成网。我的做法是定期把日报里的重要条目抽出来按主题归档。比如模型发布一个文件夹开源项目一个文件夹行业动态一个文件夹。这样过一段时间回头看能清晰看到某个方向的发展脉络。这个知识库的价值在于可追溯。想了解某个技术方向的演进翻一翻归档就能看到完整的时间线比临时搜索高效得多。7.3 从个人使用到团队共享日报最初是给自己用的后来发现团队里也有需求就扩展成了团队共享。团队共享和个人的区别在于内容侧重不同个人关注自己感兴趣的团队关注与业务相关的格式要求不同团队共享需要更规范方便不同角色阅读反馈机制不同团队共享有评论和讨论能形成信息闭环团队共享的日报我建议增加一个与我们的关系板块说明每条信息对团队业务的影响。这个板块是团队日报区别于个人日报的核心价值。8. 我踩过的坑与最后的经验做 AI 日报这段时间踩的坑不少挑几个最有代表性的说说。第一个坑贪多求全。早期想把所有信息都覆盖结果日报越做越长自己累读者也累。后来明白日报的价值在于筛选不在于覆盖。宁可漏掉一些也要保证留下的都是精品。第二个坑过度自动化。试过全自动生成结果质量惨不忍睹。后来明白判断力是人的核心价值不能交给机器。自动化应该用在重复劳动上不是用在价值判断上。第三个坑忽视反馈。早期闷头做不看读者反馈结果做了很多无用功。后来开始收集反馈才发现读者真正关心的是什么。做内容一定要有反馈闭环否则就是自嗨。第四个坑追求完美。早期每条都要精雕细琢结果每天花两小时坚持不下去。后来接受完成比完美重要先保证每天出再慢慢优化质量。持续性比单次质量更重要。最后分享一个我觉得最有用的经验把日报当成一个产品来做而不是一个任务。任务是做完就完了产品是要持续迭代的。用做产品的心态做日报你会主动去想怎么优化、怎么提升价值、怎么让读者更满意。这个心态的转变是我能坚持下来的根本原因。至于 2026-09-29 这一期日报本身它记录的只是那一天 AI 圈的切片。但做日报这件事记录的是我对这个行业持续的关注和理解。信息会过时但筛选信息的能力和判断力是会一直积累的。
返回列表