1. 项目背景与需求分析
作为一名长期关注人工智能领域的技术从业者,我发现自己正面临一个典型的信息过载困境。每天都有大量AI相关的新闻、论文和产品动态涌现,从OpenAI的最新研究到创业公司的产品发布,从技术突破到行业政策,内容精彩程度堪比小说。但问题在于:如果每天认真阅读这些英文原版资料,至少需要耗费3-4小时的工作时间。
经过详细的时间统计,我发现传统的信息获取方式存在三个核心痛点:
- 信息碎片化:新闻分散在不同平台(邮件、RSS、社交媒体)
- 语言障碍:优质内容多为英文,直接阅读效率低下
- 处理耗时:手动整理和摘要需要大量重复劳动
基于这些痛点,我决定构建一个自动化系统来解决以下核心需求:
- 自动聚合多个来源的AI资讯
- 实现内容的集中管理和预处理
- 生成易于消化的中文摘要
- 每日耗时控制在20分钟以内
需要模型API调用? 免费领10W Token,多模型网关一键接入 Claude、DeepSeek 等主流模型。
2. 系统架构设计
2.1 整体工作流程
系统采用分层处理架构,将整个流程分解为四个关键环节:
code复制[新闻源] → [收集层] → [处理层] → [应用层]
- 收集层:通过邮件订阅和RSS抓取原始内容
- 处理层:自动归档、合并和存储内容
- 应用层:智能摘要生成和交互式查询
2.2 工具选型考量
在选择具体工具时,我主要考虑以下因素:
- 零成本:全部使用免费方案
- 低代码:最小化手动编程
- 稳定性:选择大厂提供的服务
- 扩展性:支持未来功能迭代
最终确定的工具组合:
- 收集层:Gmail + Inoreader
- 处理层:Google Apps Script + Google Drive
- 应用层:飞书文档 + 扣子智能体
提示:这种架构设计的关键优势在于各层之间通过API连接,后续可以灵活替换单个组件而不影响整体系统。
3. 详细实现步骤
3.1 新闻源配置与订阅
3.1.1 精选AI新闻源
经过两周的测试比较,我筛选出以下三个最具价值的AI新闻简报:
-
TLDR AI (https://tldr.tech/ai)
- 特点:每日更新,每条新闻3-5句话摘要
- 覆盖范围:学术突破、大模型进展、行业动态
- 订阅方式:邮箱注册即可
-
The Rundown AI (https://www.therundown.ai)
- 特点:侧重AI产品和创业公司
- 亮点:经常首发独家工具评测
- 建议:关注其"Tool of the Day"栏目
-
Import AI (https://importai.substack.com)
- 特点:深度分析长文
- 价值:包含行业趋势预测和政策解读
- 注意:更新频率较低(每周2-3次)
3.1.2 RSS订阅管理
对于非邮件形式的新闻源,我使用Inoreader建立统一的RSS阅读流:
- 注册免费账户
- 添加AI相关博客的RSS地址
- 设置文件夹分类(如"Research"、"Products")
实操技巧:在Inoreader中设置关键词过滤,可以自动标记高优先级的新闻。
3.2 自动化邮件处理系统
3.2.1 Gmail过滤器配置
为避免新闻邮件淹没正常通信,需要建立智能过滤规则:
- 进入Gmail设置 → "Filters and Blocked Addresses"
- 创建新过滤器,输入发送方地址模式:
code复制*@tldrnewsletter.com OR *@technews.therundown.ai OR *@daily.therundown.ai - 设置处理动作:
- 应用标签"AI-Daily"
- 跳过收件箱
- 标记为已读
3.2.2 邮件归档效果验证
配置完成后应检查:
- 新邮件是否正确打标
- 重要邮件是否被误过滤
- 标签内的邮件分类是否清晰
避坑指南:Gmail过滤器对OR逻辑敏感,多个条件间必须换行并保留OR关键字。
3.3 自动化处理核心实现
3.3.1 Google Apps Script开发
脚本主要功能逻辑:
javascript复制function dailyProcess() {
// 1. 获取昨日AI-Daily标签下的所有邮件
const threads = GmailApp.search('label:AI-Daily after:' + getYesterday());
// 2. 提取邮件正文并合并
let fullContent = "";
threads.forEach(thread => {
fullContent += extractCleanText(thread);
});
// 3. 存储到Google Drive
const file = DriveApp.createFile('AI-News-' + getToday() + '.txt', fullContent);
// 4. 发送处理结果回传
GmailApp.sendEmail(SELF_EMAIL, 'AI新闻摘要', '处理完成,详见附件', {
attachments: [file.getAs(MimeType.PLAIN_TEXT)]
});
// 5. 写入飞书文档
updateFeishuDoc(fullContent);
}
3.3.2 飞书API集成关键点
-
认证流程:
- 获取app_id和app_secret
- 调用/auth/v3/tenant_access_token接口
- 缓存token(有效期为2小时)
-
文档写入优化:
- 内容分块(每块≤2000字符)
- 添加重试机制(应对API限流)
- 错误处理(网络中断等异常)
重要提醒:飞书API的block概念不同于常规文本段落,需要特别注意其结构限制。
3.4 智能摘要生成方案
3.4.1 扣子智能体配置
在扣子平台(https://www.coze.cn)创建智能体的关键步骤:
-
基础设置:
- 选择"单Agent"模式
- 模型选择"豆包1.8-深度思考"
- 设置合理的对话轮次限制
-
核心提示词设计:
code复制你是一个专业的AI行业分析师,需要根据提供的每日新闻素材: - 生成简洁的中文摘要(不超过300字) - 标记最重要的3条新闻 - 对技术类新闻补充背景说明 - 保持客观中立的语气 -
插件集成:
- 飞书文档读取
- 网页搜索(用于事实核查)
- 链接预览(方便跳转原文)
3.4.2 交互优化技巧
通过测试不同提示方式,发现最佳实践是:
- 首轮请求:"总结今日AI新闻,按重要性排序"
- 跟进提问:"请详细说明[某条新闻]的技术意义"
- 扩展查询:"找出与[特定公司]相关的所有消息"
4. 系统优化与问题排查
4.1 性能优化记录
在运行过程中发现并解决了以下问题:
-
内容重复问题:
- 现象:不同新闻源报道同一事件
- 解决方案:在脚本中添加基于标题的去重逻辑
-
处理超时问题:
- 现象:Google Script执行超过6分钟限制
- 优化:将大文件处理改为分批异步执行
-
格式混乱问题:
- 现象:HTML邮件转换后保留冗余标签
- 修复:使用正则表达式清洗文本
4.2 常见错误处理
| 错误类型 | 可能原因 | 解决方案 |
|---|---|---|
| 飞书认证失败 | token过期 | 实现自动刷新机制 |
| 文档写入截断 | 超出block限制 | 添加内容分块检测 |
| 邮件解析异常 | 特殊格式 | 增加异常处理分支 |
| 定时触发失效 | 时区设置错误 | 统一使用UTC时间 |
4.3 安全注意事项
-
敏感信息保护:
- 永远不要将API密钥提交给AI工具
- 使用环境变量存储凭证
- 定期轮换访问token
-
权限最小化原则:
- 飞书应用只申请必要权限
- Google Script使用独立账户
- 定期审计访问日志
5. 扩展应用场景
5.1 语音播报方案
通过NotebookLM实现:
- 将每日摘要导入Google Drive
- 创建新Notebook并选择"播客生成"模板
- 自定义主持人风格和语速
- 导出MP3文件同步到手机
5.2 团队协作版本
对系统进行以下改造:
- 将飞书文档改为共享知识库
- 添加Slack通知功能
- 设置关键词监控警报
- 增加每周自动报告生成
5.3 数据分析扩展
利用现有数据可以:
- 构建新闻热点趋势图
- 分析行业关注度变化
- 识别新兴技术关键词
- 生成机构影响力排名
6. 经验总结与反思
这个项目给我最大的启示是:自动化系统的价值不仅在于节省时间,更重要的是改变了信息消费的方式。通过这整套方案,我现在能够:
- 更主动地获取信息:系统相当于一个24小时工作的研究助理
- 更高效地消化内容:摘要和结构化的呈现大幅提升阅读效率
- 更系统地积累知识:所有历史资料自动归档,方便回溯查询
几个特别值得分享的心得:
- 渐进式优化:不要追求一步到位,我的系统也经历了5次较大迭代
- 异常处理优先:自动化系统最怕"静默失败",必须完善监控
- 人机协作思维:找到最适合人工干预的环节(对我来说是最终摘要的润色)
最后关于Claude的使用教训:自动化工具调用商业AI服务时,一定要仔细阅读其使用政策,避免触发频率限制或内容限制。我的替代方案是使用多个免费账户轮询,并添加了请求间隔控制。
