- URL: https://blog.cloudflare.com/introducing-agent-memory/
- Added At: 2026-04-19 13:29:08
- Tags: #read #agent
Cloudflare Agent Memory 是一项托管服务,通过持久化存储关键信息解决 AI 代理的上下文限制问题。它支持提取、存储和检索记忆,采用多阶段管道和多种检索方法,适用于个体代理、团队共享等场景,确保数据可迁移和隐私安全,目前处于私有测试阶段。
Agent Memory 的核心概念
Agent Memory 是 Cloudflare 推出的托管服务,旨在解决 AI 代理在长期运行中面临的上下文窗口限制和信息丢失问题。它通过提取对话中的关键信息并持久化存储,使代理能够按需回忆相关内容,避免上下文膨胀或信息遗忘。
主要功能与操作
- 存储结构:以“档案”(profile)为单位管理记忆,支持多会话、多代理共享。
- 核心操作:
- Ingest:在上下文压缩时批量提取对话中的事实、事件、指令和任务。
- Remember:代理主动存储重要信息。
- Recall:通过检索管道合成答案,返回相关记忆。
- API 集成:通过 Cloudflare Workers 绑定或 REST API 访问,与 Cloudflare Agents SDK 无缝集成。
技术架构
- 提取管道:
- 消息通过多阶段处理:生成确定性 ID、并行提取(全量与细节遍历)、验证(8 项检查)、分类(事实、事件、指令、任务)。
- 事实和指令通过主题键去重,旧记忆被新版本取代(版本链)。
- 检索管道:
- 并行运行 5 种检索方法(全文搜索、事实键查找、原始消息搜索、向量搜索、HyDE 向量搜索)。
- 使用 RRF(互惠排名融合)合并结果,由合成模型生成自然语言答案。
- 特定查询(如时间计算)通过确定性方法处理,避免依赖 LLM。
底层技术栈
- Durable Objects:隔离存储原始消息和分类记忆,支持事务性写入和全文索引。
- Vectorize:提供向量搜索,管理嵌入记忆。
- Workers AI:运行 LLM 和嵌入模型,支持本地推理和提示缓存。
- 模型选择:提取/分类使用 Llama 4 Scout(高效),合成使用 Nemotron 3(高推理能力)。
应用场景
- 个体代理记忆:适用于编码代理(如 Claude Code)、自托管框架(如 OpenClaw)或托管服务(如 Anthropic Managed Agents)。
- 自定义代理框架:为后台代理提供持久记忆,跨会话和重启后保留知识。
- 共享记忆:团队共享记忆档案,积累机构知识(如编码规范、架构决策),避免信息孤岛。
数据所有权与隐私
- 记忆数据可导出,确保用户能迁移知识,避免供应商锁定。
- 通过 Cloudflare 的基础设施实现强隔离和安全性。
内部实践与未来计划
- 内部使用:
- 编码代理记忆:跨会话和团队共享知识,减少重复提问。
- 代理代码审查:记忆历史反馈,降低噪音。
- 聊天机器人:基于历史对话回答问题。
- 未来方向:优化提取管道、检索质量,探索异步记忆巩固(类似人脑睡眠回放机制)。
- 发布计划:目前处于私有测试阶段,计划公开发布,提供早期访问等待列表。
为什么选择 Cloudflare
- 利用现有原语(Durable Objects、Vectorize、Workers AI)快速构建和扩展。
- 计算隔离、存储分层和模型推理均针对代理记忆工作负载优化,兼顾成本、质量和延迟。