Skip to content

Latest commit

 

History

History
55 lines (46 loc) · 3.65 KB

File metadata and controls

55 lines (46 loc) · 3.65 KB

Agents that remember: introducing Agent Memory

TL;DR

Cloudflare Agent Memory 是一项托管服务,通过持久化存储关键信息解决 AI 代理的上下文限制问题。它支持提取、存储和检索记忆,采用多阶段管道和多种检索方法,适用于个体代理、团队共享等场景,确保数据可迁移和隐私安全,目前处于私有测试阶段。

Summary

Agent Memory 的核心概念
Agent Memory 是 Cloudflare 推出的托管服务,旨在解决 AI 代理在长期运行中面临的上下文窗口限制和信息丢失问题。它通过提取对话中的关键信息并持久化存储,使代理能够按需回忆相关内容,避免上下文膨胀或信息遗忘。

主要功能与操作

  • 存储结构:以“档案”(profile)为单位管理记忆,支持多会话、多代理共享。
  • 核心操作
    • Ingest:在上下文压缩时批量提取对话中的事实、事件、指令和任务。
    • Remember:代理主动存储重要信息。
    • Recall:通过检索管道合成答案,返回相关记忆。
  • API 集成:通过 Cloudflare Workers 绑定或 REST API 访问,与 Cloudflare Agents SDK 无缝集成。

技术架构

  1. 提取管道
    • 消息通过多阶段处理:生成确定性 ID、并行提取(全量与细节遍历)、验证(8 项检查)、分类(事实、事件、指令、任务)。
    • 事实和指令通过主题键去重,旧记忆被新版本取代(版本链)。
  2. 检索管道
    • 并行运行 5 种检索方法(全文搜索、事实键查找、原始消息搜索、向量搜索、HyDE 向量搜索)。
    • 使用 RRF(互惠排名融合)合并结果,由合成模型生成自然语言答案。
    • 特定查询(如时间计算)通过确定性方法处理,避免依赖 LLM。

底层技术栈

  • Durable Objects:隔离存储原始消息和分类记忆,支持事务性写入和全文索引。
  • Vectorize:提供向量搜索,管理嵌入记忆。
  • Workers AI:运行 LLM 和嵌入模型,支持本地推理和提示缓存。
  • 模型选择:提取/分类使用 Llama 4 Scout(高效),合成使用 Nemotron 3(高推理能力)。

应用场景

  • 个体代理记忆:适用于编码代理(如 Claude Code)、自托管框架(如 OpenClaw)或托管服务(如 Anthropic Managed Agents)。
  • 自定义代理框架:为后台代理提供持久记忆,跨会话和重启后保留知识。
  • 共享记忆:团队共享记忆档案,积累机构知识(如编码规范、架构决策),避免信息孤岛。

数据所有权与隐私

  • 记忆数据可导出,确保用户能迁移知识,避免供应商锁定。
  • 通过 Cloudflare 的基础设施实现强隔离和安全性。

内部实践与未来计划

  • 内部使用
    • 编码代理记忆:跨会话和团队共享知识,减少重复提问。
    • 代理代码审查:记忆历史反馈,降低噪音。
    • 聊天机器人:基于历史对话回答问题。
  • 未来方向:优化提取管道、检索质量,探索异步记忆巩固(类似人脑睡眠回放机制)。
  • 发布计划:目前处于私有测试阶段,计划公开发布,提供早期访问等待列表。

为什么选择 Cloudflare

  • 利用现有原语(Durable Objects、Vectorize、Workers AI)快速构建和扩展。
  • 计算隔离、存储分层和模型推理均针对代理记忆工作负载优化,兼顾成本、质量和延迟。