Skip to content

Latest commit

 

History

History
1043 lines (713 loc) · 110 KB

File metadata and controls

1043 lines (713 loc) · 110 KB

Learning in Referencing — 研究综合文档

一句话:大语言模型的概念只能在训练时建立、不能在引用(推理/交互)时建立;本研究要打破这一点——让模型在预训练之后,仍能持续建立经过验证的、永久的、按对话者隔离的新知识。

  • 状态:研究构思 + 文献定位阶段(四轮 deep-research 已完成;第四轮 = 族 5/6 对抗补全,狭义主张存活、0 反例,见 §7.6.7 / §9.1)

  • 目标会议:COLM / ICLR 2027

  • 最后更新:2026-07-24

  • 本文档用途:把思想实验、两轮文献调研、架构分析综合成一份可反复查阅的学习/定位材料

三条最关键的结论(其余都是支撑)

  1. 验证侧:没有任何"无答案库的正确性接受/拒绝准则"——语义熵只测自洽、EIG 回答仍需 oracle、朴素自反思已被证伪。压缩/MDL 是地基已备但无人占用的路线。(§3.4)
  2. 架构侧:"推理期写入"与"跨会话持久"在任何已验证架构中都不同时成立。(§7.3)
  3. 门控侧(第三→四轮修正 ⚠️):"没有人做准入门控"是错的,已撤回——DEN / SEMA / SAGE / Self-Sizing Hopfield / CN-DPM / 2606.03787 都做了离散硬写入门。真正的新颖性边界是门控用什么信号。第四轮把族 5/6(回放选择准则 + 局部学习 + CLS/生成式回放 + 2026 agentic 记忆写入门)全部对抗补齐,12 目标 finder+verifier 一致、0 反例:现有信号落在随机/均匀、类别平衡、损失/似然、参数漂移、容量/稀疏、表征或几何新颖性、梯度干扰/多样性、代表性、(有标签下的)不确定性、来源信誉/对源忠实度/可靠度/一致性这些代理上,"无标准答案下的概念级正确性"一列仍为空。(§7.6)

阅读指引

你想干什么 直接看
快速理解核心主张 §1 – §2
了解领域现状、找引用 §3、附录文献表
避免评审被打的坑 §4
决定论文怎么立论 §5
深入"永久知识"这个核心难题 §6
看架构层面的突破口 §7
开始动手做实验 §8

验证状态图例(贯穿全文)

标记 含义
✅ 3-0 强确认(三个独立验证 agent 一致确认)
⚠️ 2-1 有争议(计入但有一票异议,引用需注意措辞强度)
❌ 被否决(0-3 或 1-2,不可当定论引用,需降级为弱版本)
🔍 未经对抗验证(检索到但未进入验证流程,多为 2026 预印本,引用前必须自查)
💭 我方推演(尚无文献支撑,是待验证的设计假设,不是已知事实)

§1 问题的起点:语言是概念交换协议

1.1 原始观察

学过多种语言后会发现,它们在根基上是一样的:都是为了建立概念、以交换信息。因此新概念可以从一个个体传递到另一个个体。 但在大语言模型中,所有概念都必须在训练中建立,而不能在引用中建立,这限制了模型在训练之后学习的能力。

1.2 把它精确化(重要)

原始表述里有一个会被评审一句话驳回的强版本,和一个真正可辩护的弱版本,必须分清:

  • ❌ 别主张:"LLM 在推理期完全学不到任何东西。" → 情境内学习(ICL)显然能在推理期建立某些东西(few-shot 任务获取、从定义学新词)。这条一驳就倒。

  • ✅ 该主张:LLM 没有任何机制能够——

    习得一个真正新颖的概念 → 无标准答案地验证它 → 将其持久化 → 并隔离在教它的那个对话者身上。

四个形容词各自都在做工,且每一个都对应一条现有工作的边界。把它们作为四个可分离的性质来命名,本身就是论文的半个贡献——已有工作总能给你其中一两个,从来没有给全。

1.3 语言学前提的取舍

"所有语言在根基上相同"是很好的动机,但不要让它承重——它是可争议的(语言相对论、Pirahã 争论等)。

可辩护的内核要窄得多:

自然语言内置了"指物(ostension)"与"定义"两种操作,用于在对话中途引入新的原语。

而这正是 LLM 缺少持久版本的那个操作。以此立论。


§2 核心论点:四个性质

# 性质 精确含义 原始表述对应
P1 全新(Novel) 概念不在训练分布内,不是被"检索"出来的 只有有限的知识
P2 无 GT 自验证 没有答案库,靠自身机制判定该概念是否成立 需经过它自己的检验和反思
P3 持久(Persistent) 会话结束、上下文清空后依然存在 学到新知识
P4 隔离(Isolated) 按对话者隔离,不跨用户串味 one on one 避免污染

注意 P4 的推论:你不会担心"上下文被污染"——上下文本来就会清空。担心污染本身就说明你要的是一个持久化的存储。所以 P3、P4 是绑定的,且意味着已经越过了纯 ICL。

2.1 判决性思想实验

如果有这样的方法,是否可以在训练中仅有英语语料,但由人来教会它汉语?

这个实验设计得很好,因为它刻意堵死了"其实训练里早就有"这条退路。但它在工程上几乎不可能干净执行(见 §3.3)——真正的价值在于它逼出了正确的方法论问题:如何证明一个概念真的在训练分布之外。


§3 文献地形(第一轮调研,7 主题)

方法:5 路并行检索 → 22 篇来源 → 96 条主张 → 25 条进入 3 票对抗验证(20 确认 / 5 否决)。 覆盖不均警告:主题 1–4 经过对抗验证;主题 5–7 未经验证(🔍),判断"空白"时应视为"本轮未覆盖"而非"确证无人做"。

3.1 主题一:ICL 是"任务定位"还是"任务习得"

  • ✅ 正典二分:Pan et al. 2023(ACL Findings, arXiv:2305.09731)把 ICL 拆成两股力——

    • Task Recognition / Location:从示例中识别并调用预训练已有的能力(即使标签是随机的也能 work);小模型即出现,不随规模/示例提升。

    • Task Learning:习得预训练中未见的新输入-标签映射;随规模涌现,随示例增多持续提升。 → 这是你 P1 判据的引用锚:要证明是 TL 而非 TR。

  • ✅ 主流理论站"定位"一侧:Xie et al.(ICLR 2022, arXiv:2111.02080)提出 ICL = 隐式贝叶斯推断,核心措辞就是 locating latent concepts——在预训练已获得的潜在概念中做后验定位。该框架数学上只覆盖分布内概念的检索,不解释 OOD 全新概念的获取。 → 关键反命题参照:接受它,则训练分布外的"全新概念"原则上无法被"定位"——这恰好界定了你必须跨过的门槛。

  • ✅ 确有"真学习",但有界:von Oswald et al.(ICML 2023, arXiv:2212.07677)证明单层线性自注意力的前向传播可构造性等价于对 in-context 样本做一步梯度下降。说明 ICL 原则上可以是真正的推理期优化。

    • ❌ 但强版本被 0-3 否决:「真实 LLM 前向传播内部真在跑 GD / mesa-optimizer」不成立。只有"合成线性回归下构造存在"。

    • 另一重边界:TL 学的是"任意输入→抽象标签"的映射,其底层概念(如情感)仍来自预训练 ≠ 习得训练分布外的全新概念。

  • ✅ 最接近"交互期习得新概念"的现有方法:CoLLEGe(Teehan, Lake, Ren, COLM 2024, arXiv:2403.15362)——元学习框架,用少量例句/定义为全新词即时生成 flexible embedding,zero-shot 无需微调。其动机陈述逐字支持你的前提:

    current language models are unable to quickly learn new concepts on the fly … prompting in-context is not robust to context distractions

    • 留白:概念"正确性"仍隐含依赖语料的下一词预测信号 → 无 P2;也无 P4。
  • ⚠️ 直接负面证据:Gupta, Sanders, Solar-Lezama(arXiv:2501.02825)——在随机采样的 3 状态 DFA 新形式语言上,纯 in-context 条件下 LLM 不如简单 n-gram 基线(6-gram 91.7% vs 最佳 LLM 82.8%)。结论:"LLM 学到的是一个个具体语言的模型,而非通用的语言理论。"(2-1,异议在于从"非推理型"外推到"全部 LLM")

小结:理论天平压向"定位"。"真习得"只在玩具任务被证明,且不触及全新语义概念。

3.2 主题二:情境内教新语言(唯一的强正面锚点)

  • ✅ MTOB(Tanzer et al., ICLR 2024, openreview tbVWug9f2h):模型仅凭上下文里的一本参考语法书学会 英语↔Kalamang 翻译。Kalamang(母语者 <200、网络近乎零存在)被刻意选作真实世界的新颖性/污染对照——"模型必须依赖上下文数据而非权重知识"。 → 这是 "learning in referencing" 最直接的经验范式。

  • ⚠️ 关键反驳(必须引用):Aycock et al.(ICLR 2025, openreview aMBSY2ebPw)——MTOB 的增益几乎全部来自语法书中的平行例句与词典条目,而非语法规则解释;LLM 无法有效利用语法说明。 → 你的"教汉语"实验必须切断"平行样例"这条捷径,否则会被判为 task location。

  • ⚠️🔍 2026 最新:Hu et al.(arXiv:2606.06428)用结果奖励(chrF)做 RL 后,在 5 门训练完全未见语言(Kalamang / Dinka / Wolof / Guaraní / …)上平均 chrF 0.27,显著高于 SFT 的 0.09(SFT 过拟合退化到基座 0.18 之下)。

    • 最关键的一点:RL 在未见语言上的优势(0.27 vs 0.12)仅当推理时提供可检索/引用的上下文资源时才出现——泛化能力绑定于"对情境内资源的使用"。 → 这是"在引用中学习"最直接的经验锚点。

    • ⚠️ 2026 预印本、未见正式同行评审、无正式显著性检验;"未见"是 held-out 义(基座+上下文仍有 0.18 非零基线)。

3.3 主题三:污染与新颖性控制(如何证明真属 OOD)

领域用两条范式:

  • (a) 真实稀有语言:Kalamang(✅)

  • (b) 构造/人造形式语言探针

评测"真获取"必须显式排除三类替代解释——ICL、模型记忆、语言学知识(Lu et al., ACL 2024, arXiv:2309.01809 ✅)。

  • ❌ 两条"保证新颖性"的强主张被 0-3 否决:

    • 「随机采样 DFA 即保证 OOD」——受控采样有用,但不足以单独坐实新颖性

    • 「涌现能力 = 只是 ICL + 记忆 + 语言知识」——是怀疑论靶标,不是定论

  • 🔍 人造语言工具箱:Biasless Language Models Learn Unnaturally / impossible languages(arXiv:2510.07178)——用扰动函数破坏普遍语言学倾向来生成"不可能语言",隔离"先验偏置 vs 真实习得"。

  • 🔍 污染事后检测:LogitTrace(arXiv:2509.20909)——逐层 logit 轨迹判定样本是否被见过。

小结:新颖性证明方法论本身仍有争议。建议受控/人造语言 + 污染检测双保险,而不是只靠"低资源假设"。

3.4 主题四:无标准答案的自验证 ★ 你的主战场

  • ✅ 最接近的现有原语:语义熵(Farquhar, Kossen, Kuhn, Gal, Nature 2024, s41586-024-07421-0)

    • 完全无监督,不需答案/任务专用数据/任务先验;重采样 → 双向蕴含聚成"意义簇" → 对意义簇算香农熵 → 高熵标记为"编造"。可泛化到人类也不知道答案的问题。

    • 构造性局限恰好界定空白:它检测的是不一致,不是不正确。作者本人明言:一套"稳定但错误"的知识、或蓄意欺骗,都能低熵通过。 → 一个"自信且一贯错误"的新概念会通过语义熵检验。 consistency ≠ correctness。

  • ✅ 主动/苏格拉底式追问——"选择"环节已可无 GT:Kobalczyk et al.(ICLR 2025 Spotlight, arXiv:2502.04485)把澄清式提问形式化为贝叶斯实验设计,选期望信息增益(EIG)最大的问题;EIG 由 N≈20 个自生成候选解估计(非固定标注池)。

    • 但"回答"环节仍需外部 oracle(可执行单测或人类)。→ 无 GT 的查询选择,接受/验证仍靠 oracle。
  • ✅ 朴素自反思已被证伪:Huang et al.(ICLR 2024, arXiv:2310.01798)LLMs Cannot Self-Correct Reasoning Yet——无外部反馈时内省式自纠无法提升、有时反而变差。被 2025–2026 多篇复现加强,瓶颈定位在验证步骤。 → 给 Reflexion / Self-Refine 一类划了红线:你必须给出比"又一个 verbal self-critique"更硬的接受信号。

  • 🔍 ★ 压缩即接受准则(最大机会):Delétang et al.(ICLR 2024, arXiv:2309.10668)Language Modeling Is Compression——证明预测器 = 无损压缩器,且 in-context 学习本身可读作压缩。 → 由此可把"概念是否学到"操作化为:

    加入该概念后,对该对话者后续输入的描述长度/困惑度是否显著下降?降了就接受。 → 这是一个完全不依赖任何答案库的量化准则。且目前没有任何人把"压缩增益"用作交互期新概念获取的在线接受/拒绝阈值。

  • 🔍 概念获取 × 主动验证的交叉新工作:Wild Guesses and Mild Guesses in Active Concept Learning(arXiv:2602.06818, 2026)——active concept learning 定义为 query-driven 识别一个结构化概念(规则/程序),正是"习得"而非"定位"的设定。留白:单会话、无隔离、无持久化。

  • 🔍 不确定性驱动的停止条件:The Silent Scholar Problem(arXiv:2512.20884)——区分 aleatoric(不可约)与 epistemic(可通过获取信息约减)不确定性;epistemic 收敛可作接受/停止条件。

小结(最重要的一条):目前没有任何一个既无答案库、又能对"新习得概念是否正确"给出接受/拒绝的完整准则。 可占的三条技术路线:① 压缩/MDL 增益阈值(无人占用)② EIG 主动追问收敛 ③ epistemic 不确定性收敛。

3.5 主题五:持久化 🔍 未经验证

  • 🔍 权威综述:Wu et al.(ACM Computing Surveys 2025, arXiv:2404.16789)Continual Learning of LLMs——纵/横维度 + 灾难性遗忘缓解(replay / 正则化 / 参数隔离 / PEFT)。 → 关键定位价值:几乎全部工作假设有任务标签/训练信号。 与"推理期、无 GT、单个全新概念"并置,即凸显你的差异化。

  • 🔍 参数化持久(ROME/MEMIT 谱系):MEMOIR(arXiv:2506.07899)最小覆写 + informed retention。

    • 必须与负面结果并读:Model Editing at Scale → Gradual and Catastrophic Forgetting(arXiv:2401.07453)——MEMIT 约 40 次编辑后仍稳,ROME/MEND 10–20 次即退化/collapse。 → 知识编辑能把"一个新事实"写进权重,但面向已知 schema 的事实三元组,不处理全新概念,也无 P2/P4。

3.6 主题六:隔离 / 防污染 🔍 未经验证(2026 热点)

  • 🔍 良性(非对抗)失败已很严重:PersistBench(arXiv:2602.01146)定义并测量 cross-domain leakage(一个对话的长期记忆被不当注入无关对话)与 memory-induced sycophancy。18 个 LLM:cross-domain 中位失败率 53%、sycophancy 97%。 → 即便没有攻击者,"持久 + 隔离"也远未解决。

  • 🔍 对抗(记忆投毒):Dash et al.(arXiv:2606.04329)——4 类写入通道 + 9 种漏洞 + 6 类攻击 + MPBench;"越积极写/检索记忆的 agent 越易被投毒"。承接 MINJA(2025,仅靠查询即可投毒,成功率 >95%)。

  • 🔍 空白地图:Lin et al.(arXiv:2604.16548)Survey on Long-Term Memory Security——Memory Lifecycle 六阶段(Write/Store/Retrieve/Execute/Share/Forget)+ Verifiable Memory Governance。明确指出:尚无"无 GT 自动决定接受/隔离新概念"的判据。

  • 🔍 per-user 隔离的现成载体:Survey of Personalized LLMs(arXiv:2502.11528)——OPPU(每用户独立 LoRA)、超网络生成 PEFT、联邦 LoRA。 → 提供"一人一套参数/记忆"的天然隔离,但目标是拟合偏好/风格,没有"该概念是否成立"的验证环节。

小结:P4 直接对应一个 2026 热点。per-user LoRA 给了隔离载体,缺的正是你要补的验证器。

3.7 主题七:符号接地与翻译不确定性 🔍 未经验证

  • 🔍 新颖指称问题:Lederman & Mahowald(TACL 2024, arXiv:2401.04854)Libraries or Librarians?——LLM 用新名字指称新实体时,"图书馆技术论"站不住脚(派生意义无法解释首次指称)。为"指称中学习"提供正面可能性论证。

  • 🔍 向量接地问题:Coelho Mollo & Millière(arXiv:2304.01481)——区分五种接地(referential / sensorimotor / relational / communicative / epistemic),论证只有 referential grounding 与本问题相关;给出接地两条件(因果-信息关系 + 选择史赋予的功能)。

  • 🔍 ★ Harnad 2024(arXiv:2402.02243)——符号接地问题原创者本人论 LLM。提出 Indirect Verbal Grounding:用语言把接地从已接地的老师延伸到学习者。 → 这就是你"用英语母语者教它汉语"思想实验的哲学正名,可直接作为机制的理论骨架。

  • 🔍 Quine gavagai → LLM:纯分布信息下,多个互不相容的意义赋值同等可辩护;语料/提示只能锐化相关性、无法弥合 form-meaning 鸿沟。 → 直接支撑 P2 的哲学必要性:指称在纯分布下本质欠定,所以必须有一个收敛/验证机制。

  • 🔍 争论仍活跃:On the Referential Capacity of LMs(Computational Linguistics 2025,内在论 rejoinder)——现有争论集中在"能否指称",而非"如何在无 GT 下自验证并隔离地持久化"。你的问题正好在争论的下游空白处。


§4 验证反证:不能踩的坑

# 坑 状态 正确做法
1 Min et al. 2022「随机标签几乎不损害性能」 ❌ 1-2 被否 后续 Rectifying Demonstration Shortcut(arXiv:2403.09488)显示某些设定下标签正确性确有作用。引用弱版本并注明争议。
2 von Oswald「真实 LLM 前向传播在跑 GD / mesa-optimizer」 ❌ 0-3 只说"单层线性自注意力=一步 GD 的构造存在,且仅在合成回归下"。
3 「涌现 = 只是 ICL」 ❌ 0-3 当怀疑论靶标用,不当定论。
4 「随机 DFA 采样保证 OOD」 ❌ 0-3 受控采样有用但不足以单独坐实新颖性。
5 主题 5–7 全部 🔍 未验证 全是 2026 预印本,引用前自查是否正式发表、数字是否经统计检验。
6 迁移外推 💭 语义熵/EIG/自纠都针对"任务/答案",尚无一条直接针对"推理期新习得概念"的正确性验证——迁移是合理但未经实证的外推(这本身可作为你的实验贡献)。

§5 空白地图与定位建议

5.1 四性质覆盖表

性质 谁最接近 到哪一步 还差什么
P1 全新 MTOB / Hu 2026 / CoLLEGe 仅"语言"类,且绑定引用外部资源 推广到语言之外;证明是 TL 而非平行样例检索
P2 无 GT 验证 语义熵 / EIG / 压缩 只有"测自洽"、"无 GT 选择该问什么"、"压缩地基" ★ 无任何"正确性"接受/拒绝准则
P3 持久 CL 综述 / 知识编辑 / per-user LoRA 载体齐备 全假设训练信号;无"该不该固化"的准入
P4 隔离 per-user LoRA / PersistBench 隔离载体 + 诊断 benchmark 无"该记忆是否该跨对话使用"的验证器

5.2 三种立论角度

  • A(最硬、推荐为核心)— 机制论文 提出无标准答案的概念验收准则(压缩增益 / EIG 收敛 / epistemic 收敛,或融合),在"教一个全新概念"任务上证明它能接受正确概念、拒绝自信且一贯错误的概念——后者正是语义熵抓不到、你能赢的地方。全场最未被占据的点。

  • B(支撑)— Benchmark 论文 构造一个干净隔离"真习得 vs 定位/平行样例/污染"的评测(人造语言 + 污染检测 + 对抗错误教学),把四性质做成四个可测轴。领域正缺这把尺(§3.3 方法论仍有争议即是证据)。

  • C(收尾)— 系统/立场论文 把四性质耦合成一个 one-on-one、reflective、per-user 的学习闭环,用 PersistBench / 记忆投毒作动机。

建议:A 为核心贡献 + B 的小型受控 benchmark 支撑评测 + C 作 discussion。


§6 聚焦:预训练后如何持续建立永久知识

这是整个研究里最硬、最值钱的一问。

6.1 先拆开:四个被混为一谈的子问题

"永久"和"持续"本身在打架——stability-plasticity 困境:要学新东西就得改权重,改权重就毁旧知识。

  1. 载体(哪):新知识物理上住在哪
  2. 写入(怎么写):怎么写进去
  3. 巩固(怎么变永久):短暂经验怎么固化又不毁旧知识
  4. 门控(什么够格) ← 这就是 P2,也是本研究的贡献核心(门控本身有人做,但无人用正确性信号——见 §7.6)

6.2 载体谱系

载体 内化程度 遗忘风险 可逆/可删 隔离难度 成熟度
上下文窗口 无(临时) — trivial trivial 不算永久
外部记忆(RAG/记忆库) 低(惰性) 无 trivial trivial(命名空间) 成熟
参数侧记忆(per-user LoRA/记忆层) 中(进 forward) 低(base 冻结) 中(换/删模块) 低(一人一模块) 较成熟 🔍
直接权重编辑 高 高(顺序编辑 collapse) 难 不可 研究中 🔍
持续微调 base 最高 最高(灾难性遗忘) 难 不可 贵/研究中 🔍

这张表的对角线就是整个领域的张力:越像"真学到",就越难撤销、越容易遗忘、越难按人隔离。

"永久"有两种,务必分清:

  • 持久存储的永久(外部记忆):永远在,但没内化——是"知道有这回事",不是"学会了";检索不到就等于不存在。

  • 内化的永久(参数):真学进去、能与别的知识组合,但在持续写入下极其脆弱。

有意思的研究恰在中间:让参数在持续写入下依然 durable。

6.3 真正的瓶颈不是载体

载体都有现成的。卡住"永久"的是两个弱环节:

  1. 巩固门控(无 GT 决定什么值得固化)——现有持续学习几乎全部假设有标签/loss。没有门控,一个未验证或自信错误的概念一旦固化就是永久污染(PersistBench:即便无攻击者,跨对话泄漏中位失败率 53% 🔍)。
  2. 持续写入下的遗忘/污染——ROME/MEMIT 顺序编辑 10–40 次即 collapse 🔍;任何可持久化的记忆天然是攻击面 🔍。

6.4 💭 推荐架构:双层 + 验证门控(CLS for LLMs)

把互补学习系统(海马=快/情景,新皮层=慢/巩固,睡眠回放=转移)搬过来:

  • 快层(episodic)=外部/情景记忆:新经验立刻、廉价、可逆地落在这里。错了随时删,天然 per-user 隔离。

  • ⚙️ 巩固门(新器官 = 贡献核):idle 时运行,决定哪些经验毕业。判据 =

    • 压缩增益(Delétang 地基):加入后该对话者后续输入的描述长度是否显著下降 ← 核心信号

    • 跨时间稳定性(语义熵,必要非充分)

    • 主动追问收敛(EIG / epistemic 不确定性低于阈值)

    • 规则:只有跨足够多次交互证明自己的概念才毕业。

  • 慢层(consolidated)= per-user 参数适配器(OPPU 式 LoRA):只把毕业的知识内化;配从快层 replay 保护旧知识。

这套设计一次满足四性质,并闭合了 §1 的原始命题:

概念不再必须在训练时建立——它在 reference 时被提出,然后靠门控挣得永久性。

6.5 诚实:仍未解决的硬核

  1. 持续权重更新下的遗忘——规模上真没解;选择性门控是缓解,不是解决。
  2. 门控的正确性——consistency ≠ correctness,"自信且一贯错误"的概念能同时骗过压缩和自洽。这既是最大风险,也正是能做出区分度的地方。
  3. 隔离 vs 泛化——有些 per-user 知识应该泛化给别人,哪条该留在本地本身是个判断问题。
  4. 撤销权——"永久"不该等于"不可逆";外部记忆删条目 trivial,权重里删除极难。

§7 架构探索:突破 Transformer

状态:第二轮 deep-research 已完成(26 篇来源 → 130 条主张 → 25 条对抗验证 → 21 确认 / 4 否决)。本章已用验证结果重写。

核心结论(✅ 跨 8 篇一手论文的合取,各分支 3-0): 没有任何已验证架构把"推理期写入"与"带准入门控的巩固"耦合起来。 覆盖矩阵里 "推理期写入"列与"跨会话持久"列在任何一行都不同时为 ✓ —— 这就是本课题的结构性空白。

⚠️ 一条历史限制(第二轮时):第二轮只覆盖族 1(TTT/快权重)、族 2(可寻址稀疏记忆)、族 3(SSM 容量);族 4/5/6 当时零验证。 ✅ 已解除(第三+四轮):族 4(DEN/SEMA/HAT/CN-DPM/StaR-MoE)见 §7.6 + 附录 I;族 5(局部学习 + Hopfield 容量)与族 6(回放选择准则 + CLS/生成式回放 + 2026 agentic 记忆门)已在第四轮全覆盖、0 反例(§7.6.7)。→ 现在可写的不是"无人做到",而是收紧后的"没有任何门控用无 GT/无外部 oracle 的概念级正确性信号"(措辞边界见 §7.6.4)。

7.1 诊断:Transformer 为什么结构上做不到

不诊断清楚就换架构,等于换个方向撞同一堵墙。五条结构性障碍:

  1. 推理期没有写入路径。 前向传播对参数是只读的。跑一遍模型不会改变它知道什么;学习只能由外部优化器发生。这是最根本的一条。
  2. 知识在 MLP 中叠加(superposition)、不可寻址。 事实不在可定位的槽里,而是散布在多义神经元上——所以改一个会有涟漪、顺序编辑会崩。你碰不到"只碰一个"。
  3. 没有快/慢分离。 一套权重干所有事,区分不了"核心信念"与"五分钟前学的",于是每次更新都在赌上核心。
  4. 全局梯度耦合。 反传更新一切;干扰是默认、隔离是例外。灾难性遗忘不是 bug,是稠密梯度更新的必然。
  5. KV 缓存是个"笨"的情景记忆。 可写、只增不减、从不压缩、从不验证、会话结束即死。Transformer 最接近情景记忆的东西,恰恰没有任何通路把它固化进权重。

7.2 由诊断推出的五个架构需求

# 需求 治哪条病
① 推理期参数写入路径 病 1
② 可寻址/稀疏存储(写一个不动其他) 病 2
③ 快/慢(情景/巩固)分离 病 3
④ 巩固算子(快→慢,带准入门控) 病 5
⑤ 状态有界 病 5

7.3 ✅ 架构族 × 缺失器官覆盖矩阵(已验证)

✓=具备 ◐=部分 ✗=缺失。本矩阵仅含族 1–3;族 4/5/6 的门控已在第三+四轮补齐,见 §7.6 / §7.6.7 + 附录 I。

架构族 推理期写入 可寻址抗干扰 快/慢分离 巩固算子 准入门控 跨会话持久
TTT layers / TTT-E2E (2512.23675) ✓ 每 1K token 梯度步 ✗ 稠密 MLP ◐ 静态第二 MLP 作 safe storage ✗ ✗ 无条件写 ✗ reset
Titans (2501.00663) ✓ surprise 门控写 M_t ✗ ◐ persistent 静态 + M_t 动态 ✗ ✗ surprise ≠ 准入 ✗
Miras: Moneta/Yaad/Memora (2504.13173) ✓ ✗ ✗ ✗ ◐ retention gate 管"覆盖多少" ✗
Gated DeltaNet (2412.06464) ✓ fast weight + 定向 delta 写 ◐ 抑制写入期干扰,容量仍 ≤ d ✗ ✗ ✗ ✗
TTT-NTP (2606.21803) ✓ 闭式 ridge 写 W^down ✗ ✗ ✗ ✗ 只答"写什么" ✗ 每样本回滚
HOPE / CMS (2512.24695) ✓ 写 MLP 知识权重 ✗ ✓ 频率分层,架构原生 ◐ 多频但时钟驱动 ✗ i ≡ 0 mod C^(ℓ) ✗ context 结束重初始化
Memory Layers at Scale (2412.09764) ✗ 测试期只读 ✓ 1M 槽 product-key ✗ ✗ ✗ ✓* 参数即 checkpoint
Sparse Memory Finetuning (2510.15103) ✗ 仍是反传训练循环 ✓ top-t 槽级 stop-gradient ✗ ✗ ◐ TF-IDF 槽定位判据 ✓ 参数写入落盘
SSM / 线性注意力(状态即记忆) ✓ 选择性状态更新 ✗ 叠加搬进状态矩阵 ✗ ✗ ✗ ✗ 易失

* Memory Layers 的持久性是参数位置的逻辑推论;因无推理期写入路径,训练后并不会有新东西被写进去。

这张表最关键的读法(⚠️ 本矩阵仅含族 1–3;族 4/5/6 的门控见 §7.6):

  1. 在族 1–3 内"准入门控"整列全空(最好的也只是 ◐)。→ 第三轮发现族 4/5/6 确有真门控,但无一使用正确性信号(§7.6)。
  2. "推理期写入"与"跨会话持久"在任何一行都不同时为 ✓。 ← 结构性空白

7.3.1 ✅ 三条关键的验证结论

① 推理期写入路径这个器官已经不缺了,但全族易失。 Titans 作者自己在 Nested Learning(arXiv:2512.24695, NeurIPS 2025)p.25 高亮框中写道:

"The concepts commonly referred to as test-time training and test-time memorization are in fact instances of parametric in-context learning, where the acquired in-context knowledge does not persist once the current context is removed."

该框显式点名 TTT layers 与自家 Titans/Miras 谱系——属"对自身不利的承认",证据等级最高。逐个核实:TTT-NTP 写入每样本后被显式回滚;TTT-E2E §4.2.3 自陈 "the model is reset after each prediction";Gated DeltaNet 的 S 序列结束即重置。

② 族 1–3 的所有门控都在调"覆盖多少/写多强",没有一个在问"够不够格永久固化"。(族 4/5/6 有"够不够格"的硬门控,但信号非正确性——见 §7.6) Titans 的门是 M_t = (1−α_t)M_{t−1} + S_t,损失是纯重构误差 ‖M(k_t) − v_t‖²,k_t/v_t 都是输入自身的线性投影——写入信号完全内生。全文 verif* / correctness / ground truth / admission 命中 0 次。Miras 的四轴设计词典中没有任何一轴对应巩固或跨会话持久(consolidat / persist / cross-session / lifelong / replay 全 0 命中)。

③ 唯一原生的快/慢分离(HOPE/CMS)把巩固接到了时钟,不是门。 唯一分支条件是取模计数器 i ≡ 0 (mod C^(ℓ)),与内容、损失、新颖性、置信度全部无关。抗遗忘只靠跨频率冗余 + 反传回流。全文 session/admission/user/verification 均 0 命中,且作者自我限定 "we focus on the first stage: memory consolidation as an online process",把离线/回放式系统巩固显式留作未来工作。

7.3.2 ⚠️ 三个必须避开的陷阱

# 陷阱 真相
1 Titans 的 "persistent memory" 不是持久化通道。它是"数据无关、测试期固定"的任务级参数,论文明说 "persistent memory parameters are fixed... should not be changed"。即 "会写的不持久、叫持久的不写"。已有二手博客误读为"跨序列携带信息",切勿沿用。
2 HOPE/CMS 的 "persistent knowledge" 指千 token 量级的低频层,不是跨会话。低频端实验只扫到 512/2K token。
3 "Titans 提供原生推理期参数写入路径" ❌ 1-2 被否(措辞过强)。"Miras 提供架构级统一形式化" ❌ 0-3 被否。综述中应降调为**"提供了写入的形式化词典"**。

7.3.3 ✅ 稀疏槽路线:唯一的抗干扰定量证据

Sparse Memory Finetuning(FAIR at Meta, arXiv:2510.15103):1.3B base,layer 12 的 FFN 换成 1M 槽 product-key 记忆池(k=32,每 token 仅 32,768 活跃参数,原 FFN 为 50M)。

在 TriviaQA 事实流上训练后,NaturalQuestions 性能跌幅:full FT 89% / LoRA 71% / 稀疏记忆微调仅 11%

关键架构性质:"the keys and values are trainable parameters (rather than activations) that can be finetuned" → 写入落在参数上、进 checkpoint,因而天然跨会话持久,与 TTT/Mamba 的易失状态形成对照。

TF-IDF 槽排序是文献中最接近"写入准入门控"的可实现机制:以 1000 个随机预训练 batch 的槽访问统计作 IDF 分母,实现为梯度掩码;且不假设任务边界。但三条限定必须写清:(1) 运行在训练循环里,非推理期;(2) 决定的是参数定位(写哪些槽),不涉及知识正确性;(3) 无自验证成分。

⚠️ 89/71/11 有四点方法学限定,论文中必须原样披露否则会被审稿人击穿:无表格支撑(从 Figure 3 曲线读出)、单次运行无误差棒无多 seed、优化器不对等(稀疏用 SGD、基线用 AdamW,精确的 11% 只在 SGD 下成立)、基线与实验跑在不同架构上(dense 1.3B vs 记忆增强 1.3B)。

7.3.4 🎯 一个现成的、低算力高价值的空实验

稀疏槽路线已展示 1000 条事实逐条写入、约 10,000 梯度步不崩溃,远超 ROME/MEMIT 的 10–40 次崩溃量级。但从未有人做过正面崩溃曲线对比——8 篇一手论文中 ROME/MEMIT/model editing 正文命中 0 次,Kevin Meng 在参考文献中完全缺席。

⚠️ 注意:这不是同基准对比(前者 SGD 批量改写 + QA F1 判分,后者闭式 rank-one 编辑 + 严格 locality/specificity 判分)。正因如此,把它做成同基准对比本身就是一个开放的、低成本的贡献点。

7.4 提案:三层记忆 + 巩固门(已按验证结果校准)

调研给出的最小新颖性配方(✅ 由发现 10 直接推出)——四个部件各有现成出处,缺的只是把它们缝起来并补上门:

部件 借自 状态
槽级可寻址持久写入 族 2(Memory Layers / Sparse Memory FT) ✅ 已验证可行,有抗干扰数据
推理期写入路径 族 1(TTT / Titans / Gated DeltaNet) ✅ 已是架构原语
频率分层巩固 HOPE / CMS ✅ 已验证,但接的是时钟
⚙️ 知识级准入门控 无人做过 🎯 你的原创部分

架构草图

  • L0 工作状态:SSM 定长状态或 KV — 会话内,易失

  • L1 情景记忆(可写 · 按对话者硬分区):TTT/Titans 式推理期写入路径,落在 product-key 稀疏槽上;写入廉价、可逆

  • ⚙️ 巩固门(原创核心):idle 时运行,判据见 §6.4(压缩增益 + 跨时间稳定性 + epistemic 收敛)

  • L2 巩固核:低频稀疏记忆层;只有毕业的槽被写入,配 L1 回放保护既有知识

🎯 一个意外强的加分项:调研对 8 篇一手论文做整词穷举,user / users / speaker / interlocutor / per-user 命中全为零——

"按对话者隔离"在这批架构文献里不仅没被实现,甚至没有被提出过。

→ 把 product-key 记忆池的 key 空间按 uid 硬分区,可以让隔离成为数学上零干扰的架构性保证,而不是约定。这是一个几乎无人竞争的主张。

四条可证伪的架构性主张(论文该长的样子):

# 主张 对照基线 证据状态
1 稀疏槽级写入下,顺序写入 N 次不 collapse ROME/MEMIT 的 10–40 次 ⚠️ 此对比从未有人做过(§7.3.4);注意非同基准,需自建统一判分
2 稀疏槽定位 → 大幅抑制叠加干扰 full FT 89% / LoRA 71% 跌幅 ✅ 已有 11% 的先例,但有四点方法学限定须披露
3 key 空间按 uid 硬分区 → 跨用户泄漏率 ≈ 0 PersistBench 的 53% 🔍 🎯 文献中未被提出
4 门控能拒绝"自信且一贯错误"的概念 语义熵(拒绝不了)+ SAGE 的几何新颖度门 🎯 信号类型未被占据(见 §7.6 修正)

主张 4 是整篇论文的心脏,但措辞必须按第三轮结果收紧: ❌ 不能说"没人做准入门控"(DEN/SEMA/SAGE/Hopfield 都做了) ✅ 要说"没有任何门控使用正确性/可信度信号"——现有全部判据(Titans 的 α_t、Miras 的 retention gate、TF-IDF、SAGE 的 s_vMF)都落在损失/漂移/容量/新颖性/几何冗余五类代理上。详见 §7.6。

7.5 范围建议:别替换注意力,补器官

Transformer 缺的是器官(写入路径 / 可寻址存储 / 巩固),不是算子(注意力本身没问题)。

三条理由:

  1. 注意力作为冻结的语义先验是资产,不是负债——它提供了理解教学语言所需的底座。丢掉它还得重新赚回来。
  2. 主张更强:"我发现 Transformer 缺三个器官并补上了" 远比 "我又提了一个架构" 可辩护。
  3. 成本低几个数量级——这直接关系可行性。

7.5.1 ✅ 可行性判决(已由规模数据核实)

❌ 不可行——"提一个新序列混合器"这条路已经关闭

  • 赛道已白热化且已进入生产:Gated DeltaNet 已被 Qwen3-Next 采用(约 3:1 混合)。任何新混合器都要在同等预训练预算下打赢它。

  • 算力门槛:Memory Layers 做到 8B;HOPE/CMS 预训练 760M/30B token 与 1.3B/100B token;Sparse Memory FT 的 1.3B base 是作者自行预训练(为公平必须自训);TTT-E2E 需要 gradients of gradients 的内外双层元学习。

✅ 可行——retrofit 路线已被独立复现

证据 说明
两篇 2026 独立工作在 Qwen-2.5-0.5B 上 retrofit 记忆层(2604.05248、2605.03229)🔍 证明"把 FFN 换成记忆层再继续训"在 0.5B 规模可复制
HOPE §7.3 "Ad-hoc Level Stacking: Initializing CMS with Pre-Trained Models" 给出用预训练 Llama 的 MLP 初始化 CMS 各频率层的具体做法,可按比例缩小
准入门控本身是纯算法组件 可在冻结 base + 1M 槽记忆池上做完全干净的受控实验:门控 on/off × 顺序写入 N 条 × 旧能力保持曲线 × 与 ROME/MEMIT 同基准崩溃曲线对比 — 不需要任何预训练算力,而恰好是当前文献缺失的那块

结论:论文的新颖性应押在"门控 + 巩固算子"上,而非新的序列混合器。 算力参照上限:Sparse Memory Finetuning 的 1K facts / 10K steps / 1.3B。 ⚠️ 该可行性判断由各论文报告的规模数字推断而来,未经对抗验证。


7.6 🔴 第三轮裁决:族 4/5/6 与"门控信号"的新颖性边界

状态:第三轮 deep-research 完成(22 源 / 110 主张 / 25 验证 → 10 确认 / 15 否决)。本轮被特意设计成"证伪我方主张"。 结果:广义主张被推翻,狭义主张存活。这是好事——现在发现,好过评审时发现。

7.6.1 裁决

版本 措辞 裁决
❌ 广义(撤回) "所有已知门控只调节写入强度/覆盖,没有一个回答该不该被永久固化" 被推翻
✅ 狭义(存活) "没有任何架构用知识级正确性 / 无标准答案的可信度判据来决定什么被永久固化" 在族 4/5/6 覆盖范围内成立(第三轮确立、第四轮补全仍 0 反例,见 §7.6.4 / §7.6.7)

推翻广义版的四个反例都是真门(离散硬判决,不是强度调制):

工作 判决规则 信号
DEN (ICLR'18, arXiv:1708.01547) if Lₜ > τ then DynamicExpansion;另 ‖wᵢᵗ−wᵢᵗ⁻¹‖₂ > σ → 分裂 训练损失 / 参数漂移
SEMA (CVPR'25, arXiv:2403.18886) 所有 descriptor 的重构误差 z 分数合取 > 阈值 → 扩容 表征新颖性/分布漂移
SAGE (2026, arXiv:2605.30711) 显式命名的 write-side novelty gate;三元硬路由 ADD/UPDATE/NOOP 几何新颖度 s_vMF
Self-Sizing Hopfield (2026, arXiv:2507.10443v3) 双阈值滞回控制律 ρₜ=ℓₜ/ℓ_prev > τ_hi 开 / < τ_lo 关 归一化损失比 + 标签几何

但对四者全文关键词穷举(correct/factual/verif/valid/trust/confid/ground-truth),正确性类信号命中全为零。

7.6.2 ★ 对照表:所有"该不该记住"判据 × 信号类型(交付物 b)

🔴 定稿说明(第十二轮,2026-08-04)—— 最后一列的框架已换

本表最初的末列是「正确性 ✓/✗」,读法是"正确性那一列空着,由我方填"。 该框架自第八轮起就不成立:GATES / LMSI 用一致度作 GT-free 的正确性代理, 第十二轮又加上 ConsistencyGate(推理期、按条、持久)。⟹ 正确性那一格已被占。

定稿末列改为「判据是否为描述长度 / 压缩增益」 —— 这是唯一仍然空着的一轴。 全族词边界扫描(含第十二轮新增的 DeMem,水印核验后逐词扫): description length / minimum description length / MDL 命中数 = 0。

⚠️ 本表凡出现「正确性」列的读法,一律以本说明为准;下方原表保留作沿革,不得直接引用其读法。

# 判决规则 出处 门控什么 信号类型 时机 正确性
1 Lₜ > τ → 扩容 DEN(族4) 要不要扩容 损失 训练期·任务边界 ✗
2 加 k 单元后组稀疏剪枝 DEN(族4) 扩多少 损失×容量 事后剪枝 ✗
3 ‖Δwᵢ‖₂ > σ → 分裂 DEN(族4) 防语义漂移 参数漂移 训练后 ✗
4 硬掩码 SGD 学出 HAT(族4) 占用/梯度抑制 损失+容量正则 训练期·task ID 外给 ✗
5 z 分数合取 > θ SEMA(族4) 要不要加 adapter 表征新颖性 训练期·任务边界 ✗
6 s_vMF → ADD/UPDATE/NOOP SAGE(agentic 记忆) 事实写不写入 几何新颖度+密度 在线·逐条 ✗
7 ρₜ > τ_hi 开 / < τ_lo 关 Self-Sizing Hopfield(族5) 要不要开新 chart 归一化损失比+标签几何 在线·逐条 ✗
8 sim(x,cⱼ) > θ_rec 同上(族5) 复用还是新分配 相似度/新颖性 在线 ✗
9 (空缺) — 我方拟填补 够不够格永久固化 知识级正确性 / 无 GT 可信度 推理期·无边界·逐条 ✓

读法:新颖性边界不在"是否有门"(多行都是真门),而在信号列——损失 / 参数漂移 / 容量 / 表征新颖性 / 几何冗余 五类已占满,正确性列空。再叠加"时机",同时满足"在线逐条 + 无任务边界"的只有第 6、7、8 行(均 2026,均非正确性信号)。

★ 第四轮补充行(族 5/6,12 目标 finder+verifier 一致确认,0 反例)

第四轮把最可能藏反例的回放选择准则 + 局部学习 + CLS/生成式回放 + 2026 agentic 记忆写入门全部补齐。没有一条越过"信号"这道线。 关键收获是:原五类代理不完整——2024–2026 的 agentic 记忆写入门用到了来源信誉 / 对源忠实度 / 可靠度 / 一致性这些新代理;但它们依然不是"概念真伪"信号(信任来源 ≠ 验证概念;忠实于输入 ≠ 世界真值;标记矛盾 ≠ 裁决真假),故狭义否定命题不被证伪,反而更锋利。

# 判决规则 出处 门控什么 信号类型 时机 正确性
10 概率 mem_sz/n 收 + 均匀随机淘汰 Reservoir(族6;Vitter'85 / 1902.10486 / 1810.11910) 每条流样本是否写入 + 淘汰哪条 随机/均匀(内容/标签/正确性全盲) 写入·准入 ✗
11 类别配额满则弃 + 从最大类随机淘汰 GDumb(族6;Prabhu ECCV'20) 是否写入 exemplar 类别平衡(GT 标签计数) 写入·准入 ✗
12 虚拟步 loss 增量最大者优先回放 MIR(族6;1908.04742) 从缓冲检索哪些回放(非准入) loss/梯度干扰 检索/回放期 ✗
13 最小化缓冲内梯度 cosine 冗余 GSS-Greedy(族6;1903.08671) 是否写入/淘汰缓冲 梯度方向多样性 写入·准入 ✗
14 herding 使运行均值逼近类均值 iCaRL(族6;1611.07725) 类内哪些图像进 exemplar 特征代表性(herding) 写入·准入 ✗
15 reservoir 收;标签仅进 loss 不进选择 DER/DER++(族6;2004.07211) 是否写入缓冲 随机/均匀(label-in-loss ≠ selection) 写入·准入 ✗
16 责任度 argmax=新组件 → 泊 STM;STM 满 → 训新专家 CN-DPM(族4;2001.00689) 是否实例化新永久专家并巩固 DP/CRP 先验 × 数据似然(novelty-under-likelihood) 门控在前(WAKE)·巩固在后(SLEEP) ✗
17 惊奇 s(t) 局部极大 > τ=med+γ·MAD Surprise-gated(2606.03787,一手核实) 8 帧片段是否二值写入 episodic 贝叶斯惊奇=预测误差+表征新颖(GT-free) 在线·逐条 ✗
18 无逐项门;无条件/按睡眠调度回放 生成式回放/CLS(DGR 1705.08690 / FearNet / BI-R) 哪些记忆巩固进权重 生成密度 + 时近性/睡眠调度 + 自蒸馏 巩固 ✗
19 STM 召回重叠达阈 → 巩固该突触 Recall-gated(族5;Lindsey & Litwin-Kumar, eLife'24) STM→LTM 是否巩固 召回重叠=熟悉度/可靠度 SNR(GT-free 但非概念真值) 在线·逐条 ✗
20 复合 salience 阈;显式拒绝 oracle 标签 Write-Time Gating(2603.15994,一手核实) 传入知识对象是否写入长期库 来源信誉+新颖度+可靠度(GT-free provenance) 在线·逐条 ✗
21 Memory Transition Verifier 三维判据 TRUSTMEM(2606.25161,一手核实) 记忆更新是否写入/编辑长期记忆 coverage+preservation+faithfulness(对源忠实度/防幻觉,非世界真值) 在线·逐条 ✗
9 (空缺) — 我方拟填补 够不够格永久固化 知识级正确性 / 无 GT 可信度 推理期·无边界·逐条 ✓
★ 第八轮 + 第十二轮补充行(这些行推翻了原表的"正确性列空缺"读法)
# 判决规则 出处 门控什么 信号类型 时机 判据=描述长度?
22 8 次 tutor rollout ≥4 一致才收(未过门者零损失) GATES(2602.20574) 蒸馏条目是否进损失 一致度(GT-free 的正确性代理) 训练期·数据准入 ✗
23 多数投票筛自训练数据 LMSI(2210.11610, 2022) 自训练样本是否保留 一致度(同上,更早先例) 训练期·数据准入 ✗
24 查询 LLM K 次取平均支持分 > 阈才提交 ConsistencyGate(2607.22962,2026-07-25) 候选事实是否写入长期记忆 一致度 🔴 推理期·按条·持久 ✗
25 仅当数据"认证"共享状态会导致决策冲突时才细分分区 DeMem(2605.10870,水印核验 v1) 预算下哪些历史可合并/遗忘 decision-centric rate–distortion(失真=regret,需观测奖励) 在线·预算约束 ✗(全文 MDL/description length 0 次)
26 相似度提候选 → LLM 判官定 delete/merge/preserve MemRefine(2606.13177) 已入库条目的事后压缩 LLM 判官的事实性判断 事后·预算约束 ✗
9 (空缺) — 我方拟填补 够不够格永久固化 压缩增益 / 两部分 MDL,算在对话者的 held-out 用词决策上 推理期·无边界·逐条 ✓ 唯一

定稿读法(第十二轮,直接决定贡献声明措辞)

  1. 「有没有门」早已不是边界(第三轮起);「GT-free 正确性代理」也不是(第八轮,GATES/LMSI); 「推理期按条持久写入」同样不是(第十二轮,ConsistencyGate)。
  2. 仍然空着的只剩「判据类型 = 描述长度 / 压缩增益」一轴,且必须再加两条限定: 压缩的是【对话者后续的用词】(DeMem 压缩的是智能体自己的动作), 门决定的是【要不要写】(DeMem/MemRefine 决定的是【什么可以忘】)。
  3. DeMem 不是威胁而是旁证:它独立论证了"该保住的是决策不是描述"—— 与我方 P0 的 7.2× margin 同向。⚠️ 但其失真定义为 regret、需要观测奖励, 按禁令 2 这只能写成作用域区分,不得作为独立卖点。

第四轮读法(三条,直接决定贡献声明措辞 —— 已被上方「定稿读法」取代,保留作沿革):

  1. 代理表要扩到十类:随机/均匀、类别平衡、损失/似然、参数漂移、容量/稀疏、表征或几何新颖性、梯度干扰/多样性、代表性、(有标签下的)不确定性、+ 来源信誉/对源忠实度/可靠度/一致性(第四轮新增)。审稿人会拿 TRUSTMEM/Write-Time Gating 的 "trust/faithful/reliable" 措辞质疑"信号只落在这几类"的完备性——必须主动把这几项写进表,并在正文显式区分:信任来源 / 忠实于输入 / 标记矛盾 ≠ 无 GT 地验证概念为真。
  2. 唯一还空的是"无 GT / 无外部 oracle 的概念真伪"信号 🔴 第八/十二轮作废:GATES/LMSI/ConsistencyGate 都是 GT-free 的一致度门 ⟹ 该格已被占。 现存表述见上方「定稿读法」第 2 条。 ⚠️ 原文此处还列了 LOCI——第十二轮无法再定位该条目(TDCommons 11091 检索不到, 作者与标题未能核实)⟹ 已从投稿正文删除,本处仅作沿革保留,不得引用。
  3. MIR 是"检索门"不是"准入门"(准入实为 reservoir),归类时勿混;DER++ 的标签只进 loss 不进选择,是 label-in-loss ≠ label-in-selection 的教科书样例。

7.6.3 ★ SAGE 是最近先例——必须正面引用并据此收紧声明

SAGE(arXiv:2605.30711, Duke, 2026-06-18)离我方设计最近:online、per-item、no-task-boundary、write-side、显式叫 novelty gate。唯二把我方与它分开的:

  1. 信号类型:几何新颖度 s_vMF ↔ 正确性/可信度(我方)
  2. 基质:非参数 agentic 文本记忆库 ↔ 参数/架构级巩固(我方)

→ 一个全新的"错误"事实会因新颖度最高被 SAGE 直接 ADD、且完全绕过 LLM 合并——这正是"正确性门控"要拦、而几何门控拦不住的。这是我方最锋利的动机演示,也是最便宜的 head-to-head baseline(LoCoMo + API,零训练,把 τ 路由变量换成正确性分数即可)。

必须调整的贡献声明(三处,审稿人会抓):

  1. 新颖性边界从"存在门控"移到"门控信号类型"
  2. 显式加限定"参数化/架构级巩固"(SAGE 是非参数)
  3. 把 SAGE 列为最近先例正面引用

顺带:SAGE 自己的 related-work 也承认"write-side 有原则的准入控制是空白,现存写入控制只有两个昂贵极端——推理期反复 LLM 审议、或训练期 RL"。第三方对空白的独立确认——但也说明这方向正被快速填。

第四轮更新:write-side 准入门的家族 2026 年在飞速扩张——除 SAGE 外,第四轮又一手核实了 Write-Time Gating(2603.15994,来源信誉/可靠度,显式拒绝 oracle 标签)、TRUSTMEM(2606.25161,coverage/preservation/faithfulness + Memory Transition Verifier)、LOCI(TDCommons 11091,2026-07-21,外部结果确认才 crystallize)。四者无一用"无 GT 的概念真伪":几何新颖、provenance、对源忠实、外部 oracle 各占一角。→ 我方 delta 因此更精确:不是"有没有门"、也不只是"信号类型",而是唯一空缺的"GT-free / 无外部 oracle 的概念级正确性"。⏰ 这三篇均 1–4 月内、部分为防御性公开/预印本,投稿前必重扫(见 §7.6.6)。

7.6.4 🔴 诚实的证据强度分级(关键)

强度 覆盖 论文可否声称
高(全文穷举) SEMA / SAGE / Self-Sizing Hopfield v3 · + 第四轮全文核实:Reservoir / GDumb / MIR / GSS / iCaRL / DER++ / CN-DPM ✅ 可写"全文穷举确认其判据不含正确性成分"
中(定向核验+代码/综述交叉) DEN / HAT · + 第四轮:生成式回放/CLS(DGR/FearNet/BI-R,BI-R 经二手 2509.00047 确证)、2606.03787 surprise 门、Write-Time Gating 2603.15994 / TRUSTMEM 2606.25161(2026 一手,方法/摘要级)、族 5 局部学习(FF/PC/EqProp/Hopfield 容量/recall-gated/self-sizing) ⚠️ 写"经定向核验",不宜声称穷举
🔴 零(第四轮后仍未覆盖) 广义 LLM-agent 长期记忆写入策略的穷举——A-MEM / MemGPT / Generative-Agents reflection + 每月新增的 26xx 预印本流,本轮仅抽样 ~6 个对象(LOCI/Write-Time Gating/TRUSTMEM/SAGE/2603.04549/AURA),未穷举 ❌ 仍不得声称"已确认无",只能写"定向核验未见"

✅ 第四轮闭合了头号卡点:族 6(回放选择准则)与族 5(局部学习)已从"零覆盖"升级到"高/中"。所有"回放选择准则算不算准入门控"的问题已回答:reservoir/GDumb/GSS/iCaRL/DER++ 是真准入门(信号 = 随机/类别平衡/梯度多样性/代表性),MIR 是检索门非准入门,CN-DPM 是架构原生两段式(似然门),生成式回放/CLS 无逐项门(无条件/睡眠调度回放)——无一用概念级正确性。 🔴 新的残余白区:广义 agentic 记忆写入门(2026 每月新增,正是"写入侧准入控制"被快速填补的方向)只抽样、未穷举——这是最可能藏未来反例的地方,投稿前必重扫(§7.6.6 ⏰)。

7.6.5 两篇必核候选——第四轮已一手定性(悬案关闭)

论文 第四轮一手裁决(finder+verifier 一致,均全文/HTML) 对主张
CN-DPM (arXiv:2001.00689) ✅ 确立:确是架构原生两段式——WAKE(责任度 Eq.8,argmax=新组件则泊入 STM,暂不巩固)→ SLEEP(STM 满则训练新专家并离散加入永久池、清空 STM)。扩容信号 = DP/CRP 先验 × 数据似然(poorly-explained→扩容,novelty-under-likelihood + 容量先验)。无任何正确性/verifier 成分;且分类设定下非 GT-free(标签 y 进 p(y|x)),即便给标签,p(y|x) 是"拟合优度"且朝 poor-fit 方向触发扩容——与正确性门方向相反。 ✗(信号=似然+容量+新颖)
arXiv:2606.03787 ✅ 确立:真实存在 = "Worth Remembering: Surprise-Gated Robot Episodic Memory"(Gorlo/Wise/Speranzon/Carlone,MIT+Lockheed)。门 = V-JEPA-2 隐空间贝叶斯惊奇 s(t) 的局部极大 > 稳健阈 τ=med(s)+γ·MAD(s) 才把 8 帧写入长期 episodic memory。是真二元写入门、且 GT-free,但信号 = 预测误差/惊奇 + 表征新颖(unexpectedness ⟂ truth:一个"惊奇但错误"的观测同样越阈)。 ✗(信号=惊奇+新颖)

新的最锋利近邻(第四轮浮现,须持续追踪):LOCI(TDCommons dpubs 11091,Reflection-Gated Crystallization,2026-07-21)——"一条 thought 只有被later externally-produced outcome 确认后才 crystallize 成持久事实"。这是目前最接近正确性门的机制,且作者称其为 anti-hallucination by construction。但仍非我方反例:(1) 它的正确性来自外部结果 oracle,不是无 GT 的自验证;(2) 是非同行评审的防御性公开,引用权重弱。→ 它恰好把我方 delta 钉死为"GT-free / 无外部 oracle"。

7.6.6 引用陷阱(会造成实质错误)

  • 🚨 arXiv:2507.10443 必须钉死 v3:v1/v2 是完全不同的另一篇("Information Must Flow…")。且 v3 是单作者预印本,只作"机制先例"引、不作科学结果引。

  • SEMA:是"z 分数归一化后的重构误差",非原始重构误差。

  • DEN:"无外部真值参照"读死了不成立(有监督损失就是对标签算的)→ 改为"无逐条内容级真伪判断"。

  • HAT:驱动目标是"任务损失 + 容量正则",非纯任务损失。

  • SAGE:比较范围是 memory scope,非全局记忆库。

  • 🚨 GDumb:arXiv:2007.05003 是误号(实际解析到一篇图主动学习论文)。正确引用 = Prabhu, Torr, Dokania, GDumb, ECCV 2020(LNCS 12347, DOI 10.1007/978-3-030-58536-5_31);未见干净的独立 arXiv 号,勿沿用错号。

  • 2606.03787:一手已确证存在(Gorlo et al., MIT+Lockheed),标题为 Worth Remembering: Surprise-Gated Robot Episodic Memory;"预测误差二元写入门"这个 gloss 属实。注意它是机器人视觉 episodic memory,域内本就没有"概念真值"对象。

  • TRUSTMEM(2606.25161):faithfulness 指对当前 chunk / 既有记忆状态的忠实度(防幻觉),不是世界真值——这是"trustworthy consolidation"命名最易被误读为反例之处,投稿引用时必须点破该区分。

  • ⏰ 2026 时效风险(已扩大):SAGE(2605.30711) / Hopfield v3(2507.10443) / 2606.03787 / Write-Time Gating(2603.15994) / TRUSTMEM(2606.25161) / LOCI(TDCommons 11091, 2026-07-21) 距今仅 1–4 个月,全部直接落在"写入侧准入控制"这个正被快速填补的方向;LOCI 更是非同行评审防御性公开。COLM/ICLR 2027 投稿前必须重扫这一簇,并重跑一次族 6/agentic 记忆的关键词穷举。

7.6.7 ★ 第四轮总裁决(族 5/6 对抗补全)

状态:第四轮 deep-research 完成(12 目标 × [发现员 + 怀疑复核] + 1 总裁决 = 25 agent,0 error)。本轮被指定去证伪狭义主张,尤其头号卡点族 6。 结果:holds-with-caveat——12 目标 finder+verifier 全部一致、0 反例、0 refute。狭义否定命题在族 4/5/6 全覆盖范围内存活;caveat 是"代理表要扩、delta 要收紧",属于让主张更锋利,不是被削弱。

逐簇裁决

簇 结论 信号 证据深度
族6 回放选择准则 无反例。reservoir/GDumb/GSS/iCaRL/DER++ 是真准入门;MIR 是检索门非准入门;生成式回放/CLS 无逐项门 随机·类别平衡·梯度多样性·代表性·loss干扰·生成密度+睡眠调度 高(6 经典全文)/ 中(CLS 方法节)
族5 局部学习 无反例,且多为"机制缺席"(FF/PC/EqProp 无 episodic 门,量词空真);Hopfield 靠构造存储、容量=被动饱和非门;recall-gated/self-sizing 是 GT-free 但信号 = 熟悉度/表征新颖 goodness/自由能/惊奇·容量·召回重叠·相似度 中(方法/算法级)
CN-DPM(必核①) ✅ 确立 = 架构原生两段式 WAKE/SLEEP;扩容 = DP 先验×似然 似然+容量+新颖(非正确性;分类下非 GT-free) 高(全文两遍)
2606.03787(必核②) ✅ 确立 = 真实的 surprise-gated robot episodic memory 贝叶斯惊奇=预测误差+新颖(GT-free 但非正确性) 中-高(2026 预印本一手两遍)
2026 agentic 记忆写入门 无 GT-free 概念真伪门;最锋利近邻 LOCI 用外部结果 oracle provenance·faithfulness·可靠度·外部 oracle 中(一手抽样,未穷举)

论文现在能/不能声称

  • ✅ 能:跨族 1–6 与 2026 agentic 记忆,没有任何永久固化门用"无 GT / 无外部 oracle 的概念级正确性"信号——现有信号穷尽落在十类代理(§7.6.2 读法 1)。族 1–3 + 族 4/5/6 经典对象为全文穷举级。
  • ✅ 能:把 delta 收紧为两条正交轴——(信号) GT-free 概念正确性 × (基质) 参数/架构级巩固;最锋利的三个近邻(SAGE 几何新颖、Write-Time Gating provenance、LOCI 外部 oracle)各差一轴。
  • ⚠️ 必须:在 §7.6.2 把 provenance/faithfulness/reliability/coherence 写进代理表,并在正文显式区分"信任来源/忠实输入/标记矛盾"≠"无 GT 验证概念为真"——否则审稿人拿 TRUSTMEM/Write-Time Gating 的措辞击穿完备性。
  • ❌ 不能:把"广义 LLM-agent 长期记忆写入策略"(A-MEM/MemGPT/reflection + 每月新 26xx)写成"已穷举无反例"——本轮仅抽样 ~6 个,只能写"定向核验未见"。

§8 实验骨架

  1. 用构造语言,别用真汉语。 真"English-only"在规模上不可保证(Unicode / 代码注释 / 借词 / 泄漏)。构造一门语义已知、可控与英语距离的语言 → 保证新颖性 + 有 ground truth 供最终打分,一举绕开污染争议。 若坚持真语言,走 MTOB 的 "gain from teaching" 路线并切断平行样例捷径(回应 Aycock)。

  2. 接受准则做成三臂对照:① 语义熵(自洽基线)② 压缩增益阈值 ③ EIG/epistemic 收敛。 关键指标:能否拒绝"自信且一贯错误"的概念——语义熵必失分处,就是你赢的地方。

  3. 污染抵抗 = 一等公民实验。 给学习者一个正确概念 + 一个错误概念,展示:

    • (a) 正确概念组合泛化到未见搭配

    • (b) 错误概念被验收准则拦下

    • (c) 持久化后不泄漏到另一个实例(借 PersistBench 的 cross-domain 测法)

  4. 持久层选择:先用外部记忆跑通闭环(易控、隔离 trivial),再上 per-user LoRA 做"内化"消融。

  5. 主动学习闭环:让学习者形成假设 → 生成测试句 → 向老师提问 → 被纠正。 把"反思"具体化为"假设-检验-信息增益",同时用来解 gavagai 欠定性。


§9 待办与开放问题

9.1 调研进度

  • 第一轮 deep-research(七主题定位) — 22 源 / 96 主张 / 25 验证(20 确认 5 否决)

  • 第二轮 deep-research(架构) — 26 源 / 130 主张 / 25 验证(21 确认 4 否决);§7 已重写

  • 第三轮 deep-research(族 4/5/6,对抗式) — 22 源 / 110 主张 / 25 验证(10 确认 15 否决);推翻广义主张,见 §7.6

    ✅ 成果:找到 4 个真门控(DEN/SEMA/SAGE/Hopfield)→ 贡献声明收紧为"信号类型";SAGE 定为最近先例。 🔴 仍未完成:本轮族 6 实质零覆盖、族 5 局部学习一侧未覆盖 → 已由第四轮闭合(见下)。

  • 第四轮(对抗式补全族 5/6) — 12 目标 / 25 agent(发现员+怀疑复核+总裁决)/ 0 反例 0 refute;狭义主张 holds-with-caveat,见 §7.6.7

    ✅ 成果:族 6(回放选择准则)与族 5(局部学习)从"零覆盖"升级到高/中;头号卡点闭合。reservoir/GDumb/GSS/iCaRL/DER++ 是真准入门(随机/类别平衡/梯度多样性/代表性),MIR 是检索门非准入门,CN-DPM ✅ 确立为架构原生两段式(似然门),生成式回放/CLS 无逐项门,2606.03787 ✅ 确立为 surprise 门——无一用概念级正确性。 ⚠️ caveat:2026 agentic 记忆写入门(Write-Time Gating/TRUSTMEM/LOCI)引入了原五类外的新代理(来源信誉/对源忠实/可靠度/一致性/外部 oracle),但均非"无 GT 概念真伪"→ §7.6.2 代理表已扩到十类,delta 收紧为"GT-free / 无外部 oracle"。 🔴 新残余白区:广义 LLM-agent 长期记忆写入策略未穷举(仅抽样 ~6 个),只能写"定向核验未见"。

  • 主题 5–6(持久化 + 记忆安全)专项补验——第一轮 🔍 全部未经对抗验证

  • 主题 7(接地 / gavagai)专项补验

  • ⏰ 投稿前重扫:SAGE / Hopfield v3 / 2606.03787 / Write-Time Gating(2603.15994) / TRUSTMEM(2606.25161) / LOCI(TDCommons 11091) 距今仅 1–4 月,"写入侧准入控制"方向正被快速填补,空白结论有过期风险;并重跑一次广义 agentic 记忆写入门的关键词穷举(A-MEM/MemGPT/reflection + 每月新 26xx)

9.2 关键开放问题

  1. 是否存在真正无需答案库的"正确性"准则——超越语义熵的自洽检测、超越 EIG 的 oracle 依赖?压缩/MDL 是最可能未被占据的路线。
  2. MTOB+RL 的"引用式"习得能否推广到语言之外的一般新概念?能否外化为可复用表征而非一次性上下文使用?
  3. 持久化与隔离如何与无 GT 验证耦合?未经验证的概念一旦固化,如何避免固化污染与跨对话者串味?
  4. 在没有共享 ground truth 的一对一指涉下,"隔离化的指物学习"能否原则上收敛到确定概念,还是本质上存在不可判定性(gavagai)?

架构侧(第二轮新增)

  1. 稀疏槽级写入真正的崩溃曲线在哪里? 已知 1000 条 / 10,000 步仍未崩,但上界(10⁴?10⁵?)与崩溃形态完全未知,且从未与 ROME/MEMIT 同基准对比。→ 低算力、高价值、当前完全空缺。
  2. 能否把 HOPE/CMS 的频率分层巩固 与 Memory Layers 的槽级可寻址写入 合成一个架构,并在低频(巩固)层写入前插入准入门控?→ 这正是核心空白,但无任何已验证工作尝试过,其训练稳定性与是否引入新的路由/干扰问题均属未知。
  3. "按对话者隔离"能否做成架构性(数学上零干扰)保证——例如把 product-key 记忆池的 key 空间按 uid 硬分区?→ 8 篇一手论文中 user/speaker/interlocutor 命中全为零,该问题尚未被提出。
  4. 除 surprise(预测误差)与 TF-IDF(槽访问频次)之外,是否存在可在无标准答案下计算的、知识级而非参数级的准入判据——自洽性 / 多次复现一致性 / 跨会话稳定性 / 与已固化知识的冲突检测?→ 现有全部门控都是误差驱动或统计驱动,没有一个触及"这条是否为真 / 是否值得"。

门控侧(第三轮新增)

  1. ✅ 已回答(第四轮):族 6 回放选择准则的信号已穷尽——reservoir=随机/均匀、GDumb=类别平衡、GSS=梯度多样性、iCaRL=特征代表性、MIR=loss/梯度干扰(且是检索门非准入门)、DER++=reservoir(标签仅进 loss)、生成式回放/CLS=生成密度+睡眠调度。没有一条用正确性/可信度代理(外部 verifier / self-consistency / 事实核查分数);2026 agentic 记忆门用到的 provenance/faithfulness/reliability 也不是概念真伪。→ 头号卡点关闭;残余仅"广义 agentic 记忆未穷举"。
  2. ⚠️ "按对话者隔离"能否做成数学上零干扰的架构性保证?→ 第三轮三条互相矛盾的断言(OPPU per-user LoRA 零干扰、HAT 硬掩码零干扰、共享路由器是干扰入口)全部未通过验证——该子问题目前完全无定论,任何方向都不可写入论文。特别要查:在线增长时共享路由器是否会把旧类样本重分配给新专家(路由崩溃)。(第四轮未触及隔离侧,仍悬。)
  3. ✅ 已回答(第四轮):CN-DPM(arXiv:2001.00689)就是把**巩固算子做成架构原生组件、且门控在前(WAKE 路由到 STM)、巩固在后(SLEEP 训练新专家入永久池)**的两段式先例——但其准入信号是 DP 先验 × 似然(novelty-under-likelihood),不是正确性。加上 Self-Sizing Hopfield v3(滞回律)、2606.03787(惊奇门),"架构原生 + 巩固前门控"已被多次实现,唯独门控信号从没用过概念正确性——这正好把贡献边界钉在"信号"而非"结构"。
  4. 🆕 (第四轮新增) trust/faithfulness/provenance 门与"概念正确性"门的边界能否做成一个可判别的评测轴?→ Write-Time Gating(信任来源)/ TRUSTMEM(忠实输入)/ LOCI(外部结果确认)三者都貌似在做"可信写入",但都不验证概念本身为真。能否构造一个测试:让这些门在"来源可信但概念错误 / 来源存疑但概念正确"上系统失败,从而经验性地隔离出"概念正确性"这一独立信号? 这既是动机演示也是最便宜的 head-to-head baseline。

9.3 立论包(第四轮后定稿——狭义主张已站住,进入写作)

触发条件("族 6 清空 + 狭义主张站住")已满足(§7.6.7),据此产出三件投稿素材。

9.3.1 一页 Proposal

工作题目:Learning in Referencing: A Correctness-Gated Consolidation Organ for Post-Training Concept Acquisition(暂)

问题设定:LLM 的概念只能在预训练时建立。我们要让模型在预训练之后,于引用(推理/交互)期建立满足四性质的新概念——全新(P1) · 无 GT 自验证(P2) · 持久(P3) · 按对话者隔离(P4)。本研究聚焦其最硬的一环:在没有答案库、也没有外部 oracle 的前提下,用什么信号决定一个新习得概念是否够格被永久固化?

贡献声明(按四轮调研逐字收紧)

  • C1|定位(negative claim,四轮实证):跨持续学习 / 记忆架构 / agentic 记忆的全部永久固化门控,其准入信号穷尽落在十类代理——随机·类别平衡·损失/似然·参数漂移·容量/稀疏·表征或几何新颖·梯度干扰/多样性·代表性·(有标签下的)不确定性·来源信誉/对源忠实/可靠/一致。"无 GT / 无外部 oracle 的概念级正确性"一列为空。

    🔴 划线句已被第八轮推翻(GATES 2602.20574 + LMSI 2210.11610 = 已实现的 GT-free 一致性准入门),如实撤回。 修正后的 C1(第八轮定稿,见 REPORT §4):空白收紧为两轴组合—— 判据类型 = 压缩增益/MDL × 门控环节 = 推理期按条持久写入(已有 GT-free 门均作用于训练期)。

🔴 第十二轮(2026-08-04 投稿前重扫)作废后半句:ConsistencyGate(arXiv:2607.22962,2026-07-25) 就是 GT-free 的推理期、按条、持久写入准入门 ⟹ 门控环节那条腿失守。 现存措辞:新颖性只剩「判据类型 = 压缩增益/MDL」一轴(全族词边界命中仍为 0)。 投稿措辞以 paper/DRAFT_INTRO_RELATED_WORK.md 为准。

  • C2|机制:提出压缩增益门控(compression-gain admission)——一个概念只有当"把它并入该对话者的持久知识后、对其后续输入的描述长度/困惑度显著下降"才毕业。地基 = Delétang Language Modeling Is Compression(ICLR 2024, 2309.10668)。这是唯一填补 C1 空缺的信号:无答案库、GT-free、无外部 oracle。必要非充分项:跨时间稳定性(语义熵)+ epistemic 收敛(EIG)。
  • C3|架构:把 C2 作为巩固门插入三层记忆器官(§9.3.3);L1 情景记忆的 product-key key 空间按 uid 硬分区 → 隔离(P4)成为数学零干扰的架构保证(§7.4 已论证该点在文献中零竞争)。
  • C4|评测(⚠️ 措辞已按 DESIGN_COMPRESSION_GATE.md §0 收紧):构造能区分"接受正确概念 vs 拒绝【模型自信且一贯地误解了教学内容】的概念(E1)"的受控 benchmark——语义熵、SAGE 几何门、surprise 门、TRUSTMEM 忠实门都会在 E1 上失分,压缩门在此处赢。

    🔴 不可写成"拒绝一切错误概念":必须区分谁错了。E1(模型误解)压缩门拒绝 ✅;E2(老师一贯教假话)压缩增益反而高(模型确实学对了老师的用法)→ 压缩门会接受,这是设计边界,不是缺陷。E2 属 provenance/来源信誉门(Write-Time Gating / TRUSTMEM)的射程,与本机制正交可组合。 正面表述:压缩增益验证的是对该对话者用法的语义保真度,不是世界真值——它正是 Quine gavagai 欠定性(§3.7)的可计算操作化。

与关键先例的 delta(两条正交轴:信号 × 基质)

先例 门控信号 基质 我方 delta
语义熵 (Nature 2024) 自洽(不一致) 外挂检测器 自洽≠正确;压缩门抓"自信且一贯错误"
SAGE (2605.30711) 几何新颖度 s_vMF 非参数文本库 信号→正确性;基质→参数/架构巩固
Self-Sizing Hopfield v3 (2507.10443v3) 归一化损失比 联想记忆 信号→正确性
CN-DPM (2001.00689) DP 先验 × 似然 参数专家池 信号→正确性(且反 poor-fit 方向)
2606.03787 贝叶斯惊奇 robot episodic 信号→正确性(惊奇 ⟂ 真伪)
Write-Time Gating (2603.15994) 来源信誉/可靠度 文本库 信号→概念真伪(非 provenance)
TRUSTMEM (2606.25161) 对源忠实度 记忆库 信号→世界真值(非对输入忠实)
LOCI (TDCommons 11091) 外部结果 oracle 事实库 信号→GT-free 自验证(去掉外部 oracle)

实验表(详见 §8)

实验 目的 关键指标
三臂接受准则 压缩门 vs 语义熵 vs EIG/epistemic 拒绝"自信且一贯错误"概念的 AUC(我方独赢点)
污染抵抗(一等公民) 正确概念组合泛化 / 错误概念拦下 / 不跨实例泄漏 组合泛化准确率 + cross-domain 泄漏率(对标 PersistBench 53%)
head-to-head vs SAGE 把 τ 路由变量换成压缩分数 LoCoMo 上"全新错误事实被 ADD"的率(SAGE 必失)
崩溃曲线 稀疏槽 N 次写入 vs ROME/MEMIT 同基准 collapse 步数(§7.3.4 空实验)

9.3.2 Related-Work 段落(投稿草稿)

⚠️ 本节已被替代(2026-08-01):末句的 "the first to make GT-free, oracle-free concept correctness … the admission criterion" 在第八轮被 GATES/LMSI 证伪,本段仅存档。 投稿版 Introduction + Related Work 见 paper/DRAFT_INTRO_RELATED_WORK.md(含 GATES/LMSI 正面让位、OPCD "not pre-evaluated" 空白锚点、三条禁令自查表)。

Continual and lifelong learning has produced a rich taxonomy of what to keep: reservoir and class-balanced sampling admit examples by randomness or label counts [GDumb, ECCV'20; Chaudhry'19]; gradient-based selection (GSS) and maximally-interfered retrieval (MIR) choose by gradient diversity or interference [Aljundi'19]; herding stores class-representative exemplars [iCaRL, CVPR'17]; dark experience replays reservoir-sampled logits [DER++, NeurIPS'20]. Architecturally, dynamically-expandable and Dirichlet-process models gate when to grow on training loss, parameter drift, or data likelihood [DEN, ICLR'18; CN-DPM, ICLR'20], and modern write-side gates admit facts by geometric novelty [SAGE'26], normalized-loss hysteresis [Self-Sizing Hopfield'26], or Bayesian surprise [2606.03787]. A 2026 wave of agent-memory work gates writes on trust proxies—source reputation and reliability [Write-Time Gating'26], faithfulness-to-source [TRUSTMEM'26], or externally-confirmed outcomes [LOCI'26]. Across all of these, the admission signal is a proxy—loss, drift, capacity, novelty, gradient geometry, representativeness, (labeled) uncertainty, or source-trust/faithfulness—never a ground-truth-free assessment of whether the newly acquired concept is itself correct. Semantic entropy detects inconsistency, not incorrectness [Farquhar, Nature'24]; naive self-reflection does not improve without an external verifier [Huang, ICLR'24]. We are, to our knowledge, the first to make GT-free, oracle-free concept correctness—operationalized as compression gain [Delétang, ICLR'24]—the admission criterion for parametric, per-interlocutor consolidation.

(引用键待补齐为正式 bibkey;negative claim 的措辞已按 §7.6.4 证据强度:经典对象"exhaustively verified",2026 对象"to our knowledge / targeted search"。)

⚠️ 末句需按 C4 收紧再投:GT-free, oracle-free concept correctness → 建议改为 GT-free, oracle-free **fidelity of an acquired concept to the interlocutor's usage**, 并补一句划界:Source-trust gates [Write-Time Gating; TRUSTMEM] address whether the teacher is reliable; ours addresses whether the model's hypothesis matches what the teacher means—the two are orthogonal and composable. 理由见 DESIGN_COMPRESSION_GATE.md §0(E1/E2 划界)。不改会被 E2 反例击穿。

9.3.3 三层架构 + 最小可跑实现

架构(器官,非替换注意力——§7.5)

L0 工作态      SSM 定长状态 / KV        会话内 · 易失
   │ (推理期写入路径,借族1 TTT/Titans 式)
L1 情景记忆     product-key 稀疏槽        可写 · 廉价 · 可逆 · 【key 空间按 uid 硬分区】→ P4 零干扰
   │
⚙️ 巩固门(原创) idle 运行 · per-user      判据 = 压缩增益(核心) + 跨时间稳定(语义熵,必要非充分) + epistemic 收敛(EIG)
   │           规则:只有跨足够多次交互、且压缩增益持续 > 阈值 的概念才毕业
L2 巩固核      低频稀疏记忆层             仅毕业槽写入 · 配 L1 回放护旧知识(借 HOPE/CMS 频率分层)

巩固门接口(伪代码)

on_idle(user_uid):
  for concept c in L1[uid].pending:
     dl_before = code_length(recent_inputs[uid] | persistent[uid])
     dl_after  = code_length(recent_inputs[uid] | persistent[uid] ∪ c)   # 压缩增益
     stable    = semantic_entropy(c) < τ_ent                              # 必要非充分
     converged = epistemic_uncertainty(c) < τ_eig                        # 主动追问收敛
     if (dl_before - dl_after) > τ_gain and stable and converged and c.hits ≥ k:
         graduate(c → L2[uid])      # 仅此路径写永久层
     elif c.age > T_max: evict(c)   # 未毕业即淘汰,天然可逆

最小可跑实现(零预训练算力——§7.5.1 已证可行)

  • base:冻结 Qwen-2.5-0.5B(retrofit 记忆层已在该规模独立复现,2604.05248 / 2605.03229)。
  • 记忆池:1M 槽 product-key(借 Sparse Memory FT 2510.15103),key 空间按 uid 前缀硬分区。
  • 门控:压缩门是纯算法组件,on/off 可控——这正是当前文献缺失、且不需算力的那块。
  • 受控实验矩阵:门控 {on, off} × 顺序写入 N∈{10²,10³,10⁴} 条 × {正确概念, 自信错误概念} × 旧能力保持曲线 × 与 ROME/MEMIT 同基准崩溃曲线。
  • 数据:构造语言(§8,语义已知、可控 OOD、有 GT 供最终打分、绕开污染争议),切断 Aycock 平行样例捷径。
  • 首个可发结论:压缩门在 E1(模型自信且一贯的误解) 上 AUC 显著高于语义熵/SAGE 几何门/surprise 门——即 §9.3.1 的 C4 独赢点。

本节已展开为两份独立设计文档:

  • 机制:DESIGN_COMPRESSION_GATE.md — 形式化(两部分 MDL + 留出轮次 + 安慰剂对照)、E1/E2 划界、失分表、失败模式、消融矩阵
  • 数据:DESIGN_CONCEPT_BENCH.md — 构造语言、gavagai 对 G1–G5(把 E1 构造出来)、切断 Aycock 捷径的教学协议、冲突词隔离测试、实施顺序

✅ P0 已跑完(2026-07-28) → research/learning-in-referencing/p0/README.md 核心信号成立,但观测量被实测修正了:压缩对象必须是老师的用词决策序列,不是自由陈述。

  • 自由陈述版:预测力 margin +0.68 nats(5/8, p=0.36 不显著),词级 ≈ 0,92% 的表面胜出来自长度罚 → ❌
  • 决策序列版:+4.92 nats(8/8, p=0.0039),安慰剂对照 8/8,4/8 项上误解的增益为负 → ✅ 扩展到 22 items × 5 类歧义后(P0d/P0e):margin +4.08 nats 95%CI[+2.52,+5.70],19/22, p=0.00043;z 校准 AUC 0.857。
  • ✅ z 校准的设计预测精确成立:M′ 平均 −0.22 vs 零分布中心 −0.27(差 0.05 nats)——M′ 确是零分布典型成员
  • ✅ 单候选阈值在【基座有能力的类型】内成立:仅 G2/G3 时 AUC 1.000, τ=+0.75(全 5 类混合则 0.857 ❌)
  • 🔴 第二前置条件:ρ(能力探针, margin)=+0.857 —— 门的判别力继承自基座能力,校准救不了
  • 🔴 作用域:属性/范畴/材料强(AUC 0.86–1.00);关系类(论元顺序)AUC 0.562 ≈ 随机(定义完全不改变预测)
  • 🔴 我方"双向判别更强"的预测被数据推翻,已撤回
  • ⏳ 缩放测试(3B/7B)受下载带宽阻塞,"放大可解"仍是未验证预测

附录:文献总表

A. 理论基座(ICL:定位 vs 习得)

状态 文献 要点
✅ Pan et al. 2023, ACL Findings — arXiv:2305.09731 TR vs TL 正典二分
✅ Xie et al. 2022, ICLR — arXiv:2111.02080 ICL = 隐式贝叶斯 / locating latent concepts
✅/❌ von Oswald et al. 2023, ICML — arXiv:2212.07677 构造成立;mesa-optimizer 强版本 0-3 被否
✅ CoLLEGe, COLM 2024 — arXiv:2403.15362 元学习概念嵌入生成
⚠️ Gupta et al. 2025 — arXiv:2501.02825 随机 DFA:LLM < n-gram
❌ Min et al. 2022, EMNLP — arXiv:2202.12837 随机标签(1-2 被否,慎引)

B. 情境内教新语言

状态 文献 要点
✅ MTOB, ICLR 2024 — openreview tbVWug9f2h 一本语法书学 Kalamang
⚠️ Aycock et al., ICLR 2025 — openreview aMBSY2ebPw 增益来自平行样例(关键反驳)
⚠️🔍 Hu et al. 2026 — arXiv:2606.06428 RL 激发未见语言上下文学习;优势绑定引用资源

C. 污染 / 新颖性控制

状态 文献 要点
✅ Lu et al. 2024, ACL — arXiv:2309.01809 需排除 ICL/记忆/语言知识三因子
🔍 Biasless / impossible languages — arXiv:2510.07178 人造语言探针工具箱
🔍 LogitTrace — arXiv:2509.20909 逐层 logit 污染检测

D. 无 GT 自验证 ★ 主战场

状态 文献 要点
✅ Farquhar et al. 2024, Nature — s41586-024-07421-0 语义熵(测自洽 ≠ 正确)
✅ Kobalczyk et al. 2025, ICLR Spotlight — arXiv:2502.04485 EIG 主动澄清(选择无 GT,回答需 oracle)
✅ Huang et al. 2024, ICLR — arXiv:2310.01798 内在自纠失败(Reflexion 路线红线)
🔍★ Delétang et al. 2024, ICLR — arXiv:2309.10668 Language Modeling Is Compression(MDL 地基,无人占用)
🔍 Active Concept Learning 2026 — arXiv:2602.06818 query-driven 结构化概念获取
🔍 Silent Scholar 2025 — arXiv:2512.20884 epistemic 不确定性收敛

E. 持久化

状态 文献 要点
🔍 Wu et al., ACM CSUR 2025 — arXiv:2404.16789 CL-LLM 权威综述(全假设训练信号)
🔍 MEMOIR 2025 — arXiv:2506.07899 终身模型编辑
🔍 Model Editing at Scale — arXiv:2401.07453 ROME/MEND 10–20 次、MEMIT ~40 次崩溃

F. 隔离 / 防污染

状态 文献 要点
🔍 PersistBench 2026 — arXiv:2602.01146 跨域泄漏 53%、sycophancy 97%
🔍 Dash et al. 2026 — arXiv:2606.04329 记忆投毒 + MPBench
🔍 Lin et al. 2026 — arXiv:2604.16548 LTM 安全综述 + VMG
🔍 Personalized LLM Survey 2025 — arXiv:2502.11528 OPPU per-user LoRA(隔离载体)

G. 符号接地 / 不确定性

状态 文献 要点
🔍 Lederman & Mahowald, TACL 2024 — arXiv:2401.04854 新颖指称问题
🔍 Coelho Mollo & Millière — arXiv:2304.01481 向量接地问题(五种接地)
🔍★ Harnad 2024 — arXiv:2402.02243 Indirect Verbal Grounding(思想实验的哲学正名)
🔍 On the Referential Capacity of LMs, Comp. Linguistics 2025 内在论 rejoinder(争论仍活跃)
🔍 Pavlick 2023, Phil. Trans. R. Soc. A 符号与接地综述(中间立场)
🔍 Gavagai in the Machine(预印本) 仅取 Quine→LLM 指称欠定论证

H. 架构(第二轮调研)

族 1|测试期训练 / 快权重(推理期写入路径 ✓,但全族易失)

状态 文献 要点
✅★ Nested Learning, Behrouz et al., Google, NeurIPS 2025 — arXiv:2512.24695 TTT 全族被自家作者定性为"参数化上下文学习,context 一撤即不留"(不利承认);含 HOPE / CMS
✅ Titans — arXiv:2501.00663(NeurIPS 2025) surprise 门控写 M_t;⚠️ "persistent memory" 是命名陷阱
✅ Miras: Moneta/Yaad/Memora — arXiv:2504.13173 保留正则化门族;四轴设计词典无一轴对应巩固/持久
✅ Gated DeltaNet — arXiv:2412.06464(ICLR 2025) fast weight + delta 写 + 擦除门;已被 Qwen3-Next 采用 🔍
✅ TTT-NTP — arXiv:2606.21803 闭式 ridge 写 W^down;每样本回滚;⚠️ 2026-06 极新,无第三方复现
✅ TTT-E2E — arXiv:2512.23675 每 ~1K token 梯度步;"reset after each prediction"
🔍 Titans Revisited — arXiv:2510.09551 第三方复现:Titans 全部评测在单序列内

族 2|可寻址稀疏记忆(跨会话持久 ✓,但测试期只读)

状态 文献 要点
✅★ Sparse Memory Finetuning, FAIR at Meta — arXiv:2510.15103 旧能力跌幅 89%(fullFT) / 71%(LoRA) / 11%(稀疏);TF-IDF 槽定位门控;⚠️ 四点方法学限定
✅ Memory Layers at Scale — arXiv:2412.09764 1M 槽 product-key;测试期只读;作者自陈需"尚未发明的新学习方法"
🔍 Qwen-2.5-0.5B retrofit 复现 ×2 — arXiv:2604.05248 / 2605.03229 证明 0.5B 规模可复制(可行性关键证据)

族 3|SSM / 线性注意力(叠加只是被搬进状态矩阵)

状态 文献 要点
⚠️ Gated DeltaNet — arXiv:2412.06464 "memory collisions";正交 KV 对数量 ≤ 模型维度;delta 缓解写入期干扰但不提高容量上界
🔍 KATA 2607.17419 / HOLA 2607.02303 / Sparse Delta Memory 2607.07386 三篇 2026 后续均确认容量墙未破;⚠️ 二手线索,未一手核对

重要区分:状态叠加是激活级、每序列重置的易失干扰;MLP 叠加是参数级永久干扰。二者不可混谈。

I. 架构(第三轮调研 · 族 4/5/6 门控)

族 4|模块化 / 可生长(有真门控,但信号是损失/新颖性/容量)

状态 文献 要点
✅ DEN — arXiv:1708.01547(ICLR 2018)+ 官方码 Lₜ>τ→扩容 + ‖Δw‖>σ→分裂;信号=损失/参数漂移;有任务边界
✅ SEMA — arXiv:2403.18886(CVPR 2025) 重构误差 z 分数合取→扩容;信号=表征新颖性;训练期·任务边界;⚠️ 写"z 分数归一化后"非原始误差
✅ HAT — arXiv:1801.01423(ICML 2018) 硬掩码 SGD 学出;无扩容判据;task ID 外部给定;正面支持我方
❌ OPPU per-user LoRA — arXiv:2402.04401 每用户无条件分配模块,无准入;作者自陈"如何筛选历史条目"是未来工作(作者级负证据);隔离零干扰断言 0-3 未过验证
✅ CN-DPM — arXiv:2001.00689(ICLR 2020) ✅ 确立(第四轮一手全文两遍):架构原生两段式 WAKE(责任度 Eq.8 路由→STM)/ SLEEP(STM 满→训新专家入永久池);扩容信号 = DP 先验 × 数据似然(novelty-under-likelihood + 容量);无正确性成分,分类设定下非 GT-free
❌ StaR-MoE — arXiv:2605.17571 无条件"每任务加一专家",无门控;共享路由器是干扰入口;4 条断言全否

族 5|局部学习 / 联想记忆(第四轮补全,无反例)

状态 文献 要点
⚠️ Self-Sizing Hopfield v3 — arXiv:2507.10443v3 双阈值滞回门;信号=归一化损失比+标签几何;在线逐条;🚨 必须钉 v3(v1/v2 是另一篇);单作者预印本;作者自陈"为假信息分配存储与真信息无异"
✅ Forward-Forward — Hinton 2022, arXiv:2212.13345;Equilibrium Prop — Scellier & Bengio 2017, arXiv:1602.05179;Predictive Coding — Millidge/Salvatori/Bogacz ✅ 无准入门(机制缺席,量词空真):三者是 backprop 替代的局部权重更新/推理规则,无 episodic 缓冲、无"写入永久存储"离散门。即便看信号:FF goodness=监督判别/熟悉度,PC 预测误差/自由能=惊奇/新颖,EqProp 直接吃 GT target——均非概念真伪。(更正:PC 生成式 / FF 无监督负样本可 GT-free)
✅ Modern Hopfield / DAM — Ramsauer 2008.02217, Krotov&Hopfield 1606.01164;Hebbian 抗遗忘界 — Fusi 级联/palimpsest ✅ 容量是被动饱和,非信号门:按构造 Hebbian 写入、无逐项 store/reject;过载=全局 blackout 非拒绝。抗遗忘界靠 recency/写入序/metaplastic 时标。两个 GT-free 离散近邻:recall-gated consolidation(Lindsey & Litwin-Kumar, eLife 2024,信号=召回重叠/熟悉度 SNR,会巩固"反复出现的假"、拒"真的一次性新颖");self-sizing Hopfield(表征新颖)——均非概念真值

agentic 记忆(★ 最近先例)

状态 文献 要点
✅★ SAGE — arXiv:2605.30711(2026-06,Duke) 显式 write-side novelty gate;ADD/UPDATE/NOOP;信号=几何新颖度(全文穷举确认无正确性成分);离我方最近,必须正面引用;非参数文本记忆库
✅ 2606.03787 = Worth Remembering: Surprise-Gated Robot Episodic Memory(Gorlo et al., MIT+Lockheed) ✅ 确立(第四轮一手两遍):真二元写入门、GT-free;门 = V-JEPA-2 隐空间贝叶斯惊奇局部极大 > τ=med+γ·MAD;信号=预测误差+新颖(惊奇 ⟂ 真伪);机器人域无"概念真值"对象。"1-2 落败"已翻案
⚠️ Write-Time Gating — Selective Memory for AI,arXiv:2603.15994(Zahn & Chana, 2026) 第四轮一手核实;write-time gating 为核心贡献;信号=复合 salience(来源信誉+新颖度+可靠度),摘要显式声明 "without oracle access to quality labels";GT-free 但为 provenance 代理,非概念真伪
⚠️ TRUSTMEM — arXiv:2606.25161(Yang et al., 2026) 第四轮一手核实;Memory Transition Verifier 三维=coverage+preservation+faithfulness;faithfulness=对当前 chunk/既有记忆的忠实度(防幻觉),非世界真值;命名最像"trustworthy"但仍不验证概念真伪→强化主张
⚠️ LOCI — TDCommons dpubs 11091(Reflection-Gated Crystallization, 2026-07-21) 第四轮一手核实;最锋利近邻:thought 仅被外部结果 oracle 确认后才 crystallize(作者称 anti-hallucination by construction);仍非反例:正确性来自外部 oracle、非 GT-free 自验证;且为非同行评审防御性公开。→ 把我方 delta 钉为"GT-free / 无外部 oracle"

族 6|回放选择准则 / CLS 巩固(第四轮全覆盖,无反例)

状态 文献 信号 / 准入门控 / 验证
✅ Reservoir sampling — Vitter 1985 Alg.R;Chaudhry 1902.10486;MER 1810.11910 随机/均匀(收 w.p. mem_sz/n + 均匀随机淘汰,内容/标签/正确性全盲);是真准入门;全文,finder+verifier 一致,变体穷举无 correctness
✅ GDumb — Prabhu/Torr/Dokania, ECCV 2020(⚠️ arXiv:2007.05003 是误号) 类别平衡计数 + 均匀随机淘汰;是真准入门;非 GT-free(需真标签定义平衡目标);全文 Alg.1 + 多源交叉
✅ MIR — Aljundi et al., NeurIPS 2019, arXiv:1908.04742 loss/梯度干扰(虚拟步 loss 增量,依赖 GT 标签);非准入门(检索/回放子集选择,准入实为 reservoir);全文(GEN-MIR 的熵项亦是标签空间置信度,非概念真值)
✅ GSS-Greedy — Aljundi et al., NeurIPS 2019, arXiv:1903.08671 梯度方向多样性(cosine 冗余);是真准入门(满时 add/evict);监督梯度非 GT-free;全文 Eq.7/9
✅ iCaRL herding — Rebuffi et al., CVPR 2017, arXiv:1611.07725 特征空间代表性/herding(运行均值逼近类均值);是真准入门(exemplar 集即持久存储,REDUCE 仅按 herding 序截断);监督;全文 Alg.4/5
✅ DER / DER++ — Buzzega et al., NeurIPS 2020, arXiv:2004.07211 随机 reservoir 准入;GT 标签仅作 DER++ 的 β·CE loss 系数、从不进入写入/选择决策(label-in-loss ≠ label-in-selection);是真准入门;全文 Alg.3
✅ 生成式回放 / CLS — DGR 1705.08690;FearNet 1711.10563;BI-R van de Ven, Nat.Commun.2020 生成密度/对抗建模 + 时近性/睡眠调度 + 自身软预测蒸馏(未验证信号);无逐项 correctness 门(DGR/BI-R 无条件回放,FearNet 按时批量转移);方法节(BI-R 经二手 2509.00047 确证)
⚠️ 对抗猎手 2023–2026 — PER 1511.05952;OCS 2106.01085;Toneva forgetting-events 1812.05159;LOCI TDCommons 11091;2603.04549 无一同时满足两轴:LOCI 用 correctness 但靠外部结果 oracle(非 GT-free);2603.04549 为 GT-free 但用 uncertainty(非 truth);PER/OCS/Toneva 落在 surprise/多样性/监督遗忘代理;方法/摘要级

族 6 小结:8 个对象、finder+verifier 全一致、0 反例。回放选择准则的信号已穷尽(随机/类别平衡/梯度干扰/梯度多样性/代表性/生成密度),没有一条用概念级正确性。头号卡点(§9.1 第四轮)关闭。残余仅"广义 agentic 记忆写入门未穷举"(§7.6.4 🔴)。


版本记录

日期 变更
2026-07-24 初版:§1–§9 + 附录 A–G(第一轮调研)
2026-07-24 §7 按第二轮架构调研重写;新增附录 H;§9.1 加入族 4/5/6 补验卡点
2026-07-24 第三轮(对抗式):新增 §7.6,推翻广义主张、贡献声明收紧为"信号类型";新增附录 I;§9.1/§9.2 更新
2026-07-24 第四轮(对抗式补全族 5/6):12 目标 / 25 agent / 0 反例 → holds-with-caveat。§7.6.2 代理表扩到十类并加 12 新行;新增 §7.6.7 总裁决;§7.6.4 证据强度重排(族 5/6 升为高/中,残余=广义 agentic 记忆);§7.6.5 关闭 CN-DPM/2606.03787 两悬案;附录 I 族 4/5/6 全部落地;§9.1 勾掉第四轮;§9.2 Q9/Q11 已回答 + 新增 Q12;§9.3 写入立论包(proposal + related-work + 三层架构最小实现)
2026-07-28 进入设计阶段:新增 DESIGN_COMPRESSION_GATE.md(机制)与 DESIGN_CONCEPT_BENCH.md(数据)。修正 C4 措辞:区分 E1(模型误解 → 压缩门拒绝 ✅)与 E2(老师教假话 → 压缩门接受,属设计边界);related-work 末句加收紧提示。§9.3.3 指向 P0 首跑实验。
2026-07-28 P0 实验跑完(首个实证结果) → research/learning-in-referencing/p0/。核心信号成立(决策序列 8/8, +4.92 nats, p=0.0039),但朴素实现失败(自由陈述 5/8, p=0.36,92% 胜出来自长度罚)。机制文档据此新增 §1.2b(观测量必须是决策序列)、§1.3 阈值警告、消融必报项 A0′/A0″。未解决:单候选阈值跨 item 不可分(AUC 0.875)。
2026-07-28 P0 续跑:per-item 校准 + 22 items 扩展集。z 校准(零分布 z 分数)AUC 0.797→0.906,设计预测「M′ 落在零分布中心」精确成立(差 0.05 nats)。v2 扩到 22 items×5 类:margin +4.08 nats 95%CI[+2.52,+5.70],19/22 p=0.00043。新增第二前置条件:ρ(能力探针,margin)=+0.857,门的判别力继承基座能力。作用域:G2/G3 内单候选阈值 AUC 1.000 (τ=+0.75);G4 关系类 AUC 0.562≈随机。撤回「双向判别更强」预测。

本文档随研究推进持续更新。第四轮已闭合头号卡点:族 5/6 全覆盖、0 反例,狭义主张 holds-with-caveat 存活(见 §7.6.7)。当前工作重心已转入 §9.3 立论包。两条硬约束仍在:(1) 广义 agentic 记忆写入门未穷举,只能写"定向核验未见"、不得写"已确认无";(2) SAGE / Hopfield v3 / 2606.03787 / Write-Time Gating / TRUSTMEM / LOCI 均为 1–4 月内预印本,投稿前必重扫(§7.6.6 ⏰)。