一句话:让 LLM 在预训练之后、于交互(引用)中建立经过验证的、永久的、按对话者隔离的新概念。
| 周期 | 2026-07-24 → 2026-08-05(13 天) |
| 调研 | 12 轮(第 12 轮 = 2026-08-04 投稿前重扫)对抗式 deep-research(第 3/4/6/7/8 轮被指定去证伪我方主张) |
| 实证 | P0–P13(含冻结确认集、跨模型家族、自然用法抽取与生成候选压力测试),单机 MPS |
| 自我推翻 | 31 处(见 §4——其中第 25/26 条推翻了参数化记忆线的全部结论) |
| 目标 | COLM / ICLR 2027 |
P12 在运行任何确认模型前冻结协议:开发集 seed 11;测试集为五个未见 seed, 150 items,其中 G1–G3 主域 90 对。主分数已严格改名为 placebo 校准的预测压缩, 不再称两段式 MDL。确认结果:Qwen2.5-1.5B AUC 0.949 [0.916, 0.977],Qwen2.5-3B 0.909 [0.860, 0.955],独立家族 SmolLM2-1.7B 0.811 [0.740, 0.878]。对应 ConsistencyGate-style support 为 0.370 / 0.440 / 0.581,语义熵为 0.230 / 0.249 / 0.439。
1.5B 开发集阈值在未见测试上得到 55.6% TPR / 9.5% all-negative FPR; 它在 3B 的 FPR 为 12.4%,且旧 decidability 阈值覆盖率降为 0,故撤回跨尺度通用阈值。 SmolLM canonical 保持 9.7% FPR、但 TPR 仅 28.9%,进一步证明覆盖率必须逐模型/提示校准。
对真实文本描述长度,三个模型在六个后续用法内的正净增益率均为 0; 因而下文凡出现“概念为自己的描述长度回本”均视为已被 P12 覆盖更新。 P13 中,直接写第一个生成候选平均损失 −2.278 nats;冻结门只收 25/90, 被收候选平均 +1.441 nats,有益准入精度 92.0%。两个事后解码 seed 保持同方向。
🔴 参数化记忆那条线(P5–P9)测到的不是"学会了一个词的含义"。 换掉提示里的那个词、其余一字不改,AUC 几乎不掉(落差 0.017–0.018; 每人两个词的设置下同样不掉,own−within = −0.005)。 它学到的是「为每位对话者写入一个持久的、按分区隔离的、与词无关的物体级偏置」。
仍然站得住 必须撤回 压缩增益门(P0–P4)——那条线里概念以文本存在,词是显式的 P5 I1「免检索地用上概念」 按对话者隔离(P3/P4)——隔离的是分区,与绑定到什么无关 P6 I2「与世界知识组合」 持久性、抗干扰这两个行为层面的观测本身 P7 I2「与另一个概念组合」 P8 I5 与 P9 跨读出方向的概念性解读 P10 追加的一条(更要命):把训练集改成两个词在同一物体上标签相反后, 记忆确实绑定到词了(L7:本词 0.925 → 换成含义相反的词 0.070,近乎完全翻转)。 但跨读出方向随之消失(F2 0.545 / F3 0.670,base 为 0.540 / 0.525; 而 P9 未绑定时是 0.935 / 0.945)。 ⟹ P9 那个漂亮的跨格式迁移,正是"没绑定到词"换来的。 参数化路线在测过的每一种配置里,最多只【完整】拿到两者之一。 🔴 P11 已把这句从"非此即彼"软化为"权衡曲线":词条记忆(按词的 token 触发) 完整拿到绑定(换成含义相反的词 → 0.080;换成无关的词 → 0.550 ≈ base,触发器不点火) 但跨格式只是部分(F3 0.775 vs base 0.525、上下文注入 0.995)。
⚠️ F2 那一格不构成提升:诊断后(P11b)相对 base 的增益仅 +0.030(σ 0.116), 逐用户符号翻转,n=8 下与 0 无法区分;且 base 自己在 F2 上就逐用户 0.20–0.84 ⟹ F2 对非上下文方法不是可靠仪器,跨格式主证据应以 F3 为准。 ⟹ 我方把点往前推了一格,没有到达上下文注入那个角。详见 §3.12 / §3.13 与 §4 #25 / #26。本报告其余部分凡出现"概念/学会"字样,读时都须带上这条限定。
原措辞把新颖性放在两轴:判据类型(压缩/MDL)× 门控环节(推理期按条持久写入, 🔴 理由是"已有 GT-free 门均作用于训练期数据/梯度准入"——这条理由本身已被证伪)。
重扫抓到 ConsistencyGate(arXiv:2607.22962,2026-07-25,晚于第十一轮): 它是 GT-free 的 write-time admission gate,作用于推理期、按条、持久的外部记忆写入。 🔴 ⟹ 「门控环节」这条腿失守,新颖性只剩「判据类型」一轴。
⟹ 定稿措辞(第五次收紧,含同轮第二次限定) 尚无方法以【压缩增益 / MDL 为判据】对【新条目的准入】做门控,且该压缩算在 【对话者后续的用词】上。 已有 GT-free 准入门用的是自洽度 / 新颖度 / 来源可信度,没有一个用描述长度 (全族含 DeMem 的词边界扫描:
description length/MDL命中 0)。
⚠️ 两条限定缺一不可,否则被 DeMem(2605.10870) 击穿: ① 压缩谁的行为——DeMem 压缩智能体自己的动作,我方压缩对话者的用词; ② 门决定什么——DeMem 决定预算下什么可以忘(分区),我方决定要不要写(准入)。 (DeMem 的失真定义为 regret、需观测奖励;按禁令 2 这只能作作用域区分,不得当卖点。) ("推理期按条持久"仍须写进问题设定,但不得再作为新颖性的一条腿。)
它的信号是自洽度(查询 LLM K 次取平均支持分)——正是我方 P2 实测在 gavagai 对上失效的那一类: 语义熵 AUC 0.269,且 M′ 更窄时 0.137(系统性反向,而 M′ ⊂ M 正是最常见的 gavagai 形态)。 ⟹ 同期最新方法用的正是我方证明不够用的信号 —— 这比"无人做过"是更强的立论。
DeMem(2605.10870)独立论证了"该保住的是决策不是描述"——与我方 P0 最硬的那条 (自由陈述 +0.68 nats/p=0.36 → 用词决策 +4.92 nats/p=0.0039,7.2×)同向。 ⟹ 我方那条不再只是自家实验结论,而是有独立理论工作佐证的观测量选择。
五次收紧的过程本身是这项工作最硬的部分——每一次都是我方先提出、后被自己的调研推翻。
下表删除线列为已作废的措辞,仅作沿革记录——不得用作行文措辞。
| 轮次 | 被推翻的表述 | 推翻者 |
|---|---|---|
| 三 | DEN / SEMA / SAGE / Self-Sizing Hopfield | |
| 六 | 2607.08032(同构判据,只提议程未实现) | |
| 七 | 2606.03979(Dreaming 有两道真实筛选) | |
| 八 | GATES 2602.20574 + LMSI 2210.11610 | |
| 十二 | ConsistencyGate 2607.22962(2026-07-25,投稿前重扫抓到) | |
| 十三 | GovMem 2607.02579 —— GT-free 的推理期按条写入门;A-MAC / NEMORI 同环节。第十二/十三轮竞争空间重扫(22 候选 → 5 高关注 → 5 篇全文 / 45 票全一致)抓到 |
新颖性重量全部落在两轴:判据类型 × 门控环节。
🔴 第五次收紧(2026-08-04)后作废:门控环节那条腿被 ConsistencyGate(2607.22962)
证伪——它就是 GT-free 的推理期按条持久写入准入门。
新颖性只剩一轴:判据类型(压缩/MDL,全族对 MDL/description length/compression 命中仍为 0)。
两条独立证据指向同一结论。 ConsistencyGate(08-04 重扫)与 GovMem(08-01 第十三轮) 是各自扫描抓到的不同论文,但都落在「GT-free 推理期按条写入门」这一环节 —— 环节侧 独占不是被单篇偶然证伪,而是被两次独立检索一致证伪。这反而强化了收紧后的定稿: 新颖性押在判据轴是稳的。引用义务:GovMem、NEMORI(最近邻 surprise 门)、 InfoMem(最近量亲缘——同量、但训练期 reward 且需 GT)必须在 Related Work 出现; GovMem 的 0/133 负结果对我方有利,应正面引用。差异句与投稿前重扫 SOP 见
watchlist.md,扫描/核查原始记录见r12/scan.json、r13/verification.json。
| 性质 | 状态 | 关键证据 | |
|---|---|---|---|
| P1 | 全新 | ✅ | 程序化构造语言;分词器过滤 0 标记、零样本探针 AUC 0.394 ≈ 无先验 |
| P2 | 无 GT 自验证 | ✅ | 冻结未见主域:Qwen 1.5B 0.949、3B 0.909、SmolLM 0.811;均优于直接 support/entropy |
| P3 | 持久 | ✅ | 清空上下文后 0.514 → 0.980(L1);0.485 → 0.992(L4,且免检索) |
| P4 | 隔离 | ✅ | 分区 8/8、跨分区命中 0/16;不分区则门控降至 50% = 随机 |
五判据(内化度):达成 I1 免检索(P5)+ I4 持久 + 隔离; I2 ✅ 两种形态(P6 ⊗世界知识 0.949 · P7 ⊗概念 0.889)+ I5 ✅ 抗干扰(P8:冲突定义下仅降 0.050,优于 L1 的 0.075); 🔴 I3 隐式触发 ❌ 不成立(P8:换读出方向后 AUC 0.507 ≈ 随机,而 L1 为 1.000)。
概念能跨表层句式迁移,不能跨读出方向迁移。 记忆挂在最后一层 ⟹ 它学到的是"这个决策格式下往哪边推",不是概念: m(h)·(W_yes−W_no) = +0.7926,m(h)·(W_A−W_B) = +0.0027(两方向余弦 −0.0265), 而检索是取到了的(top-4 重合率 0.750)。 ⟹ P5–P7 的每条结论都必须限定作用域:「在训练所用的决策格式内」。
-
「压缩什么」比「用什么判据」更关键 在自由陈述上算增益:+0.68 nats(p=0.36,词级 margin ≈ 0);换成用词决策序列:+4.92 nats(p=0.0039),提升 7.2×。 自由文本的熵绝大部分是句法与措辞,概念真伪被淹没。
-
自洽类信号不是"失效",而是被概念宽度系统性误导 语义熵在 M′ 更窄时 AUC 0.137(严重反向)、不更窄时 0.507(随机)——反向或随机,从不正向。 机制:更窄的概念天然产生更确信的预测(熵 0.363→0.253)。而最常见的 gavagai 形态正是 M′ ⊂ M。
-
product-key 路由必须做余弦归一化 提示只在细微语义处不同时,隐状态两两余弦 0.994、‖h‖≈172 → 原始点积让 softmax 饱和 → 12 个输入全落到同一个槽 → 记忆退化为常量偏置。归一化后 loss 0.6377→0.0021、acc 0.50→1.00。
| 差点得出的结论 | 被什么抓住 |
|---|---|
| 压缩门 8/8 成立 | 自埋诊断项:92% 的 margin 来自长度罚,词级 margin +0.02 ≈ 0 |
| E5 是模型缺陷 | 先验仪器:平凡常识题 raw 6/6 → 排除格式假象后才敢下结论 |
| 隔离实验模型全错(准确率 0.00) | 先验仪器:判别信号强 14× 但绝对值全在 0.5 以下(No 偏置)→ 改用阈值无关 AUC |
| 把架构直觉当限制写进论文("final-layer memory 缺组合性") | P6 决定去测自己声明的限制 → 一测就反了(+0.449,且反超 L1) |
| 发表"参数化内化"而没做换词控制 | P9 的结论自己打开了漏洞,我决定去堵 → 一堵就塌(落差 0.017)。若不堵,整条线会以错误的性质投出去 |
| 只看 m(h) 余弦 0.787 就判"路由读到了词" | 补了"决策方向上的正负例投影差" → 保留 97%,变化分量与判别正交 |
| 用同量级【随机】向量验证复述控制就宣布通过(0.88 ✅) | 改用学出来的真实 v 重跑 → 0.00。⟹ 控制实验必须用真实产物,不能用同量级替身 |
| 范数上限一律算在嵌入层(1.09),而注入在 L7(‖h‖ 大两个量级) | 训练 acc 卡 0.500 看着像"架构不能" → 改在注入层上量,acc 1.000、v 只用了 2% |
| 控制实验自身挂了两个 hook,注入被叠加成 2× | 换个脚本重测同一批 v 时数字对不上 → 隔离实验 1× 0.75 vs 2× 0.25 ⟹ 裁决作废。控制实验本身也必须被控制 |
| 把优化不足报成架构限制(60 epoch 时 acc 0.542 ≈ 只看物体的上限) | 训练曲线检查点 → ep900 收敛到 1.000。P5–P9 用的 300 步恰好在坑里 |
| 没有 base 参照就解读"F3 = 0.080" | 后补 base/L1 参照臂 → 逐用户 base 的 F1 从 0.240 到 0.880,极端值大半来自基座 |
| 把脚本打印的 |
换环境后重跑并逐行回读脚本输出 → 同时暴露出判据也错(重犯 P3 的 No 偏置坑),改 AUC 后 0.891,结论不变 |
| I3 只报 accuracy 就下结论(选 A 比例 0.910,阈值法被偏置钉死) | 顺手打印了位置偏置 → 改 AUC 重测。probe_metrics.auc 当时已 import 却只用在 I5 上 ⟹ 抽出工具还不够,判据必须在每个新度量上被显式选择一次 |
⟹ 每个主张都配一个能否掉它的诊断项。31 处自我推翻中 16 处来自这些诊断项(含 P6 推翻我方自设的限制),其余多来自被指定证伪的调研轮。
| 问题 | 现状 |
|---|---|
| E5 条件化失败 | 模型先验压过给定定义,随规模恶化(G5:1.5B 0.812 → 3B 0.000);σ_null 只抓住 3B 上 7 个错误中的 3 个 |
| 误收 M′ | 三态门仍误收 3 个——误解被固化是最该压低的错误 |
| I2 只部分成立 | P6 已证「概念 ⊗ 世界知识」(+0.449);「概念 ⊗ 概念」、否定/量化、多跳组合均未测。(原写的"final-layer memory 缺深度组合性"已被 P6 推翻并撤回) |
| 关系类概念(G4) | AUC 0.547 ≈ 随机;已归因为基座能力边界(三种定义呈现全失败) |
| 内化不幂等 | 把原 context 重新塞回已内化模型,性能反而变差——本项目正是"引用→内化"系统,必须测 |
LLM 的概念只能在训练时建立,不能在引用(推理/交互)时建立。要打破这一点,需要同时满足四条性质:
| 性质 | 含义 | |
|---|---|---|
| P1 | 全新 | 概念不在训练分布内,不是被"检索"出来的 |
| P2 | 无 GT 自验证 | 没有答案库,靠自身机制判定该概念是否成立 |
| P3 | 持久 | 会话结束、上下文清空后依然存在 |
| P4 | 隔离 | 按对话者隔离,不跨用户串味 |
本项目聚焦最硬的 P2:在没有答案库、也没有外部 oracle 的前提下,用什么信号决定一个新习得概念是否够格被永久固化?
11 轮 deep-research(每轮 fan-out 检索 → 抓取 → 3 票对抗验证 → 综合):
| 轮次 | 主题 | 规模 | 结果 |
|---|---|---|---|
| 1 | 七主题定位 | 22 源 / 96 主张 / 25 验证 | 20 确认 5 否决 |
| 2 | 架构(TTT/记忆层/SSM) | 26 源 / 130 主张 / 25 验证 | 21 确认 4 否决 |
| 3 | 族 4/5/6(对抗式) | 22 源 / 110 主张 / 25 验证 | 推翻我方广义主张 |
| 4 | 族 5/6 补全(对抗式) | 12 目标 / 25 agent | 0 反例,狭义主张存活 |
| 5 | 知识内化家族 J–P | 26 源 / 130 主张 | |
| 6 | 定向验证(对抗式) | 全文穷举 | 改正 4 处错误 + 发现 1 条优先权风险 |
| 7 | 窄范围 3 票验证(8 篇) | 105 主张 / 25 验证 | 18 确认 7 否决;证伪支点绝对表述 + 改正 2 处实质错误 |
| 8 | GATES/SEAL 定向证伪(5 篇) | 90 主张 / 25 验证 | 21 确认 4 否决;GATES 确认为反例 → 声明第四次收紧 |
| 9 | 定向闭合(2412.14964 / 2602.12275) | 2 篇全文 / 11 主张 / 33 票 | 11 条全数 3–0 确认;两篇均无 GT-free 写入侧准入筛选 → 最后风险口闭合,声明免于第五次收紧;顺带收紧 2 处我方转述 |
| 10 | J/J′/P 族收尾(GA / When Context Returns / Snell / DyPRAG / Memory Grafting) | 5 篇全文 / 17 主张 / 51 票 | 12 确认 + 5 修正,仅摘要级清零;我方 2 处转述被改正(GA 隔离、DyPRAG 干扰,见 #16/#17);无一篇含正确性写入门 → 空白声明再获确认 |
| 11 | 🔍 清零(2606.04703 迭代坍缩) | 1 篇全文 / 4 主张 / 12 票 | 坍缩现象 3–0 确认(掉到 base 以下);但我方 2 处修正(#18/#19):其稳定配方含 rejection sampling 正确性门、且论文不把坍缩归因于无差别写入 |
14 组实证(P0–P0j + P2 + P3 + P4 + P5,Qwen2.5-1.5B / 3B 冻结;P0 用 22 个手工 gavagai 对,P1/P2 用 40 个程序化生成 items × 5 类歧义)。
材料构造原则:教学集中真意 M 与误解 M′ 外延一致(都完美解释教学样例),只有留出集能分开它们—— 这是 Quine 的 gavagai 被做成了可控、可判分的实验条件。
跨持续学习 / 记忆架构 / agentic 记忆,所有永久固化门的准入信号穷尽落在十类代理上:
随机·类别平衡·损失/似然·参数漂移·容量/稀疏·表征或几何新颖·梯度干扰/多样性·代表性·(有标签下的)不确定性·来源信誉/对源忠实/可靠/一致
⚠️ 此表的原结论「无 GT 的概念级正确性一列为空」已被第八轮推翻 —— 见 §4: GATES / LMSI 的一致性判据正是 GT-free 的正确性代理,且已实现并实证。修正后的空白:不是「无 GT 正确性信号」,而是—— ① 判据类型 = 压缩增益/MDL(全族对 MDL/description length/compression 命中为 0)
② 门控环节 = 推理期按条持久写入(已有 GT-free 门均作用于训练期数据/梯度准入)🔴 第十二轮作废:ConsistencyGate 2607.22962 就在推理期按条持久写入(#27)
最近邻先例:GATES / LMSI(一致性,训练期准入)、SAGE(几何新颖度)、Write-Time Gating(来源信誉)、LOCI(外部结果 oracle)。
| 观测量 | 判别 margin | 显著性 |
|---|---|---|
| 老师的自由陈述 | +0.68 nats | p=0.36 ❌ 不显著 |
| 老师的用词决策序列 | +4.92 nats | p=0.0039 ✅ |
原因:自由陈述的熵绝大部分是句法与措辞(nuisance),概念真伪被淹没;决策序列才是概念要解释的那串信息。
22 items 扩展集:margin +4.08 nats,95%CI [+2.52, +5.70],19/22,p=0.00043(单侧符号检验;双侧 0.00086)。
⚠️ 一个差点得出的假阳性:朴素实现的G表面 8/8,但拆开后 92% 的 margin 来自长度罚L(c), 词级 margin 仅 +0.02 ≈ 零。只报 G 就是假阳性结论——诊断项是设计时特意埋的,起了作用。
| # | 前置条件 | 实测 |
|---|---|---|
| 1 | 观测量要对 | 自由陈述 → 决策序列,margin 提升 7.2× |
| 2 | 基座要有能力 | ρ(能力探针, margin) = +0.857;探针失败组 +2.11 vs 通过组 +5.86 |
| 3 | 基座要肯照做 | E5 条件化失败——模型先验压过给定定义 |
★ 条件 2 与 3 对缩放的反应相反:G4(无信号型)0.562 → 0.812 改善;G5(条件化失败)0.812 → 0.000 恶化。 ⟹「放大模型」不是通用解药。
用 GT-free 的 σ_null(零分布离散度)做可判定性闸门,把二态门(写/不写)升级为三态(ACCEPT / REJECT / ASK):
| 值 | |
|---|---|
| AUC | 0.857 → 0.964 |
| 正确接受 M | 15/15(零漏拒) |
| 覆盖项准确率 | 90.0% |
| ★ 弃权正当性 | 被弃权项 AUC = 0.551 ≈ 随机 → 弃权是对的,不是在丢信号 |
校准问题也已解决:rank(批内分位)——它是 raw 的单调变换(组内 AUC 分毫不损)且天然无量纲,
同一阈值跨规模有效(τ=0.40 → 1.5B 100% / 3B 92.3%),且覆盖/准确率权衡在两个规模上都单调。
核心域 G1–G3(n=24,基座有能力):
| 臂 | M 胜 | p | AUC |
|---|---|---|---|
| 压缩增益(z 校准) | 23/24 | 1.5e-06 | 0.915 ✅ |
| 语义熵 | 5/24 | 0.999 | 0.269 ❌ |
🔴 但"语义熵≈随机"是错的说法。 按「M′ 是否更窄」分层后机制清楚了:
分层 n 语义熵 AUC M′ 更窄(G1 合取 / G2 范畴层级) 16 0.137 严重反向 M′ 不更窄(G3/G4/G5) 24 0.507 恰好随机 机制:语义熵测的是「模型有多确信」,而更窄的概念天然产生更确信的预测 (G1 熵 0.363→0.253、G2 0.308→0.148)。 于是在最常见的 gavagai 形态(M′ ⊂ M,正是 Quine 的 rabbit vs undetached rabbit part)上, 语义熵被系统性推向误解;M′ 不更窄时退化为随机。 ⟹ 两种情形下都不能识别正确概念——反向或随机,从不正向。
epi(c)=base_ent−ent(c),base_ent 与 c 无关,作差抵消;实测 per-item margin 最大差 5.55e-17)。
实际只有 2 个独立臂,论文不得宣称 3 个独立对照。
且真正的 EIG 主动追问臂尚未实现——本轮是静态不确定性差,非 Kobalczyk 式期望信息增益选问。
✅ G4 能力边界精确复现(压缩 AUC 0.547 ≈ 随机),与 p0 §6c 的归因一致。
详见 p2/README.md。
8 对冲突词(同一伪词、两位老师教互斥含义)× 每对 8 条程序化留出决策:
| 分区(只含 A 的概念) | 共享(A+B 同时在场) | |
|---|---|---|
| 对 A 留出集的判别 AUC | 1.000(8/8 对完美) | 0.754(6/8 对下降;最差 ISO-08 掉到 0.281 = 反向) |
| ★ 压缩门选对 A 的真实含义 | 8/8 = 100% | 4/8 = 50% ≈ 随机 |
⟹ 没有分区,门就无法把概念归属到人——不是模型不行,而是信息上就不可能: 两个互斥定义同时在场时,观测数据本身不含「哪个属于谁」。隔离是机制正确性的前提,不是工程洁癖。
- 共享条件的门控比较是同样两句话的不同顺序,测的是「位置是否承载归属」(答案:不承载), 不得表述为「门在两个候选间选错」。
- 共享条件是强形式污染(互斥定义直接同处一境),不是 PersistBench 那种隐蔽的自然泄漏—— 度量不同,勿与其 53% 直接比数值。
- 🔴 本轮是上下文级分区,尚未实现 product-key 记忆层的 uid 硬分区—— 研究文档 §7.4 的「架构性零干扰」主张仍未实证。
★ 方法学:又一次"先验仪器再下结论"救了结论。初版用 0.5 阈值算准确率得到 0.00 的假象; 查证发现模型对陌生伪词谓词有系统性 No 偏置(蓝色项 p_yes 0.245–0.349 vs 红色项 0.020–0.023, 判别信号强 14× 但绝对值全在 0.5 以下)。 这反过来佐证了机制设计:压缩门用连续 NLL 而非阈值化决策,不受该偏置影响。
① 教学 → ② 门控裁决 → ③ 写入 uid 分区 → ★④ 清空上下文 → ⑤ 新会话仅从该 uid 分区加载 → 作答
16 位老师(8 对冲突词),候选 = {真含义, 对方老师含义, 2 个干扰颜色}:
| 环节 | 结果 |
|---|---|
| ② 门控裁决 | 16/16;真含义领先对方含义 +9.92 nats |
| ⑤ 新会话(上下文已清空) | none 0.514 → ★partitioned 0.980 |
| 对照:取回错用户的概念 | 0.129(远低于随机,因两义互斥) |
| 结构性零干扰 | 跨分区命中 0/16 |
🔴 共享库的真实失效模式是「后写覆盖」,不是「两义并存」:
| 组 | 分区 AUC | 共享 AUC |
|---|---|---|
| uA 先写 | 0.984 | 0.148 — 8/8 概念被彻底摧毁 |
| uB 后写 | 0.977 | 0.977 — 完好 |
均值 0.562 是「A 被毁 + B 完好」的平均,不可读作整体退化。 且这与 P3 的共享条件是不同失效模式(P3 是两义同处上下文互相干扰;P4 是存储层后写覆盖)。
四条性质状态:P1 全新 ✅ · P2 无 GT 自验证 ✅ · P3 持久 ✅(0.514→0.980)· P4 隔离 ✅(0/16)
🔴 但必须说清三条限定(详见 p4/README.md §4)
- 层级:这是 L1 外部记忆 + 检索纪律,不是研究文档 §7.4 提议的 L4 product-key 参数化记忆层 (需训练,零算力做不到)。按我们自己的五判据,本方案满足 I4 与隔离,但不满足 I1 免检索 / I2 组合性 ——仍是"知道有这回事",不是"学会了"。论文中不得说成参数级内化。
- 门控任务比 P2 容易得多:4 个互斥颜色、领先 +9.92 nats,16/16 不可与 P2 核心域 AUC 0.915 相提并论。
- 零干扰是构造性真理(键带 uid 前缀 + 按 uid 掩码),不是实证发现; 实证的是它复现了隔离行为、且两个对照确实劣化。
把 P4 的 L1 外部记忆升级为参数(冻结基座 + 只训练 uid 分区的 product-key 稀疏槽; 记忆挂最后一层之后,梯度不反传任何 transformer block → 单机可训):
| 探针 AUC(上下文完全不含概念陈述) | |
|---|---|
| 无记忆(冻结基座) | 0.485 ≈ 随机 |
| ★ 参数化记忆 | 0.992(+0.507) |
| 用他人分区 | 0.260(远低于随机) |
⟹ 判据 I1(免检索)达成 —— 这正是 P4 的 L1 方案不满足的那一条。
★ 顺序写入:分区 vs 共享(同等总容量 512 槽)
| 已写入 | uid 分区 | 共享槽 |
|---|---|---|
| 2 | 1.000 | 0.520 ← 第 2 次就崩 |
| 16 | 0.992(最低 0.960) | 0.562(最低 0.000) |
🔴 分区版的零退化是构造性的(梯度掩码 → 先前用户的槽没被碰;实测「写入时 AUC」与「最终 AUC」16/16 逐位相同), 不得报作「稀疏记忆抗崩塌」的实证。 ✅ 有意义的结论只有一条:同等容量下,分区防住了、共享没防住 ⟹ 关键是分区,不是容量或稀疏性本身。
★ 过程中两次失败,都靠先诊断而非猜测才定位(详见 p5 §3):
- 全词表 CE(151k)稀释二元信号 → 记忆完全无效(+0.000)
- 原始点积路由塌缩:隐状态两两余弦 0.9937、‖h‖≈172 → softmax 饱和 → 12 个输入全路由到同一个槽
→ 记忆退化为常量偏置。余弦归一化 + 温度后 loss 0.6377→0.0021、acc 0.50→1.00。
★ 一般性教训:提示只在细微语义处不同时,product-key 路由必须做余弦归一化。
前面所有探针都来自同源微世界(换实例但同分布)——那测的是泛化,不是组合。
跨域探针要求两步组合:① a ripe banana 是 yellow(预训练世界知识)× ② romi = yellow(推理期习得)
⟹ Is a ripe banana romi? 从未被明说。
前置检查(否则实验无意义):base 对这些物体颜色的世界知识 AUC 0.891 ✅ 🔴 此处我错过一次:初版用绝对阈值得 raw 命中 0.688(脚本已打印"世界知识不足"的警告), 我在文档里误写成"命中 1.00 ✅"。数字与判据都错——判据错在重犯了 P3 的 No 偏置坑 (16 个正确配对有 5 个 p_yes < 0.5,而负例低至 0.001)。改用 AUC 后 0.891,结论不变。
| 域内探针 | ★ 跨域探针 | |
|---|---|---|
| base(无概念、无记忆) | 0.485 | 0.500 |
| L1 上下文注入 | 1.000 | 0.840 |
| ★ L4 参数化记忆 | 0.992 | 0.949 |
| L4 − base | +0.507 | +0.449 |
| L4 − L1 | −0.008 | +0.109 |
P5 曾写「final-layer memory 缺深度组合性」,并据此在 Method 草稿写入 "we do not verify criterion I2"。实测不支持:L4 跨域 +0.449,且反超 L1 +0.109。 该断言当时只是从架构位置推测的、未测 ⟹ 已撤回。 可保留的只有结构事实:final-layer memory 不参与中间层表征计算。
- base 跨域 0.500 是构造性的:冲突对对称(A 的 Yes 项正是 B 的 No 项),逐用户范围 [0.062, 0.938] 相互抵消。 这说明探针集跨用户平衡,不代表 base 校准良好。
- 只测了「概念 ⊗ 世界知识」:「概念 ⊗ 概念」、否定/量化(
not romi/all romi)、多跳组合全部未测 ⟹ 只能声称「与世界知识的组合成立」,不得泛化为「具备组合性」。 - L4 为何反超 L1 是假说、未做消融:猜测 L1 把
romi means yellow.塞进上下文改变了提示本身、 干扰了模型对a ripe banana的世界知识检索;L4 保持提示干净。引用须标 hypothesis。
📌 详见 p6/README.md
同一用户学两个概念(颜色 + 材质),各自独立教学;探针问 Is X both w1 and w2?——
教学中从未出现过合取句式。
🔑 负例只取「恰好成立一个」的实体。 🔴 但初稿把单概念策略的上界写成 0.500,实际是 0.750——须把判据拆成两半:
conj|¬w2(只能靠 w2 拒)与conj|¬w1(只能靠 w1 拒),单概念策略必在其中一半掉到 0.5。 判据 = min(两半)。
| 臂 | 概念1 | 概念2 | ★ min(两半) |
|---|---|---|---|
| base | 0.510 | 0.444 | 0.479 |
| L1 定义进上下文 | 0.997 | 0.997 | 0.986 |
| L4 合并训练 | 0.812 | 0.889 | 0.889 |
| L4 顺序·共享 32 槽 | 0.590 | 0.931 | 0.750 |
| L4 顺序·子区(只掩梯度) | 0.483 | 0.826 | 0.576 |
| ★ L4 顺序·子区(写入+检索都掩) | 0.927 | 0.847 | 0.653 |
| 单概念策略 | 0.500 |
⟹ I2 补齐:0.889 ≫ 0.500,两个各自教出来的概念能在从未教过的句式上联合作答。 前置检查:基座对真词的合取 AUC 0.973 ✅;L1 min 0.986 ⟹ 任务本身可解。
🔴 新发现的失败:分区【内部】的顺序写入会冲掉先前的概念
| 条件 | 每概念槽数 | 写 w2 前 → 后 | Δ |
|---|---|---|---|
| 共享 32 槽·无掩码 | 32 | 0.951 → 0.590 | −0.361 |
| 子区·只掩梯度 | 16 | 0.833 → 0.483 | −0.351 |
| ★ 子区·写入+检索都掩 | 16 | 0.927 → 0.927 | +0.000 |
P5 证的是分区挡住【跨用户】干扰;【同一用户内部】P5 没测——会冲掉。
★ 修法来自诊断而非猜测(子区版失败后先查):
| 检查 | 结果 |
|---|---|
| w1 的槽 values 最大改动量 | 0.00e+00 → 梯度掩码有效,槽分毫未动 |
| w1 探针 top-4 落在 w2 子区的比例 | 25% ← 决定性证据 |
★ 一般性结论:分区必须同时作用于【写入】与【检索】。 P5 之所以成功,正因为那里检索本来就按 uid 掩了——子区破坏了这个对称性。 分区键须推理时可观测:uid 来自会话,概念来自提示里出现的词。
🔴 Δ +0.000 是构造性的(不相交子区 + 双掩码 ⟹ 构造上不可能互相影响),不得报作"抗遗忘"。 ✅ 非构造性的结论有两条:(a) 只掩写入不够(−0.351 ≈ 不分区的 −0.361,且事先我以为它会成功); (b) 修好它的那一版容量更少(16 < 32)⟹ 容量解释被排除。
📌 详见 p7/README.md
I5 抗干扰 ✅ —— 上下文塞进另一位老师的含义(Note: in some dialects, {word} means {对方}.):
| 臂 | 无干扰 | 无关长文 | ★ 冲突定义 | 降幅 |
|---|---|---|---|---|
| base | 0.545 | 0.525 | 0.033 | −0.513 |
| L1 上下文注入 | 0.988 | 0.917 | 0.912 | −0.075 |
| ★ L4 参数化记忆 | 0.960 | 0.953 | 0.910 | −0.050 |
★ 关键对照在 base 那一行:base 没有概念,那条注释是它唯一的定义来源,于是答案系统性反向(0.033)。 ⟹ 干扰被证明有效,L4 扛住不是因为模型没读它。且参数化比上下文注入更抗干扰。
🔴 I3 隐式触发 ❌ —— 不问定义,要求去用(训练中从未出现的句式,二选一行动题):
| 臂 | ★ AUC | accuracy | 选 A 比例 |
|---|---|---|---|
| base | 0.500 | 0.488 | 0.910 |
| L1 定义进上下文 | 1.000 | 0.988 | 0.496 |
| ★ L4 参数化记忆 | 0.507 | 0.492 | 0.914 |
零迁移——任务完全可解(L1 与真词先验都 1.000)。 🔴 此处判据也错过一次:第一版只报 accuracy,而伪词条件下模型 91% 选 A, 阈值法被偏置钉死在 0.5 ⟹ P3 → P6 → P8 同一类仪器错误的第三次 (且
probe_metrics.auc当时已 import,只用在了 I5 上)。改 AUC 后结论不变,但那是运气。
| 观测 | 值 | 判读 |
|---|---|---|
| 行动题 top-4 落在训练用过的槽的比例 | 0.750 | ✅ 检索取到了 ⟹ H_route 被否 |
| m(h) · (W_yes − W_no) | +0.7926 | |
| m(h) · (W_A − W_B) | +0.0027 | ← 近乎零 |
| 两读出方向本身的余弦 | −0.0265 | 近乎正交 |
| ‖m(h_act)‖ | 14.279 | 不是太小,是方向不对 |
⟹ 记忆学的是"这个决策格式下该往哪边推",不是概念。
| 臂 | F1 Yes/No | F2 A/B | F3 True/False(始终 held-out) |
|---|---|---|---|
| base | 0.540 | 0.550 | 0.510 |
| L1 定义进上下文 | 0.960 | 1.000 | 1.000 |
| L4 训 F1 | 0.960 | 0.555 | 0.755 |
| L4 训 F1+F2 | 0.902 | 0.795 | 0.645 |
加训 F2:F2 +0.240,但 F3 −0.110、F1 −0.058 ⟹ 换方向,不是累加。
| 只训 F1,测试格式 | 与 F1 的读出余弦 | AUC | 相对 base |
|---|---|---|---|
| F1 Yes/No | 1.000 | 0.960 | +0.420 |
| F3 True/False | +0.1065 | 0.755 | +0.245 |
| F2 A/B | −0.0265 | 0.555 | +0.005 ≈ 0 |
迁移量随读出方向余弦单调变化——
H_readout最直接的量化证据。⚠️ 只有三个点,顺序一致而已,不得写成拟合出来的定律。
| 实验 | 变的是 | 结果 |
|---|---|---|
| P6 跨域探针 | 表层内容 · 同读出方向 | ✅ 0.949 |
| P7 合取探针 | 表层句式 · 同读出方向 | ✅ 0.889 |
| P8 I3 | 读出方向 | ❌ 0.507 |
⟹ 精确的主张只有一条:概念能跨表层句式迁移,不能跨读出方向迁移。 「泛化 ✅ / 组合 ✅ / 隐式触发 ❌」不是三个互不相干的结论,是同一条机制的三个侧面。 论文中 P5–P7 每条结论都须加作用域「在训练所用的决策格式内」。
P5 曾(错误地)声明 final-layer memory "缺深度组合性"——已被 P6 推翻撤回。
现在有了正确版本、而且是测出来的:它只在输出层动手,学到的东西天然绑死在训练任务的读出方向上。
⟹ 要跨格式生效,记忆必须介入中间层表征(研究文档 §7.4 的原提案)。
📌 详见 p8/README.md
先是好消息。 P8 的推论(记忆须介入中间层表征)成立,且控制条件查清了真正的原因:
| 插入位置 | F1(训练) | F2 | F3 | 跨方向均值 |
|---|---|---|---|---|
| base | 0.540 | 0.550 | 0.510 | 0.530 |
| L1 定义进上下文 | 0.960 | 1.000 | 1.000 | 1.000 |
| ★ L7 全位置 | 0.945 | 0.935 | 0.945 | 0.940 |
| ◇ L7@last(只改最后位置) | 0.820 | 0.565 | 0.600 | 0.583 |
| post-norm(=P5–P8) | 0.970 | 0.555 | 0.770 | 0.663 |
L7@last同样在 L7、其上同样有 20 层去变换它,只是仅改最后一个位置 → 0.583,比 post-norm 还低。 ⟹ 增益来自【位置覆盖】而非深度:记忆必须改写描述物体的 token 的表征。
然后这条结论自己打开了漏洞,我去堵,堵塌了。
既然它改写的是物体表征,就可能只学会了「给蓝色物体打标」、根本没绑定到那个词。 控制:训练不变,只换提示里那个伪词。
| 插入位置 | 本词 → 换成别人的词 | 落差均值 |
|---|---|---|
| L7 | 0.945/0.935/0.935 → 0.930/0.895/0.935 | 0.018 |
| post-norm | 0.970/0.555/0.770 → 0.975/0.505/0.765 | 0.017 |
会不会只是单概念设置欠定?(一个词时,「w 指蓝色」与「给蓝色物体打标」外延完全相同, 那个词是常量、零信息。)P7 的两词设置是唯一例外——直接测,也不行:
| 提示里用的词 | F1 | F2 | F3 |
|---|---|---|---|
| w1(本词) | 0.785 | 0.505 | 0.695 |
| ★ 换成同用户的 w2 | 0.790 | 0.570 | 0.645 |
| own − within | −0.005 | −0.065 | +0.050 |
前置:w2 自己的探针 0.890,两个词都"学会"了 ⟹ 不是没学会导致的。
| 观测 | L7 | post-norm |
|---|---|---|
| m(h) 换词后余弦 | 0.99998 | 0.787 |
| 路由命中槽 换词后重合率 | 1.000 | 0.957 |
| m(h) 在决策方向上的投影 | — | +1.690 → +1.047 |
| ★★ 【正例−负例】的投影差 | — | +4.443 → +4.327(保留 97%) |
- L7:路由层面就看不见那个词。
- post-norm:看得见词,但 AUC 只看排序,而正负例的投影差保留 97% ⟹ 词只平移偏置、不改判别。
🔴 这里我差点得出相反结论:只看 m(h) 余弦 0.787 会判成"路由读到了词 ✅"。 是加了"决策方向上的正负例投影差"才发现变化的分量与判别正交。 ⟹「输出变了」不等于「行为变了」;度量必须对准被解释的那个量。
撤回:参数化记忆线不得写成"学会了一个词的含义 / 建立了一个概念"。 能站住的只有:「为每位对话者写入一个持久的、按分区隔离的、与词无关的物体级偏置」。
不受影响:压缩增益门(P0–P4)——那条线里概念以文本存在、词是显式的; 按对话者隔离(P3/P4)——隔离的是分区,与绑定到什么无关。
修法方向(全部未做,不得声称已解决):键取在词的 token 位置而非整段末位; 训练集让两个词在同一物体上给出相反标签(P9c 的两词方向对但强度不够——两词问的是不同属性, 一个"红或木"的分级标就能同时糊弄过去);显式的词条件路由。
📌 详见 p9/README.md
把 P9c 的后门焊死:w1 = 颜色 A、w2 = 颜色 B,训练物体只取这两色 ⟹ 同一物体在两词下标签严格相反 ⟹ 只看物体的策略在数学上恰好 0.500,训练准确率本身就是判据。
| 臂 | 训练 acc | F1 Yes/No | F2 A/B | F3 True/False |
|---|---|---|---|---|
| base(无记忆) | — | 0.585 | 0.540 | 0.525 |
| L1 定义进上下文 | — | 0.855 | 0.905 | 0.995 |
| post-norm · 本词 | 0.974 | 0.770 | 0.535 | 0.595 |
| post-norm · ★换成含义相反的词 | 0.350 | 0.515 | 0.450 | |
| ★ L7 · 本词 | 1.000 | 0.925 | 0.545 | 0.670 |
| ★ L7 · 换成含义相反的词 | 0.070 | 0.410 | 0.290 |
✅ 绑定是真的:L7 落差 −0.855(0.925 → 0.070,不是"失效"而是答案跟着词整个翻过去); post-norm 落差 −0.420。对照 P9b 未强制时只有 −0.018。
⟹ #25 的原因改写:不是"架构做不到",而是"我们没让它必须做到"。
⚠️ 撤回本身不变——P5–P9 跑的仍是欠定设置。
🔴🔴 但代价是跨读出方向没了:L7 的 F2 0.545 / F3 0.670(base 0.540 / 0.525), 而 P9 未绑定时是 0.935 / 0.945。
绑定到词 跨读出方向 post-norm + 欠定(P5–P8) ❌ 0.017 ❌ L7 + 欠定(P9) ❌ 0.018 ✅ 0.940 post-norm + 强制(P10) ◐ −0.420 ❌ 0.565 L7 + 强制(P10) ✅ −0.855 ❌ 0.608 L1 上下文注入 ✅ 构造上必然 ✅ 0.905 / 0.995 ⟹ 参数化路线最多只能拿到两者之一;上下文注入两者都有。 这是目前对该路线最强的一条负面证据。
ep150 0.771 → ep300 0.891 → ep600 0.943 → ep900 1.000。
P5–P9 全部用的 300 步恰好落在还没收敛处。 已写成硬分支:末段仍在上升 >0.03 即输出 ⚪ 不可判。
📌 详见 p10/README.md
这是本报告最该被读的一节。 每一条都是我方先提出、后被自己的调研或实验推翻的。
| # | 我方原主张 | 裁决 | 现状 |
|---|---|---|---|
| 1 | 「所有已知门控只调写入强度,没有一个回答该不该固化」 | ❌ 第三轮推翻 | DEN/SEMA/SAGE/Self-Sizing Hopfield 都是真门控 → 收紧为信号类型 |
| 2 | C4「拒绝一切自信且一贯错误的概念」 | 必须区分谁错了:E1(模型误解)拒绝 ✅;E2(老师说假话)会被接受,属设计边界 | |
| 3 | 「双向判别应强于单向」 | ❌ P0e 推翻 | 实测相反(+2.98 vs +5.41),G4 拖累 |
| 4 | 「推理期写入 × 跨会话持久 从未同时成立」 | ❌ 第五轮推翻 | 上下文蒸馏族已填上该格;Generative Adapter 更做到单次前向 × 跨会话 × 按用户隔离 |
| 5 | 「放大模型可解」(由 ρ=0.857 导出) | ❌ 3B 推翻 | margin 涨 4× 但 AUC 反降(0.857→0.738、p 0.0004→0.067) |
| 6 | 「σ_null 是盲的、接不住 E5」 | ❌ 自纠 | 判错组 σ_null 6.72 vs 判对组 13.06,AUC 0.905 → 不是盲区,是校准问题 |
| 7 | 忠实性探针 F(c) 能补上盲区 | ❌ 试了失败 | 3B 上 AUC 0.533 ≈ 随机,两个规模都不如 σ_null |
| 8 | /base 归一化(按量纲推理看好的) |
❌ 失败 | 3B AUC 掉到 0.724;rank 才对 |
| 9 | 「LMLM 是 NeurIPS 2025(主会)」+「损失掩码即准入门」 | ❌ 第六轮改正 | 实为 CCFM workshop Oral;且 v3 已更名 Large→Limited;掩码是训练目标不是准入判据 |
| 10 | 「Sharpening 证明了自我改进不能创造新信息」 | 是动机性前提,正文归因于 data-processing inequality (Cover 1999),非本文定理 | |
| 11 | 「J/O/P 三族均无写入准入门控」(绝对表述) | ❌ 第七轮证伪 | arXiv:2606.03979 的 Dreaming 阶段有两道真实筛选(梯度重要性 Top-k「采 60 拒 45」+ SEAL 式二值奖励)→ 见下方三次收紧 |
| 12 | 「Do LMs Need Sleep 把睡眠期落到权重上」 | ❌ 第七轮改正 | 其 fast weights 是 SSM 定长递归状态、每序列零初始化,permanent/cross-session/continual 全 0 —— 不是持久参数,不可与 P 族并列;另作用域也错(N 次 pass 只作用于 L=24 token 的当前窗口,非"累积上下文") |
| 13 | 「无 GT-free 的写入准入门控」 | ❌ 第八轮证伪 | GATES (2602.20574) 是 GT-free 二值准入门(一致度 ≥4/8,未过门者零损失);且非首创——LMSI (2210.11610, 2022) 已实现。→ 新颖性重量转移到「判据类型 + 门控环节」两轴 |
| 14 | 「Prompt Distillation 多个规模上超过 RAG」(🔍 转述) | 纯闭卷 PD 仅在 Squadshifts/Llama-3-8B 追平 RAG(只 Reddit 上 +0.9);「超过」依赖 PD+RAG 组合(三个规模均成立)或放大版 PD XL(Squadshifts 均值、3/4 子集);HotpotQA 上 RAG 对纯闭卷 PD 三个规模全面占优(如 Qwen-3B 59.1 vs 73.5) | |
| 15 | 「OPCD 更好保留 OOD 能力」(🔍 转述) | 实测边际:math/Sokoban 上对 off-policy CD 仅 +0.1~+0.5(落在合并 std 内);对 base 基本持平或微降(5 格中 4 格微降)——是"退化更少"不是"保留更好";系统提示场景 ~4 点仅见图无表;且 checkpoint 按 test accuracy 挑选(附录 A.3/B.2),全部数字受通胀 | |
| 16 | 「Generative Adapter 天然按用户隔离」(🔍 转述) | 隔离仅是构造暗示(一会话一 adapter、per-user 部署动机):论文从未出现 isolation 一词、无任何跨用户泄漏/干扰测试;跨会话复用也是架构性支持而非纵向演示(无"存下 adapter、后续独立会话重载"的实验);且 MSC 上 4× 省算力的代价是 F1 40.2 vs 全历史 prompt 66.0 | |
| 17 | 「DyPRAG 多文档 LoRA 平均互相干扰」(🔍 转述) | ❌ 第十轮改正(0C/3CORR) | 说反了:论文称简单平均能有效整合知识(HQA/PQA 最优 c=3);衰退只在注入过多文档时出现(4 数据集中 3 个),且归因于任务无关冗余信息 + 有损压缩(引 Shi et al. 的 distraction),非平均导致的干扰——全文无 interference 一词 |
| 18 | 「2606.04703 结论 = off-policy from 高质量 teacher 更稳」(🔍 转述) | teacher 不是外部更强模型,是同一策略条件化于经验池的自教师;"高质量"指对其轨迹做 rejection sampling 只留成功者;精确主张是跨迭代稳定性(on-policy 单轮强但 35.0→32.4→31.5 递减 vs off-policy 30.6→30.7→33.1 递增) | |
| 19 | 「迭代坍缩的直接诱因是无差别写入,门是对症解」(💭 我方推演) | ❌ 第十一轮修正(0C/3CORR) | 论文不这么归因:坍缩被归因于 (a) instance 级经验的轨迹特异伪影、(b) global 注入与决策状态错位(premature answering 63.82%→0%)、(c) on-policy 监督"fundamentally reactive";且其稳定配方本身含 rejection sampling(任务成功)正确性门——「其管线完全无门」不成立。"门能推迟坍缩"降级为我方待验证假设(💭),实验照做但不得写成该文支持 |
| 20 | 「三臂对照」+「语义熵在 E1 上≈随机」 |
| 21 | 「final-layer memory 缺深度组合性」(💭 我方从架构位置推测) | ❌ P6 推翻 | 跨域探针(概念 ⊗ 世界知识)L4 0.949 vs base 0.500(+0.449),且反超 L1 +0.109。该断言未经实测即写入 P5 §4 与 Method 草稿 §6(i),现已撤回;只保留结构事实「不参与中间层表征计算」。⟹ 教训:架构直觉不能当限制来声明——自设的限制也要做实验。 |
| 22 | 「合取探针的单概念策略上界 = 0.500」(我方设计时的算式) | ❌ P7 自纠 | 实际 0.750:负例里"只中 w1"那一半与正例在 w1 上同分布(贡献 0.5),"只中 w2"那一半能被 w1 拒掉(贡献 1.0)。⟹ 裁决线设错会把单概念策略误判为组合。修法:把判据拆成 conj\|¬w2 与 conj\|¬w1 两半取 min,单概念策略在此必 ≈ 0.5 |
| 23 | 「P5 的分区解决了干扰」(隐含地被当成一般结论) |
| 24 | 「P5–P7 证明了概念被内化」(未加作用域的读法) |
| 25 | 🔴🔴 「参数化记忆让模型学会了一个词的含义」(P5–P9 全线的隐含前提) | ❌ P9b/P9c 证伪 | 只换提示里那个词、其余一字不改,AUC 落差 0.017–0.018;每人两个词时换成同用户的另一个词,own−within = −0.005(w2 自己的探针 0.890,两词都"学会"了)。机制:L7 路由层面看不见词(命中槽重合率 1.000);post-norm 看得见但正负例投影差保留 97%(+4.443→+4.327)⟹ 词只平移偏置、不改判别。⟹ 学到的是「与词无关的物体级偏置」。P5 I1 / P6 I2 / P7 I2 / P8 I5 / P9 的概念性解读全部撤回;压缩门(P0–P4)与按对话者隔离不受影响 |
| 26 | 🔴 「P9 证明了中间层记忆能跨读出方向迁移」(作为该路线的正面结果) |
| 27 | 🔴 「门控环节(推理期·按条·持久写入)是我方新颖性的一条腿」 | ❌ 第十二轮(投稿前重扫)证伪 | ConsistencyGate(arXiv:2607.22962,2026-07-25) 就是 GT-free 的 write-time admission gate,作用于推理期、按条、持久的外部记忆写入(查询 LLM K 次取平均支持分,过阈才提交)。⟹ 新颖性只剩「判据类型」一轴。★ 但它的信号是自洽度——正是我方 P2 证明在 gavagai 对上失效的那一类(AUC 0.269;M′ 更窄时 0.137)⟹ 它同时是最好的动机引用。同轮另核 MemRefine(2606.13177):事后压缩、LLM 判官信号、无 MDL 判据,不构成威胁 |
| 28 | description length/MDL = 0、admission = 0、interlocutor/isolation = 0,故我方 MDL 那一格仍空;但"压缩类判据"这一族已被占。⟹ 措辞必须再加两条限定:压缩的是【对话者的用词】(它压缩智能体自己的动作)、门决定的是【要不要写】(它决定预算下什么可以忘)。✅ 反过来它独立佐证了我方 P0 的"决策 vs 描述"(7.2×)。其失真定义为 regret、需观测奖励("the learner observes a reward
| 29 | 「早层 + 按词的 token 触发就能同时拿到绑定与跨格式」(💭 我方设计推理) | ❌ P11 未达预注册及格线 | 及格线(跑前写死)F2/F3 ≥ 0.85;实测 0.570 / 0.775。✅ 绑定确实拿到(换词 0.080,对照 P9b 未强制时的 0.017);✅ 两个双向控制都按预测失败(值进 logits ⟹ 与 base 逐位相同;键不是词 ⟹ 训练 acc 0.531 ≈ 只看物体的上限)⟹ 两条约束的归因成立,错的是"满足它们就够"。
| 30 | 🔴🔴 「P11 的复述控制未过 ⟹ 主结果不可解读」(我方自己的裁决) | ❌ 自查发现是脚本 bug | p11_lexical_entry.py 在主 hook 未移除时又在同一 module 上注册了一个,PyTorch 把前一 hook 的返回值当作后一 hook 的 output ⟹ h+v 再 +v = h+2v,复述是在 2× 注入下测的。隔离实验(同一批学到的 v,n=4,w1-only):1× 注入 0.75 vs 2× 注入 0.25,初版报的 0.50 正落在 2× 那侧。更正后(单次注入、L7、8 用户)复述 0.94 ✅ 通过。⟹ 「不可解读」撤回;主裁决不变(F3 0.775 < 0.85,仍是负面结果,与复述控制无关)。★ 这是控制实验自身缺陷的第三次(随机替身 → 算错层的范数 → 重复 hook)⟹ 已在脚本内加 hook 计数断言 |
| 31 | 「身份保持项是让 P11 通过预注册规则的唯一路径」(💭 我方在推进前的判断) | ❌ P11c 推翻 | ① 规则本来就已通过——"未过"是 hook 重复注册造成的(#30);② 身份项对及格线没有帮助:F3 0.775 → 0.790/0.750(非单调,噪声内),而 F1 掉 0.04–0.055、绑定从 0.080 退到 0.135/0.155。⟹ 不需要且略有害,不建议采用。★ 另:脚本按预注册三分支自动打出「✅ 身份与含义不冲突」,但那三个分支的前提(λ=0 复述失败)已失效,该裁决是空的 —— 自动裁决必须被读,不能直接采信 |
下表「被推翻的表述」列引用的是已作废的措辞,仅作沿革记录——不得用作行文措辞。
| 轮次 | 被推翻的表述 | 推翻者 |
|---|---|---|
| 三 | DEN / SEMA / SAGE / Self-Sizing Hopfield | |
| 六 | 2607.08032(同构判据,但只提议程未实现) | |
| 七 | 2606.03979(Dreaming 有两道真实筛选) | |
| 八 | GATES 2602.20574 + LMSI 2210.11610 | |
| 十二 | ConsistencyGate 2607.22962(2026-07-25,投稿前重扫抓到) |
GATES(arXiv:2602.20574v1, Stein/Huang/Goldstein, UMD)是一个 GT-free 的二值写入准入门:
- 判据 = k=8 条 tutor rollout 答案的一致度 ≥4/8;未过门者 "contributes zero loss across all objectives"
- 数学确证是硬性准入而非降权:
g_i·e_{i,j}同时在 Eq.1 的分子与归一化分母中 → 被门掉的项从分母消失 - 作者自陈:"agreement… as a proxy for correctness"、"no external teacher or reward model is involved"
- 亲自划界:"it decides when to distill, not what to answer"
🔴 且非首创:LMSI(2210.11610, 2022) 早已用多数投票筛选自训练数据,明言 "we do not use any ground truth labels to filter"。
| 轴 | GATES / LMSI | 我方 |
|---|---|---|
| 判据类型 | 答案一致性。全族 MDL / description length / compression 词边界命中 = 0 | 压缩增益 / MDL |
| 门控环节 | 训练期:离线自蒸馏的训练数据与梯度更新准入,作用于固定预生成题集 | 推理期按对话者隔离的持久写入 |
摘要版:
「尚无方法以压缩增益/MDL 为判据对推理期持久写入做准入门控;已有的 GT-free 准入门(GATES, LMSI)判据为答案一致性且作用于训练期。」🔴 第十二轮作废后半句(#27):现存措辞为「尚无方法以压缩增益/MDL 为判据做写入准入门控——已有 GT-free 准入门(GATES、LMSI、ConsistencyGate)用的是自洽度,SAGE/SEMA 用新颖度,Write-Time Gating/TRUSTMEM 用来源可信度,没有一个用描述长度。」
Related Work 收口版:
据我们所知,尚无工作以压缩增益/描述长度(MDL)为准入判据,对推理期逐条候选知识的持久写入做准入裁决。 与我们最接近的是共识门控一族——GATES(Stein et al., 2026) 与 LMSI(Huang et al., 2022):它们已实现并实证了 「GT-free 的正确性代理(多数一致性)+ 硬性二值准入」这一组合,我们不在该轴上主张新颖性。 二者与本文的差异在两轴:(i) 判据类型——其信号是答案一致性而非编码代价的削减; (ii) 门控环节——其门作用于离线自蒸馏的训练数据/梯度准入,对象是固定预生成题集, 而本文的门作用于部署期按对话者隔离的持久记忆写入。 SEAL(Zweiger et al., 2025) 亦不构成反例:其 ReST-EM 筛选在生成器 RL 训练期且需每个 context 配带 gold label 的评测任务 τ, 论文自述这一耦合 "prevents RL training of SEAL from scaling to unlabeled corpora";其部署期自编辑无条件聚合应用、不设门控。
- 不得再写「尚无 GT-free 的写入准入门控」——已被 GATES 彻底证伪
- 不得保留「无外部 oracle」作为独立卖点——GATES 训练门无外部 oracle,攻防上得不偿失
- 用「写入」时必须带 scope 注解(推理期/持久/按条),否则与 GATES 的训练准入不可区分
2412.14964 与 2602.12275 连续两轮(七、八)无一条主张通过验证,是唯一未闭合的风险面。 第九轮取得两篇全文(水印校验
arXiv:2412.14964v2/arXiv:2602.12275v2),11 条主张 × 3 票对抗验证,33 票全数确认。
2412.14964v2(Prompt Distillation, Kujanpää et al.)——完全无筛(3–0):
- 三个验证者独立穷举(词边界 + substring 双跑,30+ 关键词):admission/threshold/consensus/majority/vote/discard/reject/prune/screen 全部零命中;
gate/gating9 个 raw 命中全为 mitigate/investigate 子串误报 - 生成的噪声答案不过滤,机制上靠软标签吸收:"the generated answers serve as inputs (not direct targets)… the teacher's logits remain well-defined at each step"
- 最接近的候选(附录 K 按 entropy/KL 五分位分组训练)是诊断性消融,不是方法管线中的准入筛
- 同轮证实:teacher = 同一模型带文档 prompt、student = 同一模型 + LoRA 翻转切换角色(rank 512–1024)、训练全程无 GT(gold answers 仅用于评测打分)、更大 expert 反因风格失配变差
2602.12275v2(OPCD, Microsoft)——唯一筛选依赖 GT(3–0):
- 「filtered EKD」设定:把候选经验知识接到新题上,在 1000 道 math validation(DAPO,带数值 GT)/ 128 局文字游戏(环境得分)上打分取最高 → 判据 = 任务表现,需要标签或环境 oracle,非 GT-free;触发在蒸馏训练前的数据选择期,硬性 top-1 选择
- 其明确 GT-free 的「test-time EKD」设定为随机选取,论文自述:"no ground-truth labels are available and the quality of experiential knowledge is not pre-evaluated"
- 机制(学生无 context 采样自身轨迹 + 对 context-conditioned 冻结 teacher 逐位置 reverse KL、top-256 学生词表)与两应用(experiential / system prompt distillation)均证实
⟹ 裁决:第八轮定稿声明维持原文,免于第五次收紧。 且 OPCD 构成反向支持:它把 GT-free 部署场景明确留在「质量不预评」状态——这正是我方要填的空白,可作 Related Work 中空白存在性的直接文献锚点。
5 篇全文(水印
2411.05877v1/2606.11627v1/2209.15189v1/2503.23895v4/2605.20948v1),17 主张 × 3 票 = 51 票:12 条 3–0 确认,5 条修正。无一篇含正确性/质量写入门 → 空白声明再获确认。
Generative Adapter(2411.05877v1)——主 baseline 资格确认,但隔离主张须按 #16 收紧:
- ✅ 机制:冻结基座 + 双线性生成器把 context 隐状态外积映射为 rank-128 LoRA 型增量权重,单次前向、无测试期梯度;流式增量
S_t ← S_{t-1} + A₂H_t^⊤H_tB₁ ⚠️ scope:生成器本身需预训练(1B SlimPajama token,8×H100 约 20h)+ 指令微调,~500M 参数——只有每 context 的写入路径是免训练的- ✅ 无准入门(SVD 归一化是训练稳定性手段,非筛选);✅ 数字核实(StreamingQA 19.5→31.5;MetaICL 44.9/26 任务;MSC 4× 省算力但 F1 40.2 vs 66.0)
When Context Returns(2606.11627v1)——两个实验设计风险之一升级为 ✅:
- ✅ 现象:context-induced degradation 成立但非普遍——12 设定中 7 个属退化域(Regime A);8 个 QA 设定全部出现非平凡 Harm
- ✅ 修复:NCA = stop-gradient 锚定 + forward-KL 一致性正则合为一项(β=0.5),11/12 设定降低 Harm(唯一例外 FrozenLake 跨模型蒸馏反升 5.6%→13.3%);无 context 准确率 7/8 QA 提升
⚠️ 引用 scope:仅测系统提示 + 游戏策略脚手架,未测文档/RAG context;全程单 seed、100 步全参微调、机制分析仅单模型单游戏个案
Snell(2209.15189v1)——七轮 0–3 的悬案解决,可按精确措辞引用:
- 机制(SN1 精化):teacher = 同一模型的冻结副本、条件化于详细指令+示例;student 在最小 prompt下学预测 f(y)(剥掉 scratchpad 的最终答案);损失实现为 token 级 KL(teacher 软标签用 100 采样近似),非硬标签微调
- ✅ 「无 GT」的准确 scope:蒸馏输入无标签/合成、目标永远是 teacher 自身输出;但标签间接进入——teacher prompt 内嵌少量带标签 in-context 示例、teacher 曾在带标签数据上微调过
- 「SPIDER +9%」终获精确解(0C/3CORR):= 8-shot 下 exact set match 27.9 vs 18.9,比直接梯度下降微调同 8 例高 9.0 个百分点(4-shot +8.7);不是对 teacher(28.2,学生几乎追平)也不是相对提升
- ✅ 无准入门
DyPRAG(2503.23895v4):✅ 机制(超网络翻译器 doc→LoRA、测试期免训练,但翻译器离线训练需 480–4800 个 doc-LoRA 对);❌ 我方「平均干扰」转述被改正(#17);✅ 无写入门(唯一筛选是检索侧 BM25 top-c;附录 E 自陈劣质检索照样翻译注入)
Memory Grafting(2605.20948v1):✅ 机制——实为预训练容量扩展方法(把大模型冻结隐状态存入 n-gram 索引表、注入小 MoE receiver),与 agent/用户记忆无关;✅ 数字 53.86/51.95/52.43 精确(MG/MoE/vanilla Engram,9 基准均值);
arXiv:2607.08065 的大规模审计(53 runners × K=50 × 265,000 samples):一致性只是弱预测子 (Spearman ρ 0.20–0.59),高一致(C≥0.8)的 gpt-4.1 在 GPQA 上仍 48% 出错。
"Self-consistency is not accuracy… unreliable as a standalone confidence score."
⟹ 可论证:一致性类信号 ≠ 压缩类判据,且共识门控的正确性代理效力本身存疑。
- 定位:十类代理表(族 1–6 + 2026 agentic 记忆,多数经全文穷举);空白已收紧为「判据类型=压缩/MDL」×「门控环节=推理期持久写入」两轴(§4)
- 核心信号:压缩增益能分开 M 与 M′(22 items,19/22,p=0.00043 单侧 / 0.00086 双侧)
- 观测量:必须是用词决策序列,不是自由陈述
- per-item 校准:零分布 z 分数;且设计预测精确成立(M′ 平均 −0.22 vs 零分布中心 −0.27,差 0.05 nats)
- 三态门 + 弃权正当性(被弃权项 AUC 0.551 ≈ 随机)
- 跨规模校准:
rank批内分位 - ★ C4 独赢点已实证(P2):核心域压缩 AUC 0.915 vs 语义熵 0.269,且查清失效机制(窄度膨胀确信度)
- ★ P4 隔离必要性已实证(P3):分区后判别 AUC 1.000、门控 8/8;不分区则门控 50% = 随机
- ★ 四条性质端到端跑通(P4):门控 16/16 · 清空上下文后 0.514 → 0.980 · 跨分区命中 0/16
- ★ L4 参数化记忆达成 I1 免检索(P5):无任何上下文陈述下 0.485 → 0.992;同等容量的共享槽第 2 次写入即崩(分区 ≫ 容量)
- ★ I2 与世界知识的组合成立(P6):跨域探针 base 0.500 → L4 0.949(+0.449),且反超 L1 上下文注入 +0.109;世界知识前置检查 AUC 0.891
- ★ I2 概念 ⊗ 概念也成立(P7):合并训练 min(两半) 0.889 vs 单概念策略上界 0.500、base 0.479; 前置检查:基座真词合取 0.973、L1 0.986 ⟹ 任务可解
- ★ 分区必须同时作用于写入与检索(P7 诊断):只掩梯度时 25% 的 top-4 跨区,w1 从 0.951 掉到 0.483
- ★ I5 抗干扰成立且优于上下文注入(P8):冲突定义下 L4 降 0.050 vs L1 0.075; 干扰已验证有效(base 0.545 → 0.033,照单全收)
- ★ I3 不成立,且机制已查清(P8):学到的是读出方向不是概念(m·(W_yes−W_no) +0.79 vs m·(W_A−W_B) +0.003, 检索重合率 0.750);迁移量与读出余弦同序;多格式训练不是解法
| 问题 | 现状 |
|---|---|
| E5 条件化失败 | 模型先验压过给定定义,随规模恶化;σ_null 只抓住 3B 上 7 个错误中的 3 个 |
| 误收 M′ | 三态门仍误收 3 个(误解被固化是最该压低的错误) |
| I2 的剩余空白 | ✅ P6(⊗ 世界知识)+ ✅ P7(⊗ 概念);否定/量化、多跳组合、同属性内的两个概念仍未测 |
| 🔴 「顺序到达 + 强组合」无解 | 顺序写入下能保住单概念的只有子区+双掩码(0.927,Δ 0.000),但它把合取压到 0.653(合并训练 0.889)。可隔离性 ↑ ⟹ 组合性 ↓,两者要求相反(P7 §2.4) |
| 参数化路线在组合上确有代价 | L4 全线低于 L1(min 0.889 vs 0.986)——不得掩饰 |
| 🔴 I3 不成立,且不是调参能补的 | 换读出方向即失效(0.507);是 final-layer 架构的直接后果。中间层记忆是有实证动机的下一步,但未做,不得声称能解决 |
| P5–P7 的作用域 | 全部在 F1 Yes/No 一个读出方向内;论文每条结论都须显式加这个限定 |
| I3 隐式触发 / I5 抗干扰 | 五判据中仅存的两条完全未测 |
| 关系类概念(G4) | AUC 0.562 ≈ 随机(1.5B);已归因为基座能力边界 |
| 内化不幂等 | 🔍 把原 context 重新塞回已内化模型,性能反而变差 —— 本项目正是"引用→内化"系统,必须测 |
| 迭代内化能力坍缩 | 🔍 progressive capability collapse,而非复利式改进 |
| ✅ 第十、十一轮全部清零:J/J′/P 族 + 2606.04703 均已 3 票验证——引用时须按 §4 #14–#19 收紧措辞。当前论文引用面上没有任何未验证主张 |
单模型族(Qwen2.5)、22 items、bootstrap CI 是 item 层非 seed 层、决策标签由构造给定(未覆盖从真实对话抽取的环节)、未测 E2(按设计不在射程内)。
✅ 已完成(第九至十一轮 + 2026-08-01 写作日):文献 🔍 全部清零(2412.14964/OPCD 风险口闭合、J/P 族五篇收尾、2606.04703 坍缩核定);Introduction / Related Work 初稿已成(paper/DRAFT_INTRO_RELATED_WORK.md);两个内化风险已入实验设计;P1 生成器落地并实证复核通过——程序化 40 items 在 1.5B 上核心域 G1–G3 margin +4.44(23/24, p=1e-6, AUC(z) 0.911),复现 p0 手工集(+4.08, 19/22),G4 AUC 0.500 精确复现能力边界;分词器过滤 0 标记、零样本探针 AUC 0.394≈无先验。
- ✅
P2 三臂对照已完成(C4 成立,§3.5)· ✅P3 隔离测试已完成(§3.6) 1b. ✅P4 端到端闭环已完成(§3.7)—— 四条性质首次同时成立 1c. ✅L4 参数化记忆已完成(§3.8,I1 达成) 1d. ✅验证 I2 组合性(跨域探针)已完成(§3.9)—— 结果推翻了我方自设的限制 1e. ✅「概念 ⊗ 概念」组合已完成(§3.10)—— 成立,但连带查出分区内顺序干扰 1f. ✅I3 / I5已完成(§3.11)—— I5 成立、I3 不成立,机制已查清 1g. 🔴 下一步(优先级已被 P8 改写): (a) ★ 实现中间层 product-key 记忆并测跨读出方向迁移 —— 现在有实证动机(§3.11),是最该做的一条; (b) 否定/量化探针 + 同属性内的两个概念(比正交属性更难); (c) 🔴 攻「顺序到达 + 强组合」这一格——目前无解(§3.10); (c) 把 final-layer memory 上移到中间层(研究文档 §7.4 的原提案)——注意 P6 之后这已不是为了补组合性,而是为了检验表征层介入是否另有收益 1b. 补真正的 EIG 主动追问臂(交互式追问回路),当前只是静态不确定性差 - E5 仍需解法——σ_null + rank 只是缓解;三态门仍误收 3 个 M′
2b. ✅
Method/Experiments 初稿已完成(paper/DRAFT_METHOD_EXPERIMENTS.md,含 8 条禁令自查表) - 打磨两份草稿:补正式 bibkey + 3 张图表(三臂对照分层图 / 端到端闭环示意 / 十类代理定位表)
- ✅
⏰ 投稿前重扫 rate-distortion / memory-compaction已做(2026-08-04,第十二轮): 抓到 ConsistencyGate 2607.22962(⟹ 第五次收紧,见 §0.1); MemRefine 2606.13177 经核为事后压缩、无 MDL 判据,不构成威胁; 2607.08032 仍未被实现;DeMem 2605.10870 是压缩族里离得最近的一篇,但不用描述长度、 不做准入、压缩的是智能体自己的动作、且需观测奖励 ⟹ 判据类型那一轴(加两条限定后)仍空。 ⏰ 投稿当月须再扫一次——该方向 1 个月内就冒出一篇直接命中的。
| 文档 | 内容 |
|---|---|
| p12/PROTOCOL.md / p12/RESULTS.md | 冻结确认实验:90 个未见主域对、五个生成 seed、三模型、两提示、直接基线、分层 bootstrap、污染控制与文本编码回本诊断 |
| p13/PROTOCOL.md / p13/RESULTS.md | 端到端接口压力测试:自然用法抽取、四候选生成、冻结门;主 seed 与两个明确标为事后的稳健性 seed |
| paper/main.tex / paper/output/pdf/iclr2027_predictive_compression.pdf | 官方 ICLR 2027 模板主稿与逐页验证 PDF;主文 7 页、参考文献与附录随后 |
| paper/ICLR_SUBMISSION_PLAN.md | 投稿判断、不可越过的主张边界、完成闸门、reviewer 风险与截止日前计划 |
| docs/RESEARCH_KNOWLEDGE_INTERNALIZATION.md | 知识内化全景(家族 A–P):内化五判据 I1–I5、内化度阶梯 L0–L5、核心张力、六环节流水线 |
| docs/RESEARCH_LEARNING_IN_REFERENCING.md | 四轮调研全集 + §7.6.2 十类代理表 + §9.3 立论包 |
| docs/DESIGN_COMPRESSION_GATE.md | 机制:E1–E5 划界、观测量、三态门、三个前置条件、失败模式 |
| docs/DESIGN_CONCEPT_BENCH.md | 数据:构造语言、gavagai 对 G1–G5、切断 Aycock 捷径、隔离测试 |
| p0/README.md | P0 实证全记录(§2 失败 → §3 诊断 → §4 成立 → §5 校准 → §6 扩展 → §6b 三态门 → §6c 缩放 → §6d 探针失败 → §6e 无量纲化) |
| tools/audit_retracted.py | 一致性审计器:扫全部文档,查已推翻主张是否还以肯定语气残留(实测抓到附录 J 的两处残留) |
| paper/refs.bib | 37 条正式参考文献:会场只在有证据时填(自我推翻 #9 的教训);各条 note 写死引用纪律,引用时绕不过去 |
| paper/figures/ | 三张投稿图 + 与实验 summary 的交叉核对闸门(对不上即拒绝出图) |
| p11/README.md | P11 + P11b 词条记忆:按词的 token 触发、值进表征。绑定拿到(0.080)、跨格式未达线(F2 0.570 / F3 0.775 vs 及格线 0.85);两个双向控制均按预测失败 ⟹ 约束的归因成立、"满足即够"错;§7 诊断出 F2 的失败是 H_weak(真没迁移)而非饱和;§8 身份保持项经 λ 扫证明不需要且略有害;§3 复述控制的"未过"是 hook 重复注册的 bug,已撤回 |
| p10/README.md | P10 强制词绑定:两词在同一物体上标签相反 ⟹ 只看物体的上限 0.500;L7 真绑定(落差 −0.855)但跨格式随之消失;四格图——参数化路线最多只拿到「绑定」与「跨格式」之一 |
| p9/README.md | P9/P9b/P9c + 机制诊断:中间层跨读出方向 0.940,增益来自位置覆盖;🔴 换词控制推翻词绑定(落差 0.017–0.018);两个方案因不同原因失败(路由看不见词 / 判别力保留 97%) |
| p8/README.md | P8 I3/I5:I5 成立(且优于 L1)、I3 不成立;机制=读出方向不是概念;P8b 证明多格式训练不是解法;回溯限定 P5–P7 的作用域 |
| p7/README.md | P7 概念 ⊗ 概念:I2 补齐(0.479 → 0.889);分区内顺序干扰(−0.361)与其诊断(检索跨区 25%);隔离 vs 组合的直接冲突 |
| tools/probe_metrics.py | 判别度量的唯一入口:AUC 是判据,命中率只作 No 偏置证据。抽出来是因为同一个仪器错误在 P3 后又犯了一次(P6 前置检查) |
| p6/README.md | P6 I2 组合性:跨域探针(概念 ⊗ 世界知识)base 0.500 → L4 0.949;推翻我方自设的"缺深度组合性"限制;三条限定(base 0.500 是构造性 / 概念⊗概念未测 / L4 反超 L1 只是假说) |
| p5/README.md | P5 L4 参数化记忆:I1 免检索达成(0.485→0.992);分区 vs 共享消融;两次失败的诊断记录(全词表 CE / 路由塌缩) |
| p4/README.md | P4 端到端闭环:四性质首次同时成立;共享库 last-write-wins;三条限定(L1≠L4、门控任务更易、零干扰是构造性) |
| p3/README.md | P3 冲突词隔离:P4 性质实证;分区 8/8 vs 共享 50%;三处限定 + No 偏置的方法学教训 |
| p2/README.md | P2 三臂对照:C4 核心实验;语义熵失效机制(窄度膨胀确信度)+ 两臂等价性声明 |
| p1/README.md | P1 构造语言生成器(词库 + 微世界 + G1–G5 程序化构造 + 隔离对;不变量测试全过) |
| paper/DRAFT_METHOD_EXPERIMENTS.md | Method / Experiments 投稿草案 v1:§3 机制 · §4 材料与口径 · §5 三臂/作用域/隔离/端到端 · §6 五条限制 · §7 8 条禁令自查表 |
| paper/DRAFT_INTRO_RELATED_WORK.md | Introduction / Related Work 投稿草案 v1(第八轮定稿措辞 + 三条禁令自查表 + 措辞红线速查) |
| r9/ / r10/ / r11/ | 第九/十/十一轮 3 票裁决原始记录(33 + 51 + 12 票,证据引文 + PDF md5) |
| p1/p1_eval_Qwen2.5-1.5B-Instruct.json | P1 程序化 items 实证复核(核心域 +4.44, 23/24, AUC(z) 0.911;探针 + 分词器过滤补跑) |
代码(p0/,全部可复现,零训练算力):
| 脚本 | 作用 |
|---|---|
items.py / items_v2.py / heldout.py / nullpool.py |
材料:8 → 22 个 gavagai 对 × 5 类歧义 |
p0_compression_gate.py |
朴素版(自由陈述)→ 失败 |
p0b_diagnose.py |
决定性诊断 → 能力在,观测错 |
p0c_decision_mdl.py |
修正版(决策序列)→ 成立 |
p0d_calibration.py |
per-item z 校准 |
p0e_v2_eval.py |
22 items + bootstrap CI + 分类型 |
p0f_g4_probe.py |
G4 失败归因 → 基座能力边界 |
p0g_abstention.py |
三态门(弃权) |
p0h_apparatus_check.py |
仪器有效性检查(下 E5 结论前的前置验证) |
p0i_faithfulness.py |
忠实性探针(失败,存档以免重复) |
p0j_calibration.py |
σ_null 无量纲化 → rank |
scale_eval.py |
缩放曲线(1.5B / 3B) |
本阶段最有价值的不是任何单一结论,而是每个主张都配了一个能否掉它的诊断项:
- 朴素压缩门的 8/8 → 被自埋的
ΔNLL拆解否掉(92% 是长度罚) - E5 结论 → 先做仪器有效性检查才敢下(平凡常识题 6/6,排除格式假象)
- 三态门的弃权 → 用被弃权项的 AUC ≈ 随机证明弃权是对的,而非逃避
- 第三、四、六轮调研被指定去证伪我方主张,而非支持它
31 处自我推翻中有 16 处来自这些诊断项,其余大多来自被指定去证伪我方主张(或定向核查)的调研轮。 这个习惯应保持到投稿。
★ P6 加了一条新纪律:自己声明的「限制」也必须做实验——「final-layer memory 缺深度组合性」被当作限制写进了 P5 与 Method 草稿,实际从未测过,一测就反了(#21)。未测的限制和未测的优点一样不可信。
第七轮另沉淀了一套核查 SOP(血泪换来的):
- 子串误报清单:
LoRA ⊂ exploration、gate ⊂ aggregation/mitigate/propagate/backpropagate/Bagatella(人名)、gating ⊂ backpropagating/investigating、curat ⊂ accurately - 词边界正则 + 原始 substring 双跑并对比,每个非零命中回读上下文,归为 (i) 写入准入判据 / (ii) 网络门控单元 / (iii) 评测指标或无关
- 🚨 arXiv HTML 端点曾对 2605.26099v2 返回另一篇论文的全文(两次下载 md5 不同)→ 必须用正文水印
arXiv:XXXX.XXXXXvN校验身份 ⚠️ 不得从「论文不假设 oracle verifier」推出「因此不可能有正确性门控」——该强推论被三次独立否决(0-3 ×3)