定位:DESIGN_COMPRESSION_GATE.md 论证了压缩门要赢在 E1(模型自信且一贯地误解教学内容)。本文档设计一套数据,使 E1 不再靠碰运气,而是被构造出来、可控、可判分。 核心设计:教学集在构造上就不足以消歧(M 与 M′ 都成立),只有留出用法能揭示老师的真实所指。这正是 Quine 的 gavagai,被做成了实验条件。
- 状态:设计定稿(待实现)
- 最后更新:2026-07-24
- 前置阅读:研究文档 §3.3(污染控制)、§8(实验骨架);机制文档 §0(E1/E2 划界)、§4(消融矩阵)
研究文档 §8 已定这个方向,这里补足四条硬理由:
| # | 理由 | 说明 |
|---|---|---|
| 1 | 真 "English-only" 在规模上不可保证 | Unicode、代码注释、借词、平行语料泄漏——无法审计 |
| 2 | 构造 ⇒ 新颖性由构造保证 | 绕开研究文档 §3.3 中"随机 DFA 保证 OOD" ❌0-3 被否 的方法论争议 |
| 3 | 有 GT 供最终打分(门本身看不到) | 可以判"接受的是 M 还是 M′" |
| 4 | 可控与英语的距离 | 把"迁移了什么"做成可调旋钮,而非事后猜测 |
🚨 不可复用现成人造语:Esperanto / Klingon / toki pona / Lojban 都在预训练数据里。必须现造。
- 音位模板:CV(C) 音节,音素集
{p,t,k,m,n,s,l,r} × {a,i,u,o,e},2–3 音节 → 生成伪词。 - 四道过滤:
- 与英语/多语词表比对(含常见专名、品牌、缩写)
- 分词器熟悉度检查——剔除会被切成"有语义前缀"的串
- 零样本探针:基座模型对该词无先验联想(见 §5 污染控制)
- 词内最小编辑距离约束,避免混淆
- 规模:内容词 ~40–60(足以组合,又能在冻结 0.5B 上跑通)。
一个组合式微世界,语义完全由构造决定:
实体 = kind(5) × color(4) × size(3) # 60 种实体
关系 = {above, contains, gives, follows} # 有方向 → 可测论元顺序
事件 = agent × relation × patient
→ 组合空间足够大,可以留出"未见组合"来区分泛化 vs 死记硬背(机制文档 §3 失败模式 2/3)。
| 参数 | 取值 | 作用 |
|---|---|---|
| 语序 | SOV / SVO / VSO | 与英语的结构距离 |
| 格标记 | 无 / 后缀 | 论元角色是否显式 |
| 一致关系 | 无 / 数一致 | 形态复杂度 |
| 修饰语序 | 前置 / 后置 | 短语结构距离 |
用途:做"距离 × 习得难度"的曲线,回答研究文档 §9.2 的"迁移了什么"。主实验固定一档,其余作附录。
构造原则:教学集中,M 与 M′ 外延一致(两个假设都完美解释所有教学样例);留出集把它们分开。
| # | 歧义类型 | M(老师真意) | M′(诱人的误解) | 教学集为何不足 | 留出集如何消歧 |
|---|---|---|---|---|---|
| G1 | 合取 | 红 |
红 ∧ 圆 |
所有教学样例恰好又红又圆 | 出现 红∧非圆 |
| G2 | 范畴层级 | 动物(上位) |
鸟(基本层) |
教学样例全是鸟 | 出现非鸟的动物 |
| G3 | 部分/整体 | 整只 X |
X 的某部分 |
整体出现时部分必然出现 | 出现分离的部分 / 遮挡 |
| G4 | 论元顺序 | A 给 B |
B 收 A |
教学中施受角色恒定 | 角色互换的场景 |
| G5 | 属性 vs 关系 | 大(绝对) |
比…大(相对) |
教学中对照物恒定 | 换对照物 |
✅ P0e 实测(22 items,见 P0 §6):G1–G5 已全部构造并跑通,但难度极不均—— G2 范畴 +9.12 / G3 材料 +8.25(AUC 1.000) ≫ G1 合取 +2.93 ≫ G5 +0.53 / G4 论元顺序 +0.15(AUC 0.562 ≈ 随机)。 🔴 设计时"双向判别应强于单向"的预测被推翻(单向 +5.41 vs 双向 +2.98,G4 拖累)。已撤回该预测。 G4 失败机制(P0f 已归因):三种定义呈现(抽象变量 / 显式角色说明 / 真实人名实例化)全部失败,且显式角色说明反使 margin 转负 −0.56(同时 |ΔNLL| 升到 3.37 —— 定义被用了,但方向是错的)。→ 排除提示格式与变量绑定,坐实为基座能力边界,非材料缺陷。
对后续 benchmark 的含义:主实验应以 G1/G2/G3 为核心;G4/G5 单列为"当前基座不可及"的作用域边界,别混入主指标。
每对给出三类判分:
| 结果 | 含义 | 判分 |
|---|---|---|
| 接受 M | 学对了 | ✅ 真阳 |
| 接受 M′ | E1 误解被固化 | ❌ 假阳(要打的靶) |
| 追问 / 暂缓 | 识别到歧义,未过早承诺 | ✅ 可接受(EIG 臂在工作) |
这就是三臂对照要打出的分离:
- 语义熵:模型自信承诺 M′ → 低熵 → 接受 ❌
- SAGE 几何门:M′ 常常更"新颖" → 优先 ADD ❌
- 压缩门:M′ 预测不了留出用法 → 增益低 → 拒绝 ✅
研究文档 §3.2:Aycock et al.(ICLR 2025)证明 MTOB 的增益几乎全来自平行例句与词典,不是语法规则。不切断这条捷径,结果会被判为 task location。
协议:
- 指物(ostension):
场景 + 目标语句子,不给英语翻译 - 定义(definition):用英语描述语法规则/词义,不给平行句对
- 留出项必须是未见组合 → 查表无效
- 🔴 强制消融:
平行句对教学vs仅指物+定义- 若增益全来自平行句对 → 我们复现了 Aycock,必须如实报告
- 若指物+定义单独有效 → 这本身是对 Aycock 的正面回应,值一节
主动学习闭环(对应研究文档 §9.2 与 gavagai): 学习者形成假设 → 生成测试句 → 向老师提问 → 得到纠正。 指标:歧义条件下的追问率——好的系统应该在 G1–G5 上先问再承诺。
研究文档 §3.3:新颖性证明方法论本身有争议,因此不靠单一手段。
| # | 控制 | 通过标准 |
|---|---|---|
| 1 | 构造新颖 | 词库过四道过滤(§2.1) |
| 2 | 零样本探针 | 无教学时,基座在留出项上 ≈ 随机 |
| 3 | "无教学即失败"基线(MTOB 方法论) | 增益必须来自教学,而非先验 |
| 4 | 分词器熟悉度 | 无"有语义"的子词切分 |
| 5 | 可选:LogitTrace 式逐层检测 | 附录 |
研究文档 §7.4:user/interlocutor 在架构文献中命中为零——这是几乎无人竞争的主张。最锋利的测法:
老师 A 教 词 "tuma" = 红
老师 B 教 同一个词 "tuma" = 蓝 ← 冲突!
| 指标 | 目标 | 对标 |
|---|---|---|
| 冲突词泄漏率 | u_A 回答不受 u_B 影响 | PersistBench cross-domain 53% |
| 非冲突概念泄漏 | ≈ 0 | 同上 |
| uid 分区数学保证 | key 空间前缀不相交 | 架构性而非约定性 |
为什么"冲突词"是最好的测法:它让泄漏必然可见——若 u_A 的
tuma变蓝,泄漏就板上钉钉,无需统计推断。
| # | 指标 | 对应主张 | 备注 |
|---|---|---|---|
| 1 | E1 判别 AUC(接受 M / 拒绝 M′) | C4 独赢点 | 主指标 |
| 2 | 歧义下追问率 | 主动学习闭环有效 | 高追问率也算成功 |
| 3 | 组合泛化准确率(未见组合) | 真习得 ≠ 死记硬背 | 抗失败模式 2/3 |
| 4 | 冲突词泄漏率 | P4 隔离 | 对标 53% |
| 5 | N 次顺序写入后旧能力保持 | 抗灾难性遗忘 | 对标 fullFT 89% / LoRA 71% / 稀疏 11% |
| 6 | 同基准崩溃曲线 vs ROME/MEMIT | 研究文档 §7.3.4 空实验 | 需自建统一判分 |
| 7 | 教学协议消融(平行句对 vs 指物) | 回应 Aycock | 诚实报告 |
| 8 | 重现幂等性:毕业后重注原教学轮,heldout 判分不得劣化 | 抗"内化不幂等"(✅ 2606.11627,机制文档 §3 #11) | 概念定义被复述是交互常态,必测 |
| 9 | 迭代巩固坍缩曲线:N 轮"引用→固化"后旧能力 + 新概念保持,gate-on vs gate-off | 抗迭代坍缩(✅ 2606.04703,机制文档 §3 #12;"门可推迟坍缩"系我方 💭 假设) | 与指标 5 合并跑 |
原则:先跑最可能否掉整个想法的实验,别先做工程。
| 阶段 | 做什么 | 需要什么 | 若失败意味着 |
|---|---|---|---|
| P0 | 纸面验证压缩门:手工构造 G1 的 M/M′,在冻结小模型上纯用 prompt 算 G̃ |
无需记忆层,几小时 | 核心信号无效 → 整个立论要重来(先做这个!) |
| P1 | 语言生成器 + 微世界 + G1–G5 数据 | 纯 CPU | — |
| P2 | 三臂对照(压缩 / 语义熵 / EIG) | 冻结 0.5B,单 GPU | C4 不成立 |
| P3 | 接记忆层(product-key + uid 分区)+ 隔离测试 | retrofit 已在 0.5B 复现 | P3/P4 主张受损 |
| P4 | 顺序写入 + 崩溃曲线 vs ROME/MEMIT | 同上 | 补研究文档 §7.3.4 空白 |
| P5 | head-to-head vs SAGE(LoCoMo,τ→压缩分数) | 零训练,纯 API | 最近先例未被拉开 |
🎯 P0 是最高优先级:它用几小时、零算力,就能验证"压缩增益能否分开 M 与 M′"。 这个信号若无效,后面全都不用做。 别先建工程。
| 本文档 | 关联 |
|---|---|
| §3 gavagai 对 | 兑现机制文档 §0 的 E1;闭合研究文档 §3.7 的 Quine 线 |
| §4 教学协议 | 回应研究文档 §3.2 的 Aycock 反驳 |
| §5 污染控制 | 研究文档 §3.3 双保险 |
| §6 隔离测试 | 研究文档 §7.4 的零竞争主张 |
| §7–§8 | 细化研究文档 §8 / §9.3.1 实验表 |