Skip to content

Latest commit

 

History

History
192 lines (139 loc) · 10.3 KB

File metadata and controls

192 lines (139 loc) · 10.3 KB

构造语言 Benchmark — 让"误解"成为可控实验条件

定位:DESIGN_COMPRESSION_GATE.md 论证了压缩门要赢在 E1(模型自信且一贯地误解教学内容)。本文档设计一套数据,使 E1 不再靠碰运气,而是被构造出来、可控、可判分。 核心设计:教学集在构造上就不足以消歧(M 与 M′ 都成立),只有留出用法能揭示老师的真实所指。这正是 Quine 的 gavagai,被做成了实验条件。

  • 状态:设计定稿(待实现)
  • 最后更新:2026-07-24
  • 前置阅读:研究文档 §3.3(污染控制)、§8(实验骨架);机制文档 §0(E1/E2 划界)、§4(消融矩阵)

§1 为什么必须是构造语言(而不是真汉语)

研究文档 §8 已定这个方向,这里补足四条硬理由:

# 理由 说明
1 真 "English-only" 在规模上不可保证 Unicode、代码注释、借词、平行语料泄漏——无法审计
2 构造 ⇒ 新颖性由构造保证 绕开研究文档 §3.3 中"随机 DFA 保证 OOD" ❌0-3 被否 的方法论争议
3 有 GT 供最终打分(门本身看不到) 可以判"接受的是 M 还是 M′"
4 可控与英语的距离 把"迁移了什么"做成可调旋钮,而非事后猜测

🚨 不可复用现成人造语:Esperanto / Klingon / toki pona / Lojban 都在预训练数据里。必须现造。


§2 语言设计

2.1 词库(保证新颖)

  • 音位模板:CV(C) 音节,音素集 {p,t,k,m,n,s,l,r} × {a,i,u,o,e},2–3 音节 → 生成伪词。
  • 四道过滤:
    1. 与英语/多语词表比对(含常见专名、品牌、缩写)
    2. 分词器熟悉度检查——剔除会被切成"有语义前缀"的串
    3. 零样本探针:基座模型对该词无先验联想(见 §5 污染控制)
    4. 词内最小编辑距离约束,避免混淆
  • 规模:内容词 ~40–60(足以组合,又能在冻结 0.5B 上跑通)。

2.2 语义微世界(保证可组合、可判分)

一个组合式微世界,语义完全由构造决定:

实体 = kind(5) × color(4) × size(3)          # 60 种实体
关系 = {above, contains, gives, follows}      # 有方向 → 可测论元顺序
事件 = agent × relation × patient

→ 组合空间足够大,可以留出"未见组合"来区分泛化 vs 死记硬背(机制文档 §3 失败模式 2/3)。

2.3 语法参数(与英语距离的旋钮)

参数 取值 作用
语序 SOV / SVO / VSO 与英语的结构距离
格标记 无 / 后缀 论元角色是否显式
一致关系 无 / 数一致 形态复杂度
修饰语序 前置 / 后置 短语结构距离

用途:做"距离 × 习得难度"的曲线,回答研究文档 §9.2 的"迁移了什么"。主实验固定一档,其余作附录。


§3 ★ 核心:gavagai 对(把 E1 构造出来)

构造原则:教学集中,M 与 M′ 外延一致(两个假设都完美解释所有教学样例);留出集把它们分开。

# 歧义类型 M(老师真意) M′(诱人的误解) 教学集为何不足 留出集如何消歧
G1 合取 红 红 ∧ 圆 所有教学样例恰好又红又圆 出现 红∧非圆
G2 范畴层级 动物(上位) 鸟(基本层) 教学样例全是鸟 出现非鸟的动物
G3 部分/整体 整只 X X 的某部分 整体出现时部分必然出现 出现分离的部分 / 遮挡
G4 论元顺序 A 给 B B 收 A 教学中施受角色恒定 角色互换的场景
G5 属性 vs 关系 大(绝对) 比…大(相对) 教学中对照物恒定 换对照物

✅ P0e 实测(22 items,见 P0 §6):G1–G5 已全部构造并跑通,但难度极不均—— G2 范畴 +9.12 / G3 材料 +8.25(AUC 1.000) ≫ G1 合取 +2.93 ≫ G5 +0.53 / G4 论元顺序 +0.15(AUC 0.562 ≈ 随机)。 🔴 设计时"双向判别应强于单向"的预测被推翻(单向 +5.41 vs 双向 +2.98,G4 拖累)。已撤回该预测。 G4 失败机制(P0f 已归因):三种定义呈现(抽象变量 / 显式角色说明 / 真实人名实例化)全部失败,且显式角色说明反使 margin 转负 −0.56(同时 |ΔNLL| 升到 3.37 —— 定义被用了,但方向是错的)。→ 排除提示格式与变量绑定,坐实为基座能力边界,非材料缺陷。

对后续 benchmark 的含义:主实验应以 G1/G2/G3 为核心;G4/G5 单列为"当前基座不可及"的作用域边界,别混入主指标。

每对给出三类判分:

结果 含义 判分
接受 M 学对了 ✅ 真阳
接受 M′ E1 误解被固化 ❌ 假阳(要打的靶)
追问 / 暂缓 识别到歧义,未过早承诺 ✅ 可接受(EIG 臂在工作)

这就是三臂对照要打出的分离:

  • 语义熵:模型自信承诺 M′ → 低熵 → 接受 ❌
  • SAGE 几何门:M′ 常常更"新颖" → 优先 ADD ❌
  • 压缩门:M′ 预测不了留出用法 → 增益低 → 拒绝 ✅

§4 教学协议(切断 Aycock 捷径)

研究文档 §3.2:Aycock et al.(ICLR 2025)证明 MTOB 的增益几乎全来自平行例句与词典,不是语法规则。不切断这条捷径,结果会被判为 task location。

协议:

  1. 指物(ostension):场景 + 目标语句子,不给英语翻译
  2. 定义(definition):用英语描述语法规则/词义,不给平行句对
  3. 留出项必须是未见组合 → 查表无效
  4. 🔴 强制消融:平行句对教学 vs 仅指物+定义
    • 若增益全来自平行句对 → 我们复现了 Aycock,必须如实报告
    • 若指物+定义单独有效 → 这本身是对 Aycock 的正面回应,值一节

主动学习闭环(对应研究文档 §9.2 与 gavagai): 学习者形成假设 → 生成测试句 → 向老师提问 → 得到纠正。 指标:歧义条件下的追问率——好的系统应该在 G1–G5 上先问再承诺。


§5 污染控制(双保险)

研究文档 §3.3:新颖性证明方法论本身有争议,因此不靠单一手段。

# 控制 通过标准
1 构造新颖 词库过四道过滤(§2.1)
2 零样本探针 无教学时,基座在留出项上 ≈ 随机
3 "无教学即失败"基线(MTOB 方法论) 增益必须来自教学,而非先验
4 分词器熟悉度 无"有语义"的子词切分
5 可选:LogitTrace 式逐层检测 附录

§6 隔离测试(P4,架构性零干扰)

研究文档 §7.4:user/interlocutor 在架构文献中命中为零——这是几乎无人竞争的主张。最锋利的测法:

老师 A 教   词 "tuma" = 红
老师 B 教   同一个词 "tuma" = 蓝     ← 冲突!
指标 目标 对标
冲突词泄漏率 u_A 回答不受 u_B 影响 PersistBench cross-domain 53%
非冲突概念泄漏 ≈ 0 同上
uid 分区数学保证 key 空间前缀不相交 架构性而非约定性

为什么"冲突词"是最好的测法:它让泄漏必然可见——若 u_A 的 tuma 变蓝,泄漏就板上钉钉,无需统计推断。


§7 指标总表

# 指标 对应主张 备注
1 E1 判别 AUC(接受 M / 拒绝 M′) C4 独赢点 主指标
2 歧义下追问率 主动学习闭环有效 高追问率也算成功
3 组合泛化准确率(未见组合) 真习得 ≠ 死记硬背 抗失败模式 2/3
4 冲突词泄漏率 P4 隔离 对标 53%
5 N 次顺序写入后旧能力保持 抗灾难性遗忘 对标 fullFT 89% / LoRA 71% / 稀疏 11%
6 同基准崩溃曲线 vs ROME/MEMIT 研究文档 §7.3.4 空实验 需自建统一判分
7 教学协议消融(平行句对 vs 指物) 回应 Aycock 诚实报告
8 重现幂等性:毕业后重注原教学轮,heldout 判分不得劣化 抗"内化不幂等"(✅ 2606.11627,机制文档 §3 #11) 概念定义被复述是交互常态,必测
9 迭代巩固坍缩曲线:N 轮"引用→固化"后旧能力 + 新概念保持,gate-on vs gate-off 抗迭代坍缩(✅ 2606.04703,机制文档 §3 #12;"门可推迟坍缩"系我方 💭 假设) 与指标 5 合并跑

§8 实施顺序(按"最早能证伪"排序)

原则:先跑最可能否掉整个想法的实验,别先做工程。

阶段 做什么 需要什么 若失败意味着
P0 纸面验证压缩门:手工构造 G1 的 M/M′,在冻结小模型上纯用 prompt 算 G̃ 无需记忆层,几小时 核心信号无效 → 整个立论要重来(先做这个!)
P1 语言生成器 + 微世界 + G1–G5 数据 纯 CPU —
P2 三臂对照(压缩 / 语义熵 / EIG) 冻结 0.5B,单 GPU C4 不成立
P3 接记忆层(product-key + uid 分区)+ 隔离测试 retrofit 已在 0.5B 复现 P3/P4 主张受损
P4 顺序写入 + 崩溃曲线 vs ROME/MEMIT 同上 补研究文档 §7.3.4 空白
P5 head-to-head vs SAGE(LoCoMo,τ→压缩分数) 零训练,纯 API 最近先例未被拉开

🎯 P0 是最高优先级:它用几小时、零算力,就能验证"压缩增益能否分开 M 与 M′"。 这个信号若无效,后面全都不用做。 别先建工程。


§9 与其他文档的对应

本文档 关联
§3 gavagai 对 兑现机制文档 §0 的 E1;闭合研究文档 §3.7 的 Quine 线
§4 教学协议 回应研究文档 §3.2 的 Aycock 反驳
§5 污染控制 研究文档 §3.3 双保险
§6 隔离测试 研究文档 §7.4 的零竞争主张
§7–§8 细化研究文档 §8 / §9.3.1 实验表