这是论文 C4 主张的核心实验。 结论:核心域上压缩增益 AUC 0.915(23/24, p=1.5e-6),语义熵 AUC 0.269。 但真正值得写进论文的不是这个落差,而是语义熵失效的机制——见 §3。
| 日期 | 2026-08-01 |
| 模型 | Qwen2.5-1.5B-Instruct(冻结,bf16,纯 prompt,零训练) |
| 材料 | P1 程序化生成 40 items × 5 类歧义(非手工,见 p1/README.md) |
| 脚本 | p2_three_arm.py · 结果 p2_Qwen2.5-1.5B-Instruct.json |
三臂全部 GT-free(都不知道哪个候选是对的):
| 臂 | 打分 | 用什么信息 |
|---|---|---|
| ① 压缩增益(我方) | Σ_o[−log P(y_o|o,∅)] − Σ_o[−log P(y_o|o,c)],再按零分布做 per-item z 校准 |
老师实际的用词决策 ← 外部证据 |
| ② 语义熵 | −mean_o H(p_yes(o|c)) |
只用模型自己的预测分布 ← 内部自洽 |
| ③ epistemic 下降 | mean_o[H(p_yes(o|∅)) − H(p_yes(o|c))] |
只用模型自己的预测分布 |
论点:②③ 无法区分「自洽的正确概念」与「自洽的误解」,因为二者都自洽。 只有对照老师的实际用法才能分开——这就是 C2/C4 的全部内容。
Farquhar et al.(Nature 2024)对自由生成采样后按双向蕴含聚成「意义簇」再算熵。 本设定输出是二元 Yes/No,意义簇天然退化为 {Yes},{No},故语义熵 = 该意义分布的香农熵, 且可由 logits 精确计算而无需采样。 → 这是比原方法更强的版本(无采样噪声)。它仍失分,故结论更硬。
epi(c) = base_ent − ent(c) base_ent 与 c 无关
⟹ epi(M) − epi(M′) = ent(M′) − ent(M) = se(M) − se(M′)
实测两臂 per-item margin 的最大绝对差 = 5.55e-17(浮点零)。
对 M vs M′ 的配对判定,臂 ② 与臂 ③ 完全等价。 AUC 略有差异(0.269 vs 0.259)仅因跨 item 混合池的常数平移,不是独立信号。
⟹ 论文中必须写「压缩 vs 自洽类」两臂,不得宣称三个独立对照。
| 子集 | 臂 | M 胜 | 符号检验 p | AUC |
|---|---|---|---|---|
| 核心域 G1–G3(n=24) | 压缩增益(z) | 23/24 | 1.5e-06 | 0.915 ✅ |
| 压缩增益(裸 ΔNLL) | 23/24 | 1.5e-06 | 0.835 | |
| 语义熵 | 5/24 | 0.999 | 0.269 ❌ | |
| 全部 5 类(n=40) | 压缩增益(z) | 37/40 | 9.7e-09 | 0.809 ✅ |
| 语义熵 | 16/40 | 0.923 | 0.423 ❌ |
按「M′ 是否比 M 更窄」分层,语义熵的行为完全不同:
| 分层 | n | 语义熵 AUC | 解读 |
|---|---|---|---|
| M′ 更窄(G1 合取、G2 范畴层级) | 16 | 0.137 | 严重反向——系统性偏好误解 |
| M′ 不更窄(G3 材料、G4 论元、G5 绝对/相对) | 24 | 0.507 | 恰好随机 |
机制核验(平均预测熵):
| 类型 | H(M) | H(M′) | |
|---|---|---|---|
| G1 合取 | 0.363 | 0.253 | M′ 更确信 |
| G2 范畴 | 0.308 | 0.148 | M′ 更确信 |
| G3 材料 | 0.423 | 0.404 | 略 |
| G5 绝对/相对 | 0.503 | 0.548 | M 更确信(M′ 不更窄) |
语义熵测的是「模型有多确信」,而更窄的概念天然产生更确信的预测。 于是在最常见的 gavagai 类型(合取/范畴层级,M′ ⊂ M)上, 语义熵被系统性地推向误解(AUC 0.137);在 M′ 不更窄时退化为随机(AUC 0.507)。
两种情形下它都不能识别正确概念——反向或随机,从不正向。 而压缩增益在核心域 AUC 0.915。
| 类型 | 压缩 AUC | 语义熵 AUC |
|---|---|---|
| G3 材料/物体 | 1.000 | 0.344 |
| G1 合取 | 0.953 | 0.078 |
| G5 绝对/相对 | 0.891 | 0.750 |
| G2 范畴层级 | 0.828 | 0.141 |
| G4 论元顺序 | 0.547 ≈ 随机 | 0.422 |
- ✅ G4 的能力边界被精确复现(p0 §6c 归因为基座能力边界,非机制缺陷)
⚠️ G5 是语义熵唯一有效的类型(0.750)——正因该类 M′ 不更窄。诚实报告,勿隐去。
- 只有 2 个独立臂(§2),不是宣传中的 3 个。
- EIG 主动追问臂未实现——本轮的「epistemic 下降」是静态不确定性差, 不是 Kobalczyk et al.(ICLR 2025)的期望信息增益选问。真正的 EIG 臂需要交互式追问回路,尚未做。
- 单模型(1.5B)、单次运行;未在 3B 上复跑(p0 §6c 表明 G5 在 3B 上会因 E5 翻转)。
- 语义熵的二元适配虽是精确版,但牺牲了原方法的核心组件(双向蕴含聚类)—— 自由生成设定下结论可能不同,须在论文中声明。
- 材料由 P1 程序化生成,M′ 的构造方式决定了"是否更窄"——§3.2 的分层结论受材料设计影响, 但这恰恰是真实 gavagai 的常见形态(Quine 的 rabbit vs undetached rabbit part 也是 M′ ⊂ M)。
三臂里的 B 臂测的是自由作答一致性,而 E1(自信且一贯的误解)在自由行为里几乎不
出现——模型很少主动、稳定地承诺 M′(40 items 里仅 4 个,且一致性低)。它出现在候选
上。p2b_cond_se.py 因此给出干净版:给定候选 c ∈ {M, M′},测模型按 c 作答的一致性
SE(c),直接检验 DESIGN §2 对语义熵的失分预测。
| 模型 | 域 | SE(M) | SE(M′) | AUC |
|---|---|---|---|---|
| Qwen2.5-1.5B | 核心 G1–G3 (n=24) | 0.475 | 0.616 | 0.271 |
| Qwen2.5-1.5B | 全部 (n=40) | 0.365 | 0.441 | 0.421 |
| Qwen2.5-3B | 核心 G1–G3 (n=24) | 0.9996 | 0.99999 | 0.212 |
| Qwen2.5-3B | 全部 (n=40) | 0.886 | 0.958 | 0.329 |
两个模型、两个域,AUC 全部 < 0.5,且 SE(M′) ≥ SE(M)。 语义熵不是"分不开"——它是 系统性偏爱误解:按误解作答比按真意作答更一致,所以 SE-gate 会优先收编 M′。 预测得到确认,且方向比预测更不利。3B 上两者双双饱和至 ~1.0,判别力进一步塌缩—— 放大模型不修复这一列(与 p0 §6c 的 G5 结论同向)。
这条是负结果归档:候选条件化是 B 臂失效后最自然的下一个尝试,试过、失败、留档, 避免重复劳动(同 P0i 忠实性探针、P0k 对比条件化)。
复现:python p2/p2b_cond_se.py [model_id](独立脚本,不依赖 p2_three_arm.py)。
python p2/p2_three_arm.py --model Qwen/Qwen2.5-1.5B-Instruct依赖 p1/items_p1.json(40 items)。零训练算力,单机 MPS 约 25 分钟。