Skip to content

Latest commit

 

History

History
154 lines (112 loc) · 7.38 KB

File metadata and controls

154 lines (112 loc) · 7.38 KB

P2 — 三臂对照:压缩增益 vs 自洽类信号

这是论文 C4 主张的核心实验。 结论:核心域上压缩增益 AUC 0.915(23/24, p=1.5e-6),语义熵 AUC 0.269。 但真正值得写进论文的不是这个落差,而是语义熵失效的机制——见 §3。

日期 2026-08-01
模型 Qwen2.5-1.5B-Instruct(冻结,bf16,纯 prompt,零训练)
材料 P1 程序化生成 40 items × 5 类歧义(非手工,见 p1/README.md)
脚本 p2_three_arm.py · 结果 p2_Qwen2.5-1.5B-Instruct.json

1. 设计:三臂的结构性差异就是论点本身

三臂全部 GT-free(都不知道哪个候选是对的):

臂 打分 用什么信息
① 压缩增益(我方) Σ_o[−log P(y_o|o,∅)] − Σ_o[−log P(y_o|o,c)],再按零分布做 per-item z 校准 老师实际的用词决策 ← 外部证据
② 语义熵 −mean_o H(p_yes(o|c)) 只用模型自己的预测分布 ← 内部自洽
③ epistemic 下降 mean_o[H(p_yes(o|∅)) − H(p_yes(o|c))] 只用模型自己的预测分布

论点:②③ 无法区分「自洽的正确概念」与「自洽的误解」,因为二者都自洽。 只有对照老师的实际用法才能分开——这就是 C2/C4 的全部内容。

⚠️ 臂 ① 用到的 heldout 标签是「老师被观察到的用法」(数据),不是「关于概念对错的答案」。 三臂都没有 GT。

语义熵的适配(必须写进论文)

Farquhar et al.(Nature 2024)对自由生成采样后按双向蕴含聚成「意义簇」再算熵。 本设定输出是二元 Yes/No,意义簇天然退化为 {Yes},{No},故语义熵 = 该意义分布的香农熵, 且可由 logits 精确计算而无需采样。 → 这是比原方法更强的版本(无采样噪声)。它仍失分,故结论更硬。


2. 🔴 一个必须先声明的方法学事实:实际只有 2 个独立臂

epi(c) = base_ent − ent(c)      base_ent 与 c 无关
⟹ epi(M) − epi(M′) = ent(M′) − ent(M) = se(M) − se(M′)

实测两臂 per-item margin 的最大绝对差 = 5.55e-17(浮点零)。

对 M vs M′ 的配对判定,臂 ② 与臂 ③ 完全等价。 AUC 略有差异(0.269 vs 0.259)仅因跨 item 混合池的常数平移,不是独立信号。

⟹ 论文中必须写「压缩 vs 自洽类」两臂,不得宣称三个独立对照。


3. ★ 结果:语义熵不是"随机失效",而是被概念宽度系统性误导

3.1 总表

子集 臂 M 胜 符号检验 p AUC
核心域 G1–G3(n=24) 压缩增益(z) 23/24 1.5e-06 0.915 ✅
压缩增益(裸 ΔNLL) 23/24 1.5e-06 0.835
语义熵 5/24 0.999 0.269 ❌
全部 5 类(n=40) 压缩增益(z) 37/40 9.7e-09 0.809 ✅
语义熵 16/40 0.923 0.423 ❌

3.2 ★ 机制:窄度膨胀确信度

按「M′ 是否比 M 更窄」分层,语义熵的行为完全不同:

分层 n 语义熵 AUC 解读
M′ 更窄(G1 合取、G2 范畴层级) 16 0.137 严重反向——系统性偏好误解
M′ 不更窄(G3 材料、G4 论元、G5 绝对/相对) 24 0.507 恰好随机

机制核验(平均预测熵):

类型 H(M) H(M′)
G1 合取 0.363 0.253 M′ 更确信
G2 范畴 0.308 0.148 M′ 更确信
G3 材料 0.423 0.404 略
G5 绝对/相对 0.503 0.548 M 更确信(M′ 不更窄)

⟹ 精确结论(论文应采用这一版,不要用"语义熵≈随机")

语义熵测的是「模型有多确信」,而更窄的概念天然产生更确信的预测。 于是在最常见的 gavagai 类型(合取/范畴层级,M′ ⊂ M)上, 语义熵被系统性地推向误解(AUC 0.137);在 M′ 不更窄时退化为随机(AUC 0.507)。

两种情形下它都不能识别正确概念——反向或随机,从不正向。 而压缩增益在核心域 AUC 0.915。

3.3 分类型(压缩臂)

类型 压缩 AUC 语义熵 AUC
G3 材料/物体 1.000 0.344
G1 合取 0.953 0.078
G5 绝对/相对 0.891 0.750
G2 范畴层级 0.828 0.141
G4 论元顺序 0.547 ≈ 随机 0.422
  • ✅ G4 的能力边界被精确复现(p0 §6c 归因为基座能力边界,非机制缺陷)
  • ⚠️ G5 是语义熵唯一有效的类型(0.750)——正因该类 M′ 不更窄。诚实报告,勿隐去。

4. ⚠️ 限制

  1. 只有 2 个独立臂(§2),不是宣传中的 3 个。
  2. EIG 主动追问臂未实现——本轮的「epistemic 下降」是静态不确定性差, 不是 Kobalczyk et al.(ICLR 2025)的期望信息增益选问。真正的 EIG 臂需要交互式追问回路,尚未做。
  3. 单模型(1.5B)、单次运行;未在 3B 上复跑(p0 §6c 表明 G5 在 3B 上会因 E5 翻转)。
  4. 语义熵的二元适配虽是精确版,但牺牲了原方法的核心组件(双向蕴含聚类)—— 自由生成设定下结论可能不同,须在论文中声明。
  5. 材料由 P1 程序化生成,M′ 的构造方式决定了"是否更窄"——§3.2 的分层结论受材料设计影响, 但这恰恰是真实 gavagai 的常见形态(Quine 的 rabbit vs undetached rabbit part 也是 M′ ⊂ M)。

4b. P2b — 候选条件化语义熵(B 臂的干净版)

三臂里的 B 臂测的是自由作答一致性,而 E1(自信且一贯的误解)在自由行为里几乎不 出现——模型很少主动、稳定地承诺 M′(40 items 里仅 4 个,且一致性低)。它出现在候选 上。p2b_cond_se.py 因此给出干净版:给定候选 c ∈ {M, M′},测模型按 c 作答的一致性 SE(c),直接检验 DESIGN §2 对语义熵的失分预测。

模型 域 SE(M) SE(M′) AUC
Qwen2.5-1.5B 核心 G1–G3 (n=24) 0.475 0.616 0.271
Qwen2.5-1.5B 全部 (n=40) 0.365 0.441 0.421
Qwen2.5-3B 核心 G1–G3 (n=24) 0.9996 0.99999 0.212
Qwen2.5-3B 全部 (n=40) 0.886 0.958 0.329

两个模型、两个域,AUC 全部 < 0.5,且 SE(M′) ≥ SE(M)。 语义熵不是"分不开"——它是 系统性偏爱误解:按误解作答比按真意作答更一致,所以 SE-gate 会优先收编 M′。 预测得到确认,且方向比预测更不利。3B 上两者双双饱和至 ~1.0,判别力进一步塌缩—— 放大模型不修复这一列(与 p0 §6c 的 G5 结论同向)。

这条是负结果归档:候选条件化是 B 臂失效后最自然的下一个尝试,试过、失败、留档, 避免重复劳动(同 P0i 忠实性探针、P0k 对比条件化)。

复现:python p2/p2b_cond_se.py [model_id](独立脚本,不依赖 p2_three_arm.py)。


5. 复现

python p2/p2_three_arm.py --model Qwen/Qwen2.5-1.5B-Instruct

依赖 p1/items_p1.json(40 items)。零训练算力,单机 MPS 约 25 分钟。