CALIBRATION EXPERIMENT

校准对比实验

本页把「关掉校准」和「打开校准」两条路径并排跑给你看。 上半部分是纯数学内核的最小可复现实验,毫秒级返回、不调用大模型; 下半部分是端到端真实推演,展示排序在真实案例上是否被改变。

实验一 · 内核最小可复现实验

任意填写一组「结局分支概率 P(o|a)」与「分支条件后验 q(h|o,a)」, 内核会检查它们是否满足全概率约束 Σ P(o|a)·q(h|o,a) = b(h), 并给出 IPF 投影后的结果。整个过程不经过任何大模型。

确定性 · 零参数
「不自洽样例」模拟大模型常见的输出:每一行单看都是合理的概率分布, 但把它们按分支概率加权平均回去,得不到原先的先验信念。

校准后必然成立的四条性质

边缘一致
Σ P(o|a)·q*(h|a,o) = b(h)
IPF 不动点的定义,收敛后逐项成立
非负性
IG(a) ≥ 0
由熵的凹性与 Jensen 不等式,在边缘一致的前提下推出
有界性
IG(a) ≤ H(b) ≤ log₂K
由条件熵非负推出
最小失真
argmin KL(J‖J⁰)
IPF 不动点即 Csiszár I-投影:在所有满足约束的解中,与原始推演的 KL 距离最小
这四条不是拟合出来的经验规律,是可以写在纸上证明的。 源码中的 scripts/selftest.mjs 在 500 组随机输入上逐条验证, 部署后运行 npm run selftest 即可复现。
点击「运行内核」查看结果。

实验二 · 端到端真实推演对比

同一次推演的同一批候选动作,分别用「截断为零」(业界常见做法)和 「IPF 校准」两种方式计算效用并排序,逐条比对。