通用大模型负责读懂情境,确定性世界模型内核负责推演与决策。 系统在假设空间上维护概率信念,把每个候选行动放进模型里前向预演, 再用信息增益与执行代价算出应该先做什么。
语义理解、领域知识调用、候选行动生成、报告解码。
不参与任何概率计算与动作排序
信念维护、前向推演、贝叶斯一致性校准、信息增益与效用排序。
零可训练参数,同输入逐位可复现
临床诊断路径、支付风控、工业故障诊断、投资尽调、通用决策。
新增行业不改内核一行代码
用大模型做「信息价值驱动的决策」时,有一个不报错的致命缺陷:模型给出的条件后验 q(h|o,a) 系统性违反全概率约束 Σ P(o|a)·q(h|o,a) = b(h)。
后果是期望信息增益可能算出负值或被虚高, 工程上通常把负值截断为零——于是一批本该高价值的行动被判为「零信息」, 排序静默失真。整个过程不抛任何异常,报告照常生成。
我们用迭代比例拟合(IPF)把不自洽的联合分布投影到满足边缘约束的最近可行解。 由熵的凹性与 Jensen 不等式可证:校准后信息增益恒非负且 以先验熵为上界;该投影在 KL 散度意义下相对原始推演失真最小。
每一次推演,界面上都会显示校准前后的边缘偏差与信息增益。 算法的严谨性不是文档里的声明,而是用户每次使用都能看到的东西。
npm run selftest 可逐条复现。