MONOGRAPH · GLL-WM · CPU

鼎智天心世界模型

DINGZHI TIANXIN · GATED LIFTED LINEAR WORLD MODEL

一门在提升坐标中学习线性动力学、并以谱半径约束保证多步想象可积的世界模型。 训练、推演与规划均在 CPU 上完成。它回答的是「环境下一步往哪走」, 不是校准大模型给出的概率,也不进入农业或其它业务数据。

下载可复现源码 阅读图版 I–VI 其它可跑仓库
CLASSWorld Model · Dynamics
LIFTState ⊕ Gate ⊕ RFF · 38-D
PROTOCOLOpen-loop MSE + Shooting
COMPUTECPU only ·
RUN
I · DEFINITION

世界模型的最低充分条件

沿 Ha & Schmidhuber (2018) 与后续文献的用法,一个系统被称为世界模型,当且仅当它同时完成压缩、按动作前向推演、并在想象轨迹上做决策。缺一不可。

φ(o)

压缩观测

六维力学观测被提升到 38 维坐标 ψ:原状态保证可解码,门控抑制无关基,随机傅里叶特征提供非线性容量。

A, B, c

按动作推演

在 ψ 上学习仿射动力学 ψ′ = Aψ + Ba + c。k 步有闭式,不必把输出再喂回网络十六次。

π(ψ̂)

想象中决策

随机射击只在模型里展开 12 步。真环境只接收被选中的第一步。规划从不「偷看」下一帧真值。

II · PROPOSITION

为何线性提升能压住长视野

非线性离散系统 xt+1 = f(xt, at) 在逐步展开时,误差被局部雅可比连乘。一旦谱半径大于一,开环想象指数发散—— 这正是无约束 GRU 在本组实验里 16 步 MSE 冲到 7.51 的机制。 Koopman / EDMD 给出另一条路:寻找提升 φ,使动力学在新坐标里近似线性。

ψt+k = Ak ψt + Σi=0k−1 Ak−1−i (B at+i + c)
若 ρ(A) ≤ ρ̄ < 1 且单步残差 ≤ ε,则 ‖误差k‖ ≤ ε (1 − ρ̄k) / (1 − ρ̄)

本构造在经典 EDMD 上多两步:门控让基函数随状态开关,减轻虚假振荡; 谱裁剪在每次最小二乘之后若 ρ(A)>0.98 则整体缩放 A。 上界是几何级数,不是指数。这解释图 2 里绿线从第 4 步起压住另外三条。

与平台既有决策内核切割:这里拟合的是环境动力学算子,不是大模型条件后验,也不做信息增益排序。

III · PROTOCOL

对照被锁死,只放开前向模型

01 ENV

平面气垫船

双积分器 + 周期风场 + 绕行信标。状态 6 维,动作 2 维推力。无图像、无业务语义。

02 DATA

3200 / 700

训练 3200 步、测试 700 步。35% 纯随机动作,其余为带噪 PD,避免只拟合一种策略。

03 PLANNER

射击 ×36 ×12

四种方法共用同一规划器。差别只来自「想象准不准」,不是规划器换了。

04 BASELINES

三种对照

ConstVel 无学习;MLP 逐步展开;GRU 无谱约束。鼎智天心是唯一被裁剪的线性提升模型。

IV · RESULTS

一次 CPU 实验的全部标量

加粗行为本模型。MSE 越低越好;回报是负距离,越接近 0 越好。

V · PLATES

图版与读图

六张图来自同一份 report.json。先读坐标,再读数字,最后才下判断。

PLATE I

结构:一次决策的数据流

定义图 · 非精度图
图1 结构
HOW TO READ
从左到右是一次决策,不是网络深度。上排完成「看见 → 写成线性世界」,下排完成「在世界里想 → 再动手」。金色三角表示数据只向前,规划器不回读真环境。
WHAT IT SHOWS
观测没有像素。提升后动力学是仿射的,所以 12 步射击是矩阵运算而不是 12 次反向传播。 谱裁剪是稳定性开关,不是装饰。这张图只证明它配得上世界模型这个名字;准不准看 Plate II–IV。
PLATE II

长视野:谁在第 4 步之后还站得住

越低越好
图2 多步误差
HOW TO READ
横轴是开环步数,纵轴是状态 MSE。1 步低、后面陡升 = 只会抄近邻。四条线共用测试集,没有中途用真值纠偏。
THIS RUN
GRU 1 步最准(0.00032),16 步炸到 7.51——无约束递推把残差连乘。 恒速 1 步尚可(0.0022),16 步 0.415:短时「接着滑」像力学,弯道和风场跟丢。 MLP 1 步最差(0.090),小网络没拟合近邻。 鼎智天心 1 步 0.00063,从 4 步起全程最低(0.028 / 0.062 / 0.192)。 它赢的是长视野稳定性,不是每一步都最准。
PLATE III

规划:更稳的想象有没有变成更好的动作

越高越好 · 仍为负数
图3 规划回报
HOW TO READ
回报 = −到标距离 − 速度惩罚。0 表示贴着信标。柱高差的是前向模型:规划器、候选数、视野被锁死。
THIS RUN
鼎智天心 −48.6,恒速 −101,MLP −117,GRU −140。 GRU 的地图是假的,规划器在错的地形上选路,所以最差。 平均离标大约做到对照的一半:Plate II 的曲线转化成了动作,不只是拟合好看。 局限写清楚:合成绕标,随机射击不是最优控制。
PLATE IV

形状:同一串动作下的真轨迹与四种想象

开环叠合
图4 轨迹
HOW TO READ
青色实线是环境真值。四条虚线「偷看」同一串 PD 动作,中途不用真观测纠偏。虚线越贴实线,动力学越像。金点是起点。
THIS RUN
鼎智天心虚线应保持弯向与尺度。GRU 常甩出量级,恒速走切线,MLP 弯不足。 这是 Plate II 的一次具体形状:标量平均在这里变成几何。 复现时若整体平移但形状还在,多半是风场相位;若螺旋飞走,就是谱半径没按住。
PLATE V

代价:毫秒级 CPU,并不靠堆算力取胜

越矮越快
图5 耗时
HOW TO READ
柱高是「抽 36 条 × 滚 12 步 × 挑一步」的墙钟时间,不是训练时间,也不是吞吐量冠军榜。
THIS RUN
恒速 0.11 ms(几乎只做加减)。MLP 1.16、GRU 1.06、鼎智天心 1.24 ms,三者同一量级。 不要读成「它更快」。它略慢,换来 Plate II、III。 38 维提升、约 432 次矩阵-向量乘,笔记本 CPU 仍是毫秒。整次实验约 1.8 秒,因此可以反复复现。
PLATE VI

并置:预测误差与规划回报必须一起看

两套量纲
图6 并置
HOW TO READ
实心:8 步 MSE,越矮越好。空心:四个回报做了平移缩放后的相对高度,不能和实心比绝对长度,也不能读成正回报。
THIS RUN
理想形态是实心矮、空心高。鼎智天心最接近。 GRU 实心最高(4.65)且空心最矮(−140):既测不准也控不好。 恒速两边中等。MLP 两边偏弱,与 1 步拟合不足一致。 四个回报都是负数,只是本模型负得少。
VI · REPRODUCIBILITY

零依赖,CPU 复现本页全部数字

node worldmodel/train.mjs

env.mjs 环境 · lin.mjs 线性代数 · models.mjs 四种前向模型 · train.mjs 协议 · figures.mjs 图版。 Node ≥ 18,无第三方库。产物写入 data/dztxwm/report.jsonpublic/wm/*.svg

下载源码 zip 返回首页