鼎
MONOGRAPH · GLL-WM · CPU
鼎智天心世界模型
DINGZHI TIANXIN · GATED LIFTED LINEAR WORLD MODEL
一门在提升坐标中学习线性动力学、并以谱半径约束保证多步想象可积的世界模型。
训练、推演与规划均在 CPU 上完成。它回答的是「环境下一步往哪走」,
不是校准大模型给出的概率,也不进入农业或其它业务数据。
I · DEFINITION
世界模型的最低充分条件
沿 Ha & Schmidhuber (2018) 与后续文献的用法,一个系统被称为世界模型,当且仅当它同时完成压缩、按动作前向推演、并在想象轨迹上做决策。缺一不可。
φ(o)
压缩观测
六维力学观测被提升到 38 维坐标 ψ:原状态保证可解码,门控抑制无关基,随机傅里叶特征提供非线性容量。
A, B, c
按动作推演
在 ψ 上学习仿射动力学 ψ′ = Aψ + Ba + c。k 步有闭式,不必把输出再喂回网络十六次。
π(ψ̂)
想象中决策
随机射击只在模型里展开 12 步。真环境只接收被选中的第一步。规划从不「偷看」下一帧真值。
II · PROPOSITION
为何线性提升能压住长视野
非线性离散系统 xt+1 = f(xt, at)
在逐步展开时,误差被局部雅可比连乘。一旦谱半径大于一,开环想象指数发散——
这正是无约束 GRU 在本组实验里 16 步 MSE 冲到 7.51 的机制。
Koopman / EDMD 给出另一条路:寻找提升 φ,使动力学在新坐标里近似线性。
ψt+k = Ak ψt + Σi=0k−1 Ak−1−i (B at+i + c)
若 ρ(A) ≤ ρ̄ < 1 且单步残差 ≤ ε,则 ‖误差k‖ ≤ ε (1 − ρ̄k) / (1 − ρ̄)
本构造在经典 EDMD 上多两步:门控让基函数随状态开关,减轻虚假振荡;
谱裁剪在每次最小二乘之后若 ρ(A)>0.98 则整体缩放 A。
上界是几何级数,不是指数。这解释图 2 里绿线从第 4 步起压住另外三条。
与平台既有决策内核切割:这里拟合的是环境动力学算子,不是大模型条件后验,也不做信息增益排序。
III · PROTOCOL
对照被锁死,只放开前向模型
01 ENV
平面气垫船
双积分器 + 周期风场 + 绕行信标。状态 6 维,动作 2 维推力。无图像、无业务语义。
02 DATA
3200 / 700
训练 3200 步、测试 700 步。35% 纯随机动作,其余为带噪 PD,避免只拟合一种策略。
03 PLANNER
射击 ×36 ×12
四种方法共用同一规划器。差别只来自「想象准不准」,不是规划器换了。
04 BASELINES
三种对照
ConstVel 无学习;MLP 逐步展开;GRU 无谱约束。鼎智天心是唯一被裁剪的线性提升模型。
IV · RESULTS
一次 CPU 实验的全部标量
加粗行为本模型。MSE 越低越好;回报是负距离,越接近 0 越好。
V · PLATES
图版与读图
六张图来自同一份 report.json。先读坐标,再读数字,最后才下判断。
HOW TO READ
从左到右是一次决策,不是网络深度。上排完成「看见 → 写成线性世界」,下排完成「在世界里想 → 再动手」。金色三角表示数据只向前,规划器不回读真环境。
WHAT IT SHOWS
观测没有像素。提升后动力学是仿射的,所以 12 步射击是矩阵运算而不是 12 次反向传播。
谱裁剪是稳定性开关,不是装饰。这张图只证明它配得上世界模型这个名字;准不准看 Plate II–IV。
PLATE II
长视野:谁在第 4 步之后还站得住
越低越好
HOW TO READ
横轴是开环步数,纵轴是状态 MSE。1 步低、后面陡升 = 只会抄近邻。四条线共用测试集,没有中途用真值纠偏。
THIS RUN
GRU 1 步最准(0.00032),16 步炸到 7.51——无约束递推把残差连乘。
恒速 1 步尚可(0.0022),16 步 0.415:短时「接着滑」像力学,弯道和风场跟丢。
MLP 1 步最差(0.090),小网络没拟合近邻。
鼎智天心 1 步 0.00063,从 4 步起全程最低(0.028 / 0.062 / 0.192)。
它赢的是长视野稳定性,不是每一步都最准。
PLATE III
规划:更稳的想象有没有变成更好的动作
越高越好 · 仍为负数
HOW TO READ
回报 = −到标距离 − 速度惩罚。0 表示贴着信标。柱高差的是前向模型:规划器、候选数、视野被锁死。
THIS RUN
鼎智天心 −48.6,恒速 −101,MLP −117,GRU −140。
GRU 的地图是假的,规划器在错的地形上选路,所以最差。
平均离标大约做到对照的一半:Plate II 的曲线转化成了动作,不只是拟合好看。
局限写清楚:合成绕标,随机射击不是最优控制。
PLATE IV
形状:同一串动作下的真轨迹与四种想象
开环叠合
HOW TO READ
青色实线是环境真值。四条虚线「偷看」同一串 PD 动作,中途不用真观测纠偏。虚线越贴实线,动力学越像。金点是起点。
THIS RUN
鼎智天心虚线应保持弯向与尺度。GRU 常甩出量级,恒速走切线,MLP 弯不足。
这是 Plate II 的一次具体形状:标量平均在这里变成几何。
复现时若整体平移但形状还在,多半是风场相位;若螺旋飞走,就是谱半径没按住。
PLATE V
代价:毫秒级 CPU,并不靠堆算力取胜
越矮越快
HOW TO READ
柱高是「抽 36 条 × 滚 12 步 × 挑一步」的墙钟时间,不是训练时间,也不是吞吐量冠军榜。
THIS RUN
恒速 0.11 ms(几乎只做加减)。MLP 1.16、GRU 1.06、鼎智天心 1.24 ms,三者同一量级。
不要读成「它更快」。它略慢,换来 Plate II、III。
38 维提升、约 432 次矩阵-向量乘,笔记本 CPU 仍是毫秒。整次实验约 1.8 秒,因此可以反复复现。
PLATE VI
并置:预测误差与规划回报必须一起看
两套量纲
HOW TO READ
实心:8 步 MSE,越矮越好。空心:四个回报做了平移缩放后的相对高度,不能和实心比绝对长度,也不能读成正回报。
THIS RUN
理想形态是实心矮、空心高。鼎智天心最接近。
GRU 实心最高(4.65)且空心最矮(−140):既测不准也控不好。
恒速两边中等。MLP 两边偏弱,与 1 步拟合不足一致。
四个回报都是负数,只是本模型负得少。
VI · REPRODUCIBILITY
零依赖,CPU 复现本页全部数字
node worldmodel/train.mjs
env.mjs 环境 · lin.mjs 线性代数 · models.mjs 四种前向模型 ·
train.mjs 协议 · figures.mjs 图版。
Node ≥ 18,无第三方库。产物写入 data/dztxwm/report.json 与 public/wm/*.svg。