# Zeng 等（L4DC 2025）全文与 MATLAB 复现笔记

文献：Zhexuan Zeng, Ruikun Zhou, Yiming Meng, Jun Liu, *Data-driven optimal control of unknown nonlinear dynamical systems using the Koopman operator*，PMLR 283:1127–1139，2025。[正式出版页](https://proceedings.mlr.press/v283/zeng25a.html)，[证明预印本 arXiv:2412.01085v1](https://arxiv.org/abs/2412.01085v1)。检查日期：2026-09-07。

阅读范围为正式版 PDF 全13页、预印本方法/实验部分及附录A全部证明。以下页码均为 PDF 内页码，而非 proceedings 连续页码。PDF 哈希已固定在 [sources.json](https://github.com/tanjunkai2001/adp-matlab/blob/v0.5.3/reproductions/koopman_l4dc2025/sources.json)。PMLR 页未给独立 DOI，本笔记不编造 DOI。PMLR/arXiv 中未找到本篇直接代码链接；尝试作者相关 LyZNet GitLab 时 git 端要求身份认证，没有下载或执行该代码。

## 逐页阅读记录

| 页 | 核心内容 | 对复现的具体要求 |
|---|---|---|
| 正式1–2 | 先辨识，再解模型上的最优控制；主要改动是状态/输入耦合字典和神经PDE求解 | 不能把普通 EDMD 线性预测器或纯线性 LQR 冒充本文算法 |
| 正式3 | 控制仿射确定性系统；无折扣无限积分；admissible feedback 的定义；Eq(1)–(5) | 记录初始稳定策略知识；代价无1/2时贪心反馈有1/2因子 |
| 正式4 | Eq(6) GHJB 评估、Eq(7)贪心改进；Eq(8)–(10) Koopman 流与生成元 | 价值函数零点条件和迭代索引必须明确；一个迭代步骤的旧策略/新策略分别存储 |
| 正式5 | Eq(11)输入作为恒定扩展状态；字典含状态-输入耦合；Eq(12)Yosida | 辨识轨迹的u恒定；不能用闭环变化输入而不修改扩展系统 |
| 正式6 | Eq(13)有限时域积分，生成元最小二乘；Eq(14)恢复f/g；Eq(15)–(16)随机特征GHJB | 实际实现指数加权的轨迹积分；学习器不能用真实导数代替右端 |
| 正式7 | Theorem4生成元/向量场极限；Assumption1稠密采样拟合；Remark5区分分析近似和数据拟合 | 有限lambda、字典和采样误差须单独检查，不把渐近声明当有限样本上界 |
| 正式8 | Theorem6每固定迭代的模型扰动一致性；Table1给4种对象的数据规格 | 与全迭代统一收敛、有限样本精度和实际不变域有区别 |
| 正式9 | Table2网络/配点规模；Table3模型误差；50初值10秒闭环比较 | Ef/Eg是留出点L1误差均值；成本对照必须相同初值、相同对象 |
| 正式10 | 两张图显示成本差和轨迹；作者指出高维定义域较小 | 图形吻合不替代参数和数值协议吻合，不能推广高维全域结论 |
| 正式11–13 | 参考文献，指向生成元理论及证明预印本 | 已跟进本篇完整证明，未逐一证明其所有引用定理 |
| 预印本12–14 | 附录A：价值误差的有限时间连续依赖与无穷尾项拆分 | 应检查尾项是否对模型族统一；有限时间连续依赖本身不控制无穷区间 |
| 预印本15–16 | 附录A：价值梯度、变分流和策略误差；Eq(43)–(65) | 需要导数层面的控制，不仅是向量场/成本的C0误差 |

## 公式到实现

| 正式版公式/步骤 | MATLAB 位置 | 实际行为 |
|---|---|---|
| Eq(11)，输入恒定的扩展流 | `demo_koopman.m` 的 `collectData` | 真值仅由仿真器用于生成 x(t)；u每条轨迹恒定 |
| §4.1 多项式字典 | `koopman_identify.m` | 状态各0–5次、输入0/1次、剔除常数，共71维 |
| Eq(12)–(13) resolvent/Yosida | `koopman_identify.m` / `exponentialWeights` | 有限时域指数加权积分，四点三次插值、16点Gauss求积，保留尾项 |
| 生成元矩阵最小二乘 | `koopman_identify.m` | 按列尺度归一化后SVD求解；秩不足直接失败，避免正规方程显式求逆 |
| Eq(14)取状态坐标列恢复f/g | `koopman_identify.m`、`koopman_model.m` | 对输入次数0和1的系数分组；没有把模型强制成固定B线性控制器 |
| Eq(15)线性GHJB | `koopman_policy_iteration.m` | 随机特征梯度乘当前闭环向量场；求输出权重 |
| Eq(16)贪心控制 | `koopman_policy.m` | `-0.5/R*(g1*dVdx1+g2*dVdx2)` |
| §6.2冻结策略成本对比 | `koopman_rollout.m`、`demo_koopman.m` | 在真实摆上比较数据策略、truth-model PI和初始K；同50个初值 |

随机特征是明确修改版：原文200个纯tanh隐单元，本实现使用3个二次特征和197个减去零点值/一阶项的tanh特征，令V及梯度在原点严格为零。原文未公开Q/R、摆参数、lambda、随机特征抽样分布和初始K；本实现补充为规范化摆与可追溯配置，详见 [METHOD.md](https://github.com/tanjunkai2001/adp-matlab/blob/main/reproductions/koopman_l4dc2025/METHOD.md)。因此状态是“原创方法级实现并数值检查”，而不是“原论文表图数值完整复现”。

## 理论阅读后需要保留的问题

附录的 Eq(50) 和 Eq(58) 使用从函数一致误差到导数一致误差的界，并以C1正则性作为理由。仅有一般C1正则性不足以推出这类界。例如 `h_epsilon(x)=epsilon*sin(x/epsilon^2)` 的幅度趋零，但导数幅度发散。需要额外的统一导数逼近、有限维固定函数空间范数等价，或其它充分条件，才能完成该环节。这里指出的是证明中这一步的条件缺口，未据此声称所有数值结果或最终定理必然为假。

同一附录还需明确无穷尾项、变分流有界性/衰减对近似模型族的统一条件。Eq(19)–(24)附近将L写作负成本而后使用非负积分，也有符号表述不一致；实现严格遵循正文的正成本与 `gradV*F=-cost`，没有照搬附录的负号。

此外，数据初始点位于[-1,1]^3并不证明整条流位于定理需要的不变紧集；一次稳定仿真不能充当不变域或admissibility的全域证书。200个随机特征的截断SVD求解也不自动满足渐近函数空间逼近条件。

## 复现范围与独立对照

当前复现确实包含：采样流→完整字典生成元→f/g恢复→GHJB线性最小二乘→贪心策略→真实非线性系统评估。真值只在采集、留出误差评估和独立truth-model PI调用中可用。使用模型的可调用函数没有接收真实摆参数。

独立验证包括有限时域Yosida矩阵解析解、具有状态-输入耦合的精确轨迹、特征梯度有限差分、RK4与ode45，以及lambda/初始K敏感性。truth-model PI是相同近似求解器在真实模型上得到的参照，不能被称为解析最优策略；10秒成本也不能被称为无限时域价值。

未实现原文的LAM/RLM/ADP对照和4D/6D/9D实验，未做神经网络形式化验证或硬件实验。作者代码与缺失参数如未来获得，应新建原参数复现运行，保留此方法实现及原始结果作为独立参考。
