# Mean field LQG social optimization：全文到 MATLAB 的复现记录

**文献与实际阅读。** Zhenhui Xu、Bing-Chang Wang、Tielong Shen，*Mean field LQG social optimization: A reinforcement learning approach*，**Automatica 172 (2025), 111924**，DOI [10.1016/j.automatica.2024.111924](https://doi.org/10.1016/j.automatica.2024.111924)。正式发表信息由 [arXiv 记录](https://arxiv.org/abs/2410.15119) 和 DOI 元数据核对。实际取得并完整阅读的是 [16 页作者预印本 v1](https://arxiv.org/pdf/2410.15119v1)，提交日期 2024-10-19，首页标注 2024-10-22 accepted；没有把作者预印本称为已逐页核对的出版社排版版。

PDF SHA-256：a50e13845db320f9a8575b8cead71ac9be3f3a1004fa120ccbcc06a44947db6f。2026-09-07 重算 hash 一致。阅读覆盖 pp.1–16：引言、问题与假设、两组模型 PI、两组数据回归、平均场两种近似、数值参数及表图、Appendix A 证明和参考文献；额外渲染核对 p.9 的 (42) 与 p.13 图 2/3。下列页码均为该 PDF 页码。

**目标是社会最优。** 文中 N 个同质个体共享社会成本，其动态为

\[
dx_i=(Ax_i+Bu_i)dt+(Cx_i+Du_i)\,dw_i,
\quad
J_{\mathrm{soc}}=\sum_i E\int_0^\infty
\{(x_i-\Gamma x^{(N)})^TQ(x_i-\Gamma x^{(N)})+u_i^TRu_i\}\,dt.
\]

Brownian 过程在个体间独立，状态和输入均进入扩散系数。平均场只进入成本和所得分散控制器；此例动态没有额外均值耦合项，也不是非合作 Nash 求解器。

| 页/位置 | 阅读与实现映射 |
|---|---|
| pp.3–4，(1)–(8)，Definitions 2.1–2.5 | SDE、社会成本、均方稳定、可容许性和渐近社会最优；mf_collect、mf_evaluate |
| p.4，A1–A4；p.5，(9)/(10) | 独立同均值有限二阶矩初态；均方可稳定；精确可观测；集中式基准存在条件。有限 N 集中式 SARE 未实现 |
| pp.5–6，(11)–(24)，Lemmas 3.1/3.2 | 广义 Lyapunov PI 求 P/K，非正定 S=Π−P 的第二 PI；mf_reference |
| pp.7–8，(25)–(32)，Assumption 3.1，Theorem 3.1 | Itô 二阶矩回归同时估计 P、K̃、Λ=DᵀPD；mf_build_data、mf_learn 第一阶段 |
| p.9，(35)–(42)，Assumption 3.2，Theorem 3.2 | 对状态先取期望，构造均值外积回归求 S/Ks；mf_window_moments、mf_learn 第二阶段 |
| pp.9–10，(43)/(44)，Remark 3.5 | 重新采样取得均值轨迹，mf_mean_trajectory，已实现 |
| p.10，(45)–(50) | 用 S、Ks 等辨识 A/B 的平均场近似 II；已阅读、未实现 |
| p.10，Algorithm 1；p.11，Remark 3.7 | 统一离策略数据依次学习两组增益，随后离线近似平均场并部署 |
| pp.11–13，§4，(51)，Tables 1/2，Figs.2/3 | 所有数值矩阵、探索信号、样本规模、估计与参考值核对 |
| pp.12–14，§5，Appendix A，(A.1)–(A.6) | 理想模型 PI 的稳定性/单调性证明；不把它转写为有限 MC 的自动证书 |
| pp.14–16 | 参考文献阅读，用于判断社会优化、共同噪声与其他 MFG 的边界；本任务没有沿这些参考再扩查 |

**两阶段的具体数据契约。** 采用 \(q(x)=[x_1^2,x_1x_2,x_2^2]\)，它与 \(\bar P=[P_{11},2P_{12},P_{22}]^T\) 配对，避免对交叉项再乘或漏乘 2。

第一阶段的状态矩为 \(E[q(x)]\)，交叉矩为 \(E[xu]\)，输入矩为 \(E[u^2]\)。每个积分区间的回归为

\[
[\Delta E q(x),\;-2\!\int E[(u+K_{\rm old}x)x^T],\;
-\!\int E[u^2]+\!\int E[(K_{\rm old}x)^2]]
\begin{bmatrix}\bar P\\ \widetilde K^T\\ \Lambda\end{bmatrix}
=-\!\int E[x^T(Q+K_{\rm old}^TRK_{\rm old})x].
\]

未知数共 6 个，拟合后 \(K=(R+\Lambda)^{-1}\widetilde K\)。所有期望来自独立重复轨迹。mf_learn 输入只有观测矩、Q/R/Γ、K0 和数值选项，没有 A/B/C/D；也不接收模型参考结果。

第二阶段令 \(m=E[x]\)、\(v=E[u]\)、\(\Upsilon=R+\widehat\Lambda\)，数据改为 \(q(m)\)、\(mv\)；未知数为 S 的 3 个对称坐标及 Ks 的 2 个坐标。先合并所有路径的均值，再形成 \(q(m)\)。不能使用批次均值外积的平均，更不能把第一阶段的 \(E[xx^T]\) 换成 \(E[x]E[x]^T\)。testSecondMomentsAreNotOuterMean 用均值为零、方差非零的明确反例检查这一点。

两套经验数据的激励秩分别检查为 6 和 5，每次 PI 又检查实际回归矩阵。列归一化后用 QR 最小二乘，记录奇异值、条件数、拟合残差和增益步差；零列、秩亏、条件数超限、P 非正定、R+Λ 非正及超时不收敛会报明确错误。数值满秩只是这个观测矩阵的性质，不等于有限样本统计准确。

**两个必须说明的论文数值细节。**

1. 预印本 p.9 的 (42) 排版为 \((\Phi^T\Phi)^T\Phi^{-1}\Theta\)，对矩形 \(\Phi\) 维数不成立，已通过页面图像核对。这里根据同页 (39) 的明确线性方程求解 \(\Phi\theta=\Theta\) 的最小二乘；不照抄该排版式，也不显式求正规方程逆矩阵。这是实现中的明确公式解释。
2. Table 2 的 “true S/Ks” 以 Table 1 的估计 \(\widehat K=[8.467,-4.9231]\)、\(\widehat\Lambda=0.2010\) 为上游参数。实际代入 (15) 得
   \(S=[-3.49348485,3.57177862;3.57177862,-9.70248807]\)，\(Ks=[-0.48152789,0.49231959]\)，与表 2 的四位小数吻合。完整模型两阶段联合参考则为 \(K=[8.38542249,-4.76423677]\)、\(Ks=[-0.48727947,0.49657226]\)。这个解释由数值代入支持；不可把前一种条件参考误当成后一种联合精确解。局部测试专门核对此区别。

**参数和计算规模。** mf_config 保留 §4 的
\(A=[0.3,0.7;-0.9,0.5]\)，\(B=[0.2;0]\)，\(C=[0.05,0.03;0.05,0.02]\)，\(D=[0.05;0.06]\)，\(Q=\mathrm{diag}(3,2)\)，\(R=1.25\)，\(\Gamma=0.9I\)，\(K_0=[6,-3]\)，初态独立均匀分布于 \([0,4]^2\)，已知初始均值 \([2,2]^T\)。探索输入为 100 个频率在 [-100,100] 均匀抽取的正弦信号之和。

训练保留 100 路径、dt=0.001 秒、T=0.9 秒、增益停止阈值 1e−4。窗口起点取 0:0.001:10，因此原始轨迹明确延伸到 10.9 秒以覆盖最后一个完整窗口。论文对“学习区间 [0,10]”与 \(t'=t+T\) 的末端截取未给代码；这是显式边界选择。连续 SDE 用 Euler–Maruyama，时间积分用左端点累积，保留 dt 引起的离散化偏差。

补充对照用相同 probe 池化 100/400/1000/4000 条独立路径；4000 路径分成 40 个 100 路径批次，仅为了限制内存，每个批次仍由真实模拟状态/输入生成。保留主 100 路径的完整状态/输入/Brownian 增量；更大规模保留全部池化矩、批次 seeds、probe 和配置，可重新生成每条路径。没有用解析矩补充数据。4 次独立 4000 路径实验另改变 probe 和采样 seed，给增益标准误。

群体评估保留 N=40，增加 48 个相互独立的群体，使用共同随机数比较三种控制器。成本只积到 20 秒；dt=0.002 秒是评估的较粗网格，平均场近似 I 用 100 路径。没有复刻所有图版，也没有解维度为 80 的有限 N 集中式 SARE；这两处降低了复现范围。4000 路径属于额外提高采样量，不宣称比论文计算更少。有限 N 参考是完整模型平均场分散策略，不是定义 2.5 中的集中式最优下界。

**实际调试与初始结论。** MATLAB R2025b 实际执行了数据生成、两个 PI、广义 Riccati 参考、平均场采样和群体成本。第一轮 100 路径的 K/Ks 相对误差为 18.23%/30.01%，8 次独立训练 1 次被拒绝；失败和随机种子均保留，没有替换为更好种子。相同 probe 增至 4000 路径后，主实验误差约 0.53%/0.85%，有限群体成本约 459.52，而模型参考约 459.51。完整复核结果、增益标准误和成本标准误以 [证据目录](https://github.com/tanjunkai2001/adp-matlab/blob/main/docs/ARTIFACTS.md) 中的 CSV/MAT/日志为准。

成本标准误来自 48 个独立群体，而不是把相关时间样本或群体内个体当成独立重复；它以固定拟合增益和固定 MC 均值曲线为条件。配对成本差另使用每个群体的两策略差值计算标准误。增益标准误来自独立训练实验。它们都不能替代 Theorem 3.1/3.2 所需的精确期望、初始化与可观测性前提，亦不能证明 \(N\to\infty\) 或无限时域最优。

**源码与许可。** 已核查论文全文与 arXiv 页可见链接，并做论文全题名的 GitHub 域名检索；未找到经确认的作者实现链接，不等于断言作者没有代码。本目录为公式驱动的独立原始实现，没有复制第三方 MATLAB 文件。arXiv v1 链接的是 [非排他分发许可](https://arxiv.org/licenses/nonexclusive-distrib/1.0/license.html)，它授予 arXiv 分发论文的许可，并非第三方代码开源许可。PDF 和页面图仅保留在研究工作区，不随此库重新分发。本目录未自行新增代码许可证，也未执行公开发布。
