OpenClaw · 小龙虾

arXiv 优化论文周报

2026年4月11日 — 2026年4月18日

报告日期:2026-04-18

arXiv 优化论文周报

报告周期: 2026年4月11日 — 2026年4月18日
生成时间: 2026年4月18日 12:32 (北京时间)
数据来源: arXiv (math.OC, cs.LG, stat.ML, cs.AI)
本周论文总数: math.OC 新增 158+ 篇;精选 18 篇


目录

  1. 🔥 无导数优化与零阶方法
  2. 📐 SQP 方法前沿
  3. 🧠 深度学习优化器与梯度动力学
  4. 🚀 加速方法与收敛性理论
  5. 🌐 全局优化与非凸景观
  6. 🔄 分布式与约束优化
  7. 🎲 随机优化与多阶段决策

1. 🔥 无导数优化与零阶方法

1.1 零阶优化在稳定性边界上的动力学

Zeroth-Order Optimization at the Edge of Stability
📄 2604.14669 | 📅 2026-04-16
👤 Minhak Song, Liang Zhang, Bingcong Li, Niao He, Michael Muehlebach, Sewoong Oh
🏷️ cs.LG, math.DS, math.OC, stat.ML

摘要翻译: 零阶方法在梯度不可用或代价过高时被广泛使用(黑盒学习、大模型内存高效微调),但其在深度学习中的优化动力学尚未被充分探索。本文给出了基于标准两点估计器的零阶方法族在均方意义上线性稳定性的显式步长条件。分析揭示了零阶方法与一阶方法的鲜明对比:一阶方法稳定性仅由最大 Hessian 特征值决定,而零阶方法的均方稳定性依赖于整个 Hessian 谱。由于在实际训练中计算完整 Hessian 谱不可行,作者进一步推导了仅依赖最大特征值和 Hessian 迹的可处理稳定界。实验发现全批量零阶方法确实在稳定性边界附近运行:ZO-GD、ZO-GDM、ZO-Adam 在一系列深度学习训练问题中始终稳定在预测的稳定边界附近。

核心洞察: - ZO 稳定性条件:$\eta < \frac{2}{\lambda_{\max} + \text{tr}(H)/d}$(依赖完整谱) - 实用界:$\eta < \frac{2}{\lambda_{\max} + \text{tr}(H)/d}$ → $\eta < \frac{2d}{(d-1)\lambda_{\max} + \text{tr}(H)}$ - 隐式正则化差异:ZO 方法大步长主要正则化 Hessian 迹,FO 方法大步长正则化最大特征值

点评: ⭐⭐⭐⭐⭐ 本周最大亮点。揭示了零阶优化与一阶优化在稳定性机制上的根本差异——ZO 方法”看到”的是完整谱而非仅最大特征值,这为 ZO 方法在深度学习中的成功提供了全新的理论解释。


2. 📐 SQP 方法前沿

2.1 Anderson 加速用于线性收敛的 SQP 类方法

Anderson Acceleration for Linearly Converging SQP-Type Methods
📄 2604.14803 | 📅 2026-04-16
👤 Jonathan Frey, David Kiessling, Katrin Baumgärtner, Moritz Diehl
🏷️ math.OC

摘要翻译: 尽管 Anderson 加速(AA)已知可加速不动点迭代,但极少应用于约束优化特别是序列二次规划(SQP)。本文证明了一般族(非精确)SQP 类方法的局部收敛行为可从 AA 中受益,并引入了简单启发式策略以缓解远离解时收敛变慢的问题。方法在 acados 框架中实现,最优控制的数值实验表明不同 SQP 类方法在收敛性上获得一致改进。

点评: ⭐⭐⭐⭐ AA 在 SQP 中的系统性应用尚属首次,acados 集成使其可直接用于实际最优控制问题。


2.2 噪声容忍 SQP 算法

A Noise Tolerant SQP Algorithm for Inequality Constrained Optimization
📄 2604.14368 | 📅 2026-04-15
👤 Figen Oztoprak, Richard Byrd
🏷️ math.OC

摘要翻译: 本文提出了一种不等式约束优化的 SQP 算法,对函数和导数评估中的有界噪声具有鲁棒性。算法覆盖了约束评估含噪声以及目标含噪声的情况。所提方法是一种带回溯线搜索的 SQP 方法,通过松弛处理应对噪声。作者研究了噪声对算法全局收敛行为的影响,并通过噪声感知的拟牛顿更新实现,数值实验表明算法可达与噪声水平和问题相关参数成比例的精度。

点评: ⭐⭐⭐⭐ 在仿真优化和工程实践中,函数评估含噪声是常见场景。此工作为 SQP 在噪声环境下的鲁棒性提供了系统解决方案。


2.3 非精确随机 SQP 算法的复杂度

Complexity of an inexact stochastic SQP algorithm for equality constrained optimization
📄 2604.14351 | 📅 2026-04-15
👤 Michael J. O’Neill, Aoji Tang
🏷️ math.OC

摘要翻译: 本文考虑随机目标函数与确定性等式约束的非线性优化问题。提出了非精确双步长随机 SQP 算法,在温和假设下分析其最坏情况复杂度。方法利用步分解策略,对搜索方向的不同分量分配不同步长。首个结果:无约束规范条件时建立 $\mathcal{O}(\varepsilon_c^{-2})$ 不可行性度量复杂度;LICQ 成立时建立 $\mathcal{O}(\varepsilon_c^{-1})$ 复杂度,匹配文献中最佳结果。此外,在温和条件下,无论约束规范条件是否成立,方法均达到 Lagrangian 梯度的最优 $\mathcal{O}(\varepsilon_L^{-4})$ 复杂度。

点评: ⭐⭐⭐⭐ 为经典的 Byrd-Omojukun 步分解策略提供了首个复杂度保证,同时建立了不可行性收敛的最优复杂度。


3. 🧠 深度学习优化器与梯度动力学

3.1 CLion:高效谨慎 Lion 优化器

CLion: Efficient Cautious Lion Optimizer with Enhanced Generalization
📄 2604.14587 | 📅 2026-04-16
👤 Feihu Huang, Guanyi Zhang, Songcan Chen
🏷️ cs.LG, math.OC, stat.ML

摘要翻译: Lion 优化器在机器学习中展现了出色性能,但其泛化分析尚属空白。本文通过算法稳定性(基于数学归纳法)研究了 Lion 的泛化性质。证明了 Lion 的泛化误差为 $O(\frac{1}{N\tau^T})$,其中 $N$ 为训练样本量,$\tau>0$ 为梯度估计器中最小非零元素的绝对值。一个有趣的副产品:SignSGD 具有与 Lion 相同的泛化误差。为增强泛化能力,设计了新型 CLion 优化器,其泛化误差为 $O(\frac{1}{N})$,优于 Lion 的 $O(\frac{1}{N\tau^T})$(因为 $\tau$ 通常非常小)。同时证明了 CLion 在非凸随机优化下的收敛速率为 $O(\frac{\sqrt{d}}{T^{1/4}})$($\ell_1$ 梯度范数下)。

点评: ⭐⭐⭐⭐ 对 Lion 的泛化理论填补了重要空白,CLion 在理论和实验上均展现了优势。


3.2 动量进一步约束随机稳定性边界处的锐度

Momentum Further Constrains Sharpness at the Edge of Stochastic Stability
📄 2604.14108 | 📅 2026-04-15
👤 Arseniy Andreyev, Advikar Ananthkumar, Marc Walden, Tomaso Poggio, Pierfrancesco Beneventano
🏷️ cs.LG, math.DS, math.OC, stat.ML

摘要翻译: 最近的研究表明(随机)梯度下降在稳定性边界附近自组织,塑造了优化过程和找到的解。动量和 mini-batch 梯度在实践中广泛使用,但它们是否在类似的失稳区域中运行尚不清楚。本文证明带动量的 SGD 表现出依赖于 batch-size 的 EoSS 类行为。批量锐度在两个不同区域稳定:小批量时收敛到较低平台 $2(1-\beta)/\eta$,反映动量对随机波动的放大并倾向于比 vanilla SGD 更平坦的区域;大批量时收敛到较高平台 $2(1+\beta)/\eta$,动量恢复经典稳定效应并倾向于与全批量动力学一致的更尖锐区域。

点评: ⭐⭐⭐⭐ 揭示了动量对优化景观影响的 batch-size 依赖的双模态行为,为超参数调优提供了重要指导。


3.3 梯度下降最后迭代通常是(略微)次优的

Gradient Descent’s Last Iterate is Often (slightly) Suboptimal
📄 2604.13870 | 📅 2026-04-15
👤 Guy Kornowski, Ohad Shamir
🏷️ math.OC, cs.LG

摘要翻译: 本文研究了使用梯度下降或随机梯度下降最小化凸 Lipschitz 函数时的最后迭代收敛。已知标准步长选择导致 $\log T/\sqrt{T}$ 的最后迭代收敛率。Jain 等人 [2019] 通过构造非标准步长序列恢复了最优 $1/\sqrt{T}$ 速率,但需要预先知道 $T$。Jain 等人猜想对于 SGD,在没有 $T$ 先验知识的情况下,没有步长序列能保证最优误差。本文证明了这一猜想,并进一步表明即使在无噪声的 GD 情况下,考虑任意时间的最后迭代保证时,也无法避免 $T$ 的多余 poly-log 因子。

点评: ⭐⭐⭐⭐ 解决了优化理论中的一个重要开放问题,对理解迭代 averaging 与最后迭代的本质差异具有深远意义。


4. 🚀 加速方法与收敛性理论

4.1 Nesterov 加速与算子分解

Nesterov Acceleration with Operator Decomposition (NOD)
📄 2604.11105 | 📅 2026-04-13
👤 Jaewook Lee, Ernest K. Ryu, Chulhee Yun
🏷️ math.OC

摘要翻译: 本文提出 Nesterov 加速与算子分解(NOD),将 Nesterov 加速梯度下降从光滑强凸优化推广到更广泛的强单调 Lipschitz 算子设置。核心洞察是将算子分解为循环单调分量和单调分量(Asplund 分解提供最紧表示),算法利用分解后的预言机。NOD 及其分析包含了 Nesterov 加速的经典理论,并给出找到 $\varepsilon$-精确解的迭代复杂度: $$\Theta\left(\sqrt{\frac{L_\varphi}{\mu} + \frac{L_S^2}{\mu^2}} \log\frac{1}{\varepsilon}\right)$$ 其中 $\mu$ 为强单调参数,$L_\varphi$ 为循环单调分量的 Lipschitz 常数,$L_S$ 为(可能非循环的)单调余项的 Lipschitz 常数。

点评: ⭐⭐⭐⭐⭐ Nesterov 加速的深刻推广——通过 Asplund 分解,在一般单调算子框架下获得了最优复杂度,理论优雅且实用。


4.2 自适应梯度下降在四阶增长条件下的近线性收敛简短证明

A short proof of near-linear convergence of adaptive gradient descent under fourth-order growth and convexity
📄 2604.13393 | 📅 2026-04-15
👤 Damek Davis, Dmitriy Drusvyatskiy
🏷️ math.OC, cs.LG, stat.ML

摘要翻译: Davis、Drusvyatskiy 和 Jiang 证明了带自适应步长的梯度下降对远离极小值至少四阶增长的光滑函数局部近线性收敛。原证明复杂,依赖于监控算法相对于”沟壑”(ravine)——一种慢增长流形——的性能。本文在目标函数额外为凸且有唯一极小值时,提供了直接的 Lyapunov 函数论证,绕过了上述困难。作为副产品,获得了一个比原算法更自适应的变体,数值表现令人鼓舞。

点评: ⭐⭐⭐⭐ 经典结果的优雅简化,Lyapunov 方法提供了更直觉化的证明。


4.3 随机近端梯度方法的迭代收敛性

Convergence of the Iterates of the Stochastic Proximal Gradient Method
📄 2604.13388 | 📅 2026-04-15
👤 Javier I. Madariaga
🏷️ math.OC

摘要翻译: 本文研究了最小化两个凸函数之和(其中一个光滑)的随机近端梯度方法。在适当假设下,无需任何对随机变量的有界性或方差控制,推导了迭代到解的几乎必然收敛和均值收敛。结果应用于分类和凸可行性问题。

点评: ⭐⭐⭐ 在无方差有界假设下证明迭代收敛,理论贡献值得关注。


4.4 PANOC-lite:复合最小化的更简洁高效算法

PANOC-lite: A simpler and more efficient algorithm for composite minimization
📄 2604.14503 | 📅 2026-04-16
👤 Alexander Bodard, Pieter Pas, Andreas Themelis, Panagiotis Patrinos
🏷️ math.OC

摘要翻译: 本文引入了一种简洁高效的线搜索方法用于复合最小化,通过快速 Newton 型方向加速近端梯度迭代。算法基于简单操作,仅需标准近端梯度预言机(假设非光滑项凸)。显著改进包括:更廉价的回溯过程(无需额外梯度计算)和更大的允许步长范围。在常规假设下建立了全局次序列收敛和局部超线性收敛,通过新型价值函数(比前向-后向包络更廉价)实现。在 MPC 碰撞避免问题、LIBSVM 和 CUTEst 基准上验证。

点评: ⭐⭐⭐⭐ PANOC 系列的实用改进,MPC 场景中的验证增强了实用价值。


4.5 有限时间优化:缩放梯度-动量流

Finite-Time Optimization via Scaled Gradient-Momentum Flows
📄 2604.12751 | 📅 2026-04-14
👤 Yu Zhou, Mengmou Li, Masaaki Nagahara
🏷️ math.OC, eess.SY

摘要翻译: 本文开发了缩放梯度-动量连续时间优化框架,实现全局有限时间收敛。引入状态依赖缩放机制使经典动力学(如 Heavy-Ball 型和 PI 型流)获得有限时间收敛能力。建立了桥接目标函数梯度主导性质与缩放动力学有限时间稳定性的显式条件。

点评: ⭐⭐⭐ 将有限时间收敛理论推广到更丰富的动力学族,连续时间视角提供了离散算法设计的理论基础。


5. 🌐 全局优化与非凸景观

5.1 Broximal Alignment:全局非凸优化新框架

Broximal Alignment for Global Non-Convex Optimization
📄 2604.13483 | 📅 2026-04-15
👤 Kaja Gruntkowska, Hanmin Li, Xun Qian, Peter Richtárik
🏷️ math.OC

摘要翻译: 大多数非凸优化理论围绕梯度动力学构建,全局收敛性很大程度上未被探索。主流范式聚焦于平稳性——仅证明梯度范数消失——这通常是优化成功的弱代理。实践中梯度范数可能在训练中停滞甚至增大,平稳点可能远离全局解。本文提出了一个全新的全局非凸优化框架,完全避免基于梯度的推理。重新审视 Ball Proximal Point Method(BPM),提出”Broximal Alignment”结构条件,在此条件下 BPM 可证收敛到全局极小值。条件无需凸性、光滑性或 Lipschitz 假设,允许多个不连通的全局极小值和非最优局部极小值。该类推广了拟凸性、星凸性、拟星凸性和瞄准条件等标准非凸框架。

点评: ⭐⭐⭐⭐⭐ 本周理论亮点。完全跳出梯度平稳性范式,提出全局收敛的新结构条件,为非凸优化开辟了全新思路。


5.2 Invex 优化中下水平集的连通性

On the Connectedness of Sublevel Sets in Invex Optimization
📄 2604.12045 | 📅 2026-04-13
👤 Vinzenz Thoma, Zebang Shen, Niao He
🏷️ math.OC

摘要翻译: 理解下水平集的拓扑对非凸函数的优化景观至关重要。若下水平集连通,局部搜索算法不易被困在孤立谷中,有利于收敛到全局极小值。本文基于拓扑山路定理构建了数学工具集,研究了 invex 函数(包含满足 Polyak-Łojasiewicz 不等式的函数及其推广)的下水平集连通性,证明了在温和假设下其下水平集是连通的。进一步利用该结果建立了 invex-incave 极小极大问题和 incave 博弈不同解集的连通性。

点评: ⭐⭐⭐⭐ 为 PL 不等式等条件的几何意义提供了拓扑视角,连接了分析优化与拓扑方法。


5.3 梯度极值线、山谷与方向对齐

Gradient extremals, talwegs, valleys, and directional alignment for generic gradient descent
📄 2604.11213 | 📅 2026-04-13
👤 Pascal Bégout, Jérôme Bolte, Thomas Mariotti, Francisco Silva
🏷️ math.OC

摘要翻译: 梯度极值线是梯度为 Hessian 特征向量的轨迹。这些对象提供了连接山谷(valleys)和山脊线(talwegs)等概念的自然几何框架,本文从变分角度分析了这些概念。证明了梯度流及其离散对应物的轨迹与梯度极值线的切空间以及(在一般情况下)山脊线表现出方向对齐。在非共振假设下,与二次情况不同,对齐速率由第一谱间隙或 Hessian 在极限点的最小特征值控制。进一步证明了体积集中现象:长时间后,初始条件集的像集中在山谷内部并渐近围绕山脊线。

点评: ⭐⭐⭐⭐ 美丽的几何分析工作,将梯度下降的轨迹行为与 Hessian 的几何结构联系起来,对理解优化景观有深刻启发。


6. 🔄 分布式与约束优化

6.1 轻量级实时 ALADIN 分布式优化

Lightweight Real-Time ALADIN for Distributed Optimization
📄 2604.15176 | 📅 2026-04-16
👤 Yifei Wang, Xuhui Feng, Shimin Pan 等
🏷️ math.OC

摘要翻译: 本文通过扩展增广拉格朗日交替方向非精确 Newton(ALADIN)算法,提出了多节点分布式优化的实时计算框架。方法整合了伴随 SQP 技术以高效近似 ALADIN 内嵌二次规划中的 Jacobian 信息,减少通信开销。进一步设计了事件触发更新策略以降低计算复杂度,避免每次迭代更新 Hessian 和 Jacobian 矩阵。所提方法实现局部收敛和增强的通信效率。

点评: ⭐⭐⭐ ALADIN 的实用化改进,事件触发策略在实时场景中具有价值。


6.2 Mix-CALADIN:共识混合整数分布式优化

Mix-CALADIN: A Distributed Algorithm for Consensus Mixed-Integer Optimization
📄 2604.14897 | 📅 2026-04-16
👤 Boyu Han, Xu Du, Karl H. Johansson, Apostolos I. Rikos
🏷️ math.OC, eess.SY

摘要翻译: 本文解决了含混合整数变量的分布式共识优化问题,特别关注布尔变量。引入了扩展 CALADIN 框架的新分布式算法,结合了处理布尔变量的专门技术,不依赖局部混合整数求解器。在目标函数 Lipschitz 连续的温和假设下,为凸和非凸混合整数规划问题建立了严格收敛保证。

点评: ⭐⭐⭐ 将 ALADIN 框架扩展到混合整数设置,无需局部整数求解器是一个重要贡献。


6.3 HUANet:硬约束展开 ADMM 网络

HUANet: Hard-Constrained Unrolled ADMM for Constrained Convex Optimization
📄 2604.13179 | 📅 2026-04-14
👤 Trinh Tran, Binh Nguyen, Truong X. Nghiem
🏷️ math.OC, cs.LG, eess.SY

摘要翻译: 本文提出 HUANet,一种受约束的深度神经网络架构,将 ADMM 迭代展开为可训练神经网络用于求解约束凸优化问题。现有端到端学习方法作为从参数到解的黑盒映射,缺乏显式最优性原则且无法强制约束。为解决此限制,展开 ADMM 并在每个迭代中嵌入硬约束神经网络以加速算法,等式约束通过网络输出的可微校正阶段强制执行。训练期间进一步将一阶最优性条件作为软约束以促进收敛。

点评: ⭐⭐⭐ 算法展开(algorithm unrolling)与约束优化的有趣结合,硬约束保证是实际应用的关键。


7. 🎲 随机优化与多阶段决策

7.1 多阶段条件复合优化

Multistage Conditional Compositional Optimization (MCCO)
📄 2604.14075 | 📅 2026-04-15
👤 Buse Şen, Yifan Hu, Daniel Kuhn
🏷️ math.OC, cs.LG, stat.ML

摘要翻译: 本文引入多阶段条件复合优化(MCCO)作为不确定性下决策的新范式,结合了多阶段随机规划和条件随机优化的方面。MCCO 最小化条件期望和非线性代价函数的嵌套。应用广泛,涵盖最优停止、LQR 问题、分布鲁棒情境 bandit 及涉及动态风险度量的问题。朴素嵌套采样方法的场景复杂度随嵌套层数指数增长。作者开发了新的多级 Monte Carlo 技术,场景复杂度仅随所需精度多项式增长。

点评: ⭐⭐⭐⭐ 新问题范式的提出具有开创性,多级 Monte Carlo 的多项式复杂度突破指数壁垒令人印象深刻。


7.2 经典与量子加速:能量守恒下降法用于非凸优化

Classical and Quantum Speedups for Non-Convex Optimization via Energy Conserving Descent
📄 13022 | 📅 2026-04-14
👤 Yihang Sun, Huaijin Wang, Patrick Hayden, Jose Blanchet
🏷️ quant-ph, cs.LG, math.OC, stat.ML

摘要翻译: 能量守恒下降(ECD)算法近期被提出作为全局非凸优化方法。与梯度下降不同,适当配置的 ECD 动力学可逃逸严格局部极小值并收敛到全局极小值。本文首次对 ECD 进行了分析研究,聚焦一维设置。形式化了随机 ECD 动力学(sECD)和 ECD Hamilton 量的量子类比(qECD),通过 Hamilton 模拟为量子算法提供基础。对于正双势阱目标函数,计算了从局部到全局极小值的期望命中时间。证明了 sECD 和 qECD 相对于各自梯度下降基线(SGD 和其量子化版本)均获得指数级加速。对于高壁垒目标函数,qECD 相对于 sECD 进一步加速。

点评: ⭐⭐⭐⭐ 量子优化与经典全局优化的首次严格比较,指数级加速的结果令人振奋。


本周趋势总结

趋势 代表论文 说明
零阶方法动力学 ZO at Edge of Stability ZO 与 FO 稳定性机制的根本差异
SQP 理论突破 Anderson SQP, Noise SQP, Stochastic SQP AA 加速、噪声鲁棒、复杂度分析三线并进
全局收敛新范式 Broximal Alignment 跳出梯度平稳性,提出全新的结构条件
动量与稳定性 Momentum Sharpness, GD Last Iterate 深化对优化动力学边界行为的理解
Nesterov 加速推广 NOD 通过 Asplund 分解推广到一般单调算子
展开网络+约束 HUANet 算法展开与硬约束的结合
量子优化 ECD 量子加速 经典与量子全局优化的指数级加速

本报告由 OpenClaw 自动生成,精选论文基于与优化理论/方法的相关性和学术影响力。