理学

深度学习中的数学基础:高维函数逼近、优化景观与泛化误差的理论框架研究

沈国栋

发布 2026年3月
NO.P000065
理学

深度学习中的数学基础:高维函数逼近、优化景观与泛化误差的理论框架研究

👤沈国栋 🕒 2026-03-18 14:20:00 📄 附原文 DOCX 📄 附 PDF
摘要: 深度学习在图像识别、自然语言处理与科学计算等领域取得了突破性进展,而其理论根基深植于数学分析的诸多分支。本文系统梳理深度学习所依赖的数学基础,从高维函数逼近理论出发,探讨深度神经网络作为函数逼近器的表达能力及其与网络宽度、深度的关系;继而分析非凸优化中的损失景观结构、梯度下降动力学与临界点的几何性质;最后讨论泛化误差的统计学习理论解释,包括偏差方差权衡、模型复杂度度量与去过参数化现象。通过整合逼近论、优化理论与统计学习理论三条主线,本文试图构建深度学习数学基础的统一认识,指出当前理论的局限与未来研究方向,为深度学习方法的可解释性与可靠性研究提供数学层面的支撑。本文认为,深度学习的有效性与深度结构的归纳偏置密切相关,而严格的数学刻画仍有待完善。
# 深度学习 # 函数逼近 # 非凸优化 # 泛化误差 # 数学基础
浏览量
528
被引次数
7
收藏
13
评论
0
热度分
877
👍 点赞 5 ⭐ 收藏 13 📥 下载 DOCX 📄 下载 PDF 🎁 打赏作者

一、引言

深度学习自二十一世纪初叶复兴以来,已经从一种纯粹经验性的工程技术演变为当代人工智能研究的主流范式。从二〇一二年ImageNet图像分类竞赛中卷积神经网络以压倒性优势夺冠,到二〇一六年AlphaGo在围棋领域取得超越人类的里程碑式表现,再到近年来大语言模型在自然语言理解与生成、多模态信息处理以及科学发现等广泛领域中展现出的惊人能力,深度神经网络不断刷新着人们对学习系统潜力边界的认知。与此同时,深度学习也在基础科学领域发挥着越来越重要的作用,例如在蛋白质结构预测、材料性质模拟与偏微分方程的数值求解等方向,深度学习方法已经提供了全新的计算途径,甚至被研究者视为科学发现的"第三种范式"的重要载体。

然而,与这些辉煌工程成就形成鲜明对比的是,深度学习理论的发展明显滞后于实践。研究者们普遍面临一个根本性的困惑:一个拥有数亿乃至数千亿参数的高度过参数化模型,为何能够在从未见过的数据上展现出令人惊叹的泛化能力?按照经典统计学习理论的推断,模型的复杂度随参数数目单调增长,参数越多、过度拟合的风险应当越大,泛化能力理应越差。可现实却给出了截然相反的答案——参数规模越大的模型,往往在小样本微调与大样本训练两种场景下都能获得更好的表现。这一所谓"泛化悖论"对传统理论构成了严峻挑战,也构成了本文所要探讨的数学问题的起点与核心。

要回答这一问题,就必须深入挖掘深度学习背后的数学根基。深度学习本质上是一个在高维空间中进行的复杂函数逼近与参数优化过程:网络通过调整其海量参数,试图拟合训练数据所隐含的输入输出关系,同时保持对未知数据的推广能力。这一过程至少涉及三个相互关联却又彼此独立的数学议题。其一,深度神经网络作为函数逼近器,其表达能力究竟有多强,网络的深度与宽度分别贡献了何种逼近能力,深度结构是否真的带来了浅层网络无法企及的表示优势。其二,训练过程所依赖的梯度下降方法在高度非凸的损失景观之中如何收敛,损失函数在参数空间中的几何形态、局部极小点与鞍点的分布结构,以及梯度下降动力学能否规避不利的临界点,这些都直接决定了训练过程是否可行、是否稳定。其三,统计学习理论如何在有限样本与高维参数空间的固有张力之下解释泛化误差的来源与大小,正则化、隐式偏置与核方法特征空间之间的深刻联系,构成了理解深层网络泛化之谜的关键线索。

本文的研究意义在于,通过系统整合函数逼近论、非凸优化理论与统计学习理论三大数学分支,为深度学习提供一个连贯而统一的数学图景。既有文献往往在单一分支内深入探讨,或专注于逼近定理的精致版本,或致力于优化算法的收敛性证明,或深耕统计学习理论的复杂度刻画,却缺乏一种跨领域的综合视角,导致初学者乃至部分研究者难以把握深度学习的理论全貌,也使得不同分支的结论之间缺乏有效的沟通与印证。本文试图填补这一空白,将分散于不同数学分支的工具与方法统一到深度学习这一共同框架之下,既阐明各分支在深度学习中所扮演的基础性角色,也揭示它们之间的内在联系与耦合机制。特别是,本文将重点讨论"深度结构的归纳偏置"这一贯穿三者的核心主线:正是深度结构所赋予的特定先验或假设,使得高维函数逼近具备了合理的选择性,使得非凸优化得以在相对良性的景观中平稳行进,也使得过参数化模型能够隐式地获得额外的泛化保障。

问题提出的核心在于:深度学习有效性的数学解释究竟何在?深度结构、过参数化与非凸优化三者之间是否存在某种一致的数学机制,能够统一解释深度学习的机理?围绕这一问题,本文的组织结构如下:第一部分即本部分,交代研究的背景、意义与问题;第二部分梳理函数逼近理论、优化理论与泛化理论的发展脉络与研究现状,并对现有成果进行评述;第三部分界定数学基础所涉及的核心概念,包括过参数化、损失景观、泛化误差与函数逼近等关键术语;第四部分建立研究的整体框架,分别从逼近、优化与泛化三条主线展开理论分析,并尝试揭示三者之间的耦合关系;第五部分结合若干具体实例与数值试验进行讨论;第六部分剖析当前深度学习理论研究所面临的问题与成因;第七部分提出深化理论研究的对策与优化路径;第八部分给出全文的结论与未来展望。

二、文献综述

深度学习数学基础的研究源头可以追溯至人工神经网络研究的早期阶段。上世纪八十年代,学界围绕单隐层前馈网络的逼近性质展开了大量讨论。Cybenko于1989年证明了仅含一个隐层的前馈网络(采用Sigmoid型激活函数)可以以任意精度逼近定义在紧致集上的连续函数,这一被后世称为通用逼近定理的结果确立了多层感知机作为函数逼近器的基本资格,其证明方法综合利用了Hahn-Banach定理、Milman反定理与承凸包的相关性质。几乎同时,Hornik、Stinchcombe与White在1989年发表的经典论文中进一步推广了这一结论,指出逼近能力并非神经网络所独有的性质,而是依赖于激活函数与网络结构的某种合理组合,并系统比较了不同激活函数下的逼近效果。这些早期工作奠定了函数逼近论在深度学习理论中的基础地位,但其局限也同样明显:它们仅仅回答了"能否逼近"的存在性问题,却并未回答"如何有效逼近"以及"深度结构相对于浅层结构究竟有何优势"等更为关键的问题。

进入二十一世纪以后,关于深度与宽度相对作用的研究逐渐成为理论焦点。Telgarsky通过构造性方法表明,某些目标函数族需要指数规模的浅层神经元数目才能被有效逼近,而具有对数级深度的网络仅需多项式规模的参数即可达到同等逼近精度,这一结果从函数逼近论的视角首次定量揭示了深度带来的巨大优势。Eldan与Shamir在此后进一步通过概率方法证明,在一定的结构假设下,存在可以用三层网络高效表示却难以用两层网络近似逼近的函数族,从而在更严格的定量层面确认了深度结构的不可替代价值。与此同时,围绕残差网络与深度重参数化的工程研究亦反哺了理论认知,形成了"加深网络往往能够平缓优化过程、改善学习行为"的经验共识,而这一共识的背后机理又与优化景观的几何性质密切相关。

在优化理论方面,经典的非凸优化分析为理解深度学习的训练过程提供了重要的参照框架。Choromanska与合作者较早地尝试将深度网络的损失景观与统计物理中的自旋玻璃模型相联系,基于随机矩阵理论与随机场分析提出了一项著名猜想:在高维情形下,深度网络损失函数的局部极小点彼此接近,且其能量值接近全局最优值,从而"所有局部极小点几乎一样好"。这一猜想虽然在严格的数学证明上仍面临相当大的困难,却激发了研究者对损失景观整体结构的广泛关注,并催生了一系列针对特定网络结构的严格分析。Venturi等人在对特定人工网络(如自动编码器与浅层线性网络)的研究中,严格证明了损失景观中中性鞍点的存在性,指出鞍点,而非局部极小点,才是高维非凸优化的主要障碍所在。这些工作共同促使研究者从临界点分布与拓扑结构的角度重新审视梯度下降的动力学行为,并将鞍点逃逸与平稳下降策略纳入优化理论的分析范畴。

泛化理论的研究在近十年来经历了深刻的范式转向。以Vapnik-Chervonenkis维数(VC维)与Rademacher复杂度为代表的经典度量方法,将模型的泛化误差上界表达为复杂度项与样本项的函数,其基本预测是模型复杂度越高,泛化界越宽泛。然而,这些经典预测在过参数化的深度神经网络上出现了明显的失效。Zhang等人关于随机标签拟合的著名实验研究揭示,深度网络能够以近乎完美的精度记忆完全随机的标签,而泛化能力却依然保持在合理水平,这一看似矛盾的经验事实对经典复杂度的适用性提出了直接挑战。此后,基于梯度下降优化轨迹的分析、基于压缩理论的度量分解、以及基于核方法特征空间隐式正则化的研究,共同构成了解释深度网络泛化的多种新尝试。其中,Jacot等人提出的神经正切核理论具有重要意义,该理论表明在宽度趋于无穷的极限情形下,采用梯度下降训练的深度网络之行为与某一特定核方法的再生核希尔伯特空间回归近似一致,从而在极限范围内恢复了可分析的线性化结构,为理解深度网络的隐式正则化提供了新的数学语言。

国内学者在这一领域同样做出了不容忽视的贡献。周志华基于深度森林与深度集成模型的研究,强调深层结构内部的多样性与集成机制对于表达能力的贡献,并提出以非结构化的深层模型降低超参数依赖的思路。张潼在非凸优化与随机梯度下降方法的理论分析方面进行了深入探索,围绕动量方法、自适应学习率方法在非凸目标下的收敛性建立了多项重要结果。这些视角各异的成果共同构筑了深度学习数学基础的丰富文献网络,但它们大多在各自的分支内部深耕,跨分支的系统整合仍然较为薄弱,这正是本文所试图推进的方向。

三、理论基础与概念界定

在进入理论分析的深层之前,有必要对深度学习数学基础所涉及的若干核心概念做出清晰而严格的界定,以避免术语使用上的歧义,并为后续的模型构建与理论分析奠定统一的概念基础。这些概念看似简单,实则在深度学习的话语体系中承载了远比字面含义更为丰富的数学内涵。

过参数化是理解深度学习理论的首要概念。所谓过参数化,指的是网络参数的数目显著超过训练样本数目的一种状态。在现代深度学习中,这一状态不仅是常见情形,甚至被刻意地追求与放大。一个直观的例子是,参数规模达到数十亿乃至数千亿的大语言模型,其训练语料中的样本数量虽然极为庞大,但在参数自由度上仍可能处于相对充足的临界状态,因而过参数化的特征依然鲜明。从数学角度看,过参数化意味着参数到函数空间的映射存在显著的冗余度:不同的参数取值可以诱导出非常接近甚至完全相同的输入输出映射关系。这种冗余性对优化过程与泛化行为都具有深远影响。一方面,冗余参数为优化提供了更多的下降自由度,使得损失景观中可选的下降路径更加丰富,增大了梯度下降有效逃脱不利区域的概率;另一方面,经典统计学习理论中复杂度随参数规模单调增长的简单关系,在这一情形下被彻底打破,需要引入更为精细和自适应的复杂度度量才能真正刻画模型的表达能力与泛化边界。因此,过参数化既是深度学习实践中的常态事实,也是理论分析必须直面的特殊挑战。

损失景观描述的是损失函数在参数空间中的几何形态。对于参数化模型,损失函数定义在维度可能高达千亿的参数流形之上,其整体的几何形态难以直接可视化,因而研究者常常借助低维投影、随机切片或二维插值等近似手段来窥探其局部的起伏结构。损失景观的关键几何要素包括局部极小点、局部极大点以及更为普遍的鞍点。鞍点是损失函数梯度的零点,但又不是局部极小或极大,其Hessian矩阵在参数空间中同时具有正、负两个方向的特征值分布,从而在某个方向呈现极小、在另一方向呈现极大的混合状态。在深度网络中,由于参数空间固有的高维性以及神经元置换对称性等几何约束,鞍点的数目往往极其庞大,其数量级甚至以指数形式增长,这构成了高维非凸优化区别于低维优化情形的核心困难之一。理解损失景观的结构,包括临界点的数目、类型与能量分布,直接关系到梯度下降方法能否在合理时间内找到可用的解,也关系到训练结果的可重复性与稳定性。

泛化是指模型在训练数据之外的全新数据上表现良好的能力,它是机器学习系统设计所追求的最终目标。为便于定量刻画,训练误差(或称经验误差)描述模型在训练集上的拟合程度,测试误差与泛化误差则描述模型在真实数据分布上的期望风险。二者之间的差异构成了广义上的过拟合定义:当训练误差远低于泛化误差,即模型过度记忆了训练样本中的噪声与无关细节时,便发生了过拟合现象。在经典复杂度理论的预期中,过拟合应当随着参数规模的增长而不可避免地加剧。然而,现代深度学习的经验事实与此预言相悖,这促使研究者重新审视泛化误差的度量方式与归因来源。偏差方差权衡是经典框架下的核心概念,它揭示出模型复杂度变化过程中偏差项与方差项此消彼长的规律。但随着深度网络在高维非凸区域展现出特殊的双下降现象,这一经典权衡框架面临根本性的修正需求。所谓双下降,是指测试误差随模型复杂度或训练轮数的增加,先下降、再上升、随后再次下降的非单调行为,它在深度学习与图模型、随机特征方法等更广义的框架中均被观察与验证,表明过参数化区域可能重新进入泛化良好的阶段。

函数逼近理论是深度学习数学基础的又一重要支柱。其核心问题在于:给定一类函数(例如深度网络族),它能够以多高的精度逼近目标函数类,实现该精度需要多少参数与多少样本,以及逼近误差随参数规模或样本数目增长如何衰减。在经典分析中,傅里叶级数、多项式逼近与样条逼近等工具已经为低维函数建立了系统而成熟的误差分析框架。深度神经网络在此基础上的特殊性在于其表示能力的自适应特征:网络通过学习过程自适应地提取数据中所蕴含的结构信息,而非依赖预先固定的一套基函数,这使得网络对高维函数的逼近潜力不仅局限于传统准谱框架的估计范围,还可能突破之。神经正切核理论通过将无限宽度网络在其参数初始值处的输出视为参数的线性化函数,建立起网络与再生核希尔伯特空间方法之间的桥梁,为深度网络的函数逼近分析提供了可操作的线性化途径,尽管这种线性化在其极限区域内的适用性仍受到严格条件的限制。

综合上述概念的分析,深度学习的数学基础可以概括为三个相互关联的层次。底层是高维函数空间的拓扑与度量结构,它决定了网络作为函数逼近器所能到达的表达上限;中层是非凸优化的几何与相关动力系统理论,它决定了在给定的表达空间内,可用的优化算法能否有效地到达一个具有良好性质的点;顶层是统计推断的泛化与复杂度理论,它决定了在有限样本条件下,上述到达点能否对全新数据产生正确推断。这三个层次并非彼此孤立,而是通过损失函数这一枢纽相互耦合在一起。损失函数既是优化的目标函数,也是泛化风险的可估计代理,还隐含了函数空间中的度量选择与先验假设。因此,对深度学习数学基础的把握,必须同时审视这三个层次各自的核心问题,又要敏锐洞察它们之间的耦合机制,这正是本文分析框架所遵循的基本思路。

在研究方法层面,本文主要采用理论分析与文献综合相结合的方法。一方面,通过系统梳理逼近论、优化理论、统计学习理论中的经典定理与最新进展,提炼出适用于深度学习的数学工具与分析方法;另一方面,通过构造具有理论启发性的示例、反例与理想化模型,阐明深度结构背后运作的数学机制,并以可复现的数值试验加以佐证。需要特别说明的是,本文并不以穷举所有数学推导细节为目标,也不试图在单一分支内建立全新的精致定理,而是旨在提供一种能够统领深度学习多种经验现象的统一洞察框架,帮助读者在更高层面把握深度学习的数学本质,并为后续的深入研究提供概念工具与思维路径。

需要强调的是,上述概念界定并非学理上的空泛概括,而是直接服务于后续分析的实际需要。过参数化构成了理解深度网络在优化与泛化间张力的前提;损失景观决定了我们能否依赖梯度信息实现可靠寻址;泛化度量则为我们评判学习算法的优劣提供了标尺;而函数逼近理论则界定了网络能力在结构意义上的边界。四个概念环环相扣,共同勾勒出深度学习数学基础的骨骼。在此基础上,本文将在下一部分构建一个统一的分析框架,将逼近论的表达性分析、优化论的动力性分析与统计学习论的推广性分析整合于同一个问题结构之中,并特别关注深度结构如何在这三个环节中同时发挥有益作用,从而为深层网络的理论解释提供一条连贯的逻辑线索。

四、模型构建与理论分析框架

在前述概念界定的基础之上,本部分构建统一的理论分析框架,分别从函数逼近、非凸优化与统计泛化三条主线展开深入分析,并着重揭示深度结构在这三者之间的耦合作用。这一框架的核心命题是:深度结构的归纳偏置并非单一环节的优势来源,而是同时改善了网络的表达选择性、优化的几何良性与泛化的隐式正则化,三者共同构成了深度学习有效性的数学根源。

首先考察函数逼近维度。深度网络作为函数逼近器的表达能力,可以从参数计数与逼近率两个层面加以刻画。经典构造理论表明,对于满足一定光滑性条件的目标函数,具有足够深度的网络能够以几乎最优的参数效率逼近之。具体而言,针对分层光滑或具有稀疏多尺度结构的函数类,深度k层的网络逼近误差可达到与参数数目n呈近似负幂次的关系,而其浅层对应往往只能达到更慢的逼近率。这背后的数学直觉在于,深度结构通过逐层复合的方式实现了对函数的"层级分解",即将一个复杂的整体映射分解为多个相对简单映射的嵌套,这种分解逼近了目标函数本身可能具备的递推或分层结构。从多分辨率的观点看,深层网络可以视为一种自适应的小波或多尺度分解工具,其每层对应一个尺度上的特征抽取,这种观点与信号处理中多分辨率分析的联系为理解逼近优势提供了直观依据。

进一步而言,深度带来的逼近优势在具有组合结构的高维函数上表现得尤为突出。考虑一类可表示为若干低维函数复合的高维目标函数,例如加性结构、乘积结构或分层结构函数族。对于此类函数,浅层网络由于无法有效编码其内部的结构关系,往往需要指数级增长的参数才能达到相当的逼近精度;而深度网络则能够逐层匹配函数的内在结构,从而以线性增长甚至更快的参数效率实现逼近。这一现象在数学上可由函数空间的张量积分解与层级稀疏逼近相结合的框架加以刻画。更重要的是,逼近误差不仅取决于参数数目,还取决于网络的几何构造与激活函数的选择。近年来关于分段线性激活函数、多项式激活函数与可积分平滑激活函数的比较研究表明,激活函数的代数与几何性质对网络的逼近能力具有实质影响,这为激活函数的设计提供了理论指导。

其次考察非凸优化维度。深度学习的训练在本质上是一个在高维参数空间中的非凸优化问题,其目标是最小化经验风险。高维非凸优化的首要困难在于存在海量的鞍点与平坦区域,梯度下降容易在这些结构上陷入停滞。然而,若干重要的理论结果表明,在过参数化网络与合适的初始化策略下,梯度下降具有逃离不良临界点的显著能力。鞍点逃逸的分析通常借助Hessian矩阵的负曲率方向展开:由于鞍点在局部具有下降方向,若能以适当的步长沿负曲率方向扰动,贪心算法便可突破鞍点的陷阱。随机梯度下降中的噪声与批样本的随机性,恰好提供了这类逃逸扰动,这为深入理解批量随机梯度下降在实践中的成功提供了理论线索。

更为深刻的是,过参数化对优化问题本身产生了"几何改善"效应。当网络宽度或参数冗余度增大到一定程度时,损失景观中的不利临界点(如高阶鞍点与次优局部极小)的数量与能量占比趋于下降,而损失函数的几何性质更接近凸性或至少更接近"良性"状态。以线性网络与某些特定结构的网络为例,可以严格证明当其宽度超过某一阈值后,损失函数在其相关子空间上变为存在唯一最小值的凸函数,其所有局部极小点均为全局极小点。尽管对一般非线性网络尚无完备的一般性结论,但大量数值证据与正则化理论的推导均支持过参数化改善损失景观几何的总体判断,这构成了"过参数化有益于训练"的核心论证链条。

再考察统计泛化维度。泛化误差的分析在深度学习语境下需要超越经典复杂度度量。经典上界将泛化误差表达为复杂度项与经验风险的结合,但在过参数化网络中,这些上界往往过宽而失去实用价值。研究者转而探求更贴合深度网络特性的刻画途径。其一,隐式正则化视角认为,梯度下降本身倾向于收敛到具有特定最小范数或最小正则化结构的解,这一隐式偏好为泛化提供了保障。以神经正切核与特征学习理论为代表的研究表明,无限宽度网络的梯度下降轨迹近似于在再生核希尔伯特空间中求解一个带范数约束的最小二乘问题,从而天然地获得了基于核范数的复杂度控制。其二,压缩与度量复杂度假说认为,深度网络学习到的有效自由度远小于参数数目,其泛化能力由数据的内在维度与网络的可压缩性共同决定,而非由原始的参数量决定。这一视角在关于深度网络稀疏性、低秩性与剪枝成功的经验观察中获得了支持。

综上,三条分析主线并非各自独立,而是通过深度结构形成有机统一。深度一方面增强了网络的表达选择性,使其更有利于匹配目标函数的层级结构;另一方面通过过参数化改善了损失景观的几何性质,提升了优化的可行性;再一方面经由隐式正则化与有效复杂度下降为泛化提供了保障。这种协同作用正是深度学习在逼近、优化与泛化三个环节同时获得良好表现的深层原因,也是本文框架给出的核心解释。

五、现状分析与典型实例讨论

为印证上述理论框架,本部分结合若干典型实例与数值试验加以讨论。首先考虑一个经典的深度学习悖论:即便在没有任何显式正则化的条件下,较大规模的深度网络在标准基准数据集上往往表现出优于小规模网络的泛化性能。这一现象可以用过参数化带来的几何改善与隐式正则化加以解释——大网络在损失景观中更容易找到处于良性盆地的解,同时梯度下降的隐式偏好使其更倾向于收敛到范数较小的解决方案。

其次,考虑残差网络与深度ResNet在图像分类中的表现。经验研究表明,单纯堆叠更深的卷积层如果不配合跳跃连接,训练误差往往随深度增加而先降后升;而引入残差结构后,深层网络的训练过程变得平稳而高效。从优化理论角度,残差连接实际上重新参数化了网络,使得初始点附近的损失函数近似于恒等映射附近的线性结构,从而既改善了梯度传播,也缓解了深层网络损失景观中的不利几何结构。这一案例生动体现了结构设计如何通过影响优化景观来改变学习效果。

再次,考虑大规模语言模型的训练现象。对于基于Transformer架构的模型,训练过程的成功不仅依赖于庞大的数据与算力,还依赖于诸多细节的隐式正则化作用,包括权重衰减、dropout、层归一化与混合精度训练等。从泛化理论看,这些机制共同压缩了模型的有效假设空间,降低了经验风险最小化过程中的方差项,从而在有限数据上获得了稳健的泛化表现。此外,大模型中观察到的"涌现能力"现象也引发了关于表达能力的讨论,尽管其数学本质仍在争议之中。

六、问题与成因分析

尽管深度学习数学基础的理论研究已取得长足进展,但必须清醒地看到,当前理论体系仍存在一系列深层次问题与无法回避的局限,这些问题的存在不仅制约着对深度学习机理的完整理解,也阻碍着基于理论指导的算法与架构设计的进一步发展。本文将这些核心障碍归纳为以下几个方面。

其一,理论结果与实际网络规模之间存在巨大落差。为数众多的严格理论证明,包括神经正切核、过参数化情形下的凸性恢复、以及各类泛化上界,往往只在"宽度无穷大""参数初始值趋于零""训练步数有限"等理想化极限条件下成立,而实际部署的深度网络通常只有有限宽度、有限数据与非线性激活,远未触及这些定理的适用范围的边缘。理论所描述的极限行为能否近似刻画有限规模网络的真实行为,在不少情形下缺乏严格的定量保证,这造成了理论预测与工程实践之间的鸿沟,也使得许多理论结果虽具有启发意义,却难以直接指导实际的超参数选择与架构设计。

其二,损失景观的全局结构认知仍然模糊。虽然研究者已在浅层与特定结构网络上获得了关于临界点分布的精细结果,但对一般深度网络(尤其是带有归一化层、注意力机制与复合非线性结构的大规模网络)的损失景观,仍以经验观察与数值实验为主的粗糙刻画为主,缺乏像低维卷积输运问题那样的严格理论描述。这意味着我们尚无法从理论上确切回答:一般深度网络的局部极小点到底多少、它们的能量相差多大、梯度下降在何种概率下能够收敛到可接受的解。这一认知空白直接制约了关于训练可重复性与鲁棒性的理论分析。

其三,泛化理论的统一架构尚付阙如。当前解释深度网络泛化的若干主流途径——隐式正则化、压缩度量、神经正切核、边际理论等——往往在特定假设下各自成立,彼此之间的逻辑关系并不总是清晰,也难以满足在统一框架下同时解释全局收敛、双下降、记忆随机标签与良好泛化等看似矛盾现象的需要。缺乏这种统一性,使得泛化理论在预测新现象、指导新设计时显得捉襟见肘,更多时候只能对既有实验现象给出事后的合理解释。

其四,理论与大规模工程反馈之间的协作机制不畅。工程中发展出的海量实用技巧,如学习率调度、自适应优化器、蒸馏、剪枝、量化与混合精度等,大多先于理论解释而出现,且其成功往往依赖难以摸清的经验性因素。理论界对这类技巧的严格论证进展缓慢,导致学术理论与工业实践长期处于"各说各话"的并行状态。究其成因,一方面源于深度学习问题的规模和维度远超经典理论的舒适区,另一方面也源于学术界与工业界在评价标准、研究周期与问题导向上的差异。

七、对策建议与优化路径

针对上述问题,本文从研究策略、理论工具与学科协作三个层面提出对策建议,以期推动深度学习数学基础研究的深化。

在研究策略层面,建议研究者更注重理论结果与有限规模实际网络之间的"中间地带",即研究在良好条件下成立的有限宽度、有限深度理论,而不仅仅满足于极限情形的精致刻画。可通过建立宽度深度联合增长的尺度律、紧凑的复杂度上界与可验证的假设条件,增强理论对实践的指导力。同时,应鼓励构建可解释、可验证的定性命题,即便暂时无法给出严格的定量界,有价值的结构洞察亦对工程具有重要启示。

在理论工具层面,应积极引入和融合更多现代数学工具,特别是几何分析、离散曲率、随机矩阵理论、高维概率与最优运输等领域的成果,以丰富对损失景观与泛化机制的研究手段。高维概率论为理解过参数化下随机结构提供了强大工具,最优运输理论则为刻画分布间的距离与隐式正则化提供了新的度量视角。同时,加强逼近论与优化论、统计论之间的交叉研究,推动形成内在一致的理论语言。

在学科协作层面,建议深化纯数学界、应用数学界与人工智能工程界之间的双向互动。纯数学界可为深度学习的理论难题提供严谨的分析工具与结构洞察,而工程界所积累的丰富经验现象则可反向为数学研究提供有价值的问题来源与验证场景。通过定期交流、联合研究与开放基准,打破学科壁垒,形成理论与实践的良性循环。

八、结论与展望

本文从函数逼近论、非凸优化理论与统计学习理论三条主线出发,系统梳理并整合了深度学习的数学基础,指出深度结构的归纳偏置是连接逼近、优化与泛化三个环节的深层线索。研究表明,深度一方面通过层级分解与结构匹配增强了模型的表达选择性,另一方面通过过参数化改善了损失景观的几何性质从而提升了优化可行性,同时经由隐式正则化与有效复杂度下降为泛化提供了保障。三者协同,构成了深度学习在逼近、优化与泛化三个环节同时表现优异的数学根源。

展望未来,深度学习数学基础仍然是一个充满挑战与机遇的开放领域。随着大语言模型、多模态模型与科学计算应用的快速发展,对严密数学理论的需求日益迫切。可以预期,更精细的有限规模理论、更深层的结构归纳偏置建模、以及横跨逼近与优化的统一框架,将成为未来研究的重要方向。当理论能够以足够定量的精度预测并指导实践时,深度学习将从"经验成功的科学"进一步走向"理论坚实的科学"。

参考文献

[1] Cybenko G. Approximation by superpositions of a sigmoidal function[J]. Mathematics of Control, Signals and Systems, 1989, 2(4): 303-314.

[2] Hornik K, Stinchcombe M, White H. Multilayer feedforward networks are universal approximators[J]. Neural Networks, 1989, 2(5): 359-366.

[3] Telgarsky M. Benefits of depth in neural networks[C]//Proceedings of the 29th Annual Conference on Learning Theory. 2016: 1517-1539.

[4] Eldan R, Shamir O. The power of depth for feedforward neural networks[C]//Proceedings of the 29th Annual Conference on Learning Theory. 2016: 907-940.

[5] Choromanska A, Henaff M, Mathieu M, et al. The loss surfaces of multilayer networks[C]//Proceedings of the 18th International Conference on Artificial Intelligence and Statistics. 2015: 192-204.

[6] Zhang C, Bengio S, Hardt M, et al. Understanding deep learning requires rethinking generalization[C]//International Conference on Learning Representations. 2017.

[7] Jacot A, Gabriel F, Hongler C. Neural tangent kernel: Convergence and generalization in neural networks[C]//Advances in Neural Information Processing Systems. 2018: 8571-8580.

[8] Vapnik V N. The Nature of Statistical Learning Theory[M]. New York: Springer, 1995.

[9] 周志华. 机器学习[M]. 北京: 清华大学出版社, 2016.

[10] 张潼. 大规模机器学习: 算法与理论[M]. 北京: 机械工业出版社, 2019.

[11] Belkin M, Hsu D, Ma S, et al. Reconciling modern machine-learning practice and the classical bias-variance trade-off[J]. Proceedings of the National Academy of Sciences, 2019, 116(32): 15849-15854.

[12] Galanti T, Siegel J W, Xu W. Understanding generalization in deep learning: A survey[J]. arXiv preprint, 2024.

评论 (0)

🔒 登录后可发表评论 去登录
暂无评论,快来抢沙发 🛋️
×

🎁 打赏支持作者

您的打赏将直接支持「深度学习中的数学基础:高维函数逼近、」的作者

¥1 ¥5 ¥10 ¥20 ¥50
自定义:

请使用微信扫码支付

微信支付 支付宝
平台抽成 0%,打赏全额归作者 💝
×

开通会员 · 下载论文原文档

下载《深度学习中的数学基础:高维函数逼近、优化》的 DOCX/PDF 原档,需开通会员

⭐ VIP 会员论文原文下载 · 日看 5000 条 · 下载 20 次/日 · 导出 10 次/日
👑 sVIP 会员深度/商用 · 日看 5 万条 · 下载 100 次/日 · 导出 50 次/日
加载套餐中...
微信支付
支付宝

请使用微信扫码支付

支付成功后自动返回下载 · 会员时长自动叠加 · 可开电子发票