数据科学与工程优化(六)

一、噪声地板(Noise Floor)问题背景在实际SGD(随机梯度下降)中,由于每次只用部分样本(甚至单样本)估计梯度,噪声地板(noise floor)不可避免:即SGD只能收敛到一个残差带(目标函数的最优值附近的宽区间),而非真正精确的最优点。这在大规模数据和非精确(有噪声)目标情况下尤其明显。二、降低噪声地板的三大方法方法一:动态步长(Dynamic Stepsize)基本思想:若每步步长 $\alpha_k$ 随迭代$k$递减,且满足$$ \sum_{i=0}^{\infty} \alpha_i = \infty,\quad \sum_{i=0…
数据科学与工程优化(五)

一、随机梯度下降法(SGD)背景许多机器学习与数据科学中的目标函数都具有求和结构:$$ \min_{x \in \mathbb{R}^n} f(x) = \frac{1}{m} \sum_{j=1}^{m} f_j(x) $$例如,$f_j(x) = \|a_j^T x - y_j\|^2$,$(a_j, y_j)$ 是数据点,$m$ 很大。标准梯度下降法每步需计算:$$ \nabla f(x_k) = \frac{1}{m} \sum_{j=1}^m \nabla f_j(x_k) $$计算复杂度高达 $O(mn)$,昂贵且不适合大规模问题。因此我们考…
数据科学与工程优化(四)

一、梯度法复杂度总结对于 $L$-光滑但非凸的 $f$,最速下降法(Steepest Descent)收敛速率为$$ O\left(\frac{1}{\sqrt{k}}\right) $$对于 $L$-光滑且凸的 $f$,$$ O\left(\frac{1}{k}\right) $$若 $f$ 还是 $\gamma$-强凸,则线性收敛速率$$ \left(1 - \frac{\gamma}{L}\right)^k $$二、重球法(Heavy Ball Method)1、适用范围适合凸二次型函数:$$ \min_{x \in \mathbb{R}^n} f…
数据科学与工程优化(三)

一、最速下降法最速下降法(Steepest Descent)用于求解无约束优化问题:$$ \min_{x \in \mathbb{R}^n} f(x) $$其中 $f: \mathbb{R}^n \to \mathbb{R}$ 是 $L$-光滑函数。算法通过迭代更新:$$ x_{k+1} = x_k + \alpha_k d_k $$$\alpha_k > 0$ 是步长(step length),在机器学习领域也常称为学习率(learning rate)。步长/学习率决定每次迭代沿搜索方向前进的距离,步长太小收敛慢,太大可能导致发散或振荡。两者本质…
数据科学与工程优化(二)

一、基本术语和模型考虑以下优化模型:$$ \min_{x \in \mathbb{R}^n} f(x) \quad \text{s.t.} \quad x \in F $$1、最小化点的定义局部极小点(local minimiser):$x^* \in F$,若存在 $\varepsilon > 0$,使得对所有 $x \in F \cap B_\varepsilon(x^*)$,有$$ f(x^*) \leq f(x) $$严格局部极小点(strict local minimiser):$x^* \in F$,若存在 $\varepsilon &…
数据科学与工程优化(一)

一、课程概述本课程主要讨论数据科学中的优化问题,包含以下内容:优化模型的基本形式与实际例子一阶迭代方法数据分析中的典型问题与优化方法二、为什么要用优化?在数据科学与机器学习中,很多问题都可以归结为优化问题。例如:回归问题数据补全问题数据结构检测降维问题数据分类问题这些问题通常涉及到参数的选择,使得模型对真实数据拟合得更好或者揭示数据的某种结构。三、优化模型的基本形式1、无约束优化模型$$ \min_{x \in \mathbb{R}^n} f(x) $$其中 $f$ 是光滑函数(本课程中指 $C^1$ (连续函数)且梯度 Lipschitz 连续)。2、…
简洁优雅的播放器——Meloria Music Player

💫 介绍 (description)这是一款为你精心打造的、功能丰富、界面美观的本地音乐播放器。运行于 Windows 平台,使用 Flutter 构建,使用 Dart / C++ 开发,采用 Material You 外观设计,带来流畅的原生体验。✨ 截图 (Screenshots)浅色模式表现深色模式表现音乐库页面分类页面🚀 特色功能 (Features)强大的音乐库:歌曲、专辑、艺术家等多维度浏览。轻松管理你的所有音乐文件。智能播放列表:自由创建、编辑和管理你的播放列表。记录最近播放,随时继续你的音乐之旅。沉浸式播放体验:设计精美的全屏播放器。支持…
常见激活函数表达式及其特性

1、Sigmoid 函数表达式:$$ \sigma(x) = \frac{1}{1 + e^{-x}} $$导数:$$ \sigma'(x) = \sigma(x)[1 - \sigma(x)] $$特性:输出区间:$(0, 1)$非线性,可微在$x \to +\infty$时趋近于1,$x \to -\infty$时趋近于0优点:将值压缩到$(0,1)$之间,适合做概率输出缺点:容易出现梯度消失问题,导致深层网络训练困难2、Softmax 函数表达式:对于输入向量$\mathbf{x} = (x_1, x_2, \ldots, x_n)$,第…
最小二乘法

最小二乘法(Least Squares Method)是一种用于数据拟合的方法,通过最小化观测值与模型预测值之间的误差平方和,来求得模型参数的最优估计。下面以一元线性回归为例,详细推导最小二乘法的过程。一、问题描述给定 $n$ 组数据点 $(x_1, y_1), (x_2, y_2), \ldots, (x_n, y_n)$,希望用一个线性函数$$ y = a x + b $$来拟合这些数据点。目标是找到参数 $a$ 和 $b$,使得拟合直线与观测数据之间的误差平方和最小。二、残差平方和对于每一个数据点 $i$,其观测值为 $y_i$,拟合值为 $\ha…
常用积分表

一、常见积分表序号积分表达式积分结果1$\int x^n \, \mathrm{d}x$$\dfrac{x^{n+1}}{n+1} + C \quad (n \neq -1)$2$\int \mathrm{d}x$$x + C$3$\int a \, \mathrm{d}x$$a x + C$4$\int \frac{1}{x} \, \mathrm{d}x$$\ln\vert x\vert + C$5$\int e^{x} \, \mathrm{d}x$$e^{x} + C$6$\int a^{x} \, \mathrm{d}x$$\dfrac{a^{…
常微分方程求解(6)

设$n$阶常数矩阵$\mathbf{A}$中的每一元素$a_{ij}\ (i,j=1,\cdots,n)$都是常数,则称$$ \frac{\mathrm{d}\mathbf{x}}{\mathrm{d}t} = \mathbf{Ax} + \mathbf{f}(t) $$为常系数线性微分方程组。我们先介绍常系数齐次方程组$$ \frac{\mathrm{d}\mathbf{x}}{\mathrm{d}t} = \mathbf{Ax} $$的解法,再讨论常系数非齐次方程组的情形。一、常系数齐次线性方程组的解法与解常系数线性方程类似,根据方程组是齐次、线性,…
奥托循环和卡诺循环

一、奥托循环(Otto Cycle)1. 循环过程描述奥托循环由四个过程组成(以理想气体为工质):$1 \rightarrow 2$:绝热压缩$2 \rightarrow 3$:等容加热(燃烧过程,吸热$Q_\mathrm{in}$)$3 \rightarrow 4$:绝热膨胀$4 \rightarrow 1$:等容冷却(排气,放热$Q_\mathrm{out}$)2、过程物理量变化与公式推导(1)绝热过程($1\rightarrow2$, $3\rightarrow4$)绝热条件下,$$ pV^\gamma = \mathrm{const} $$$$ …
不同情况下两列波叠加情况计算

设两列波的表达式均为:$$ f_1(x,t) = A_1 \cos(k_1 x + \omega_1 t + \varphi_1) $$$$ f_2(x,t) = A_2 \cos(k_2 x + \omega_2 t + \varphi_2) $$常见叠加情况如下:一、同频同波数同相位(完全相同的波)$$ f(x,t) = f_1(x,t) + f_2(x,t) = A_1 \cos(kx + \omega t + \varphi) + A_2 \cos(kx + \omega t + \varphi) $$直接合并:$$ f(x,t) = (A_1 …
叉积和混合积性质

一、叉积1、定义设$\mathbf{a} = (a_1, a_2, a_3)$,$\mathbf{b} = (b_1, b_2, b_3)$是三维空间中的两个向量,则它们的差积(叉积)定义为:$$ \mathbf{a} \times \mathbf{b} = \begin{vmatrix} \mathbf{i} & \mathbf{j} & \mathbf{k} \\ a_1 & a_2 & a_3 \\ b_1 & b_2 & b_3 \end{vmatrix} = \left( a_2b_3 - a_3…
矩估计和极大似然估计

一、矩估计(Method of Moments, MM)1、意义矩估计是一种参数估计方法。其基本思想是用样本矩(即样本的若干阶幂平均)去逼近总体矩(即理论矩),从而求出未知参数的估计值。也就是说,通过样本的统计量去“模拟”总体分布的性质。2、计算方法(1)一般步骤设总体分布含有$k$个未知参数$\theta_1, \theta_2, \ldots, \theta_k$。写出前$k$阶的理论矩(关于参数的表达式):$$ \mu_r' = \mathbb{E}(X^r), \quad r=1,2,\ldots,k $$根据样本计算对应的样本矩:$$…