avatar
文章
12
标签
2
分类
3
主页
机器学习笔记
友链
IzzyMoonbow's Blog
主页
机器学习笔记
友链

IzzyMoonbow's Blog

machine-learning
发表于2026-08-12|笔记本科课程机器学习
This folder contains unofficial latex-written notes from last year’s excellent student, Taoyu Yang. You can open them using local markdown readers or chrome/edge extensions like Markdown Viewer (remember to enable mathjax in content to display equations). Note that, these notes are far from complete. They lack figures, some explanations, as well as verbal insights that can hardly be written down. I highly recommend you take notes yourself during the class. It is a great excercise to test whet...
24秋机器学习笔记-11-生成式模型
发表于2025-02-06|笔记本科课程机器学习
本文主要涉及无监督学习中的生成式模型,介绍了 VAE 与 DDPM。 在阅读本篇之前建议先阅读10-无监督学习。 张老师关于 VAE 的推导和讲解非常精彩,强烈建议动手跟着推一遍。 一键回城。 VAE(变分自编码器,Variational Autoencoder) 引入 在上篇笔记中的 MoG 其实已经是种生成式模型了,但其只能用于处理成簇/低维的数据(会面临维度灾难:高维下数据点之间的欧氏距离没有那么好的实际意义了) 一种高维数据的代表是图片。比如我们知道 x∼p(x)x \sim p(x)x∼p(x),但是一般而言从 p(x)p(x)p(x) 中采样是比较困难的。但是像均匀分布 U([a,b])U([a,b])U([a,b]) 和高斯分布这样比较简单的分布还是比较容易采样的。 一种思路是,从一个简单的分布(如 [0,1][0,1][0,1] 高斯分布)中采样一个隐变量 zzz,然后用一个函数(可以是一个神经网络)f(z;θ)f(z;\theta)f(z;θ) 将 zzz 映射到 xxx(可以是图片)。事实上这也是市面上大多数生成式模型的基本思路。 此时 p(x)p(...
24秋机器学习笔记-10-无监督学习
发表于2024-12-04|笔记本科课程机器学习
本文主要涉及无监督学习中的降维/聚类方法,介绍了 PCA、k-means 与 EM 算法。 一键回城。 无监督学习简介 之前我们学习的都是有监督学习,我们的目标是最小化一个损失函数 L(f(x),y)L(f(x),y)L(f(x),y),或者最大似然 P(y∣x)P(y|x)P(y∣x)。比如回归问题中的线性回归与 GPR,分类问题中的逻辑回归、SVM 与 NN 等。 而无监督学习可以理解为只给一堆 XXX,然后学习 XXX 的分布 P(X)P(X)P(X)。 一般有三种: 降维(dimensionality reduction):学习一个更 compact 的 f(x)f(x)f(x) 的表示。 聚类(clustering):将一系列具有高相似度的样本聚为一类进行分析。 生成式模型:如 ChatGPT,Diffusion 等 主成分分析(PCA) 简介 一种经典的降维方法,x∈Rd→z∈Rd′x\in \mathbb{R}^d \to z \in \mathbb{R}^{d'}x∈Rd→z∈Rd′ 其中 d′<dd' < dd′&l...
24秋机器学习笔记-09-集成学习
发表于2024-11-22|笔记本科课程机器学习
一键回城。 概览 核心思想:将若干(弱)的模型组合在一起以获得一个强的模型。这些模型需要尽可能 diversed(因为如果都一样的话就起不到增强的效果了) 回顾偏差-方差分解: ED[(f(x;D)−y)2]=ED[(f(x,D)−f‾(x))2]+(f‾(x)−y)2\mathbb{E}_D[(f(x;D) - y)^2] = \mathbb{E}_D[(f(x,D) - \overline{f}(x))^2] + (\overline{f}(x) - y)^{2} ED​[(f(x;D)−y)2]=ED​[(f(x,D)−f​(x))2]+(f​(x)−y)2 高方差低偏差的模型:树模型,神经网络;低方差高偏差的模型:线性模型。 集成学习模型一般可以分为 Bagging 和 Boosting 两类。 Bagging Bagging 的目的是减少方差,所以被集成的模型一般为高方差低偏差的模型。 理想情况下,假设我们可以从分布 P(D)P(D)P(D) 中反复采样训练集 DDD,然后令 f(x)=1T∑t∈[T]f(x;Dt)\displaystyle f(x) = \f...
24秋机器学习笔记-08-树模型
发表于2024-11-13|笔记本科课程机器学习
一键回城。 决策树 回忆:我们之前的很多模型都可以写成 y=wTx+by = w^Tx+by=wTx+b,决策逻辑(二分类):f(x)≥0f(x)\ge0f(x)≥0 时预测为 111,否则预测为 000。 事实上这个逻辑可以写成一个树。 我们之前学习的模型多为线性模型,为了应对非线性性,我们可以考虑引入决策树。 决策树定义:一棵包含根节点、内部节点、叶子节点和有向边的树,每个非叶节点会将数据根据某种特性进行划分,一个数据点的预测值即为其对应的叶子节点对应的标签。 An example: y∈{−1,+1}y \in \{-1,+1\}y∈{−1,+1},+1+1+1 表示其为一个好的研究者,−1-1−1 表示其为一个不好的研究者。 收集的数据如下: ID A B C y 1 √ √ √ +1+1+1 2 √ √ × +1+1+1 3 √ × √ −1-1−1 4 × × × −1-1−1 5 × √ × −1-1−1 6 × × √ −1-1−1 7 × √ × −1-1−1 8 √ × √ −1-1−1 9 × √ × ...
24秋机器学习笔记-07-高斯过程
发表于2024-11-06|笔记本科课程机器学习
本文主要涉及高斯过程相关的推导以及应用。 一键回城。 作者的概率统计知识相当菜,在课后费了好大劲才搞懂这一节的内容,如有错误欢迎随时指出,吾必当感激不尽! 多元高斯分布(Multivariate Gaussian Distribution) 考虑多元高斯分布 N(x∣μ,Σ)\mathcal{N}(x\mid \mu,\Sigma) N(x∣μ,Σ) μ∈Rd\mu \in \mathbb{R}^dμ∈Rd 为均值,Σ∈Rd×d\Sigma \in \mathbb{R}^{d\times d}Σ∈Rd×d 为协方差矩阵。Σij=Cov⁡(xi,xj)=E[(xi−μi)(xj−μj)]=E[xixj]−E[xi]E[xj]\Sigma_{ij} = \operatorname{Cov}(x_i,x_j) = \mathbb{E}[(x_i - \mu_i)(x_j-\mu_j)] = \mathbb{E}[x_i x_j] - \mathbb{E}[x_i]\mathbb{E}[x_j]Σij​=Cov(xi​,xj​)=E[(xi​−μi​)(xj​−μj​)]=E[xi...
24秋机器学习笔记-06-学习理论
发表于2024-10-30|笔记本科课程机器学习
本节内容假设模型为二分类,y∈{1,−1}y \in \{1,-1\}y∈{1,−1},x∈Xx\in \mathcal{X}x∈X。 问题引入 定义 EinE_{\text{in}}Ein​ 表示训练误差(in-sample error)。令 h∈Hh \in \mathcal{H}h∈H 为一个模型,例如 h(x)=sgn⁡(wTx+b)h(x) = \operatorname{sgn}(w^T x + b)h(x)=sgn(wTx+b)。 Ein=1n∑i∈[n]1(h(xi)≠yi)E_{\text{in}} = \frac{1}{n} \sum_{i \in [n]} 1(h(x_i)\neq y_i) Ein​=n1​i∈[n]∑​1(h(xi​)=yi​) 此处 111 为 indicator function,和艾弗森括号是一个意思。 定义 EoutE_{\text{out}}Eout​ 为 out of sample error。事实上,我们更关心 EoutE_{\text{out}}Eout​ 而不是 EinE_{\text{in}}Ein​。二者之间有某...
24秋机器学习笔记-05-表示定理
发表于2024-10-23|笔记本科课程机器学习
引例 课上通过如下几个例子引出表示定理相关内容。 SVM 在带松弛变量的 SVM 表示中, min⁡w∑i∈[n]max⁡(0,1−yi(wTxi+b))+λ∥w∥2\min_w \sum_{i \in [n]} \max(0, 1-y_i(w^T x_i+b)) + \lambda \left\| w \right\|^{2} wmin​i∈[n]∑​max(0,1−yi​(wTxi​+b))+λ∥w∥2 接下来将记号进行改写(本节内容均如此约定):换成 f(xi)=wTφ(xi)f(x_i) = w^T \varphi(x_i)f(xi​)=wTφ(xi​),优化形式变为 min⁡w∑i∈[n]max⁡(0,1−yi(wTφ(xi)))+λ∥w∥2\min_w \sum_{i \in [n]} \max(0, 1-y_i(w^T \varphi(x_i))) + \lambda \left\| w \right\|^{2} wmin​i∈[n]∑​max(0,1−yi​(wTφ(xi​)))+λ∥w∥2 (注意这里的 www 包含之前的 bbb,多进行了对 bbb 的 n...
24秋机器学习笔记-04-支持向量机(SVM)
发表于2024-10-09|笔记本科课程机器学习
本文主要涉及支持向量机(Support Vector Machine)以及对偶理论。 一键回城。 本文所涉及部分用了 3 个课时来讲述,内容较多。 带约束的优化问题 先介绍一般性的优化问题,进而引出 K.K.T 条件。 等式约束下的优化问题 min⁡xf(x)\min_x f(x)minx​f(x),s. t. h(x)=0h(x)=0h(x)=0,其中 f,hf,hf,h 都可微。 ∀x\forall x∀x 在平面 h(x)=0h(x) = 0h(x)=0 上,有 ∇h(x)\nabla h(x)∇h(x) 与平面正交。 如果有切向分量,说明我们沿着切向走可以使得 h(x)>0h(x)>0h(x)>0,与 h(x)=0h(x)=0h(x)=0 矛盾。 对于一个局部最小值 x∗x^*x∗,梯度 ∇f(x∗)\nabla f(x^*)∇f(x∗) 也与平面垂直。 若有切向分量,则沿着其反方向走,可以保证 h(x)=0h(x)=0h(x)=0 的约束不变,且 fff 可以继续降低。 一般而言,x∗x^*x∗ 为局部最小值的必要条件为:∃λ\exists...
24秋机器学习笔记-03-偏差/方差分解
发表于2024-09-25|笔记本科课程机器学习
本文主要涉及机器学习中的模型选择,以及偏差-方差分解。 一键回城。 模型选择(Model Selection) 在利用机器学习相关技术解决实际问题的时候,模型的选择是尤为重要的。 一般而言,会将全部数据的 80%80\%80% 用于训练(训练集),10%10\%10% 用于验证(验证集,validation set),最后 10%10\%10% 用于测试(测试集,test set)。 如果数据包含时间戳,则应当按照时间顺序划分 Trn Val 和 Test,防止数据泄露问题(前面不应该看到后面)。否则,随机分配即可。 模型选择的原则: 如果有现成可用的(hand-out 的)验证集,则应当选择在验证集上表现更好的模型; 如果没有,则应当选择更简单的模型。 奥卡姆剃刀准则,简单有效原理。 Bias-Variance Decomposition 考虑在某训练集 DDD 上训练后,在测试集上的误差是怎么来的。 记号约定;DDD 为训练集 ∼P(D)\sim P(D)∼P(D),xxx 为样本,yyy 为标签。 f(x;D)f(x;D)f(x;D) 为训练后,对 xxx ...
12
avatar
IzzyMoonbow
Studying statistics
文章
12
标签
2
分类
3
Follow Me
公告
This is my Blog
最新文章
machine-learning2026-08-12
24秋机器学习笔记-11-生成式模型2025-02-06
24秋机器学习笔记-10-无监督学习2024-12-04
24秋机器学习笔记-09-集成学习2024-11-22
24秋机器学习笔记-08-树模型2024-11-13
分类
  • 笔记12
    • 本科课程12
      • 机器学习12
标签
本科课程 机器学习
归档
  • 八月 2026 1
  • 二月 2025 1
  • 十二月 2024 1
  • 十一月 2024 3
  • 十月 2024 3
  • 九月 2024 3
网站信息
文章数目 :
12
本站访客数 :
本站总浏览量 :
最后更新时间 :
© 2026 By IzzyMoonbow框架 Hexo 8.1.2|主题 Butterfly 5.7.0