☰
AI和大模型—维度的处理
2026/9/28 18:56:51 网站建设 项目流程

一、介绍

在前面的学习中,对LoRA有过分析。通过低秩矩阵进行处理,可以将海量参数的大矩阵分解为小矩阵来处理。这其实就涉及到了很重要的一个问题,降维。从理论上讲,矩阵的维度越高,越能更好的描述对应的事物的特点。但凡事总有限制,任何东西都不能无限的扩大。先不说能不能实现,光成本的增长可能就已经无法被忍受了。所以为了实现目的,就有可能对相关的矩阵数据进行维度处理,即降维。

二、低秩矩阵和满秩矩阵

这里再重新说明一下低秩矩阵,在数学上,矩阵的秩等于其线性无关的行(或列)的最大数目。一个m×n的矩阵,若其秩r远小于 min(m,n),则称之为低秩矩阵。这句话是什么意思?就是说这个矩阵虽然很大,但真正的有用的信息并不多。而相反满秩矩阵的信息量就非常多。而满秩矩阵是指对于m×n矩阵,若秩等于min(m,n)。它可以分为行满秩和列满秩两种情况。
而由低铁矩阵可以引入低秩正则化和低秩分解两个概念。低秩正则化一般是指优化目标函数中显式地惩罚矩阵的秩,即它是一种处罚机制,是实现低秩矩阵的一种手段。而低秩矩阵分解则是指现有的低秩矩阵可以分解为多个矩阵相乘,其虽然也可以降秩,但更重要的目的在于压缩数据量。降维一般是指后者即低秩分解。当然,可以把这两种方式统一起来,应用在海量参数矩阵的降维上面。

三、矩阵的奇异值分解

有过图像处理经验的都知道,其实对于一张图片来说,其真正的起决定性的作用的数据信息占比很少。举一个简单例子,一个BMP的图像,压缩成JPG图像时,往往可以缩小数个量级的数据存储。但这对于普通用户来说,几乎没有什么不同。如果用矩阵来表示图像,则表示这个矩阵中包含了大量的无效信息。
为了明白这一点,可先引入秩为1的矩阵,秩为1的矩阵是线性代数中最核心的“基本单元”,从数学上看,它一定能写成一个列向量乘以一个行向量的形式,即
A=uvT(vT表示转置向量)。即列向量决定了高度,行向量决定了宽度。同样,秩为1的矩阵也包含了大量的冗余信息。
在明白了秩为1的矩阵后,就可以引入另外一点。即任何一个复杂的满秩矩阵都可以通过SVD分解为一系列的秩为1矩阵的线性相加即:

每一个秩为1的矩阵都代表了一层信息,越靠前的矩阵,则代表了图像或数据的主要特征。也就是说,对于后面的代表细节或噪音的数据,可以根据情况进行取舍。这样就达到了降维和压缩数据的目的。

四、应用

在分析了上面的降维的处理后,就可以发现其大模型应用中的方式了。SVD是一种精确的公式分解而LRMF(低秩矩阵分解)则是一种建模模拟计算。前者是数学推导的,后者是大致推算的。
对于SVD来说,它更适合于理论分析和降维投影以及求伪逆等情况即对数据完整但想求最优解的情况更有优势。具体来说,包括图像压缩、主成分分析以及大模型的语义向量降维。
对于LRMF来说,它更适合于推荐系统、大模型的参数微调整以及大规模的预测即对数据稀疏、矩阵巨大的情况更有优势。具体来说,包括互联网推荐系统、大模型微调整如LoRA。

五、总结

这一篇可能需要大家有一点点线性代数的知识。当然,如果对此不感兴趣也可以略过此文。不过,要想真正明白大模型底层的参数处理,对矩阵有一些了解还是必须的。

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询