色另类_婷婷激情四月_亚洲精品无码不卡在线播放he_欧美第七页_精品国产综合区久久久久99_青娱乐极品盛宴在线

產品分類

當前位置: 首頁 > 工業控制產品 > 自動化控制 > 人工智能

類型分類:
科普知識
數據分類:
人工智能

人工智能之PCA算法

發布日期:2022-10-09 點擊率:95

前言:人工智能機器學習有關算法內容,人工智能之機器學習主要有三大類:1)分類;2)回歸;3)聚類。今天我們重點探討一下PCA算法。

PCA(主成分分析)是十大經典機器學習算法之一。PCA是Pearson在1901年提出的,后來由Hotelling在1933年加以發展提出的一種多變量的統計方法。

對于維數比較多的數據,首先需要做的事就是在盡量保證數據本質的前提下將數據中的維數降低。降維是一種數據集預處理技術,往往在數據應用在其他算法之前使用,它可以去除掉數據的一些冗余信息和噪聲,使數據變得更加簡單高效,從而實現提升數據處理速度的目的,節省大量的時間和成本。降維也成為了應用非常廣泛的數據預處理方法。目前處理降維的技術有很多種,如SVD奇異值分解,主成分分析(PCA),因子分析(FA),獨立成分分析(ICA)等。今天重點介紹主成分分析(PCA)。

PCA(主成分分析)算法目的是在“信息”損失較小的前提下,將高維的數據轉換到低維,通過析取主成分顯出的最大的個別差異,也可以用來削減回歸分析和聚類分析中變量的數目,從而減小計算量。

PCA(主成分分析)通常用于高維數據集的探索與可視化,還可以用于數據壓縮,數據預處理等。

PCA算法概念:

PCA(PrincipalComponent Analysis)主成分分析,也稱為卡爾胡寧-勒夫變換(Karhunen-Loeve Transform),是一種用于探索高維數據結構的技術。

PCA是一種較為常用的降維技術,PCA的思想是將維特征映射到維上,這維是全新的正交特征。這維特征稱為主元,是重新構造出來的維特征。在PCA中,數據從原來的坐標系轉換到新的坐標系下,新的坐標系的選擇與數據本身是密切相關的。第一個新坐標軸選擇的是原始數據中方差最大的方向,第二個新坐標軸選擇和第一個坐標軸正交且具有最大方差的方向。該過程一直重復,重復次數為原始數據中特征的數目。大部分方差都包含在最前面的幾個新坐標軸中。因此,可以忽略余下的坐標軸,即對數據進行降維處理。

PCA算法本質

PCA算法本質就是找一些投影方向,使得數據在這些投影方向上的方差最大,而且這些投影方向是相互正交的。這其實就是找新的正交基的過程,計算原始數據在這些正交基上投影的方差,方差越大,就說明在對應正交基上包含了更多的信息量。原始數據協方差矩陣的特征值越大,對應的方差越大,在對應的特征向量上投影的信息量就越大。反之,如果特征值較小,則說明數據在這些特征向量上投影的信息量很小,可以將小特征值對應方向的數據刪除,從而達到了降維的目的。

PCA把可能具有相關性的高維變量合成線性無關的低維變量,稱為主成分( principal components)。新的低維數據集會盡可能保留原始數據的變量。

簡而言之,PCA本質上是將方差最大的方向作為主要特征,并且在各個正交方向上將數據“離相關”,也就是讓它們在不同正交方向上沒有相關性

PCA算法中術語

1、樣本“信息量”

樣本的“信息量”指的是樣本在特征方向上投影的方差。方差越大,則樣本在該特征上的差異就越大,因此該特征就越重要。在分類問題里,樣本的方差越大,越容易將不同類別的樣本區分開。

2、方差

希望投影后投影值盡可能分散,而這種分散程度,可以用數學上的方差來表述。在統計描述中,方差用來計算每一個變量(觀察值)與總體均數之間的差異。此處,一個字段的方差可以看做是每個元素與字段均值的差的平方和的均值,即:

3、協方差

對于二維降成一維的問題來說,找到使得方差最大的方向就可以了。但是對于更高維的問題,需要用到協方差來表示其相關性。即:

PCA理論基礎:

PCA理論基礎如下:

1)最大方差理論。

2)最小錯誤理論。

3)坐標軸相關度理論。

PCA算法流程:

1)去平均值,即每一位特征減去各自的平均值;

2)計算協方差矩陣;

3)計算協方差矩陣的特征值與特征向量;

4)對特征值從大到小排序;

5)保留最大的個特征向量;

6)將數據轉換到個特征向量構建的新空間中。

PCA降維準則:
1) 最近重構性:樣本集中所有點,重構后的點距離原來的點的誤差之和最小。
2) 最大可分性:樣本在低維空間的投影盡可能分

PCA算法優點:

1)使得數據集更易使用;

2)降低算法的計算開銷;

3)去除噪聲;

4)使得結果容易理解;

5)完全無參數限制。

PCA算法缺點:

1)    如果用戶對觀測對象有一定的先驗知識,掌握了數據的一些特征,卻無法通過參數化等方法對處理過程進行干預,可能會得不到預期的效果,效率也不高;

2)    特征值分解有一些局限性,比如變換的矩陣必須是方陣

3)    在非高斯分布情況下,PCA方法得出的主元可能并不是最優的。

PCA算法應用:

PCA算法已經被廣泛的應用于高維數據集的探索與可視化,還可以用于數據壓縮,數據預處理等領域。在機器學習當中應用很廣,比如圖像,語音,通信的分析處理。PCA算法最主要的用途在于“降維”,去除掉數據的一些冗余信息和噪聲,使數據變得更加簡單高效,提高其他機器學習任務的計算效率。

結語:

PCA是一種常用的數據分析方法。PCA通過線性變換將原始數據變換為一組各維度線性無關的表示,可用于識別和提取數據的主要特征分量,通過將數據坐標軸旋轉到數據角度上那些最重要的方向(方差最大);然后通過特征值分析,確定出需要保留的主成分個數,舍棄其他非主成分,從而實現數據的降維降維使數據變得更加簡單高效,從而實現提升數據處理速度的目的,節省大量的時間和成本。降維也成為了應用非常廣泛的數據預處理方法。PCA算法已經被廣泛的應用于高維數據集的探索與可視化,還可以用于數據壓縮,數據預處理,圖像,語音,通信的分析處理等領域。

下一篇: PLC、DCS、FCS三大控

上一篇: 索爾維全系列Solef?PV

推薦產品

更多
主站蜘蛛池模板: 欧美一级网站 | 国产亚洲视频在线 | 婷婷色香五月激情综合2020 | 国产精品久久久久久吹潮 | 一级片免费视频 | 国产91精品黄网在线观看 | 久草在线新免久费观看视频 | 色婷婷激情 | 奇米影视7777| 91色在线观看 | 亚洲射吧| 天天干天天碰 | 欧美成人观看视频在线 | 国产欧美日韩精品a在线观看高清 | 亚洲成a人片在线观看中文 在线a人片免费观看国产 | 中文字幕在线观看电影 | 99riav1国产精品视频 | 一区二区三区高清在线观看 | 深夜影院破解版免费vip | 懂色中文一区二区三区在线视频 | 久草视频播放 | 排球少年第四季 | 国产在线毛片 | 亚洲欧美日韩中文字幕在线不卡 | 激情五月婷婷综合 | 91国在线啪| 午夜在线 | 亚洲人成网站看在线播放 | 日韩av不卡在线 | 涩涩色综合亚洲悠悠色 | 国产精品福利视频免费观看 | 日韩欧美在线观看一区 | 欧美两性人xxxx高清免费 | 亚洲精品第一国产综合高清 | 97福利社 | 中文字幕在线观看视频一区 | 九九久久久 | 亚洲一区二区综合 | 无码国产精品成人午夜视频 | 日韩在线免费 | 欧美人妖channelsantini同性 |