深度學習及應用 課件 第二章 深度學習中的數學基礎_第1頁
深度學習及應用 課件 第二章 深度學習中的數學基礎_第2頁
深度學習及應用 課件 第二章 深度學習中的數學基礎_第3頁
深度學習及應用 課件 第二章 深度學習中的數學基礎_第4頁
深度學習及應用 課件 第二章 深度學習中的數學基礎_第5頁
已閱讀5頁,還剩61頁未讀 繼續免費閱讀

下載本文檔

版權說明:本文檔由用戶提供并上傳,收益歸屬內容提供方,若內容存在侵權,請進行舉報或認領

文檔簡介

第二章:深度學習中的數學基礎深度學習的核心技術是神經網絡,神經網絡由多個神經元和它們之間的連接組成。這些神經元和連接可以通過大量的數據和計算來訓練和優化,以便在新的數據上進行準確的預測和分類。神經網絡運算的數學基礎是線性代數、微積分、概率論和信息論等多個領域的結合。這一章將從線性代數到信息論進行全面的介紹,揭示深度學習中的核心概念、算法原理與數學理論之間的聯系,為后續章節各種深度學習網絡模型提供必備的數學知識儲備。需要說明的是,本章主要復習與深度學習最為相關的一些基本公式,具體的數學理論和推導參考專業參考書。引言第二章

深度學習中的數學基礎2.1深度學習中的線性代數2.2深度學習中的微積分2.3深度學習中的概率論2.4深度學習中的信息論第二章

深度學習中的數學基礎2.1深度學習中的線性代數2.1.1向量與矩陣2.1.2矩陣運算2.1.3仿射變換2.1.4矩陣范數2.1.5線性代數的應用2.1.1向量與矩陣在開展深度學習相關工作時,所面臨的都是客觀世界中的對象,例如圖片、視頻、語音、文本等。這些對象包含各式各樣的數據:圖片對應的是像素值,文本對應的是字符串,語音對應的是聲波,視頻則包含大量的用戶行為數據。如果將深度學習網絡看作一個數學函數,那么網絡將權重參數存儲在矩陣中,輸入和輸出則是向量或矩陣。線性代數通過矩陣運算來處理這些對象,讓網絡模型變得快速而簡單。矩陣是數的陣列,如下所示:橫排稱為行,豎排稱為列。在上例中,矩陣由3行3列構成,稱為3行3列矩陣。特別地,行數和列數相同的矩陣稱為方陣。2.1.1向量與矩陣此外,如下所示的矩陣、分別稱為列向量、行向量,也可以簡單地稱為向量。進一步,將矩陣A推廣到更一般的情形,如下所示:

2.1深度學習中的線性代數2.1.1向量與矩陣2.1.2矩陣運算2.1.3仿射變換2.1.4矩陣范數2.1.5線性代數的應用2.1.2矩陣運算在深度學習中,矩陣運算主要包括矩陣加減、矩陣乘積、Hadamard乘積和矩陣轉置。對于兩個矩陣A、B,矩陣的加減定義為相同位置元素的和、差所產生的矩陣。矩陣A、B的乘積如圖2.1所示,具體過程為:將A的第i行看作行向量,B的第j列看作列向量,將它們的內積作為第i行第j列元素,由此所產生的矩陣就是矩陣A和B的乘積AB。

圖2.1兩個矩陣的乘積2.1.2矩陣運算2.1深度學習中的線性代數2.1.1向量與矩陣2.1.2矩陣運算2.1.3仿射變換2.1.4矩陣范數2.1.5線性代數的應用2.1.3仿射變換仿射變換是指通過一個線性變換和一個平移,將一個向量空間變換為另一個向量空間的過程。對應到深度學習網絡模型中,就是神經網絡通過連接權重對特征進行線性變換,并通過偏置項來進行閾值判斷。令A為n×n的實數矩陣,x是n維向量空間中的點,仿射變換可以表示為其中b平移項,當b=0時,仿射變換退化為線性變換。例2.2:在2維平面中,仿射變換可表示為仿射變換除了實現網絡模型線性層變換外,還經常用于圖像的旋轉、平移、縮放和剪切等,目的是增強圖像和數據擴增,生成更多樣本。2.1深度學習中的線性代數2.1.1向量與矩陣2.1.2矩陣運算2.1.3仿射變換2.1.4矩陣范數2.1.5線性代數的應用2.1.4矩陣范數范數是線性代數中一個基本且重要的概念。范數用于衡量向量或矩陣的“長度”或“大小”,并具有非負性、齊次性和三角不等式等基本性質。非正式地說,向量或矩陣的范數是表示一個向量或矩陣有多大。在深度學習中,范數的作用是多方面的。首先,在深度學習網絡正則化方面,范數通過約束參數的大小來控制網絡復雜度,防止過擬合,具體細節參見本書第12章。其次,在特征表示領域,范數被用來約束特征向量的尺度,通過將特征向量規范到單位范數空間,可以更好地進行相似度計算和度量學習。再次,網絡模型壓縮和加速技術也廣泛運用范數概念,權重矩陣的譜范數不僅用于評估模型復雜度,還是模型剪枝和量化的重要依據,通過控制各層參數的范數,可以在保持性能的同時顯著減小模型規模。2.1.4矩陣范數

2.1.4矩陣范數2.1深度學習中的線性代數2.1.1向量與矩陣2.1.2矩陣運算2.1.3仿射變換2.1.4矩陣范數2.1.5線性代數的應用2.1.5線性代數的應用線性代數作為處理向量、矩陣和線性變換的數學分支,為深度學習提供了處理高維數據和執行復雜算法的核心工具。作為深度學習的數學支柱,其核心思想滲透在深度學習網絡模型的每個計算環節,從基礎架構到優化過程都發揮著不可替代的作用。比如,在深度學習的基礎架構中,所有數據都以向量或矩陣的形式存在和流動。最基本的網絡全連接層本質上就是矩陣乘法運算,通過權重矩陣將輸入向量線性變換到新的空間。CNN中的卷積操作可以轉化為特殊的矩陣乘法,而RNN則通過矩陣的遞歸乘積實現時間步傳播。無論是處理簡單的線性回歸還是復雜的神經網絡架構,這種基于線性代數的表示方法為各類深度學習模型提供了統一的數學框架。2.1.5線性代數的應用在深度學習的模型訓練過程中,同樣深度依賴線性代數。反向傳播算法的核心梯度計算涉及雅可比矩陣的鏈式求導,各種優化器算法通過矩陣運算更新參數。即便是Transformer架構的核心注意力機制,也不過是查詢矩陣、鍵矩陣和值矩陣的系列乘積與歸一化運算,這些計算過程都建立在線性代數基礎之上。另外,在深度學習的實際應用中,線性代數同樣展現出強大的適應能力。在計算機視覺領域,圖像的每個像素可以表示為向量,整幅圖像構成矩陣,而圖像的旋轉、縮放等操作本質上都是線性變換。在NLP領域,詞嵌入技術通過線性變換將詞匯轉化為高維向量,為文本數據建立可計算的數學表示,這些應用都依賴于線性代數提供的高效計算框架。2.1深度學習中的線性代數2.2深度學習中的微積分2.3深度學習中的概率論2.4深度學習中的信息論第二章

深度學習中的數學基礎2.2深度學習中的微積分2.2.1導數基礎2.2.2偏導數基礎2.2.3函數梯度2.2.4鏈式法則2.2.5微積分的應用2.2.1導數基礎

在幾何上,導數可以看作是函數曲線上的切線斜率,圖2.2給出了一個函數導數的可視化示例。

2.2.1導數基礎

對該函數求導,可以得到接下來看下導數的性質,在深度學習中,主要用到導數的線性特性和求最小值。對于線性特性,具體地:

2.2深度學習中的微積分2.2.1導數基礎2.2.2偏導數基礎2.2.3函數梯度2.2.4鏈式法則2.2.5微積分的應用2.2.2偏導數基礎

2.2.2偏導數基礎

2.2深度學習中的微積分2.2.1導數基礎2.2.2偏導數基礎2.2.3函數梯度2.2.4鏈式法則2.2.5微積分的應用2.2.3函數梯度

2.2深度學習中的微積分2.2.1導數基礎2.2.2偏導數基礎2.2.3函數梯度2.2.4鏈式法則2.2.5微積分的應用2.2.4鏈式法則

上述公式稱為單變量函數的復合函數求導公式,也稱為鏈式法則。2.2.4鏈式法則

由于第1個式子為Sigmoid函數,根據前面式可得

2.2.4鏈式法則

2.2深度學習中的微積分2.2.1導數基礎2.2.2偏導數基礎2.2.3函數梯度2.2.4鏈式法則2.2.5微積分的應用2.2.5微積分的應用微積分在深度學習中的應用貫穿于網絡模型設計、訓練和優化的全過程,為深度學習提供了關鍵的理論基礎和實踐方法。在網絡模型訓練的核心機制誤差反向傳播法中,微積分的鏈式法則發揮著決定性作用。神經網絡本質上是一個巨大的復合函數:輸入數據經過第一層變換得到結果,這個結果又作為第二層的輸入,依此類推,直到最終輸出。因此要計算損失函數關于網絡權重參數的導數,就必須使用鏈式法則,也就是說,鏈式法則使得多層神經網絡能夠通過層層遞進的梯度計算,將最終的預測誤差精準地分配回網絡中的每個權重參數。正是這一機制,讓包含數百萬甚至數十億參數的深度神經網絡得以有效訓練。2.2.5微積分的應用網絡模型優化同樣運用到微積分的概念。比如,梯度下降法直接來源于函數的一階導數信息,指引權重參數朝著誤差減小的方向更新。網絡優化器Adam作為一種自適應優化算法,根據歷史梯度信息動態調整學習率,這本質上是對導數信息的累積與運用。在深度學習網絡架構設計中,也會運用微積分思想。比如,殘差網絡解決了深層網絡梯度消失問題,其設計思想源于對梯度流動的微分分析。注意力機制中的Softmax權重分配也依賴于可導運算。總的來說,微積分不僅為深度學習提供了理論基礎,也直接指導了網絡模型改進和網絡架構創新。從基本的梯度下降到最新的網絡結構設計,微積分思想貫穿始終,這些設計細節將在后面各章節中詳細闡述。2.1深度學習中的線性代數2.2深度學習中的微積分2.3深度學習中的概率論2.4深度學習中的信息論第二章

深度學習中的數學基礎2.3深度學習中的概率論2.3.1概率分布2.3.2多元高斯分布2.3.3貝葉斯定理2.3.4期望和方差2.3.5隨機過程2.3.6概率論的應用2.3.1概率分布

2.3.1概率分布2.3.1概率分布

2.3.1概率分布2.3深度學習中的概率論2.3.1概率分布2.3.2多元高斯分布2.3.3貝葉斯定理2.3.4期望和方差2.3.5隨機過程2.3.6概率論的應用2.3.2多元高斯分布

2.3.2多元高斯分布2.3深度學習中的概率論2.3.1概率分布2.3.2多元高斯分布2.3.3貝葉斯定理2.3.4期望和方差2.3.5隨機過程2.3.6概率論的應用2.3.3貝葉斯定理

2.3深度學習中的概率論2.3.1概率分布2.3.2多元高斯分布2.3.3貝葉斯定理2.3.4期望和方差2.3.5隨機過程2.3.6概率論的應用2.3.4期望和方差

2.3.4期望和方差

2.3深度學習中的概率論2.3.1概率分布2.3.2多元高斯分布2.3.3貝葉斯定理2.3.4期望和方差2.3.5隨機過程2.3.6概率論的應用2.3.5隨機過程

2.3.5隨機過程離散時間的馬爾可夫過程也稱為馬爾可夫鏈,如果一個馬爾可夫鏈的條件概率:

2.3深度學習中的概率論2.3.1概率分布2.3.2多元高斯分布2.3.3貝葉斯定理2.3.4期望和方差2.3.5隨機過程2.3.6概率論的應用2.3.6概率論的應用概率論為深度學習提供了處理不確定性和復雜模式的數學框架,其應用滲透在網絡模型構建、訓練和推理的各個環節。在深度學習中,概率論主要體現在以下方面:在深度學習中,通常需要處理多個隨機變量,如圖像中的像素值、文本中的單詞等。處理多個隨機變量的方法包括聯合概率、條件概率、貝葉斯定理等。比如,聯合概率常用于描述輸入特征和目標變量之間的關系,而條件概率常用于網絡模型的預測階段,即根據輸入特征預測目標變量的取值,貝葉斯定理則常用于網絡模型的參數估計和不確定性量化,從而提高網絡模型的泛化能力和魯棒性。在深度學習生成模型領域,概率論發揮著核心作用。比如,VAE通過編碼器學習數據到潛空間的概率分布映射,再通過解碼器實現從潛空間到數據空間的概率生成。訓練過程中使用的變分推斷方法,本質上是在優化一個包含概率分布相似度衡量的下界目標,使模型能夠以概率化的方式理解數據的內在結構。2.3.6概率論的應用再比如,GAN則采用了另一種基于概率分布匹配的獨特范式。它通過生成器和判別器的對抗訓練,實現生成數據分布與真實數據分布的逐步逼近。其中判別器充當了概率分布差異的測量儀,而生成器則不斷調整自身輸出以欺騙判別器。這種動態博弈過程最終使得生成數據在概率分布上與真實數據達到高度一致。另外,DiffusionModel將數據生成過程建模為一個漸進的概率演化過程。前向階段通過逐步添加噪聲將數據轉化為簡單分布,逆向階段則學習逐步去噪的概率轉換。這種基于馬爾可夫鏈的概率框架,使得模型能夠通過多個微小概率步驟的累積,實現復雜數據的高質量生成。概率論不僅提供了網絡模型設計的理論基礎,也使深度學習能夠被量化,這對醫療診斷、自動駕駛等安全關鍵領域尤為重要。從參數初始化到不確定性估計,概率思維貫穿深度學習的全流程,使其成為處理復雜現實問題的有力工具。2.1深度學習中的線性代數2.2深度學習中的微積分2.3深度學習中的概率論2.4深度學習中的信息論第二章

深度學習中的數學基礎2.4深度學習中的信息論2.4.1信息量和熵2.4.2交叉熵2.4.3信息論的應用2.4.1信息量和熵

在自信息的定義中,對數的底可以使用2或自然常數e,當底為2時,自信息的單位為bit;當底為e時,自信息的單位為nat。自信息只處理單個的輸出,如果對整個概率分布中的不確定性總量進行量化,則需要熵的概念,其定義為2.4.1信息量和熵

根據它們的定義,條件熵也可以寫為2.4.1信息量和熵

也可以寫為

2.4深度學習中的信息論2.4.1信息量和熵2.4.2交叉熵2.4.3信息論的應用2.4.2交叉熵

2.4深度學習中的信息論2.4.1信息量和熵2.4.2交叉熵2.4.3信息論的應用2.4.3信息論的應用信息論為深度學習提供了刻畫數據規律和優化模型性能的數學語言,其核心概念同樣滲透在深度學習網絡模型的各個關鍵環節。信息論在深度學習中的應用主要體現在以下幾個方面:損失函數的設計植根于信息論基礎。在深度學習中,常用的損失函數有交叉熵損失函數和均方誤差損失函數等,其中交叉熵損失函數是用于計算預測結果與真實結果之間的差異,它可以用來衡量模型的預測準確性,因此交叉熵損失函數已經成為分類任務的標準選擇。在深度學習中,信息熵最大化是一種常用的方法,它可以用于優化網絡模型的訓練。具體來說,可以通過最大化輸入數據的熵,來增加深度網絡的表示能力。這樣可以使網絡能夠更好地捕捉輸入數據的隨機性和不確定性,從而提高模型的性能。2.4.3信息論的應用在NLP中,文本摘要是一種常用的方法,它用于將長文本轉換為短文本。信息熵可以用于評估文本摘要的質量

溫馨提示

  • 1. 本站所有資源如無特殊說明,都需要本地電腦安裝OFFICE2007和PDF閱讀器。圖紙軟件為CAD,CAXA,PROE,UG,SolidWorks等.壓縮文件請下載最新的WinRAR軟件解壓。
  • 2. 本站的文檔不包含任何第三方提供的附件圖紙等,如果需要附件,請聯系上傳者。文件的所有權益歸上傳用戶所有。
  • 3. 本站RAR壓縮包中若帶圖紙,網頁內容里面會有圖紙預覽,若沒有圖紙預覽就沒有圖紙。
  • 4. 未經權益所有人同意不得將文件中的內容挪作商業或盈利用途。
  • 5. 人人文庫網僅提供信息存儲空間,僅對用戶上傳內容的表現方式做保護處理,對用戶上傳分享的文檔內容本身不做任何修改或編輯,并不能對任何下載內容負責。
  • 6. 下載文件中如有侵權或不適當內容,請與我們聯系,我們立即糾正。
  • 7. 本站不保證下載資源的準確性、安全性和完整性, 同時也不承擔用戶因使用這些下載資源對自己和他人造成任何形式的傷害或損失。

評論

0/150

提交評論