Titeur : Dr. Haithem Hermessi
Cours : Fondamentaux du Deep learning
A/U :2021-2021
Algebre lin aire et convolutions
1. Rappel
Cette partie est une r capitulation de lalg bre lin aire de base dans le contexte des r seaux de
neurones. Nous commen ons par une simple couche cach e h :
La sortie est une fonction non lin aire f appliqu e un vecteur z. Ici, z est la sortie dune
transformation affine A Rm n au vecteur dentr e x Rn :
h=f(z)
Par souci de simplicit , les biais sont ignor s. L quation lin aire peut tre d velopp e comme
Publicité
suit :
z=Ax
o a(i) est la i-i me ligne de la matrice A.
Pour comprendre la signification de cette transformation, analysons une composante de z telle
que a(1)x. Soit n=2, alors a= (a1,a2) et x=(x1,x2).
a et x peuvent tre vus comme des vecteurs dans laxe des coordonn es 2D. Maintenant, si
langle entre a et est et langle entre x et est , alors avec les formules
trigonom triques a x peut tre tendu comme :
La sortie mesure lalignement de lentr e sur une ligne sp cifique de la matrice A. Cela peut tre
compris en observant langle entre les deux vecteurs, . Lorsque = , les deux vecteurs sont
parfaitement align s et le maximum est atteint. Si = , alors a x atteint son minimum et les
Publicité
deux vecteurs sont orient s dans des directions oppos es. En substance, la transformation
lin aire permet de voir la projection dune entr e vers diff rentes orientations d finies par A.
Cette intuition est galement extensible des dimensions plus lev es.
2. Extension de lalg bre lin aire aux convolutions
Nous tendons maintenant lalg bre lin aire aux convolutions, en utilisant lexemple de
lanalyse des donn es audio (1D). Nous commen ons par repr senter une couche enti rement
connect e comme une forme de multiplication matricielle :
Dans cet exemple, la matrice de poids w est de taille de 4 3, le vecteur dentr e a une taille
de 3 3 1 et le vecteur de sortie a une taille de 4 1.
Cependant, pour les donn es audio, les donn es sont beaucoup plus longues (pas de 3
chantillons). Le nombre d chantillons dans les donn es audio est gal la dur e de laudio
Publicité
(par exemple 3 secondes) multipli e par le taux d chantillonnage (par exemple 22,05 kHz).
Comme indiqu ci-dessous, le vecteur dentr e x sera assez long. En cons quence, la matrice
de poids deviendra grosse.
La formulation ci-dessus sera difficile entra ner. Heureusement, il existe des moyens de la
simplifier.
a. Propri t : stationnarit
Les signaux de donn es naturelles ont la propri t d tre stationnaires (cest- -dire que certains
mod les/motifs se r p tent). Cela nous permet de r utiliser le noyau a(1) que nous avons d fini
pr c demment. Nous utilisons ce noyau en le pla ant chaque fois un pas plus loin (cest- -dire
que la foul e est de 1), ce qui donne le r sultat suivant :
La partie sup rieure droite et la partie inf rieure gauche de la matrice sont toutes deux remplies
Publicité
de 00 gr ce la localit , ce qui entra ne une certaine parsit . La r utilisation dun certain noyau
encore et encore est appel e partage du poids.
b. Propri t : localit
En raison de la localit (cest- -dire que nous ne nous soucions pas des points de donn es qui
sont loign s) des donn es, w1k de la matrice de pond ration ci-dessus, peut tre rempli par 0
lorsque k est relativement important. Par cons quent, la premi re ligne de la matrice devient un
noyau de taille 3. D signons ce noyau de taille 3 comme :
Happy Learning J
Contact: [email protected]