2  Álgebra matricial

Grande parte dos métodos estatísticos multivariados consiste em olhar para uma nuvem de pontos, girar seus eixos, medir distâncias ou projetá-la em um subespaço de menor dimensão. Em linguagem algébrica, essas operações geométricas nada mais são do que multiplicações por matrizes, autovalores e decomposições. Este capítulo reúne as ferramentas dessa linguagem que usaremos ao longo de todo o livro.

Definição 2.1 (Produto interno e norma) Dados dois vetores \(\boldsymbol{u}, \boldsymbol{v} \in \mathbb{R}^p\), o produto interno (ou produto escalar) entre eles é o escalar definido por:

\[ \boldsymbol{u}^T\boldsymbol{v} = \sum_{j=1}^p u_j v_j \]

A norma euclidiana (ou comprimento) de um vetor \(\boldsymbol{u}\) é a raiz quadrada do produto interno de \(\boldsymbol{u}\) consigo mesmo:

\[ \|\boldsymbol{u}\| = \sqrt{\boldsymbol{u}^T\boldsymbol{u}} = \sqrt{\sum_{j=1}^p u_j^2} \]

Um vetor é dito unitário (ou normalizado) quando \(\|\boldsymbol{u}\| = 1\).

Definição 2.2 (Vetores ortogonais e ortonormais) Dois vetores \(\boldsymbol{u}, \boldsymbol{v} \in \mathbb{R}^p\) são ditos ortogonais se seu produto interno for nulo:

\[ \boldsymbol{u}^T\boldsymbol{v} = 0 \]

Geometricamente, vetores ortogonais formam um ângulo de \(90^\circ\) entre si. Um conjunto de vetores \(\{\boldsymbol{u}_1, \dots, \boldsymbol{u}_k\}\) é dito ortonormal se todos os seus elementos forem mutuamente ortogonais e tiverem norma unitária:

\[ \boldsymbol{u}_i^T\boldsymbol{u}_j = \begin{cases} 1, & \text{se } i = j, \\ 0, & \text{se } i \ne j. \end{cases} \]

Definição 2.3 (Inversa de uma matriz) Uma matriz quadrada \(\boldsymbol{A}\) de dimensão \(p \times p\) é dita invertível (ou não singular) se existir uma matriz \(\boldsymbol{A}^{-1}\) de mesma dimensão tal que:

\[ \boldsymbol{A}\boldsymbol{A}^{-1} = \boldsymbol{A}^{-1}\boldsymbol{A} = \boldsymbol{I} \]

A matriz \(\boldsymbol{A}^{-1}\) é única e denominada matriz inversa de \(\boldsymbol{A}\). Quando essa matriz não existe, \(\boldsymbol{A}\) é dita singular (ou não invertível).

Proposição 2.1 (Propriedades da matriz inversa) Sejam \(\boldsymbol{A}\) e \(\boldsymbol{B}\) matrizes invertíveis de dimensão \(p \times p\) e \(c \in \mathbb{R}\) um escalar não nulo. O inverso matricial satisfaz:

  1. Inversa do produto: \((\boldsymbol{A}\boldsymbol{B})^{-1} = \boldsymbol{B}^{-1}\boldsymbol{A}^{-1}\).
  2. Inversa da transposta: \((\boldsymbol{A}^{T})^{-1} = (\boldsymbol{A}^{-1})^{T}\).
  3. Inversa da inversa: \((\boldsymbol{A}^{-1})^{-1} = \boldsymbol{A}\).
  4. Multiplicação por escalar: \((c\boldsymbol{A})^{-1} = \frac{1}{c}\boldsymbol{A}^{-1}\).

Definição 2.4 (Matriz ortogonal) Uma matriz quadrada \(\boldsymbol{Q}\) de dimensão \(p \times p\) é dita ortogonal se sua transposta coincide com sua inversa:

\[ \boldsymbol{Q}^T\boldsymbol{Q} = \boldsymbol{Q}\boldsymbol{Q}^T = \boldsymbol{I} \]

Proposição 2.2 (Propriedades de matrizes ortogonais) Seja \(\boldsymbol{Q}\) uma matriz ortogonal de dimensão \(p \times p\). Então:

  1. Colunas e linhas ortonormais: as colunas de \(\boldsymbol{Q}\) formam uma base ortonormal de \(\mathbb{R}^p\), e o mesmo vale para suas linhas.
  2. Preservação de comprimentos e distâncias: para quaisquer vetores \(\boldsymbol{u}, \boldsymbol{v} \in \mathbb{R}^p\), \[ (\boldsymbol{Q}\boldsymbol{u})^T(\boldsymbol{Q}\boldsymbol{v}) = \boldsymbol{u}^T\boldsymbol{Q}^T\boldsymbol{Q}\boldsymbol{v} = \boldsymbol{u}^T\boldsymbol{v} \] o que implica \(\|\boldsymbol{Q}\boldsymbol{u}\| = \|\boldsymbol{u}\|\) e \(\|\boldsymbol{Q}\boldsymbol{u} - \boldsymbol{Q}\boldsymbol{v}\| = \|\boldsymbol{u} - \boldsymbol{v}\|\).

Definição 2.5 (Traço de uma matriz) Para uma matriz quadrada \(\boldsymbol{A}\) de dimensão \(p \times p\), o traço de \(\boldsymbol{A}\), denotado por \(\operatorname{tr}\left(\boldsymbol{A}\right)\), é a soma dos elementos de sua diagonal principal:

\[ \operatorname{tr}\left(\boldsymbol{A}\right) = \sum_{i=1}^p a_{ii} \]

Proposição 2.3 (Propriedades do traço) Sejam \(\boldsymbol{A}\) e \(\boldsymbol{B}\) matrizes quadradas de ordem \(p \times p\) e \(c, d \in \mathbb{R}\) escalares. O traço satisfaz as seguintes propriedades:

  1. Linearidade: \(\operatorname{tr}\left(c\boldsymbol{A} + d\boldsymbol{B}\right) = c\operatorname{tr}\left(\boldsymbol{A}\right) + d\operatorname{tr}\left(\boldsymbol{B}\right)\).
  2. Invariância sob transposição: \(\operatorname{tr}\left(\boldsymbol{A}^{T}\right) = \operatorname{tr}\left(\boldsymbol{A}\right)\).
  3. Propriedade cíclica: se \(\boldsymbol{A}\) tem dimensão \(n \times p\) e \(\boldsymbol{B}\) tem dimensão \(p \times n\), então \[ \operatorname{tr}\left(\boldsymbol{A}\boldsymbol{B}\right) = \operatorname{tr}\left(\boldsymbol{B}\boldsymbol{A}\right) \] Em geral, o traço do produto de várias matrizes é invariante sob permutações cíclicas, por exemplo \(\operatorname{tr}\left(\boldsymbol{A}\boldsymbol{B}\boldsymbol{C}\right) = \operatorname{tr}\left(\boldsymbol{C}\boldsymbol{A}\boldsymbol{B}\right) = \operatorname{tr}\left(\boldsymbol{B}\boldsymbol{C}\boldsymbol{A}\right)\), desde que as dimensões permitam as multiplicações.

Definição 2.6 (Norma de Frobenius) Para uma matriz \(\boldsymbol{A} = (a_{ij})\) de dimensão \(n \times p\), a norma de Frobenius de \(\boldsymbol{A}\), denotada por \(\|\boldsymbol{A}\|_F\), é a raiz quadrada da soma dos quadrados de todos os seus elementos:

\[ \|\boldsymbol{A}\|_F = \sqrt{\sum_{i=1}^n \sum_{j=1}^p a_{ij}^2} = \sqrt{\operatorname{tr}\left(\boldsymbol{A}^T\boldsymbol{A}\right)} \]

Definição 2.7 (Determinante de uma matriz) Para uma matriz quadrada \(\boldsymbol{A} = (a_{ij})\) de ordem \(p \times p\), o determinante de \(\boldsymbol{A}\), denotado por \(\det(\boldsymbol{A})\), é o escalar definido indutivamente por:

  • Para \(p = 1\), \(\det(\boldsymbol{A}) = a_{11}\);
  • Para \(p \ge 2\), pela expansão em cofatores ao longo da primeira linha: \[ \det(\boldsymbol{A}) = \sum_{j=1}^p (-1)^{1+j} a_{1j} \det(\boldsymbol{A}_{-1,-j}) \] onde \(\boldsymbol{A}_{-1,-j}\) é a submatriz \((p-1) \times (p-1)\) obtida ao remover a primeira linha e a \(j\)-ésima coluna de \(\boldsymbol{A}\).

Proposição 2.4 (Propriedades do determinante) Sejam \(\boldsymbol{A}\) e \(\boldsymbol{B}\) matrizes quadradas de ordem \(p \times p\) e \(c \in \mathbb{R}\) um escalar. O determinante satisfaz:

  1. Multiplicatividade: \(\det(\boldsymbol{A}\boldsymbol{B}) = \det(\boldsymbol{A})\det(\boldsymbol{B})\).
  2. Inversão: se \(\boldsymbol{A}\) é invertível, \(\det(\boldsymbol{A}^{-1}) = 1/\det(\boldsymbol{A})\).
  3. Invariância sob transposição: \(\det(\boldsymbol{A}^{T}) = \det(\boldsymbol{A})\).
  4. Multiplicação por escalar: \(\det(c\boldsymbol{A}) = c^p \det(\boldsymbol{A})\).

Definição 2.8 (Posto de uma matriz) O posto de uma matriz \(\boldsymbol{A}\) de dimensão \(n \times p\), denotado por \(\operatorname{posto}\left(\boldsymbol{A}\right)\), é o número de colunas (ou linhas) linearmente independentes de \(\boldsymbol{A}\).

Proposição 2.5 (Propriedades do posto) Para uma matriz \(\boldsymbol{A}\) de dimensão \(n \times p\):

  1. \(\operatorname{posto}\left(\boldsymbol{A}\right) \le \min(n, p)\).
  2. Se \(\boldsymbol{A}\) é quadrada de ordem \(p \times p\), dizemos que \(\boldsymbol{A}\) tem posto completo se \(\operatorname{posto}\left(\boldsymbol{A}\right) = p\). Uma matriz quadrada é invertível se e somente se tem posto completo, o que equivale a \(\det(\boldsymbol{A}) \ne 0\).

Definição 2.9 (Forma quadrática) Uma forma quadrática é uma função polinomial que contém apenas termos de grau dois. Dado um vetor \(\boldsymbol{x}\) de dimensão \(p \times 1\) e uma matriz numérica simétrica \(\boldsymbol{A}\) de dimensão \(p \times p\), o produto definido por:

\[ Q(\boldsymbol{x}) = \boldsymbol{x}^T \boldsymbol{A} \boldsymbol{x}= \sum_{i=1}^p \sum_{j=1}^p a_{ij} x_i x_j \]

é uma forma quadrática.

Definição 2.10 (Matriz positiva-definida) Uma matriz simétrica \(\boldsymbol{A}\) é dita positiva-definida se \(\boldsymbol{x}^T\boldsymbol{A}\boldsymbol{x}> 0\) para todo vetor não nulo \(\boldsymbol{x}\). Se \(\boldsymbol{x}^T\boldsymbol{A}\boldsymbol{x}\geq 0\) para todo \(\boldsymbol{x}\), a matriz é dita positiva-semidefinida.

Definição 2.11 (Matriz idempotente) Uma matriz quadrada \(\boldsymbol{A}\) é dita idempotente se

\[ \boldsymbol{A}^2=\boldsymbol{A} \]

Isso significa que aplicar duas vezes a transformação definida por \(\boldsymbol{A}\) produz o mesmo resultado que aplicá-la uma única vez. Quando \(\boldsymbol{A}\) também é simétrica, essa transformação representa uma projeção ortogonal sobre o espaço gerado pelas colunas de \(\boldsymbol{A}\).

Definição 2.12 (Autovalores e autovetores) Seja \(\boldsymbol{A}\) uma matriz quadrada de ordem \(p \times p\). Um escalar \(\lambda\) é dito um autovalor de \(\boldsymbol{A}\) associado ao autovetor não nulo \(\boldsymbol{e} \in \mathbb{R}^p\) se:

\[ \boldsymbol{A}\boldsymbol{e} = \lambda\boldsymbol{e} \]

Essa equação pode ser reescrita como \((\boldsymbol{A} - \lambda\boldsymbol{I})\boldsymbol{e} = \boldsymbol{0}\). Para que exista uma solução não nula \(\boldsymbol{e}\), a matriz \(\boldsymbol{A} - \lambda\boldsymbol{I}\) deve ser singular.

Teorema 2.1 (Decomposição espectral) Toda matriz simétrica \(\boldsymbol{A}\) de dimensão \(p \times p\) com autovalores reais \(\lambda_1, \dots, \lambda_p\) e autovetores ortonormais correspondentes \(\boldsymbol{e}_1, \dots, \boldsymbol{e}_p\), pode ser decomposta como:

\[ \boldsymbol{A} = \boldsymbol{E}\boldsymbol{\Lambda}\boldsymbol{E}^T = \sum_{i=1}^p \lambda_i \boldsymbol{e}_i \boldsymbol{e}_i^T \]

onde \(\boldsymbol{\Lambda} = \operatorname{diag}\left(\lambda_1, \dots, \lambda_p\right)\) é a matriz diagonal dos autovalores e \(\boldsymbol{E} = (\boldsymbol{e}_1, \dots, \boldsymbol{e}_p)\) é a matriz ortogonal (\(\boldsymbol{E}^T\boldsymbol{E} = \boldsymbol{E}\boldsymbol{E}^T = \boldsymbol{I}\)) cujas colunas são os autovetores ortonormais.

Proposição 2.6 (Propriedades dos autovalores) Para uma matriz simétrica \(\boldsymbol{A}\) de ordem \(p \times p\) com autovalores \(\lambda_1, \dots, \lambda_p\) e decomposição espectral \(\boldsymbol{A} = \boldsymbol{E}\boldsymbol{\Lambda}\boldsymbol{E}^T\):

  1. Soma dos autovalores (Traço): Pela propriedade cíclica do traço e pela ortogonalidade de \(\boldsymbol{E}\), \[ \sum_{i=1}^p \lambda_i = \operatorname{tr}\left(\boldsymbol{\Lambda}\right) = \operatorname{tr}\left(\boldsymbol{\Lambda}\boldsymbol{E}^T\boldsymbol{E}\right) = \operatorname{tr}\left(\boldsymbol{E}\boldsymbol{\Lambda}\boldsymbol{E}^T\right) = \operatorname{tr}\left(\boldsymbol{A}\right) \]
  2. Produto dos autovalores (Determinante): Pela propriedade multiplicativa do determinante, \[ \prod_{i=1}^p \lambda_i = \det(\boldsymbol{\Lambda}) = \det(\boldsymbol{E})\det(\boldsymbol{\Lambda})\det(\boldsymbol{E}^T) = \det(\boldsymbol{E}\boldsymbol{\Lambda}\boldsymbol{E}^T) = \det(\boldsymbol{A}) \]
  3. Caracterização de matrizes positiva-definidas: \(\boldsymbol{A}\) é positiva-definida (positiva-semidefinida) se e somente se todos os seus autovalores satisfazem \(\lambda_i > 0\) (\(\lambda_i \geq 0\)) para todo \(i = 1, \dots, p\).
  4. Matrizes idempotentes: Se \(\boldsymbol{A}\) é simétrica e idempotente (\(\boldsymbol{A}^2 = \boldsymbol{A}\)), seus autovalores são exclusivamente \(0\) ou \(1\), o que implica \(\operatorname{posto}\left(\boldsymbol{A}\right) = \operatorname{tr}\left(\boldsymbol{A}\right) = \sum_{i=1}^p \lambda_i\).

Exemplo 2.1 Vamos decompor a seguinte matriz simétrica \(\boldsymbol{A}\):

\[ \boldsymbol{A} = \begin{pmatrix} 2 & 1 \\ 1 & 2 \end{pmatrix} \]

  1. Autovalores: Resolvendo a equação característica \(\det(\boldsymbol{A} - \lambda\boldsymbol{I}) = 0\), isto é, \((2-\lambda)^2 - 1 = 0\), encontramos \(\lambda_1 = 3\) e \(\lambda_2 = 1\).

  2. Autovetores:

    • Para \(\lambda_1 = 3\): Resolvendo \((\boldsymbol{A} - 3\boldsymbol{I})\boldsymbol{e}_1 = \boldsymbol{0}\), obtemos \(\boldsymbol{e}_1 = \begin{pmatrix} 1/\sqrt{2} \\ 1/\sqrt{2} \end{pmatrix}\).
    • Para \(\lambda_2 = 1\): Resolvendo \((\boldsymbol{A} - 1\boldsymbol{I})\boldsymbol{e}_2 = \boldsymbol{0}\), obtemos \(\boldsymbol{e}_2 = \begin{pmatrix} 1/\sqrt{2} \\ -1/\sqrt{2} \end{pmatrix}\).

A decomposição espectral é \(\boldsymbol{A} = \boldsymbol{E}\boldsymbol{\Lambda}\boldsymbol{E}^T\), com: \[ \boldsymbol{E} = \begin{pmatrix} 1/\sqrt{2} & 1/\sqrt{2} \\ 1/\sqrt{2} & -1/\sqrt{2} \end{pmatrix}, \quad \boldsymbol{\Lambda} = \begin{pmatrix} 3 & 0 \\ 0 & 1 \end{pmatrix} \]

Assim, \(\boldsymbol{A}\) multiplica por 3 a direção de \(\boldsymbol{e}_1\) e por 1 a direção de \(\boldsymbol{e}_2\). Note que:

  • \(\operatorname{tr}\left(\boldsymbol{A}\right) = 2 + 2 = 4\) e \(\lambda_1 + \lambda_2 = 3 + 1 = 4\);
  • \(\det(\boldsymbol{A}) = 2\cdot 2 - 1\cdot 1 = 3\) e \(\lambda_1 \lambda_2 = 3 \cdot 1 = 3\).

Definição 2.13 (Matriz raiz quadrada) Seja \(\boldsymbol{A}\) uma matriz simétrica e positiva-semidefinida de ordem \(p \times p\), com decomposição espectral \(\boldsymbol{A} = \boldsymbol{E}\boldsymbol{\Lambda}\boldsymbol{E}^T\), onde \(\boldsymbol{\Lambda} = \operatorname{diag}\left(\lambda_1, \dots, \lambda_p\right)\) com \(\lambda_i \geq 0\). A matriz raiz quadrada de \(\boldsymbol{A}\) é definida por:

\[ \boldsymbol{A}^{1/2} = \boldsymbol{E}\boldsymbol{\Lambda}^{1/2}\boldsymbol{E}^T \]

onde \(\boldsymbol{\Lambda}^{1/2} = \operatorname{diag}\left(\sqrt{\lambda_1}, \dots, \sqrt{\lambda_p}\right)\), satisfazendo \(\boldsymbol{A}^{1/2}\boldsymbol{A}^{1/2} = \boldsymbol{A}\). Se \(\boldsymbol{A}\) for positiva-definida (\(\lambda_i > 0\)), sua inversa da raiz quadrada é:

\[ \boldsymbol{A}^{-1/2} = \boldsymbol{E}\boldsymbol{\Lambda}^{-1/2}\boldsymbol{E}^T \]

onde \(\boldsymbol{\Lambda}^{-1/2} = \operatorname{diag}\left(1/\sqrt{\lambda_1}, \dots, 1/\sqrt{\lambda_p}\right)\), satisfazendo \(\boldsymbol{A}^{-1/2}\boldsymbol{A}\boldsymbol{A}^{-1/2} = \boldsymbol{I}\).

Definição 2.14 (Decomposição em valores singulares) Toda matriz \(\boldsymbol{A}\) de dimensão \(I \times J\) com posto \(r = \operatorname{posto}\left(\boldsymbol{A}\right)\) pode ser escrita como:

\[ \boldsymbol{A} = \boldsymbol{U} \boldsymbol{\Lambda} \boldsymbol{V}^T \]

onde \(\boldsymbol{U}\) é uma matriz ortogonal \(I \times I\) cujas colunas são os vetores singulares à esquerda, \(\boldsymbol{V}\) é uma matriz ortogonal \(J \times J\) cujas colunas são os vetores singulares à direita, e \(\boldsymbol{\Lambda}\) é uma matriz retangular \(I \times J\) que contém os valores singulares \(\lambda_k\) em sua diagonal principal, ordenados de modo que \(\lambda_1 \geq \lambda_2 \geq \dots \geq \lambda_r > 0\), e zeros nas demais posições. Os valores singulares não nulos são as raízes quadradas dos autovalores positivos de \(\boldsymbol{A}^T\boldsymbol{A}\) e \(\boldsymbol{A}\boldsymbol{A}^T\).

Enquanto a decomposição espectral se aplica a matrizes simétricas, a SVD é um resultado mais geral, possibilitando a decomposição de qualquer matriz retangular. Para uma matriz simétrica e positiva-semidefinida \(\boldsymbol{A}\), a SVD coincide com a decomposição espectral: seus valores singulares são os próprios autovalores, e seus vetores singulares à esquerda e à direita são os autovetores (\(\boldsymbol{U} = \boldsymbol{V} = \boldsymbol{E}\)).

Teorema 2.2 (Teorema de Eckart-Young-Mirsky) Seja \(\boldsymbol{A}\) uma matriz de dimensão \(I \times J\) com posto \(r\) e decomposição em valores singulares \(\boldsymbol{A} = \sum_{k=1}^r \lambda_k \boldsymbol{u}_k \boldsymbol{v}_k^T\), em que \(\lambda_1 \geq \lambda_2 \geq \dots \geq \lambda_r > 0\). Para qualquer inteiro \(q < r\), a melhor aproximação de posto \(q\) de \(\boldsymbol{A}\) segundo a norma de Frobenius é a soma truncada da SVD:

\[ \widehat{\boldsymbol{A}}_q = \sum_{k=1}^q \lambda_k \boldsymbol{u}_k \boldsymbol{v}_k^T \]

Isto é, para qualquer matriz \(\boldsymbol{B}\) com \(\operatorname{posto}\left(\boldsymbol{B}\right) \le q\),

\[ \|\boldsymbol{A} - \widehat{\boldsymbol{A}}_q\|_F \le \|\boldsymbol{A} - \boldsymbol{B}\|_F \]

e o erro quadrático mínimo de aproximação é a soma dos quadrados dos valores singulares descartados:

\[ \|\boldsymbol{A} - \widehat{\boldsymbol{A}}_q\|_F^2 = \sum_{k=q+1}^r \lambda_k^2 \]