L’analyse en composantes principales (ACP) résume un ensemble de variables corrélées en un nombre réduit de composantes non corrélées. Dans SPSS, elle est particulièrement utile lorsqu’un modèle de régression comprend plusieurs indicateurs mesurant des dimensions communes, susceptibles d’engendrer de la multicolinéarité.
1. Vérifier la pertinence de l’ACP
Commencez par la matrice de corrélation. Les variables doivent présenter des corrélations significatives sans être presque identiques. La statistique de Kaiser–Meyer–Olkin (KMO) évalue l’adéquation des données : les valeurs supérieures à 0,60 sont généralement acceptables et les valeurs plus élevées indiquent une structure commune plus nette. Un test de sphéricité de Bartlett significatif conforte la pertinence de l’extraction de composantes à partir de la matrice de corrélation.
2. Déterminer le nombre de composantes à retenir
SPSS fournit les valeurs propres et le pourcentage de variance expliqué par chaque composante. Le critère de la valeur propre supérieure à un constitue un point de départ, mais le graphique des éboulis et le sens des composantes doivent aussi guider la décision. Une solution pertinente concilie parcimonie et proportion cumulée suffisante de variance expliquée.
3. Interpréter la matrice des composantes après rotation
Les saturations indiquent la force de l’association entre chaque variable initiale et une composante. Après rotation, repérez les variables dont les saturations absolues sont les plus élevées et attribuez à chaque composante un nom reflétant leur concept commun. Le signe indique le sens de la relation et la valeur absolue son intensité. Les variables fortement associées à plusieurs composantes exigent de la prudence, car elles peuvent représenter plusieurs dimensions sous-jacentes.
4. Utiliser les scores des composantes en régression
Les scores des composantes enregistrés peuvent servir de variables explicatives dans une régression linéaire. Les composantes de l’ACP étant non corrélées, elles réduisent la multicolinéarité liée aux variables initiales redondantes. Dans le tableau des coefficients de SPSS, un coefficient positif signifie qu’une valeur plus élevée de la composante est associée à une valeur prédite plus élevée, les autres composantes étant constantes. Un coefficient négatif indique la relation inverse.
5. Interpréter l’ajustement et les résultats statistiques
Le R carré indique la proportion de variation de la variable expliquée par les composantes retenues. Le R carré ajusté est préférable pour comparer des modèles comportant des nombres différents de variables explicatives. Le test F de l’ANOVA évalue le modèle dans son ensemble. Pour chaque composante, examinez le coefficient, l’intervalle de confiance et la valeur p, en distinguant la significativité statistique de l’importance pratique ou économique.
6. Valider avant de présenter les résultats
Examinez les graphiques des résidus pour vérifier la linéarité et la constance de la variance, étudiez leur normalité lorsque l’inférence en dépend et repérez les observations influentes. Si les scores des composantes traitent la colinéarité entre les composantes incluses, ils ne corrigent ni le biais de variable omise, ni les erreurs de mesure, ni la non-linéarité, ni une mauvaise spécification du modèle.
Principe d’interprétation
Le coefficient d’une composante décrit l’effet d’une combinaison latente de variables, et non l’effet isolé d’une variable initiale. Interprétez la régression à la lumière des saturations après rotation et du concept attribué à chaque composante.