Immaginate di disporre di una grande tabella di dati: nelle righe, individui (o osservazioni); nelle colonne, le variabili che li caratterizzano. La tabella è grande e comprende molte righe. Potrebbe anche avere molte colonne, ma per il momento non è questo il nostro problema. E non avete alcuna conoscenza a priori della struttura delle osservazioni.
Gruppi di punti ---------------------
Per semplicità di visualizzazione, consideriamo il caso estremo in cui vi siano soltanto due colonne, corrispondenti a due variabili quantitative (misurabili), chiamate V1 e V2. Un’osservazione rappresenta quindi un punto in ℝ2. Per comprendere meglio questi dati, si possono riassumere le singole variabili (media, deviazione standard) e rappresentarle in una figura, con V1 sull’asse delle ascisse e V2 su quello delle ordinate.
Dall’esempio in alto emerge un’informazione molto interessante — vi si distinguono tre gruppi nettamente separati — mentre in quello in basso tutto sembra formare un unico ammasso. L’esempio centrale è intermedio: si potrebbero definire tre gruppi, ma i confini non sono chiari.