AI & Analytics

LDA in de praktijk: dimensiereductie bij vastgoeddata

Towards Data Science (Medium)
LDA in de praktijk: dimensiereductie bij vastgoeddata

Samenvatting

LDA reduceert vastgoeddata tot discriminanten die klassen zo scherp mogelijk van elkaar scheiden.

LDA voor dimensiereductie

Linear Discriminant Analysis is een supervised learning-techniek voor de voorbereidingsfase van classificatiemodellen. Het artikel laat met een vastgoeddataset zien hoe LDA een dataset met veel kenmerken omzet naar een kleiner aantal lineaire discriminanten.

Die discriminanten bewaren de belangrijkste kenmerken van de oorspronkelijke data, maar coderen ze in een kleinere feature space. LDA richt zich daarbij niet alleen op compactheid: de techniek zoekt een representatie waarin datapunten uit verschillende klassen zo goed mogelijk van elkaar gescheiden blijven.

LDA en klassenscheiding

LDA gebruikt Fisher’s criterium: de verhouding tussen variantie tussen klassen en variantie binnen klassen. Een hoge verhouding betekent dat de klassen onderling verder uit elkaar liggen, terwijl datapunten binnen dezelfde klasse dichter bij elkaar blijven.

Dat maakt LDA anders dan een aanpak die uitsluitend het aantal kenmerken verkleint. De klassenlabels sturen de reductie. Daardoor past de techniek bij classificatieproblemen waarin de scheiding tussen bekende klassen centraal staat. Het artikel noemt beeldclassificatie als toepassing, omdat zulke datasets duizenden kenmerken kunnen bevatten. De vastgoedcase vertaalt dat principe naar een praktijksituatie, zonder dat het excerpt een specifiek classificatieresultaat meldt.

De methode werkt onder aannames. De data moeten lineair scheidbaar zijn, een Gaussische verdeling volgen en voor alle klassen dezelfde covariantiematrix hebben. Die voorwaarden bepalen mede of LDA passend is.

Concrete takeaway voor LDA

Controleer vóór toepassing van LDA eerst de drie aannames en leg vast welke klassen de analyse moet onderscheiden. Gebruik daarna de lineaire discriminanten als kleinere invoer voor het classificatiemodel, maar behandel de reductie niet als een volledig behoud van de oorspronkelijke kenmerken: informatie wordt samengevat, terwijl de kenmerken die klassenscheiding ondersteunen centraal blijven staan.

Lees het volledige artikel
Meer over AI & Analytics →