Le clustering ou analyse de clusters est une méthode d'apprentissage non supervisé utilisée dans le Machine Learning et l'analyse de données, qui organise vos données afin que les points de données d'un même groupe (ou cluster) présentent une similarité plus importante entre eux qu’avec n’importe quel point de donnée des autres groupes. Le clustering aide à donner un sens à des jeux de données volumineux et complexes en mettant en évidence des motifs et des tendances ou en faisant des prédictions sur des données non labellisées.
Le clustering est une méthode d’apprentissage non supervisé qui regroupe les données de sorte que les points d’un même groupe soient plus similaires entre eux qu’à ceux des autres groupes, ce qui permet de révéler des motifs et des tendances dans des données non étiquetées.
Le clustering est une technique d’apprentissage non supervisé qui regroupe des données non étiquetées en fonction de leur similarité, tandis que la classification est une méthode d’apprentissage supervisé qui utilise des données étiquetées pour attribuer des catégories.
Les algorithmes de clustering courants incluent le clustering hiérarchique, k-means, les modèles de mélanges gaussiens, DBSCAN, les cartes auto-organisatrices, le clustering spectral, les modèles de Markov cachés et le fuzzy c-means.
Le clustering dur attribue chaque point de données à un seul cluster (comme k-means), tandis que le clustering flou permet à chaque point de données d’appartenir à plusieurs clusters avec des degrés d’appartenance variables (comme les modèles de mélanges gaussiens).
Le clustering est utilisé pour la compression de données, la segmentation d’images et de données LiDAR, la détection d’anomalies, l’imagerie médicale (détection de tumeurs et segmentation des tissus), les systèmes d’information géographique et l’analyse de séquences génétiques en bioinformatique.
MATLAB fournit des fonctions intégrées pour les principaux algorithmes de clustering, ainsi que des outils interactifs comme la tâche Cluster Data dans le Live Editor et l’application Data Cleaner, des capacités de visualisation et des méthodes d’évaluation comme l’analyse de silhouette pour déterminer le nombre optimal de clusters.
Vous pouvez utiliser des critères d’évaluation tels que l’analyse gap ou l’analyse de silhouette pour mesurer la qualité des clusters et visualiser les résultats à l’aide d’outils comme les dendrogrammes.
Oui, le clustering peut être utilisé pour segmenter des images en regroupant des régions de pixels selon leurs similarités de couleur ou de forme. Il est notamment utilisé en imagerie médicale pour la détection de tumeurs et dans les systèmes géographiques pour la classification de l’occupation des sols.
Ressources
Développez vos connaissances grâce à la documentation, aux exemples, aux vidéos et plus encore.