L'apprentissage non supervisé est un type de technique de Machine Learning qui tire des conclusions à partir de données non labellisées. L'apprentissage non supervisé vise à identifier des patterns et des relations cachés dans les données, sans aucune supervision ou connaissance préalable des résultats.
L’apprentissage non supervisé est une technique de Machine Learning qui permet d’extraire des informations à partir de données non étiquetées en identifiant des motifs et des relations cachés, sans supervision ni connaissance préalable des résultats.
L’apprentissage supervisé entraîne des modèles à partir de données étiquetées comportant des entrées et des sorties connues, tandis que l’apprentissage non supervisé exploite des données non étiquetées afin de découvrir des structures et des motifs cachés sans étiquettes ni résultats prédéfinis.
Les méthodes principales sont le clustering (regroupement de points de données similaires), la réduction de dimensionnalité (simplification des données en réduisant le nombre de caractéristiques) et les règles d’association (identification de relations entre variables dans de grandes bases de données).
Les algorithmes de clustering les plus populaires incluent le k-means, le clustering hiérarchique, les modèles de mélange gaussien (GMM), DBSCAN, les cartes auto-organisatrices, le clustering spectral, les modèles de Markov cachés et le fuzzy c-means.
Les techniques de réduction de dimensionnalité diminuent le nombre de caractéristiques tout en préservant l’information essentielle. Elles réduisent ainsi la charge de calcul, améliorent l’efficacité des algorithmes et facilitent la visualisation ainsi que l’analyse de données de grande dimension.
L’apprentissage non supervisé est utilisé pour l’analyse exploratoire des données, la détection d’anomalies, la segmentation d’images médicales, la génomique et la bioinformatique, les systèmes de recommandation, le Traitement du langage naturel et la reconnaissance de formes.
Oui. MATLAB fournit un ensemble complet d’outils pour l’apprentissage non supervisé, notamment des algorithmes de clustering, des techniques de réduction de dimensionnalité telles que PCA et t-SNE, des autoencodeurs via Deep Learning Toolbox, ainsi que des tâches interactives dans Live Editor pour la préparation et l’analyse des données.
L’analyse en composantes principales (PCA) transforme les données en composantes orthogonales capturant la plus grande part de variance avec un nombre réduit de variables. Elle crée de nouvelles variables, appelées composantes principales, qui sont des combinaisons linéaires des variables d’origine.
L’apprentissage non supervisé est particulièrement utile lorsque l’étiquetage des données est coûteux, chronophage ou difficile à mettre en œuvre. Il permet aux entreprises et aux chercheurs d’extraire des informations pertinentes à partir de données non étiquetées qui seraient autrement difficiles à exploiter.
Ressources
Développez vos connaissances grâce à la documentation, aux exemples, aux vidéos et plus encore.
Documentation
- Introduction à la sélection de caractéristiques
- Sélection de caractéristiques pour la classification de données à dimensionnalité élevée
- Détection d'anomalies en utilisant un autoencodeur et les ondelettes
- Fonction de règles d'association
- Visualisation de données à dimensionnalité élevée avec la t-SNE