Démarrer avec Text Analytics Toolbox
Text Analytics Toolbox™ propose des algorithmes et des visualisations pour le prétraitement, l'analyse et la modélisation de données texte. Les modèles créés avec cette toolbox peuvent être utilisés dans des domaines tels que l'analyse de sentiments, la maintenance prédictive ou la modélisation thématique.
| Nom de la fonction | Description |
|---|---|
wordcloud |
Créer un graphique de nuage de mots-clés à partir d'un modèle de sacs de mots (bag-of-words) ou d'un modèle LDA |
wordCloudCounts |
Compter les mots pour créer un nuage de mots-clés |
textscatter |
Diagramme de dispersion de texte 2D |
textscatter3 |
Diagramme de dispersion de texte 3D |
heatmap |
Créer un graphique de type carte thermique |
histcounts |
Nombre d'occurrences par classe de l'histogramme |
discretize |
Regrouper les données en compartiments ou en catégories |
Visualisation
Utilisation des nuages de mots-clés et des diagrammes de dispersion de texte pour résumer et valider vos résultats.
| Nom de la fonction | Description |
|---|---|
readWordEmbedding |
Lire le word embedding à partir d'un fichier texte |
trainWordEmbedding |
Entraîner le word embedding |
word2vec/vec2word |
Mapper des mots sur des vecteurs d'embedding |
ldaModel |
Modèle LDA (Latent Dirichlet Allocation) |
lsaModel |
Modèle LSA (Latent Semantic Analysis) |
bagOfWords |
Modèle de sac de mots |
fitlda |
Ajuster un modèle LDA (Latent Dirichlet Allocation) |
fitlsa |
Ajuster un modèle LSA (Latent Semantic Analysis) |
predict |
Prédire les principaux thèmes LDA de documents |
fitdist |
Ajuster l'objet de loi de probabilité aux données |
fitrlinear |
Ajuster un modèle de régression linéaire à des données à dimensionnalité élevée |
fitclinear |
Ajuster un modèle de classification linéaire à des données à dimensionnalité élevée |
fitcecoc |
Ajuster des modèles multiclasses pour des classificateurs |
| Nom de la fonction | Description |
|---|---|
extractFileText |
Lire des données à partir de fichiers PDF, Microsoft Word ou texte |
textscan |
Lire des données formatées à partir d'un fichier texte ou d'une chaîne de caractères |
readtable |
Créer une table à partir d’un fichier |
compose |
Convertir des données en tableau de chaînes de caractères formaté |
xlsread |
Lire un fichier de feuille de calcul Microsoft Excel |
webread |
Lire un contenu à partir d'un service web RESTful |
TabularTextDatastore |
Datastore pour des fichiers texte tabulaires |
FileDatastore |
Datastore avec lecteur de fichier personnalisé |
SpreadsheetDatastore |
Datastore pour les fichiers de feuille de calcul |
| Nom de la fonction | Description |
|---|---|
tokenizedDocument |
Diviser des documents en collections de mots |
normalizeWords |
Supprimer les flexions des mots grâce au stemmer de Porter |
bagOfWords |
Modèle de sac de mots |
stopWords |
Liste de mots vides |
context |
Rechercher les occurrences de mots contextuelles dans un document |
removeWords |
Retirer les mots sélectionnés d'un document ou d'un sac de mots |
removeLongWords |
Retirer les mots longs d'un document ou d'un sac de mots |
removeShortWords |
Retirer les mots courts d'un document ou d'un sac de mots |
removeInfrequentWords |
Retirer les mots à faible fréquence du modèle de sac de mots |
erasePunctuation |
Effacer la ponctuation dans un texte ou un document |
| Nom de la fonction | Description |
|---|---|
str = "Hello, world" |
Déclarer une variable de chaîne de caractères |
str = ["Hello","World"] |
Déclarer un tableau de chaînes de caractères |
str = string(C) |
Convertir un vecteur de caractères « C » en chaîne de caractères |
str2double |
Convertir une chaîne de caractères en nombres à double précision |
strlength |
Renvoyer la longueur d'une chaîne de caractères |
isstring |
Déterminer si la donnée d'entrée est un tableau de chaînes de caractères |
join |
Combiner plusieurs chaînes de caractères |
split |
Diviser les chaînes de caractères d'un tableau de chaînes de caractères |
splitlines |
Diviser une chaîne de caractères au niveau des caractères de fin de ligne |
replace |
Trouver et remplacer des sous-chaînes dans un tableau de chaînes de caractères |
contains |
Déterminer si un motif figure dans la chaîne de caractères |
erase |
Supprimer des sous-chaînes dans des chaînes de caractères |
extractBetween |
Extraire les sous-chaînes comprises entre des délimiteurs |
extractAfter |
Extraire la sous-chaîne figurant après la position spécifiée |
extractBefore |
Extraire la sous-chaîne figurant avant la position spécifiée |
strcmp |
Comparer des chaînes de caractères |
regexp |
Rechercher une expression régulière (sensible à la casse) |