Cheat Sheet

Démarrer avec Text Analytics Toolbox

Le processus d'exploration sémantique de textes visant à extraire des informations latentes à partir de différents types de documents

Text Analytics Toolbox™ propose des algorithmes et des visualisations pour le prétraitement, l'analyse et la modélisation de données texte. Les modèles créés avec cette toolbox peuvent être utilisés dans des domaines tels que l'analyse de sentiments, la maintenance prédictive ou la modélisation thématique.

Nom de la fonction Description
wordcloud Créer un graphique de nuage de mots-clés à partir d'un modèle de sacs de mots (bag-of-words) ou d'un modèle LDA
wordCloudCounts Compter les mots pour créer un nuage de mots-clés
textscatter Diagramme de dispersion de texte 2D
textscatter3 Diagramme de dispersion de texte 3D
heatmap Créer un graphique de type carte thermique
histcounts Nombre d'occurrences par classe de l'histogramme
discretize Regrouper les données en compartiments ou en catégories
nuage de mots-clés

Visualisation

Utilisation des nuages de mots-clés et des diagrammes de dispersion de texte pour résumer et valider vos résultats.

Apprentissage non supervisé

Modélisation et prédiction

Conversion de texte en représentations numériques en utilisant des modèles de sac de mots ou des modèles de word embedding pré-entraînés, puis application des algorithmes de Machine Learning spécialisés pour la prédiction et la modélisation thématique.

Nom de la fonction Description
readWordEmbedding Lire le word embedding à partir d'un fichier texte
trainWordEmbedding Entraîner le word embedding
word2vec/vec2word Mapper des mots sur des vecteurs d'embedding
ldaModel Modèle LDA (Latent Dirichlet Allocation)
lsaModel Modèle LSA (Latent Semantic Analysis)
bagOfWords Modèle de sac de mots
fitlda Ajuster un modèle LDA (Latent Dirichlet Allocation)
fitlsa Ajuster un modèle LSA (Latent Semantic Analysis)
predict Prédire les principaux thèmes LDA de documents
fitdist Ajuster l'objet de loi de probabilité aux données
fitrlinear Ajuster un modèle de régression linéaire à des données à dimensionnalité élevée
fitclinear Ajuster un modèle de classification linéaire à des données à dimensionnalité élevée
fitcecoc Ajuster des modèles multiclasses pour des classificateurs
Nom de la fonction Description
extractFileText Lire des données à partir de fichiers PDF, Microsoft Word ou texte
textscan Lire des données formatées à partir d'un fichier texte ou d'une chaîne de caractères
readtable Créer une table à partir d’un fichier
compose Convertir des données en tableau de chaînes de caractères formaté
xlsread Lire un fichier de feuille de calcul Microsoft Excel
webread Lire un contenu à partir d'un service web RESTful
TabularTextDatastore Datastore pour des fichiers texte tabulaires
FileDatastore Datastore avec lecteur de fichier personnalisé
SpreadsheetDatastore Datastore pour les fichiers de feuille de calcul
Icônes représentant des fichiers PDF, des fichiers texte et des feuilles de calcul

Importation

Extraction du texte à partir de fichiers Microsoft® Word®, de fichiers PDF, de fichiers texte et de feuilles de calcul.

prétraiter du texte

Prétraitement

Suppression des artefacts présentant peu d'intérêt, tels que les mots courants, les signes de ponctuation et les URL, et application d’une normalisation du texte afin de ramener les mots à leur racine.

Nom de la fonction Description
tokenizedDocument Diviser des documents en collections de mots
normalizeWords Supprimer les flexions des mots grâce au stemmer de Porter
bagOfWords Modèle de sac de mots
stopWords Liste de mots vides
context Rechercher les occurrences de mots contextuelles dans un document
removeWords Retirer les mots sélectionnés d'un document ou d'un sac de mots
removeLongWords Retirer les mots longs d'un document ou d'un sac de mots
removeShortWords Retirer les mots courts d'un document ou d'un sac de mots
removeInfrequentWords Retirer les mots à faible fréquence du modèle de sac de mots
erasePunctuation Effacer la ponctuation dans un texte ou un document
Nom de la fonction Description
str = "Hello, world" Déclarer une variable de chaîne de caractères
str = ["Hello","World"] Déclarer un tableau de chaînes de caractères
str = string(C) Convertir un vecteur de caractères « C » en chaîne de caractères
str2double Convertir une chaîne de caractères en nombres à double précision
strlength Renvoyer la longueur d'une chaîne de caractères
isstring Déterminer si la donnée d'entrée est un tableau de chaînes de caractères
join Combiner plusieurs chaînes de caractères
split Diviser les chaînes de caractères d'un tableau de chaînes de caractères
splitlines Diviser une chaîne de caractères au niveau des caractères de fin de ligne
replace Trouver et remplacer des sous-chaînes dans un tableau de chaînes de caractères
contains Déterminer si un motif figure dans la chaîne de caractères
erase Supprimer des sous-chaînes dans des chaînes de caractères
extractBetween Extraire les sous-chaînes comprises entre des délimiteurs
extractAfter Extraire la sous-chaîne figurant après la position spécifiée
extractBefore Extraire la sous-chaîne figurant avant la position spécifiée
strcmp Comparer des chaînes de caractères
regexp Rechercher une expression régulière (sensible à la casse)
"Hello,world"

Chaînes de caractères

Manipulation, comparaison et stockage efficace des données textuelles.