Guide de référence

Quel est l'algorithme de Machine Learning le plus adapté à vos besoins ?

Vous disposez de données et d'une application, mais vous vous demandez quel algorithme essayer en premier : quel que soit votre choix, des compromis sont nécessaires. Voici quelques principes de base pour vous aider à démarrer.

Taille de votre jeu de données

Les algorithmes sont très sensibles à la taille de votre jeu de données. Bien qu'il n'existe pas de règles absolues dictant quel algorithme utiliser pour des jeux de données de moins de 50 Mo ou de plus de 1 To, voici les algorithmes à envisager pour démarrer en fonction du volume de données dont vous disposez, en partant du principe que votre échantillon est équilibré.

  • Arbres de décision
  • Modèles linéaires (y compris régression logistique et analyse discriminante linéaire)

  • SVM (non linéaire)
  • Classification naïve bayésienne
  • Méthode des plus proches voisins
  • Réseaux de neurones (peu profonds)

  • Réseaux profonds
  • Méthodes d’ensemble

Vitesse d’apprentissage

La vitesse d’apprentissage correspond au temps nécessaire à la création et à l'entraînement d'un nouveau modèle avec une ressource de calcul donnée. Des facteurs tels que l'architecture et la complexité de l'algorithme (entre autres) jouent sur la rapidité avec laquelle le modèle sera entraîné. Voici les algorithmes à envisager si votre projet est très sensible à la vitesse d'apprentissage et que vous ne disposez pas de hardware d'accélération.

  • Arbres de décision
  • Modèles linéaires (notamment régression logistique et analyse discriminante linéaire)
  • Classification naïve bayésienne

  • Méthodes d’ensemble
  • Méthode des plus proches voisins
  • Réseaux de neurones (peu profonds)

  • SVM (non linéaire)

  • Réseaux profonds

Interprétabilité

Les modèles de Machine Learning peuvent être peu intuitifs et difficiles à comprendre. L'interprétabilité correspond au degré de transparence du processus décisionnel de l'algorithme. Cependant, l’interprétabilité se fait souvent au détriment de la capacité de prédiction et de la précision. Il peut également exister des exigences spécifiques en matière d'interprétabilité en fonction des secteurs d'activité et des applications. Pour vous aider à démarrer, voici quelques évaluations de base indiquant le niveau de difficulté d'interprétation de chaque algorithme.

  • Arbres de décision
  • Modèles linéaires (notamment régression logistique et analyse discriminante linéaire)

  • Méthode des plus proches voisins
  • Réseaux de neurones (peu profonds)
  • Classification naïve bayésienne

  • SVM (non linéaire)
  • Méthodes d’ensemble
  • Réseaux profonds

Réglage

Le réglage est l'étape consistant à optimiser les paramètres ou les hyperparamètres d'un modèle spécifique afin d'obtenir le meilleur résultat possible pour ce modèle. Certains algorithmes ne se prêtent pas au réglage et limitent le nombre de paramètres ou d'hyperparamètres que vous pouvez modifier en vue d'optimiser le modèle pour votre application. Une fois que vous avez choisi un type de modèle spécifique à entraîner, vous pouvez modifier automatiquement les paramètres qui influent fortement sur ses performances afin de l'optimiser. Quel niveau de réglage souhaitez-vous être en mesure d'effectuer ?

  • Modèles linéaires (y compris régression logistique et analyse discriminante linéaire)
  • Méthode des plus proches voisins

  • Arbres de décision
  • SVM (non linéaire)
  • Méthodes d’ensemble
  • Classification naïve bayésienne
  • Réseaux de neurones (peu profonds)

  • Réseaux profonds