Articles techniques

La perspective de MathWorks

Utilisation de l'IA dans les processus de fabrication des semi-conducteurs


Auteur:

  • Xiaoxing Wang, MathWorks

10 minutes de lecture

Résumé

  • L'IA peut extraire des patterns exploitables à partir de données de séries temporelles de capteurs à haute fréquence dans la fabrication de semi-conducteurs.
  • L'estimation du profil de gravure peut être formulée comme un problème de régression et les workflows low-code peuvent accélérer le développement et le réglage du modèle.
  • La détection non supervisée d'anomalies utilisant des caractéristiques extraites des signaux de vibration permet de détecter des modes de défaillance rares avec des données étiquetées limitées.
  • L'optimisation des processus implique souvent des problèmes multiobjectifs (optimalité de Pareto), qui révèlent des compromis entre des objectifs concurrents, tandis que les considérations de déploiement portent sur la manière dont les modèles sont utilisés en pratique.

Introduction

La fabrication de semi-conducteurs est l'une des industries fondamentales qui soutiennent l'économie mondiale et ses processus nécessitent un contrôle extrêmement précis et complexe. Avec les progrès constants de la miniaturisation des dispositifs et des structures multicouches, de nombreux procédés et équipements sont impliqués, même pour un seul wafer, et de petites variations de processus peuvent affecter directement le rendement et la qualité. Ces dernières années, pour faire face à cette complexité croissante, les efforts en faveur d’une « fabrication intelligente » utilisant l’intelligence artificielle (IA) basée sur de grands volumes de données obtenues, à partir des processus et équipements de fabrication, se sont accélérés.

Les données d'image constituent une source d'information importante pour la gestion des processus de fabrication des semi-conducteurs. Par exemple, il a été démontré que certains systèmes détectent les anomalies de processus à un stade précoce en classant les images acquises pendant la fabrication en types de défauts prédéfinis.¹ À l'inverse, cet article se concentre principalement sur les signaux unidimensionnels obtenus à partir de capteurs.

Dans la fabrication des semi-conducteurs, une grande variété de données, telles que la température, la pression, le débit et la vitesse de rotation, sont enregistrées sous forme de séries temporelles à des fréquences d'échantillonnage élevées. Ces données présentent souvent des structures complexes caractérisées par une forte dimensionnalité, une non-linéarité et du bruit. En conséquence, il peut être difficile de comprendre le comportement global en utilisant uniquement des méthodes statistiques conventionnelles et l'IA a attiré l'attention en tant que moyen efficace d'extraire automatiquement les patterns latents et les corrélations dans les données (Figure 1).

Définitions de l'intelligence artificielle, du Machine Learning et du Deep Learning dans une illustration présentant les trois concepts.

Figure 1. Relations entre l'IA, le Machine Learning et le Deep Learning.

Présentation des technologies d'IA (Machine Learning et Deep Learning)

L'IA désigne les mécanismes qui apprennent à partir des données pour prendre des décisions et faire des prédictions. L’une de ses technologies de base est le Machine Learning (Figure 2). Le Machine Learning est une méthodologie permettant d'apprendre automatiquement des patterns au sein des données et de construire des modèles capables de prendre des décisions appropriées face à de nouvelles données.² On peut le classer en deux grandes catégories : l’apprentissage supervisé, qui prédit les résultats à partir d’entrées inconnues, et l’apprentissage non supervisé, qui extrait les structures et les patterns inhérents aux données. L'apprentissage supervisé peut être divisé en classification, où la sortie est une catégorie discrète, et en régression, où la sortie est une valeur continue.

Les techniques de Machine Learning : apprentissage non supervisé (clustering) et apprentissage supervisé (classification et régression).

Figure 2. Mécanisme de Machine Learning.

Les performances du modèle s'améliorent souvent lorsque des données d’apprentissage plus représentatives sont disponibles. La figure 3 illustre des algorithmes de Machine Learning représentatifs. Dans de nombreux cas, il existe un compromis entre la performance prédictive et l'interprétabilité du modèle.³ Historiquement, la création de modèles appropriés nécessitait une expertise approfondie en statistiques et dans les domaines connexes ; cependant, des applications faciles à utiliser et low-code ont récemment fait leur apparition.

Graphique illustrant les algorithmes de Machine Learning ; l'interprétabilité est représentée sur l'axe des abscisses et la puissance de prédiction, sur l'axe des ordonnées.

Figure 3. Exemples d'algorithmes de Machine Learning illustrant le compromis entre performance prédictive et interprétabilité.

Application de l'IA aux données de capteurs

Cette section présente trois méthodes d'application de l'IA aux données de capteurs dans la fabrication de semi-conducteurs : l'estimation du profil de gravure, la détection non supervisée des anomalies et l'optimisation des processus.

Estimation des profils de gravure

Les procédés de fabrication des semi-conducteurs peuvent être globalement divisés en « procédés front-end », dans lesquels les circuits sont formés sur des wafers de silicium, et en « procédés back-end », dans lesquels les puces de circuits intégrés fabriquées sont découpées et conditionnées. Entre ces procédés, des étapes de nettoyage sont insérées pour influer sur le rendement du dispositif.⁴ Ces étapes permettent d'éliminer les matières indésirables de la surface du wafer, générées lors du traitement initial par gravure chimique. Ces dernières années, les procédés de nettoyage de wafers individuels, dans lesquels des produits chimiques sont apportés tout en faisant tourner chaque wafer, se sont généralisés.

Dans de tels processus, l'estimation de la distribution radiale du taux de gravure sur un wafer (profil de gravure) est essentielle pour l'optimisation du processus et le contrôle de la qualité (Figure 4). Les vitesses de gravure dépendent fortement des variables de la recette, notamment des propriétés chimiques, de la température, du débit du liquide et de la vitesse de rotation du wafer. Parce que le Machine Learning peut apprendre les relations dans les données et faire des prédictions pour de nouvelles entrées, l'estimation des profils de gravure peut être formulée comme un problème de régression en utilisant le rayon du wafer et les variables de recette comme entrées et les profils de gravure comme sorties (Figure 5).

Schéma d'un processus de nettoyage humide d’un wafer individuel avec flux de buse, rotation de la plaquette et profils de gravure.

Figure 4. Processus de nettoyage de wafers individuels et distribution du taux de gravure.

Diagramme présentant les tableaux de données d’apprentissage et d'inférence utilisés pour construire et appliquer un modèle prédictif.

Figure 5. Cadre de régression pour l'estimation du profil de gravure à partir des variables de la recette.

La figure 6 (en haut et au milieu) présente les résultats de l’apprentissage et de l'estimation des profils de gravure à l'aide de MATLAB® l'application low-code Regression Learner. Quatre profils comportant de multiples variables de recette ont été utilisés comme données d’apprentissage, tandis que différents profils ont été utilisés comme données de test pour vérifier la généralisation du modèle. Les résultats indiquent que le modèle a été correctement entraîné et qu'il n'y a pas de signes évidents de surajustement. Cependant, la précision du modèle dépend fortement du choix des algorithmes et des hyperparamètres. Par exemple, l'optimisation de paramètres tels que la taille minimale des feuilles, la fonction noyau et le nombre de couches peut encore améliorer les performances prédictives. L'optimisation bayésienne est efficace pour le réglage des hyperparamètres car elle permet d'identifier les valeurs optimales plus efficacement que les méthodes de recherche par grille ou de recherche aléatoire classiques. La figure 6 (en bas) montre un outil qui automatise ce processus, permettant d'obtenir des modèles haute performance avec moins d'essais.

Trois captures d'écran MATLAB montrant les graphiques de vitesse de gravure, les résultats d'évaluation du modèle et les panneaux d'optimisation des hyperparamètres.

Figure 6. Apprentissage(en haut) et validation (au milieu) du modèle à l'aide d'une application low-code et optimisation des hyperparamètres pour différents modèles (en bas).

Détection non supervisée d'anomalies à l'aide de données vibratoires

Le fonctionnement stable des équipements de fabrication de semi-conducteurs est essentiel au maintien de la qualité des processus, ce qui rend la surveillance de l'état des équipements indispensable. Par exemple, les équipements comportant des composants rotatifs, tels que les outils de nettoyage ou de gravure, peuvent développer des anomalies mécaniques au niveau des moteurs ou des roulements, ce qui nuit à la productivité et à la qualité. Les techniques de détection d'anomalies utilisant des signaux de séries temporelles, comme les données de vibration, sont efficaces car elles peuvent détecter des changements subtils intégrés aux données qui ne seraient pas détectés par les seuils conventionnels ou le contrôle statistique des processus.⁵

Lorsque les événements anormaux sont rares, il est difficile de recueillir des données de défaillance étiquetées. Dans ces cas, l'apprentissage non supervisé devient particulièrement précieux car les modèles peuvent être entraînés en utilisant uniquement des données de fonctionnement normal.

La figure 7 montre les données de vibration triaxiales acquises sur une machine industrielle avant et après maintenance.⁶ Dans cet exemple, on suppose que les données avant maintenance représentent un état anormal, tandis que les données après maintenance représentent un état normal. Cette configuration implique que seules des données à l'état normal sont utilisées pour l’apprentissage du modèle et que des données mixtes, normales et anormales, sont utilisées pour la validation du modèle. Toutefois, le déploiement de l'IA n'élimine pas le besoin de préparation des données. En général, les applications d'IA nécessitent un nettoyage des données (prétraitement) et une extraction de caractéristiques.

Trois graphiques de séries temporelles empilées montrant les signaux de vibration sur les canaux 1 à 3, comparant les conditions avant et après.

Figure 7. Données de vibration triaxiales avant et après maintenance.

Les caractéristiques sont des représentations numériques de certaines caractéristiques des échantillons de données individuels⁷ et peuvent être obtenues à partir d'analyses dans le domaine temporel, dans le domaine fréquentiel ou temps-fréquence. Sélectionner les caractéristiques appropriées représente un défi, même pour les experts en IA. Par conséquent, l'analyse exploratoire, comme la création d'histogrammes ou le calcul de statistiques de base telles que la moyenne et la variance, constitue souvent un bon point de départ.⁸⁻⁹

Dans la figure 8, 12 caractéristiques sont calculées à partir des données de vibration avant et après maintenance, des tests t à deux échantillons sont appliqués pour évaluer les différences statistiquement significatives entre elles, puis l'importance des caractéristiques est classée. Une fois les caractéristiques hautement importantes identifiées, on peut s'attendre à ce que l’apprentissage d'un modèle utilisant ces caractéristiques améliore la précision. L'autoencodeur, qui exploite la structure des réseaux de neurones, est une méthode d'apprentissage non supervisé représentative.¹⁰ Dans les auto-encodeurs, l'erreur de reconstruction entre les entrées et les sorties est utilisée comme score d'anomalie.

Capture d'écran d'une application d'analyse de données montrant des signaux de séries temporelles, des distributions d'histogrammes, un graphique à barres d'importance des caractéristiques et des tableaux récapitulatifs.

Figure 8. Analyse des caractéristiques à l'aide de l'application Diagnostic Feature Designer.

Douze caractéristiques sont extraites des données, qui sont divisées aléatoirement en ensembles d’apprentissage et de test dans un rapport de 9:1. L'autoencodeur est entraîné en utilisant uniquement des caractéristiques provenant de données normales (Figure 9). Lorsque les caractéristiques de test sont entrées dans le modèle entraîné, l'erreur de reconstruction (score d'anomalie) diffère clairement entre les conditions avant et après maintenance (Figure 10). Autrement dit, bien que le modèle n'ait été entraîné que sur des données normales post-maintenance, il peut détecter des anomalies pré-maintenance en appliquant un seuil approprié.

Fenêtre de progression de l’apprentissage affichant les courbes métriques au fil des itérations d'entraînement, ainsi que l'état, la progression et les détails de l'entraînement.

Figure 9. Courbe d'apprentissage de l'auto-encodeur (évolution de la fonction de perte ; c'est-à-dire l'erreur quadratique moyenne).

Visualisation de la détection d'anomalies avec perte de reconstruction au fil du temps, distribution de la perte avec ligne de seuil et matrice de confusion des classes prédites.

Figure 10. Évaluation des performances du modèle à l'aide de données de test (en haut), de distributions de scores d'anomalie pour les classes normales et anormales (en bas à gauche) et de la matrice de confusion (en bas à droite).

Référence 11 introduit une approche alternative de détection d'anomalies non supervisée utilisant une machine à vecteurs de support à une seule classe. Il convient toutefois d'être prudent car les réglages des hyperparamètres influencent considérablement les performances. La figure 11 illustre comment le paramètre d'échelle du noyau affecte la région d'anomalie (frontière de décision), montrant que des échelles de noyau plus petites augmentent la non-linéarité.¹³

Deux nuages de points comparant les résultats de détection d'anomalies aux échelles de noyau 0,2 et 4,0, avec des points normaux et des régions d'anomalies ombrées.

Figure 11. Modifications de la frontière de décision en fonction des différentes valeurs d'échelle du noyau ; les valeurs plus petites entraînent une non-linéarité plus élevée.

Enfin, au-delà de la détection des anomalies, le pronostic utilise des données d'observation séquentielles pour modéliser l'état de santé actuel et futur des équipements. Une fois qu’un seuil de défaillance spécifique à l’application est défini, la durée de vie utile restante peut être estimée (Figure 12). Dans ce cas, vous pouvez utiliser l'estimation bayésienne pour mettre à jour les paramètres du modèle de manière séquentielle.¹⁴⁻¹⁵ Les lecteurs intéressés sont invités à consulter la Référence 16.

Diagramme illustrant la prévision de la durée de vie utile restante, avec les valeurs de santé observées, un seuil de défaillance et les courbes de prévision futures.

Figure 12. Exemple de prédiction de la durée de vie utile restante d'un équipement à partir de signaux de séries temporelles.

Optimisation des processus

Le Deep Learning peut être exprimé comme un problème d'optimisation dans lequel les paramètres (poids et biais) des fonctions construites à partir de combinaisons superposées de transformations linéaires et de fonctions d'activation non linéaires sont optimisés en minimisant une fonction de perte.¹⁷ Par conséquent, cette section se concentre sur le problème d'optimisation.

Dans les procédés de fabrication des semi-conducteurs, il est souvent nécessaire d'optimiser simultanément plusieurs objectifs, tels que la vitesse de dépôt et l'uniformité de l'épaisseur du film.¹⁸ Dans de tels cas, il est nécessaire d'identifier les variables d'entrée optimales pour plusieurs fonctions objectives ; cependant, une solution optimale pour un objectif n'est généralement pas optimale pour un autre. Cette relation de concurrence implique que l'amélioration d'un objectif détériore souvent un autre ; par conséquent, le but est d'identifier les solutions de compromis, c’est-à-dire les solutions optimales au sens de Pareto, qui forment un front de Pareto.

Une solution optimale au sens de Pareto est définie comme une solution dans laquelle l'amélioration d'une fonction objectif quelconque dégrade nécessairement au moins une autre fonction objectif. La figure 13 (encart) illustre un problème d'optimisation à deux objectifs dans leq el \(f_₁\) et \(f_₂\) doivent être minimisés mais sont dans une relation de compromis. Les algorithmes génétiques sont une méthode bien connue pour identifier les solutions Pareto-optimales.¹⁹ Alternativement, un problème d'optimisation multiobjectif peut être converti en un problème mono-objectif en attribuant des pondérations à chaque objectif :

\(F(x) = \alpha f_1(x) + (1 - \alpha) f_2(x) \)

En modifiant le poids \( \alpha \), le rapport de compromis entre \(f_₁\) et \(f_₂\) est modifié, ce qui donne de multiples solutions de Pareto. La figure montre que les fronts de Pareto obtenus par algorithmes génétiques et optimisation bayésienne concordent bien.

Graphique de comparaison d'optimisation montrant f2 par rapport à f1, avec des points provenant d'un algorithme génétique, d'une optimisation bayésienne et d'une courbe de solution connue.

Figure 13. Solutions Pareto-optimales d'une fonction multiobjectif bidimensionnelle.

Bien que l'exemple présenté ici soit une optimisation multiobjectif bidimensionnelle à une seule variable, la même procédure peut être étendue aux fonctions objectives multidimensionnelles à plusieurs variables.²⁰ :

$$ \begin{aligned} \min_{x_1,x_2}\quad& \{f_1(x_1,x_2),\,f_2(x_1,x_2)\} \\[1em] \text{où}\quad& f_1(x_1,x_2)=x_1^{4}+x_2^{4}+x_1x_2-(x_1x_2)^2-10x_1^{2} \\& f_2(x_1,x_2)=x_1^{4}+x_2^{4}+x_1x_2-(x_1x_2)^2 \\[1em] \text{sous réserve de}\quad& 0\le x_1\le5,\qquad -5\le x_2\le0 \end{aligned} $$

La figure 14 montre comment les problèmes d'optimisation multiobjectifs peuvent être construits à l'aide de méthodes low-code. L'application à interface graphique appelée Live Editor Task permet aux utilisateurs d'essayer différents solveurs par le biais de la souris, tandis que les conditions configurées sont automatiquement converties en code, garantissant ainsi la transparence du modèle.

Capture d'écran d'un outil d'optimisation montrant les paramètres d'objectif et de contrainte, les choix de solveur et la configuration d'un algorithme multiobjectif.

Figure 14. Construction de problèmes d'optimisation à l'aide de méthodes low-code.

Déploiement du système

Enfin, tenez compte de l'intégration du système. Le lieu de déploiement des algorithmes développés (edge devices, serveurs ou plateformes cloud) dépend du volume de données transférées, des besoins de calcul et des contraintes opérationnelles. Si la minimisation du transfert de données est essentielle, le prétraitement nécessaire doit être effectué sur l'équipement cible, seules les données essentielles étant transmises aux edge devices pour la prédiction, afin de pouvoir ensuite transmettre les résultats à un serveur et les partager avec les utilisateurs finaux.

Il est également important de prendre en compte la manière dont les résultats des prédictions seront utilisés dans les opérations, par exemple si les résultats sont affichés sur des desktops ou des tablettes portables, et si les utilisateurs possèdent des connaissances suffisantes dans le domaine. Pour une étude de cas de déploiement détaillée, veuillez consulter la Référence 21.

Conclusion

L'IA est de plus en plus utilisée dans la fabrication des semi-conducteurs pour détecter des variations subtiles des processus et des anomalies d'équipement difficiles à identifier par les méthodes conventionnelles. Les exemples présentés dans cet article démontrent comment les données de séries temporelles de capteurs peuvent être utilisées pour développer des modèles qui contribuent à l'amélioration de la qualité et à des opérations plus fiables.

Le Machine Learning et le Deep Learning appliqués aux données de séries temporelles peuvent être utilisés pour des tâches telles que l'estimation du profil de gravure et la surveillance basée sur les vibrations. Pour obtenir des résultats fiables, concentrez-vous sur la collecte de données représentatives, la réalisation d'un prétraitement et d'une extraction de caractéristiques minutieux, et l'utilisation de l'expertise du domaine pour définir la validation et les seuils. Lorsque la labellisation est difficile, les méthodes non supervisées offrent une alternative pratique. La croissance continue de la disponibilité des données et des capacités d'IA devrait accroître encore l'autonomie dans l'optimisation des processus.

Cette étude a utilisé MATLAB, Statistics and Machine Learning Toolbox™, Predictive Maintenance Toolbox™, Deep Learning Toolbox™, Optimization Toolbox™ et Global Optimization Toolbox™. Les données utilisées peuvent être téléchargées depuis le site web de MathWorks (voir les Références 6 et 20).

Références

  1. Imoto, K., and Nakai, T., « Automated Defect Classification System for Semiconductor Manufacturing Processes Using Deep Learning, » Toshiba Review, Vol. 74, No. 5, 2019.

  2. Sanada, T., and Jimbo, Y., « Single-Wafer Cleaning Technologies in Semiconductor Manufacturing Processes, » NAGARE, Vol. 42, p. 187, 2023.

  3. DeLaus, M. D., « Machine Learning for Automated Anomaly Detection in Semiconductor Manufacturing, » master’s thesis, Massachusetts Institute of Technology (MIT), 2019.

  4. Adachi, Y., « Introduction au prétraitement pour le Machine Learning », Lec Telecom, p. 30, 2019.

  5. Wang, X., Journal of Measurement Technology, Vol. 48, n° 7, pp. 20–26, 2020.

  6. Konishi, S., Introduction à l'analyse multivariée : Du linéaire au non linéaire, Iwanami Shoten, pp. 212-221, 2010.

  7. Gebraeel, N., IEEE Transactions on Automation Science and Engineering, Vol. 3, pp. 382–393, 2006.

  8. Gebraeel, N., et al., IIE Transactions, Vol. 37, pp. 543–557, 2005.

  9. Agence de promotion des technologies de l'information (IPA), Livre blanc sur l'IA, Japon, p. 91, 2020.

  10. Moriya, T., « Application of Machine Learning in Semiconductor Manufacturing, » Applied Physics, Vol. 90, No. 5, 2021.

Publié en 2026


Continuer votre exploration