Larssen Consulting
Les bases

Apprentissage profond

deep learning

L’apprentissage profond (deep learning) est la branche de l’apprentissage automatique qui utilise des réseaux de neurones à nombreuses couches, capables d’apprendre seuls, à partir de données brutes, les caractéristiques utiles à une tâche.

  • Lecture : 3 minutes
  • Mis à jour le 8 octobre 2026
  • 4 sources

En clair

« Profond » ne veut pas dire « subtil » : le mot décrit simplement le nombre de couches du réseau. Pensez à une chaîne de montage. Devant une photo, les premiers postes repèrent des traits et des contrastes. Les suivants les assemblent en formes : un œil, une roue. Les derniers reconnaissent l’objet entier. Chaque couche construit sur le travail de la précédente.

La nouveauté, c’est que personne n’indique à ces couches quoi chercher. Auparavant, des ingénieurs décrivaient à la main ce qu’il fallait regarder dans une image ou un son, un travail long et propre à chaque problème. Un réseau profond le découvre seul, à condition de recevoir beaucoup d’exemples. C’est ce qui lui a permis de s’attaquer à des données brutes : pixels, ondes sonores, phrases.

Presque tout ce que l’on appelle « IA » dans l’actualité en relève : assistants conversationnels, générateurs d’images, traduction, reconnaissance vocale, conduite assistée. La contrepartie est connue : ces réseaux demandent beaucoup de données et de puissance de calcul, et leur fonctionnement interne reste difficile à expliquer, même pour les équipes qui les construisent.

Un exemple

Un service de radiologie s’équipe d’un outil d’aide à la lecture. Le réseau a été entraîné sur un grand nombre de clichés annotés par des radiologues. Devant une nouvelle image, il signale les zones suspectes et leur attribue un score.

Le médecin garde le diagnostic. L’outil sert de second regard et aide à classer les examens par ordre d’urgence. Ses performances doivent être vérifiées sur les images de l’établissement, car un réseau entraîné sur d’autres appareils peut s’y montrer moins fiable.

Niveau technique

Comment ça marche

Un réseau profond empile des couches qui transforment progressivement la donnée brute en représentations de plus en plus abstraites. Ces représentations ne sont pas conçues par des ingénieurs : elles sont apprises à partir des données, par rétropropagation 1.

Le tournant date de 2012. Le réseau convolutif AlexNet, entraîné sur 1,2 million d’images, remporte le concours ImageNet avec 15,3 % d’erreur (la bonne réponse devant figurer parmi cinq propositions), contre 26,2 % pour le second. Il compte 60 millions de paramètres répartis sur huit couches et a été entraîné en cinq à six jours sur deux processeurs graphiques 2. Trois ingrédients se trouvaient réunis : un grand jeu de données étiquetées, la puissance des GPU et des améliorations d’architecture.

La profondeur a ensuite augmenté rapidement. En 2015, les réseaux résiduels (ResNet) atteignent 152 couches en apprenant, à chaque étage, une correction de leur entrée plutôt qu’une transformation complète, ce qui facilite l’entraînement ; un ensemble de ces réseaux descend à 3,57 % d’erreur sur ImageNet 3. En 2017, l’architecture Transformer abandonne la lecture mot à mot au profit d’un mécanisme d’attention et devient la base des grands modèles de langage 4.

Ce que ça change pour une entreprise

L’apprentissage profond a rendu exploitables des données que les entreprises stockaient sans pouvoir les traiter : courriers, contrats, enregistrements d’appels, photos, plans. La plupart des usages passent aujourd’hui par des modèles déjà entraînés, accessibles en ligne ou installés en interne, que l’on adapte au besoin.

Entraîner soi-même un réseau profond reste coûteux : il faut des données nombreuses et propres, des GPU et des compétences rares. Les modèles sont aussi difficiles à auditer, et leur qualité chute quand les données réelles diffèrent de celles d’entraînement. Pour un problème simple sur des données structurées, une méthode classique est souvent plus économique et plus facile à expliquer.

Idées reçues

  • « Profond signifie que le modèle comprend en profondeur. »

    Le terme désigne uniquement le nombre de couches du réseau, pas une qualité de compréhension.

  • « L’apprentissage profond a remplacé tout le reste. »

    Sur les données en tableau, des méthodes classiques restent très utilisées : elles sont plus légères et plus simples à expliquer.

  • « C’est une invention récente. »

    La rétropropagation, qui sert à entraîner ces réseaux, a été popularisée en 1986. Ce qui a changé vers 2012, ce sont les données et la puissance de calcul disponibles.

Sources

  1. LeCun, Bengio et Hinton, « Deep learning », Nature, 2015
  2. Krizhevsky, Sutskever et Hinton, « ImageNet Classification with Deep Convolutional Neural Networks », NeurIPS, 2012
  3. He et al., « Deep Residual Learning for Image Recognition », 2015
  4. Vaswani et al., « Attention Is All You Need », 2017

Voir aussi