GPT (OpenAI) (FR)
GPT (Generative Pre-trained Transformer) est une famille de grands modèles de langage (LLM) développée par la société OpenAI. Les modèles GPT sont basés sur l'architecture des transformeurs et mettent en œuvre le paradigme du pré-entraînement génératif : dans un premier temps, le modèle est entraîné sur de vastes corpus de textes sans étiquetage explicite, puis il peut être affiné (fine-tuned) pour des tâches spécifiques.
Dénomination
L'acronyme GPT signifie Generative Pre-trained Transformer (Transformeur Génératif Pré-entraîné).
- Génératif (Generative) : signifie que le modèle est capable de créer (générer) du nouveau contenu, comme du texte.
- Pré-entraîné (Pre-trained) : indique que le modèle passe par une phase d'entraînement initiale approfondie sur un grand volume de données (par exemple, des textes provenant d'Internet). Après ce pré-entraînement, le modèle peut souvent être « affiné » (fine-tuned) pour des tâches plus spécifiques.
- Transformeur (Transformer) : c'est le nom d'une architecture de réseau neuronal spécifique, qui constitue l'innovation clé à la base de GPT et de nombreux autres modèles d'IA modernes.
La principale caractéristique de GPT est que l'entraînement se déroule de manière autorégressive : le modèle prédit le token suivant en se basant sur le contexte précédent. Autrement dit, le modèle apprend à maximiser la probabilité du token suivant, connaissant la séquence des tokens précédents. Lors de l'entraînement, l'erreur de prédiction de l'élément suivant est minimisée, ce qui permet de générer des textes possédant une grande cohérence et une bonne cohésion.
Processus de génération de texte dans GPT
Le modèle GPT génère du texte de manière séquentielle, token par token, selon le schéma itératif suivant :
- Il reçoit en entrée une séquence de texte initiale (prompt, seed text).
- Il calcule une distribution de probabilité sur tous les tokens du vocabulaire pour l'élément de texte suivant.
- Il sélectionne le token suivant :
- soit celui avec la plus haute probabilité (sélection gloutonne ou greedy search),
- soit par échantillonnage stochastique (sampling),
- soit en utilisant des stratégies de filtrage spéciales (top-k, top-p).
- Il ajoute le token sélectionné à la séquence actuelle.
- La séquence mise à jour est de nouveau fournie en entrée au modèle pour prédire le token suivant.
Architecture du transformeur : traitement du texte
Le processus de traitement des données à l'intérieur du transformeur pour prédire le token suivant comprend plusieurs étapes principales :
- Tokenisation (Tokenization). Le texte d'entrée est divisé en tokens — de petites unités de texte qui peuvent être des mots, des parties de mots ou des signes de ponctuation. Dans le modèle GPT-3, par exemple, le vocabulaire comprend environ 50 257 tokens.
- Plongements de tokens (Embeddings). Chaque token est converti en un vecteur de longueur fixe à l'aide d'une matrice de plongements (W_E). Ces vecteurs encodent la signification des tokens : les tokens sémantiquement proches sont situés à proximité les uns des autres dans un espace multidimensionnel. Dans le modèle GPT-3, la dimension des plongements est de 12 288.
- Traitement dans les couches du transformeur.
- Blocs d'attention (Attention Blocks) : Chaque token interagit avec les autres tokens de la séquence. Le mécanisme d'attention permet de prendre en compte le contexte et d'interpréter correctement la signification des mots.
- Couches entièrement connectées (Feed-Forward Layers) : Après l'attention, chaque token est traité séparément par un réseau neuronal à deux couches avec une activation non linéaire.
- Transformation inverse et Softmax. Après toutes les couches, le vecteur traité est reconverti dans l'espace des tokens à l'aide d'une matrice (W_U), qui est souvent la transposée de W_E. Le vecteur de logits résultant est normalisé à l'aide de la fonction Softmax pour obtenir une distribution de probabilité sur tous les tokens.
- Sélection du token suivant (Sampling). Le token suivant est choisi sur la base de la distribution de probabilités. Le paramètre de température (temperature) contrôle le caractère aléatoire de la sélection : avec une température de 0, le token le plus probable est choisi ; à des températures plus élevées, la probabilité de choisir des options moins probables augmente, ce qui favorise une plus grande diversité dans le texte.
Modèles GPT
- GPT-1 (2018) : premier modèle de la famille ; environ 117 millions de paramètres ; entraînement en deux étapes (pré-entraînement + affinage sur des tâches de NLP).
- GPT-2 (2019) : 1,5 milliard de paramètres ; entraînement sur le corpus WebText ; capable pour la première fois de générer des textes longs et cohérents ; amélioration de la qualité de la génération en mode zero-shot.
- GPT-3 (2020) : 175 milliards de paramètres ; entraînement à grande échelle sur un ensemble de corpus incluant Common Crawl, Books, Wikipedia ; développement important des capacités few-shot et zero-shot.
- GPT-3.5 (2022) : version intermédiaire entre GPT-3 et GPT-4 ; meilleur suivi des instructions grâce à l'apprentissage par renforcement à partir de rétroaction humaine (RLHF) ; fenêtre de contexte étendue à 4096 tokens.
- GPT-4 (2023) : modèle multimodal avec entrée texte et image ; extension stable du contexte à 8 192 et 32 768 tokens ; amélioration significative de la précision, de la robustesse et du raisonnement logique.
- GPT-4 Turbo (2023) : version optimisée de GPT-4 ; fenêtre de contexte étendue à 128 000 tokens ; latence et coût d'exploitation réduits.
- GPT-4o (2024) : modèle multimodal de nouvelle génération (texte, image, audio) ; très haute vitesse et précision des réponses ; fenêtre de contexte de 128 000 tokens.
- GPT-4.5 (2025) : version de recherche basée sur GPT-4 avec une meilleure compréhension des requêtes utilisateur, une réduction du nombre d'erreurs et une génération optimisée de réponses complexes ; fenêtre de contexte de 128 000 tokens.
- GPT-4.1 (2025) : version améliorée de la famille GPT-4 avec une fenêtre de contexte allant jusqu'à 1 048 576 tokens et un support de la multimodalité.
GPT-1
Le premier modèle, GPT-1, a été présenté par OpenAI en 2018 dans l'article « Improving Language Understanding by Generative Pre-Training ». Le modèle comprenait environ 117 millions de paramètres et était basé sur l'architecture des transformeurs. L'entraînement de GPT-1 se déroulait en deux étapes : une phase de pré-entraînement génératif non supervisé (pre-training), suivie d'une phase d'ajustement fin supervisé (fine-tuning).
Lors de la phase de pré-entraînement, le modèle a été entraîné sur le corpus BookCorpus, qui comprend plus de 7 000 livres non publiés de divers genres. La particularité de ce corpus était la présence de longs extraits de texte continus, ce qui était essentiel pour que le modèle développe la capacité de traiter des dépendances textuelles complexes et étendues.
Lors de la phase d'ajustement fin, le modèle a été adapté pour résoudre des tâches spécialisées de traitement du langage naturel, notamment :
- Réponse aux questions (Question Answering, QA) — formuler une réponse correcte à partir d'un contexte textuel donné ;
- Inférence en langage naturel (Natural Language Inference, NLI) — déterminer la relation logique entre deux textes : implication, contradiction ou neutralité ;
- Évaluation de la similarité sémantique (Semantic Textual Similarity) — mesurer le degré de proximité sémantique entre deux séquences de texte.
Grâce à cette approche, GPT-1 a démontré une supériorité significative par rapport aux modèles précédents sur plusieurs benchmarks standards pour les tâches de compréhension de texte.
Le développement de GPT-1 a mis en évidence plusieurs avancées et découvertes clés dans le domaine du traitement du langage naturel (NLP) :
- Efficacité du pré-entraînement génératif. Il a été confirmé empiriquement que le pré-entraînement sur de grands corpus de texte non étiqueté permet au modèle d'acquérir des représentations linguistiques universelles, adaptées à une application ultérieure dans diverses tâches sans nécessiter de modifications architecturales fondamentales.
- Universalité de l'architecture des transformeurs. L'utilisation d'un décodeur transformeur multicouche a permis au modèle de traiter avec succès les dépendances à long terme dans le texte, ce qui était auparavant difficile pour les modèles basés sur des réseaux de neurones récurrents.
- Réduction de la dépendance à l'égard des données étiquetées. Les travaux ont confirmé qu'un pré-entraînement à grande échelle sur des données non étiquetées peut réduire considérablement la quantité de données étiquetées nécessaires pour atteindre une haute qualité sur les tâches cibles.
- Fondations pour les développements futurs. Les résultats de GPT-1 ont jeté les bases conceptuelles et techniques des versions ultérieures des modèles de la famille GPT (GPT-2, GPT-3 et au-delà).
GPT-2
Le modèle GPT-2 a été présenté par OpenAI en février 2019. Il dépassait considérablement son prédécesseur en taille : la version complète du modèle contenait environ 1,5 milliard de paramètres. Contrairement à GPT-1, qui a été entraîné sur le corpus BookCorpus (~5 Go), GPT-2 a été entraîné sur un corpus spécialement assemblé, WebText, d'environ 40 Go, comprenant des données textuelles de sources Internet de haute qualité. L'augmentation de la taille du modèle et du volume des données d'entraînement a permis à GPT-2 d'améliorer considérablement la qualité de la génération de texte : il a démontré sa capacité à créer des articles, des récits et même des fragments cohérents de prose de fiction.
GPT-2 utilisait une architecture de décodeur transformeur autorégressif, similaire à GPT-1, sans modifications significatives. Le modèle était composé de 48 couches d'auto-attention, avait une dimension d'état caché de 1600 et comprenait environ 1,5 milliard de paramètres. L'entraînement est réalisé sur la tâche de prédiction du token suivant sur la base du contexte précédent en utilisant un mécanisme d'attention masqué.
L'une des principales différences de GPT-2 était que le modèle a démontré pour la première fois une grande efficacité en mode zero-shot learning — la capacité à résoudre de nouvelles tâches sans passer par un affinage explicite sur des exemples pour ces tâches. Le modèle a été entraîné sur un grand corpus de textes généralistes et n'a pas subi d'entraînement spécialisé sur les données de tâches spécifiques. L'évaluation a été effectuée en mode zero-shot, où le modèle accomplissait les tâches uniquement sur la base des connaissances acquises lors du pré-entraînement. Dans plusieurs tâches de modélisation du langage, GPT-2 a atteint une qualité comparable ou supérieure aux résultats des modèles spécialement entraînés sur des ensembles de données spécialisés (par exemple, Wikipédia, textes d'actualités, livres).
GPT-3
Le modèle GPT-3 a été présenté par OpenAI en juin 2020. Il a marqué une nouvelle étape dans le développement des transformeurs génératifs après GPT-2 et s'est distingué par une mise à l'échelle de l'architecture jusqu'à 175 milliards de paramètres, ce qui en faisait à l'époque le plus grand modèle de langage.
L'architecture de GPT-3 est restée fondamentalement la même — un décodeur transformeur autorégressif multicouche sans changements radicaux. Les principales améliorations de performance ont été obtenues en augmentant le nombre de couches, la largeur des couches cachées et l'échelle de l'entraînement. Le modèle a été entraîné sur une combinaison de plusieurs grands corpus de textes, dont Common Crawl, WebText2, Books1, Books2 et Wikipédia, pour un volume total d'environ 570 Go de données.
L'une des principales caractéristiques de GPT-3 était sa capacité de few-shot learning et zero-shot learning : le modèle pouvait accomplir un large éventail de tâches de traitement du langage naturel, y compris la traduction, le résumé, la réponse aux questions, la rédaction d'essais et même la programmation, en se basant uniquement sur quelques exemples dans la requête textuelle ou même sans aucun exemple.
GPT-3.5
Le modèle GPT-3.5 a été présenté par OpenAI fin 2022 dans le cadre de l'évolution de la famille GPT. Il était basé sur l'architecture du décodeur transformeur autorégressif à grande échelle utilisée dans GPT-3, avec des améliorations dans la qualité de la génération de texte, le traitement du contexte et la capacité à suivre des instructions complexes. Le nombre exact de paramètres de GPT-3.5 n'a pas été officiellement divulgué, mais on suppose qu'il est comparable à celui des modèles GPT-3.
L'entraînement de GPT-3.5 comprenait une utilisation étendue des méthodes d'apprentissage par renforcement à partir de la rétroaction humaine (Reinforcement Learning from Human Feedback, RLHF), ce qui a permis d'améliorer la pertinence des réponses fournies. Le modèle a été entraîné sur des corpus de textes étendus, incluant Common Crawl, Books, WebText et d'autres sources de haute qualité. Une particularité de GPT-3.5 a été l'augmentation de la fenêtre de contexte maximale à 4096 tokens dans les versions populaires (par exemple, gpt-3.5-turbo), ce qui a permis de traiter des dialogues plus longs et des instructions complexes.
En pratique, GPT-3.5 a été adapté pour résoudre un large éventail de tâches de traitement du langage naturel, telles que :
- La génération de texte cohérent et logique ;
- La réponse aux questions (QA) et la compréhension du contexte ;
- Le suivi d'instructions en plusieurs étapes ;
- Une meilleure maintenance du contexte à long terme dans les dialogues.
Plusieurs versions clés basées sur GPT-3.5 ont été publiées à des fins diverses :
- text-davinci-002 — le premier modèle accessible au public basé sur GPT-3.5, optimisé pour la génération et le suivi d'instructions.
- text-davinci-003 — une version améliorée avec une capacité de raisonnement et de génération de textes complexes encore plus grande.
- gpt-3.5-turbo — la version la plus performante et la plus économique de GPT-3.5, utilisée dans le service ChatGPT depuis fin 2022.
GPT-4
Le modèle GPT-4 a été présenté par OpenAI le 14 mars 2023 dans l'article "GPT-4 Technical Report". Il a marqué la prochaine étape dans le développement de la famille des modèles de langage, offrant des améliorations significatives dans la compréhension du texte, la génération de réponses créatives et pertinentes, ainsi que le traitement de données multimodales. Le nombre exact de paramètres et les détails architecturaux du modèle n'ont pas été officiellement divulgués, mais il est généralement admis que GPT-4 surpasse considérablement GPT-3.5 en taille et en complexité. L'entraînement de GPT-4 était basé sur des corpus textuels et multimodaux à grande échelle, couvrant des données textuelles, des images et d'autres types d'informations. Le modèle a utilisé des méthodes RLHF (apprentissage par renforcement à partir de la rétroaction humaine). L'une des caractéristiques importantes du modèle a été l'augmentation de la fenêtre de contexte : jusqu'à 8 192 tokens dans la version de base et jusqu'à 32 768 tokens dans la version étendue (GPT-4 Turbo), ce qui a permis de travailler avec de longs textes et des dialogues complexes.
L'entraînement de GPT-4 a été réalisé sur une combinaison de corpus textuels et multimodaux à grande échelle. La partie textuelle comprenait des données de haute qualité soigneusement sélectionnées provenant d'Internet, de livres, d'articles et de dépôts de code. Pour la version multimodale, des ensembles de données d'images spécialisés avec des descriptions textuelles correspondantes ont été utilisés.
L'entraînement s'est déroulé en plusieurs étapes :
- un pré-entraînement non supervisé à grande échelle sur des textes et des images,
- un ajustement fin supervisé (supervised fine-tuning) sur des tâches spécialisées,
- une étape finale d'apprentissage par renforcement à partir de la rétroaction humaine (RLHF) pour améliorer la fiabilité, la sécurité et la qualité de l'interprétation des instructions.
Pour optimiser le processus d'entraînement, des techniques d'apprentissage distribué utilisant des milliers de GPU et des optimiseurs spécialisés ont été appliquées, capables de stabiliser l'entraînement de très grands modèles avec une architecture profonde. une attention particulière a été accordée à la réduction de la fréquence des erreurs, à l'amélioration de la résistance des modèles aux « hallucinations » et à l'augmentation de la stabilité de la génération pour les longues séquences d'entrée.
Plusieurs versions principales basées sur GPT-4 ont été publiées :
- GPT-4 (mars 2023) : version de base avec prise en charge des entrées textuelles et graphiques ; fenêtre de contexte de 8 192 tokens (version étendue — 32 768 tokens).
- GPT-4 Turbo (novembre 2023) : modification optimisée de GPT-4 avec une fenêtre de contexte étendue à 128 000 tokens ; coûts de calcul réduits et génération accélérée ; prise en charge des modes d'appel de fonction (function calling) et de sortie JSON.
- GPT-4o (mai 2024) : version multimodale de nouvelle génération avec la capacité de traiter du texte, des images et de l'audio ; vitesse de réponse et qualité d'interaction améliorées ; fenêtre de contexte de 128 000 tokens.
- GPT-4.5 (février 2025) : version de recherche avec une génération améliorée de textes complexes, une précision accrue dans l'exécution des instructions et un niveau réduit d'hallucinations ; fenêtre de contexte de 128 000 tokens.
- GPT-4.1 (avril 2025) : version stable avec une extension radicale du contexte jusqu'à 1 048 576 tokens ; efficacité améliorée dans les tâches de programmation, de traitement de longs textes et de multimodalité.
GPT-5
Le 7 août 2025, OpenAI a présenté GPT‑5 comme le modèle « le plus intelligent, le plus rapide et le plus utile », avec un mode de raisonnement intégré (« thinking ») et un accent sur des scénarios réels — écriture, programmation, santé et compréhension multimodale. GPT‑5 est devenu le modèle par défaut dans ChatGPT pour tous les utilisateurs connectés.[1]
GPT‑5 est un système unifié composé de deux principaux éléments : une réponse rapide et économique pour les requêtes quotidiennes (gpt‑5‑main) et un raisonnement approfondi pour les tâches complexes (gpt‑5‑thinking). Un routeur sélectionne en temps réel le mode approprié en fonction du type de dialogue, de la complexité, de la nécessité d'outils et des indications explicites de l'utilisateur (par exemple, « think hard about this »). Des variantes « mini/pro » sont également disponibles dans ChatGPT ; la carte système indique la correspondance entre les noms des familles de la série GPT‑4/o et les variantes de GPT‑5.
Trois tailles sont disponibles via l'API : gpt-5, gpt-5‑mini et gpt-5‑nano (toutes supportant le texte et le visuel). Le contexte total maximum est de 400 K tokens (jusqu'à ≈272 K en entrée et jusqu'à 128 K pour le raisonnement et la sortie), une valeur fixe pour toute la famille GPT‑5 dans l'API. La page publique indique la même métrique et les mêmes fiches tarifaires.
Sur les ensembles de données factuelles ouverts et les recherches web, GPT‑5 réduit considérablement les hallucinations : environ 45 % d'erreurs en moins par rapport à GPT‑4o, et ~80 % en moins par rapport à OpenAI o3 en mode « thinking ». Une réduction de la tendance à la « tromperie » dans les tests avec des tâches impossibles a également été observée.
| Génération | Année de sortie | Nombre de paramètres | Taille du corpus de textes | Caractéristiques clés |
|---|---|---|---|---|
| GPT-1 | 2018 | ≈117 millions | ≈5 Go (BooksCorpus) | Pré-entraînement génératif sur de grands corpus, entraînement en deux étapes (pre-training + fine-tuning) |
| GPT-2 | 2019 | 1,5 milliard | ≈40 Go (WebText) | Génération de texte améliorée ; publication partielle du modèle |
| GPT-3 | 2020 | 175 milliards | ≈570 Go (Common Crawl, WebText2, etc.) | Apprentissage in-context à grande échelle ; capacité d'apprentissage few-shot et zero-shot sans affinage |
| GPT-3.5 | 2022 | ~6–175 milliards (différentes versions) | >570 Go + instruction tuning supplémentaire | Stabilité améliorée ; entraînement au suivi d'instructions ; base de ChatGPT |
| GPT-4 | 2023 | Non divulgué (estimations : 500 milliards+) | Non divulgué (supposément plusieurs billions de tokens) | Multimodalité (texte + images) ; précision accrue ; résistance aux hallucinations |
| GPT-4 Turbo | 2023 | Non divulgué | Basé sur l'entraînement de GPT-4 | Augmentation du contexte à 128 000 tokens ; optimisation de la vitesse et du coût de génération |
| GPT-4o | 2024 | Non divulgué | Entraînement sur des données multimodales | Traitement multimodal du texte, des images et de l'audio ; haute vitesse de réponse |
| GPT-4.5 | 2025 | Non divulgué | Corpus textuels et multimodaux étendus | Exécution améliorée des instructions ; réduction de la fréquence des erreurs ; version de recherche |
| GPT-4.1 | 2025 | Non divulgué | Corpus mis à jour ; optimisation de la qualité | Contexte jusqu'à 1 048 576 tokens ; augmentation des performances et de la précision ; multimodalité |
| Modèle | Année de sortie | Nombre de paramètres | Nombre de couches | Taille de l'état caché | Nombre de têtes d'attention | Fenêtre de contexte | Taille du corpus d'entraînement |
|---|---|---|---|---|---|---|---|
| GPT-1 | 2018 | ≈117 millions | 12 | 768 | 12 | 512 tokens | ≈5 Go (BooksCorpus) |
| GPT-2 | 2019 | 1,5 milliard | 48 | 1600 | 25 | 1024 tokens | ≈40 Go (WebText) |
| GPT-3 | 2020 | 175 milliards | 96 | 12 288 | 96 | 2048 tokens | ≈570 Go (Common Crawl + WebText2 + autres) |
| GPT-3.5 | 2022 | ~6–175 milliards (différentes versions) | (estimation ~96) | (estimation : similaire à GPT-3) | (non divulgué) | 4096 tokens | Common Crawl étendu + ensembles de données supplémentaires |
| GPT-4 | 2023 | (non divulgué, estimation : 500+ milliards) | (non divulgué) | (non divulgué) | (non divulgué) | 8 192 tokens | Supposément plusieurs billions de tokens |
| GPT-4 Turbo | 2023 | (non divulgué) | (non divulgué) | (non divulgué) | (non divulgué) | 32 768 tokens | Version optimisée de GPT-4 pour réduire les coûts |
| GPT-4o | 2024 | (non divulgué) | (non divulgué) | (non divulgué) | (non divulgué) | 128 000 tokens | Entraînement sur des données multimodales (texte, audio, image) |
| GPT-4.5 | 2025 | (non divulgué) | (non divulgué) | (non divulgué) | (non divulgué) | 128 000 tokens | Exécution améliorée des instructions ; réduction de la fréquence des erreurs |
| GPT-4.1 | 2025 | (non divulgué) | (non divulgué) | (non divulgué) | (non divulgué) | 1 048 576 tokens | Multimodalité ; apprentissage à grande échelle avec augmentation du contexte |
Liens externes
- « Better Language Models and Their Implications », OpenAI, 14 février 2019
Bibliographie
- Radford, A. et al. (2018). Improving Language Understanding by Generative Pre-Training. PDF.
- Radford, A. et al. (2019). Language Models are Unsupervised Multitask Learners. PDF.
- Brown, T. B. et al. (2020). Language Models are Few-Shot Learners. arXiv:2005.14165.
- Kaplan, J. et al. (2020). Scaling Laws for Neural Language Models. arXiv:2001.08361.
- Chen, M. et al. (2021). Evaluating Large Language Models Trained on Code. arXiv:2107.03374.
- Ouyang, L. et al. (2022). Training Language Models to Follow Instructions with Human Feedback. arXiv:2203.02155.
- Hoffmann, J. et al. (2022). Training Compute-Optimal Large Language Models. arXiv:2203.15556.
- Bai, Y. et al. (2022). Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback. arXiv:2204.05862.
- OpenAI (2023). GPT-4 Technical Report. arXiv:2303.08774.
- Bubeck, S. et al. (2023). Sparks of Artificial General Intelligence: Early Experiments with GPT-4. arXiv:2303.12712.