Optimalisatie van kosten voor het gebruik van LLM
Optimalisatie van kosten voor het gebruik van grote taalmodellen (LLM) — dit is een geheel van strategieën en technische methoden gericht op het verminderen van de reken- en financiële middelen die nodig zijn voor het trainen, fijn-afstemmen (fine-tuning) en, in het bijzonder, het uitvoeren (inferentie) van grote taalmodellen. De relevantie van dit vakgebied wordt bepaald door de enorme kosten van zowel de ontwikkeling als de exploitatie van LLM's.
Zo werd de training van het GPT-3-model met 175 miljard parameters naar schatting voor ongeveer $4,6 miljoen uitgevoerd op cloud GPU-infrastructuur[1] en vergde 1,3 miljoen kWh aan elektriciteit[2]. De grootste kosten vallen echter vaak op de inferentiefase. Naar schatting bedroegen de dagelijkse operationele kosten voor het onderhouden van de ChatGPT-service begin 2023 ongeveer $700.000 (circa $0,0036 per verzoek), wat de eenmalige trainingskosten vele malen overtreft[3].
Optimalisatie tijdens de trainings- en modelselectiefase
Effectief kostenbeheer begint met fundamentele beslissingen die vóór de inferentiefase worden genomen.
Schalingswetten: modelgrootte vs. hoeveelheid data
Een van de belangrijkste doorbraken in het begrip van de economie van LLM-training waren de Chinchilla-schalingswetten, gepresenteerd door onderzoekers van DeepMind in 2022. Ze toonden aan dat voor een optimaal gebruik van het rekenbudget een model getraind moet worden op aanzienlijk meer data dan voorheen gebruikelijk was[4].
Historisch gezien werd aangenomen dat de prestaties vooral toenamen door het verhogen van het aantal parameters. Het Chinchilla-onderzoek toonde echter aan dat het model Chinchilla (70 miljard parameters), getraind op 1,4 biljoen tokens, kwalitatief beter presteert dan het veel grotere model GPT-3 (175 miljard parameters), dat op slechts ~300 miljard tokens getraind werd[5]. De aanbevolen verhouding is ongeveer 20 tokens aan trainingsdata per modelparameter. Deze aanpak maakt het mogelijk compactere en efficiëntere modellen te bouwen, waardoor zowel de trainingskosten als de latere inferentiekosten dalen.
Fine-tuning en de efficiëntie ervan
In plaats van de kostbare training van een model vanaf nul wordt het fine-tunen (fine-tuning) van reeds bestaande open modellen (zoals de LLaMA- en Falcon-families) steeds gangbaarder. Om de kosten verder te verlagen worden methoden voor parametrisch efficiënt fijn-afstemmen (Parameter-Efficient Fine-Tuning, PEFT) toegepast.
De populairste methode, LoRA (Low-Rank Adaptation), maakt het mogelijk een model aan te passen door slechts een klein aantal extra parameters bij te werken. Onderzoek toont aan dat LoRA de fine-tuningkosten met tientallen procenten kan verlagen (tot ~68% in sommige scenario's) met een verwaarloosbare invloed op de kwaliteit[6].
Vermindering van modelgrootte (Model Compression)
Een essentieel optimalisatiegebied is het verkleinen van de fysieke omvang van een model met behoud van de prestaties.
Kennisdestillatie (Knowledge Distillation)
Kennisdestillatie is een proces waarbij een groot en krachtig 'leraar'-model wordt gebruikt om een compacter 'student'-model te trainen. De student leert de antwoorden van de leraar na te bootsen op een brede dataset en neemt diens 'kennis' over. Deze methode maakt het mogelijk vergelijkbare kwaliteit te bereiken voor specifieke taken tegen aanzienlijk lagere kosten. Zo werd het model DeepSeek-R1 met succes gedestilleerd van 671 miljard naar 70 miljard en zelfs 1,5 miljard parameters met een acceptabel kwaliteitsverlies voor veel toepassingen[7].
Kwantisering (Quantization)
Kwantisering is het proces van het verlagen van de numerieke precisie die wordt gebruikt voor de representatie van modelgewichten. In plaats van de standaard 32-bits of 16-bits drijvende-kommagetallen worden 8-bits of zelfs 4-bits gehele getallen gebruikt.
- 8-bits kwantisering verkleint de modelgrootte met ongeveer 50% bij een precisieverlies van circa 1%.
- 4-bits kwantisering verkleint de modelgrootte met 75% terwijl concurrerende uitvoerkwaliteit behouden blijft[7].
Met hardwareondersteuning (bijvoorbeeld in moderne GPU's van Nvidia) en softwarebibliotheken (bijvoorbeeld TensorRT) kan kwantisering de inferentie 2–4 keer versnellen[8].
Optimalisatie tijdens de inferentiefase
Wanneer een model getraind en ingezet is, hangt het grootste deel van de kosten samen met het dagelijkse gebruik ervan.
Batching van verzoeken (Batching)
Batching is het samenvoegen van meerdere gebruikersverzoeken in één 'batch' voor gelijktijdige verwerking op de GPU. Dit verhoogt de benutting van de hardware en de algemene doorvoer aanzienlijk. Voor LLM's, waarbij het genereren van antwoorden per token verloopt, is continu batching (continuous/in-flight batching) het meest effectief. Deze methode maakt het mogelijk nieuwe verzoeken dynamisch aan de batch toe te voegen zodra andere verzoeken daarin voltooid zijn, wat stilstand elimineert en de GPU-belasting maximaliseert[9].
Caching van sleutels en waarden (KV Cache)
In transformer-modellen is voor het genereren van elk nieuw token informatie over alle voorgaande tokens vereist. Om exponentiële groei van berekeningen te voorkomen wordt caching van sleutels en waarden (KV Cache) toegepast. Het systeem slaat tussenliggende rekenresultaten van het aandachtsmechanisme op voor de reeds verwerkte context en hergebruikt deze, waardoor het genereren van lange reeksen en meervoudige dialogen aanzienlijk efficiënter wordt[7].
Optimalisatie van het aandachtsmechanisme
Het opslaan van de KV-cache vereist een aanzienlijke hoeveelheid geheugen. Om dit te verminderen zijn geoptimaliseerde varianten van het aandachtsmechanisme ontwikkeld:
- Multi-Query Attention (MQA): Alle aandachtshoofden gebruiken één gemeenschappelijke set sleutels en waarden.
- Grouped-Query Attention (GQA): Een tussenliggend compromis waarbij de aandachtshoofden in groepen zijn verdeeld en elke groep een gemeenschappelijke set sleutels en waarden gebruikt.
Meta heeft GQA met succes toegepast in de LLaMA 2-modellen, waardoor de inferentie-efficiëntie bij het werken met lange contexten aanzienlijk verbeterde zonder noemenswaardig kwaliteitsverlies[10].
Optimalisatie van infrastructuur en systeemarchitectuur
Hybride systemen en Retrieval-Augmented Generation (RAG)
Niet altijd is het grootste en krachtigste model noodzakelijk voor een taak. De hybride of cascade-aanpak houdt in dat een klein en goedkoop model wordt gebruikt voor eenvoudige verzoeken, en pas bij mislukking of voor complexe taken het verzoek wordt doorgestuurd naar een groot en duur model.
Een bijzonder en zeer effectief geval van deze aanpak is Retrieval-Augmented Generation (RAG). In deze architectuur kan de LLM relatief compact zijn, omdat voor het beantwoorden van vragen actuele informatie uit een externe kennisbasis wordt gebruikt (bijvoorbeeld uit bedrijfsdocumentatie of een zoekmachine). Dit verlaagt niet alleen de vereisten aan de modelgrootte, maar lost ook het probleem van hallucinaties op. Het inzetten van een gespecialiseerd 70-miljard-parametermodel met RAG op lokale infrastructuur kan 2–4 keer goedkoper zijn dan het gebruik van de GPT-4 API in de cloud[11].
Noten
- ↑ «OpenAI's GPT-3 Language Model: A Technical Overview». Lambda Labs. [1]
- ↑ «The Energy Footprint of Humans and Large Language Models». Communications of the ACM. [2]
- ↑ «The Inference Cost Of Search Disruption - Large Language Model Cost Analysis». SemiAnalysis. [3]
- ↑ Hoffmann, J., et al. (2022). «Training Compute-Optimal Large Language Models». arXiv:2203.15556.
- ↑ Chow, T. (2024). «Three Kuhnian Revolutions in ML Training». Substack. [4]
- ↑ «A Study to Evaluate the Impact of LoRA Fine-tuning on the Performance of Non-functional Requirements Classification». arXiv:2503.07927. (2025).
- ↑ 7.0 7.1 7.2 «LLM Inference Optimization: How to Speed Up, Cut Costs, and Scale AI Models». deepsense.ai. [5]
- ↑ Jin, H., et al. (2024). «GPTQ: Accurate Post-Training Quantization for Generative Pre-trained Transformers».
- ↑ «Continuous vs dynamic batching for AI inference». Baseten Blog. [6]
- ↑ «What is grouped query attention?». IBM. [7]
- ↑ «Inferencing on-premises with Dell Technologies». Dell Technologies Analyst Paper. [8]