Samenvatting
Disaggregatie bij duizend GPU's levert niet vanzelf meer throughput op; bij kleine aantallen overheersen afrondingsverliezen.
Disaggregatie en GPU-throughput
NVIDIA bouwde prefill-decode-disaggregatie in Dynamo, SGLang maakte de aanpak standaard voor grootschalige implementaties en vLLM voegde een KV connector API toe. Toch toont de analyse van Doubleword dat een gebalanceerde gescheiden opstelling dezelfde throughput kan halen als colocatie.
Bij kleine aantallen GPU's ontstaan afrondingsverliezen: fractional GPU's bestaan niet, waardoor gespecialiseerde workers niet volledig worden benut. Het directe voordeel zit daar vooral in afzonderlijke SLO-afstelling, niet in hogere throughput.
Waarom disaggregatie belangrijk is
Prefill en decode belasten hardware verschillend. Prefill vraagt veel rekenkracht en bereikt volgens het artikel 80 tot 95 procent GPU-compute-utilisatie. Decode leest vooral sequentieel uit de KV-cache en blijft op een H100 onder 5 procent compute-utilisatie. Op gedeelde GPU's kunnen beide processen elkaar daardoor hinderen.
Bij bursty workloads kan een grote prefill-aanvraag de time-per-output-token met 2 tot 30 keer verhogen. DistServe liet op zijn benchmark zien dat gescheiden pools 7,4 keer meer requests binnen dezelfde latency-eisen konden verwerken. Dat resultaat geldt voor de schaal waarop DistServe testte, niet automatisch voor kleinere of gemengde workloads.
Een studie uit juni 2025 met honderdduizenden ontwerppunten vond disaggregatie vooral effectief bij prefill-zwaar verkeer en grotere modellen. Bij gemengde workloads domineerden wachtrijen en KV-cacheoverdracht tussen nodes juist de end-to-end-latency.
Concrete takeaway voor disaggregatie
Meet eerst waar de vertraging ontstaat. Bij scheduling-interferentie kan chunked prefill een eenvoudiger alternatief zijn: lange prefill-aanvragen worden opgeknipt en tussen decode-batches uitgevoerd op dezelfde GPU-pool. Dat voorkomt extra node-pools, netwerkoverdracht van de KV-cache en afstelling van een P:D-ratio. In het beschreven geval stabiliseerde chunked prefill de TPOT bij een middelgroot classificatiemodel; TNG Technology Consulting mat met standaard-vLLM 50 procent meer totale tokendoorvoer.
Verdiep je kennis
Predictive Analytics — Wat kan het voor jouw bedrijf?
Ontdek wat predictive analytics is, hoe het werkt en hoe je het inzet voor je bedrijf. Van de 4 niveaus van analytics to...
KennisbankAI in Power BI — Copilot, Smart Narratives en meer
Ontdek alle AI-functies in Power BI: van Copilot en Smart Narratives tot anomaliedetectie en Q&A. Compleet overzicht met...
KennisbankChatGPT en BI — Hoe AI je data-analyse verandert
Ontdek hoe ChatGPT en generatieve AI de wereld van business intelligence veranderen. Van SQL en DAX genereren tot data-a...