AI & Analytics

De vier caches in LLM-diensten

Analytics Vidhya
De vier caches in LLM-diensten

Samenvatting

LLM-diensten gebruiken vier caches om herhaald rekenwerk, inferentiekosten en wachttijd bij lange verzoeken te beperken.

Vier caches in LLM-diensten: wat er gebeurt

Het artikel onderscheidt KV caching, prefix caching, prompt caching en semantic caching. Elke techniek grijpt op een ander moment in tijdens het aanbieden van een LLM. Dat is nodig omdat één verzoek duizenden of zelfs miljoenen tokens kan bevatten uit systeeminstructies, gespreksgeschiedenis, opgehaalde documenten, tooldefinities en gebruikersinvoer.

De KV-cache vormt de basis van autoregressieve inferentie. Een Transformer genereert een antwoord token voor token en berekent daarbij Key- en Value-tensors voor de verwerkte tokens. Door die tensors in bijvoorbeeld GPU-geheugen op te slaan, hoeft het model eerdere context niet telkens opnieuw te verwerken.

Prefix caching hergebruikt het begin van een eerder verzoek. Prompt caching laat de LLM-aanbieder de prompt opslaan. Semantic caching gaat nog een stap verder: bij een semantisch gelijkwaardige vraag hoeft de LLM mogelijk helemaal niet opnieuw te antwoorden.

Waarom vier caches in LLM-diensten belangrijk zijn

De vier technieken lossen niet hetzelfde probleem op. KV caching beperkt herberekening tijdens het genereren van één antwoord. Prefix caching richt zich op gedeelde beginstukken van afzonderlijke verzoeken. Prompt caching verplaatst het opslaan van promptinformatie naar de aanbieder, terwijl semantic caching controleert of een bestaand antwoord volstaat.

Dat onderscheid helpt bij het beoordelen van LLM-architecturen. Een lange prompt veroorzaakt niet automatisch hetzelfde soort werk als een lange generatie. Ook bepaalt de plek van een cache welke informatie beschikbaar blijft en wanneer hergebruik mogelijk is. Wie alleen naar de totale responstijd kijkt, mist dus de verschillende fasen: prefill, token-voor-token generatie en het afhandelen van vergelijkbare verzoeken.

Concrete takeaway voor LLM-diensten

Breng per toepassing eerst in kaart welk werk terugkomt: eerder verwerkte context, een gedeeld promptbegin, een volledige prompt of een semantisch vergelijkbare vraag. Koppel daarna pas KV-, prefix-, prompt- of semantic caching aan die fase. Zo voorkom je dat één cachetechniek een probleem oplost waarvoor zij niet bedoeld is.

Lees het volledige artikel
Meer over AI & Analytics →