Samenvatting
GPU-kernelgeneratie met Proteus maakt Qwen 3.5 122B-kernels 1,8–5,2× sneller dan de beste vLLM-implementaties.
GPU-kernelgeneratie: wat er gebeurt
Databricks beschrijft Proteus, een systeem dat GPU-kernels specialiseert voor de exacte vorm van bewerkingen tijdens runtime. Individueel gegenereerde kernels voor Qwen 3.5 122B waren 1,8–5,2× sneller dan de beste beschikbare implementaties in vLLM.
Proteus laat agents kernels voorstellen, test ze tegen een gecontroleerde referentie-implementatie en meet alleen gevalideerde varianten. Daarna gebruikt het systeem de beste resultaten voor volgende iteraties. Die controle voorkomt dat een agent alleen het benchmarkcijfer optimaliseert, zonder de bedoelde bewerking correct uit te voeren.
GPU-kernelgeneratie: waarom dit belangrijk is
Productiesystemen voor inferentie gebruiken traditioneel generieke kernels voor uiteenlopende modellen en werklasten. Dat sluit niet altijd aan op de werkelijke GPU-vormen: modelparameters bepalen een deel van een matrixbewerking, terwijl bijvoorbeeld het aantal tokens per verzoek tijdens runtime varieert.
Proteus koppelt vrije verkenning door de agent aan strikte regels voor feedback, validatie en publicatie. Dat onderscheid is relevant, omdat een opvallend snel resultaat ook kan ontstaan door achtergebleven werk uit een vorige run, ongelijke vergelijkingen of verborgen aannames. De bron benadrukt bovendien dat context een afweging vormt: extra tekst helpt een model, maar verhoogt de kosten en vergroot de kans dat een volgende poging afwijkt.
De aanpak sluit aan op de groeiende belangstelling voor agentic GPU-kernelgeneratie. De beschreven vraag is scherp: waarom zouden modellen van 1 miljard tot 1 biljoen parameters dezelfde kernel gebruiken als hun runtime-vormen verschillen?
GPU-kernelgeneratie: concrete takeaway
Behandel gegenereerde kernels niet als productieklaar op basis van één snelheidsmeting. Gebruik een gecontroleerde referentie, controleer of beide varianten exact hetzelfde werk uitvoeren en test op achtergebleven werk en verborgen aannames voordat je de beste kernel accepteert.
Verdiep je kennis
Data lakehouse uitgelegd — Het beste van twee werelden
Wat is een data lakehouse en waarom combineert het het beste van data warehouses en data lakes? Vergelijking, architectu...
KennisbankETL uitgelegd — Extract, Transform, Load in gewone taal
Wat is ETL? Leer hoe Extract, Transform en Load werkt, het verschil met ELT, en welke tools je kunt gebruiken. Helder ui...