AI & Analytics

NVIDIA: open source routerbibliotheek Switchyard

KDnuggets
NVIDIA: open source routerbibliotheek Switchyard

Samenvatting

NVIDIA Switchyard routeert AI-verzoeken per beurt naar een passend model en voorkomt zo onnodige oproepen naar dure LLM’s.

NVIDIA Switchyard routeert LLM-verzoeken

NVIDIA NeMo Switchyard is een open-source routeringslaag die als proxy en bibliotheek tussen een AI-agent en meerdere modellen staat. De applicatie hoeft niet zelf te weten welk model een verzoek afhandelt: Switchyard selecteert het doelmodel en stuurt de aanvraag door.

De tutorial gebruikt Switchyard v0.2.0 met OpenRouter. Een voorbeeldconfiguratie verdeelt verzoeken over openai/gpt-4o en openai/gpt-4o-mini. Met strong_probability: 0.3 gaat ongeveer 30 procent naar het sterke model en 70 procent naar het goedkopere model. De server draait via de Switchyard-CLI op poort 4000; installatie via Cargo voor de native Rust-server staat ook beschreven.

Waarom NVIDIA Switchyard telt voor AI-analytics

Veel AI-agents sturen volgens het artikel nog elk type aanvraag naar hetzelfde frontiermodel. Een classificatiestap, eenvoudige toolaanroep of voortgangscontrole krijgt dan dezelfde modelroute als een complexe redeneertaak. Switchyard maakt die keuze afzonderlijk per verzoek of per beurt.

De directe aanroep van één model blijft een eenvoudig alternatief. Daar staat tegenover dat Switchyard een extra routeringslaag toevoegt, met configuratie voor modellen, fallbackgedrag en routeringsregels. De random router in het voorbeeld is vooral geschikt voor A/B-tests en het controleren van de proxy. Daarna verschuift de tutorial naar content-aware routing, waarbij de inhoud van het verzoek de keuze bepaalt.

De architectuur sluit aan op omgevingen waarin meerdere modellen naast elkaar bestaan: een goedkoper model voor eenvoudige taken, een sterker model voor moeilijke opdrachten en eventueel een lokaal model achter dezelfde laag. Het artikel beschrijft geen algemene benchmark, maar laat wel zien waar de kosten- en latencywinst vandaan moet komen: niet elk verzoek gebruikt automatisch het duurste model.

Concrete takeaway voor NVIDIA Switchyard-gebruikers

Begin met Switchyard v0.2.0 en een tweemodellenconfiguratie. Test eerst random routing met een vaste seed, controleer de serverstart en meet daarna per taaktype kosten, latency en antwoordkwaliteit voordat je content-aware routing invoert.

Lees het volledige artikel
Meer over AI & Analytics →