Data Strategie

Databricks: architectuur stap voor stap getekend

Reddit r/dataengineering
Databricks: architectuur stap voor stap getekend

Samenvatting

Databricks scheidt control plane en compute plane, terwijl Delta-tabellen en Unity Catalog data en governance structureren.

Databricks-architectuur: control plane en compute plane

De uitgewerkte architectuur verdeelt Databricks over een control plane en een compute plane. De control plane bevat onder meer de webapplicatie, job scheduler en metadata van notebooks. De compute plane voert het werk uit: klassiek in het eigen cloudaccount of serverless in het Databricks-account.

De data blijft in de eigen opslag staan als Delta-tabellen. Unity Catalog beheert de toegang en structuur daaroverheen. De architectuurtekening gebruikt een notebook als vertrekpunt om de onderdelen en hun onderlinge relaties zichtbaar te maken.

Waarom Databricks-architectuur telt

Deze indeling maakt een onderscheid dat in tekstuele uitleg snel vervaagt: Databricks beheert de aansturing en metadata, terwijl compute afzonderlijk draait. Ook de locatie van de uitvoering verschilt per model. Bij klassieke compute ligt die in het eigen cloudaccount; bij serverless compute gebruikt Databricks zijn eigen account.

Dat onderscheid helpt BI-professionals om technische vragen preciezer te plaatsen. Gaat een vraag over jobs, notebooks en metadata, dan kijk je naar de control plane. Gaat het over de uitvoering van een notebook, dan hoort de compute plane centraal te staan. De data zelf verhuist volgens de bron niet naar een aparte Databricks-opslaglaag, maar blijft in de eigen opslag als Delta-tabellen.

De bron vergelijkt Databricks niet met andere platforms. De waarde van de tekening zit daarom niet in een productvergelijking, maar in een helder mentaal model van de onderdelen die samen een Databricks-omgeving vormen.

Concrete takeaway

Maak voor je volgende architectuurgesprek een schema met vier lagen: control plane, compute plane, Delta-tabellen en Unity Catalog. Noteer bij compute expliciet of de uitvoering klassiek in het eigen cloudaccount of serverless in het Databricks-account plaatsvindt. Gebruik daarna één notebook-run om te controleren welke functie bij welke laag hoort.

Lees het volledige artikel
Meer over Data Strategie →