AI & Analytics

AI-analist: welke is het beste voor jouw lastige vragen?

ThoughtSpot Blog

Samenvatting

AI-analisten verschillen sterk bij lastige vragen: Spotter beantwoordde 70,6 procent van de uitdagende BIRD-vragen correct.

AI-analisten en de BIRD-benchmark

ThoughtSpot testte Spotter samen met vier andere agentic analytics-engines op BIRD, een publieke benchmark voor natuurlijke vragen over realistische databases. De test bevatte 1.533 vragen, verdeeld over 11 databases, met voor elke engine één poging en dezelfde beoordelingsmethode.

Spotter behaalde over alle moeilijkheidsniveaus een score van 82,8 procent. De warehouse-native assistant volgde met 82,0 procent, daarna de frontier LLM met 78,4 procent, de lakehouse-agent met 74,9 procent en de coding agent met 72,5 procent. Bij de uitdagende vragen liep het verschil verder uiteen: Spotter scoorde 70,6 procent, tegenover 46,8 procent voor de laagst scorende engine.

AI-analisten en nauwkeurigheid in de praktijk

De benchmark laat zien dat een totaalscore alleen weinig zegt over prestaties op lastige vragen. BIRD onderscheidt simple, moderate en challenging op basis van de benodigde SQL-structuur, niet op basis van de lengte van de vraag. De engines werkten bovendien met verschillende uitgangspunten: Spotter gebruikte een beheerd semantic model, terwijl andere systemen een raw schema, catalogus of directe SQL-generatie gebruikten.

Die context telt voor BI-teams. BARC meldt dat actieve BI-adoptie ongeveer een kwart van de medewerkers omvat en in zeven jaar nauwelijks verschoof. In een onderneming met 10.000 medewerkers, vijf vragen per week per gebruiker en 2.500 actieve gebruikers staat één procentpunt nauwkeurigheid volgens de berekening gelijk aan 6.500 correcte of foutieve antwoorden per jaar.

De test wijst ook op het belang van de onderliggende agentopzet. Een nieuwer model leverde 3,4 procentpunt extra op zonder wijziging van het agent harness. De nauwkeurigheidshelling over moeilijkheidsniveaus voorspelt volgens de analyse beter hoe een systeem op eigen data presteert dan één totaalcijfer.

AI-analisten: concrete takeaway

Vraag leveranciers niet alleen naar een percentage. Test dezelfde eenvoudige, gemiddelde en lastige vragen op je eigen databases, controleer de gebruikte schema- en semantic-modelcontext en vraag naar resultaten per vraag. Let vooral op de daling bij moeilijke opdrachten. Die score zegt meer over dagelijks gebruik dan een hoog gemiddelde op eenvoudige vragen.

Lees het volledige artikel
Meer over AI & Analytics →