AI Infrastructure
Vector database
Een vector database is een databank die embeddings opslaat en snel kan zoeken naar inhoud die semantisch op elkaar lijkt. Ze wordt vaak gebruikt in RAG-oplossingen om relevante documenten, e-mails of kennisartikels op te halen voor een AI-model.
VDB · Ook bekend als: vectordatabase, vector DB
Wat is een vectordatabase?
Een vectordatabase is een gespecialiseerde databasetechnologie die gegevens opslaat en indexeert als wiskundige vectoren, ook wel embeddings of vectorrepresentaties genoemd. Een embedding is een numerieke representatie van de semantische betekenis van een stuk tekst, een afbeelding of een ander gegevenstype, uitgedrukt als een reeks getallen in een hoogdimensionale wiskundige ruimte. Een cruciaal en elegant principe is dat teksten of documenten met een gelijkaardige betekenis wiskundig dicht bij elkaar liggen in die vectorruimte, zelfs wanneer ze geen enkele gemeenschappelijke woordkeuze hebben. Vectordatabases zijn technisch geoptimaliseerd voor één specifieke operatie: het snel en nauwkeurig vinden van de vectoren die het dichtst bij een gegeven zoekvector liggen, via technieken als Approximate Nearest Neighbor search.
Vectordatabases versus traditionele databases
Traditionele relationele databases slaan sterk gestructureerde data op in rijen en kolommen en zijn bijzonder efficiënt voor exacte overeenkomsten, wiskundige berekeningen en gestructureerde queries. Ze zijn echter fundamenteel ongeschikt voor semantisch zoeken: een query op het woord "goedkope vluchten" vindt geen rij die uitsluitend het woord "voordelige reizen" bevat, hoe semantisch equivalent beide concepten ook zijn. Vectordatabases vullen precies die leemte: ze begrijpen de betekenis achter een zoekopdracht en vinden relevante resultaten op basis van semantische nabijheid in de vectorruimte. Populaire vectordatabases zijn Pinecone, Weaviate, Qdrant en Milvus; pgvector is een veelgebruikte extensie voor wie vectorfunctionaliteit wil integreren in een bestaande PostgreSQL-installatie. De keuze voor een specifieke vectordatabase hangt af van factoren zoals het volume van te indexeren documenten, de gewenste zoeklatentie, de integratiemogelijkheden met jullie AI-platform en de hosting-voorkeur: volledig beheerde clouddienst of zelfgehoste installatie op eigen infrastructuur.
Vectordatabases in KMO-toepassingen
Voor KMO's zijn vectordatabases het meest relevant als de technologische ruggengraat van een RAG-architectuur: interne documenten, handleidingen, beleidsregels en kennisartikelen worden via een embeddingmodel omgezet naar vectorrepresentaties die opgeslagen worden in de vectordatabase. Wanneer een medewerker of klant een vraag stelt, wordt die vraag eveneens omgezet naar een vector en vergeleken met alle opgeslagen vectoren om de meest semantisch relevante passages op te halen als context voor het AI-antwoord. In de praktijk hoeft een KMO zelden zelf een vectordatabase te beheren en configureren: de meeste professionele AI-workspaceplatformen bieden documentindexering en semantisch zoeken als kant-en-klare, beheerde functionaliteit aan. Kennis van het concept helpt echter om de meerwaarde van die functionaliteit correct te begrijpen en in te schatten.
Wat betekent Vector database?
Een vector database is een databank die embeddings opslaat en snel kan zoeken naar inhoud die semantisch op elkaar lijkt. Ze wordt vaak gebruikt in RAG-oplossingen om relevante documenten, e-mails of kennisartikels op te halen voor een AI-model.