Kennisbank voor AI voorbereiden: bronnen opschonen zonder eindeloos dataproject
Bereid een kennisbank voor AI voor door per document een eigenaar, geldigheidsstatus, datum, doelgroep en versie vast te leggen. Verwijder duplicaten, markeer conflicten en test of belangrijke vragen met duidelijke bronpassages kunnen worden beantwoord. Begin met één kennisdomein. Meer documenten verhogen niet automatisch de kwaliteit; relevante, actuele en terugvindbare bronnen zijn belangrijker.
Definitie en afbakening
Een AI-geschikte kennisbank is een beheerde verzameling bronnen die een systeem mag doorzoeken of gebruiken bij antwoorden. Voorbereiding omvat inhoudelijke selectie, rechten, structuur, metadata, opsplitsing, indexering, testvragen en actualisatie. Het doel is niet alle bedrijfskennis te centraliseren, maar betrouwbare ondersteuning te bieden voor afgebakende informatievragen.
Het herkenbare bedrijfsprobleem
Organisaties koppelen complete documentomgevingen aan een assistent en verwachten betere antwoorden. Oude versies, sjablonen en concepten krijgen hetzelfde gewicht als beleid. Gebruikers zien een overtuigend antwoord met een bronlink, maar de bron is niet langer geldig. Zonder documenteigenaarschap lost een beter retrieval-algoritme het kernprobleem niet op.
Een gemiddelde kan kritieke uitzonderingen verbergen. Segmenteer fouten naar type en gevolg, vooral wanneer zeldzame gevallen hoge schade of veel herstelwerk veroorzaken. Financiële waarde mag een harde veiligheids- of rechtmatigheidsgrens niet wegmiddelen.
Technische waarde ontstaat in een keten
Een technisch gemiddelde is niet genoeg. De activiteit ‘kies vragen en doelgroep’ kan sterk scoren terwijl het risico ‘meer documenten worden als betere dekking gezien’ de keten toch onbetrouwbaar maakt.
Stappenplan voor het voorbereiden van een kennisbank voor AI
1. Kies vragen en doelgroep
Bepaal welke informatiebehoefte wordt ondersteund en wat buiten scope blijft. Controleer voor de stap ‘kies vragen en doelgroep’ ook toegang, verwijdering en toekomstige wijzigingen.
2. Selecteer gezaghebbende bronnen
Wijs per onderwerp de leidende bron en inhoudelijke eigenaar aan. Laat de stap ‘selecteer gezaghebbende bronnen’ eindigen in een expliciet besluit over scope, investering en beheer.
3. Regel status en metadata
Leg versie, datum, geldigheid, doelgroep, rechten en vertrouwelijkheid vast. Benoem bij de stap ‘regel status en metadata’ de eigenaar, het bewijs en de grens voor doorgaan.
4. Verwijder of markeer conflicten
Voorkom dat concept, oud beleid en actuele instructie gelijkwaardig worden opgehaald. Leg voor de stap ‘verwijder of markeer conflicten’ vast welke data en technische afhankelijkheid de uitkomst bepalen.
5. Bouw een representatieve testset
Gebruik gewone vragen, uitzonderingen, ontbrekende antwoorden en misleidende formuleringen. Test tijdens de stap ‘bouw een representatieve testset’ gewone gevallen, uitzonderingen en foutieve invoer.
6. Organiseer continu beheer
Laat bronwijzigingen, verwijdering en herindexering aantoonbaar doorwerken. Koppel de stap ‘organiseer continu beheer’ aan meetbare kwaliteit, kosten en een herstelroute.
Beslismodel
| Beslispunt | Centrale vraag | Gewenst bewijs | Handelingsregel | |---|---|---|---| | Kies vragen en doelgroep | Bepaal welke informatiebehoefte wordt ondersteund en wat buiten scope blijft. | Testdata, eigenaar en meetrapport | Doorgaan bij gehaalde grens | | Selecteer gezaghebbende bronnen | Wijs per onderwerp de leidende bron en inhoudelijke eigenaar aan. | Architectuur-, risico- en kostenbewijs | Beperkt testen bij onzekerheid | | Regel status en metadata | Leg versie, datum, geldigheid, doelgroep, rechten en vertrouwelijkheid vast. | Testdata, eigenaar en meetrapport | Herontwerpen of stoppen | | Verwijder of markeer conflicten | Voorkom dat concept, oud beleid en actuele instructie gelijkwaardig worden opgehaald. | Architectuur-, risico- en kostenbewijs | Doorgaan bij gehaalde grens | | Bouw een representatieve testset | Gebruik gewone vragen, uitzonderingen, ontbrekende antwoorden en misleidende formuleringen. | Testdata, eigenaar en meetrapport | Beperkt testen bij onzekerheid | | Organiseer continu beheer | Laat bronwijzigingen, verwijdering en herindexering aantoonbaar doorwerken. | Architectuur-, risico- en kostenbewijs | Herontwerpen of stoppen |
Praktijkvoorbeeld met invoer, berekening en uitkomst
Situatie
Een HR-dienstverlener wil 4.000 beleidsdocumenten ontsluiten.
Invoer
Een steekproef vindt 22 procent verouderde versies. Handmatige beoordeling kost gemiddeld 6 minuten per document à €50. Een gefaseerde start gebruikt 900 documenten uit één domein.
Berekening
Volledige eerste beoordeling: 4.000 × 6/60 × €50 = €20.000. Gefaseerd: 900 × 6/60 × €50 = €4.500.
Uitkomst
De eerste fase beperkt de investering met €15.500 en levert eerder bewijs over retrieval en gebruik. Uitbreiding volgt alleen bij voldoende antwoordkwaliteit en netto waarde.
Verbinding met de vijf lagen van de ROI-scan
Het risico ‘bronverwijzing wekt vertrouwen in een verouderde bron’ kan daarom een andere oorzaak hebben dan de eerste technische diagnose suggereert.
Lees ook RAG implementeren, Databronnen inventariseren, Datakwaliteit voor AI.
Scenario’s en opties
| Scenario | Wanneer passend | Investering | Vereist bewijs | |---|---|---:|---| | Eerst meten | Bepaal welke informatiebehoefte wordt ondersteund en wat buiten scope blijft. | Laag | Nulmeting en afgebakende testset | | Beperkte technische proef | Wijs per onderwerp de leidende bron en inhoudelijke eigenaar aan. | Middel | Kwaliteit, rechten, kosten en foutgedrag | | Gefaseerd naar productie | Leg versie, datum, geldigheid, doelgroep, rechten en vertrouwelijkheid vast. | Middel tot hoog | Gehaalde grens, monitoring en beheerbudget | | Niet bouwen of terugschalen | Meer documenten worden als betere dekking gezien | Beperkt verlies | Vastgelegd besluit en eenvoudiger alternatief |
Risico’s en beheersmaatregelen
1. Meer documenten worden als betere dekking gezien
Maak het risico ‘meer documenten worden als betere dekking gezien’ zichtbaar met een vroeg signaal in data, systeem of workflow. Koppel de controle aan de stap ‘bouw een representatieve testset’, wijs een bevoegde eigenaar aan en bepaal welke overschrijding tot beperking of herstel leidt.
2. Bronverwijzing wekt vertrouwen in een verouderde bron
Maak het risico ‘bronverwijzing wekt vertrouwen in een verouderde bron’ zichtbaar met een vroeg signaal in data, systeem of workflow. Koppel de controle aan de stap ‘organiseer continu beheer’, wijs een bevoegde eigenaar aan en bepaal welke overschrijding tot beperking of herstel leidt.
3. Opsplitsing verwijdert noodzakelijke context
Maak het risico ‘opsplitsing verwijdert noodzakelijke context’ zichtbaar met een vroeg signaal in data, systeem of workflow. Koppel de controle aan de stap ‘kies vragen en doelgroep’, wijs een bevoegde eigenaar aan en bepaal welke overschrijding tot beperking of herstel leidt.
4. Wijzigingen bereiken de index niet tijdig
Maak het risico ‘wijzigingen bereiken de index niet tijdig’ zichtbaar met een vroeg signaal in data, systeem of workflow. Koppel de controle aan de stap ‘selecteer gezaghebbende bronnen’, wijs een bevoegde eigenaar aan en bepaal welke overschrijding tot beperking of herstel leidt.
Veelgestelde vragen
Hoeveel documenten heb je nodig voor een AI-kennisbank?
Er is geen minimum. Begin met genoeg gezaghebbende bronnen om de afgebakende vragen betrouwbaar te testen.
Moeten documenten hetzelfde formaat hebben?
Niet noodzakelijk, maar verwerking, metadata en leesbaarheid moeten per formaat betrouwbaar worden getest.
Wat is chunking?
Het opdelen van bronnen in stukken voor retrieval. Grootte en overlap beïnvloeden vindbaarheid, context en kosten en moeten worden geëvalueerd.
Is een bronlink voldoende tegen hallucinaties?
Nee. Retrieval, bronkwaliteit, generatie en gebruikerscontrole kunnen allemaal falen. Controleer of beweringen werkelijk door de aangehaalde passage worden ondersteund.
Wie beheert de kennisbank?
Inhoudelijke bronhouders beheren geldigheid; techniek beheert verwerking en index; een product- of proceseigenaar bewaakt de gebruikersuitkomst.
Bronnen en officiële documentatie
- Lewis et al., Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks
- NIST AI Risk Management Framework
- NIST AI 600-1, Generative AI Profile
- ISO/IEC 42001, AI-managementsystemen
Verder lezen
- AI data readiness beoordelen: is je organisatie klaar voor een betrouwbare implementatie?
- Datakwaliteit voor AI-implementatie: meet wat de use-case werkelijk nodig heeft
- Data governance voor AI: eigenaarschap, toegang en kwaliteit bestuurbaar maken
- Databronnen voor AI inventariseren: van verspreide bestanden naar een beslisbaar overzicht
- Databronnen koppelen aan AI: kies tussen API, retrieval en gecontroleerde export