LEESMIJ: FICTIEVE patiëntgegevens voor Care & Code (versie 1.0, 29 september 2026)

1. WAT IS DIT?
Een set van 100 FICTIEVE patiëntendossiers om je eigen toepassingen op te testen: zonder ooit echte patiëntgegevens in een AI- of bouwtool te moeten stoppen.
Je kan het bestand gebruiken tijdens de Care & Code build-dag (3 oktober 2026, Antwerpen) en ook daarna: het blijft beschikbaar om je toepassingen mee te testen.
De data bestaat uit een aantal gekoppelde tabellen (zie punt 4), niet uit één lange lijst. Alles is gegenereerd door een script met een vaste seed (20261003), dus reproduceerbaar.

2. HET IS FICTIEF: DE NAMEN ZIJN NEP
- Alle personen zijn verzonnen. Namen zijn willekeurige combinaties van veelvoorkomende Vlaamse voor- en achternamen (met een deel namen van andere herkomst, zoals in de echte bevolking). Elke gelijkenis met een bestaand persoon is toeval.
- Adressen: echte Vlaamse gemeenten, postcodes en straatnamen, maar met willekeurige huisnummers. Ze verwijzen niet naar echte bewoners.
- Er zijn geen rijksregisternummers, geen telefoonnummers en geen echte e-mailadressen (alles eindigt op @example.com). Elke patiënt-ID begint met FICT-.
- De medische gegevens zijn geloofwaardig maar willekeurig samengesteld en NIET klinisch gevalideerd. Gebruik ze nooit voor medische beslissingen, onderzoek of statistiek.

3. REPRESENTATIEF VOOR DE VLAAMSE BEVOLKING
De set is opgebouwd om de Vlaamse bevolking in grote lijnen te weerspiegelen:
- Leeftijd en geslacht volgen de bevolkingsstructuur van Statbel (1 januari 2026): hier 20% jonger dan 18, 21% van 65 jaar of ouder (waarvan 6% 80-plus) en 52% vrouwen (meer vrouwen bij de ouderen).
- Woonplaats: verdeeld over de vijf Vlaamse provincies naar aantal inwoners (West-Vlaanderen 18, Antwerpen 28, Oost-Vlaanderen 23, Vlaams-Brabant 17, Limburg 13), met grote steden én kleine gemeenten.
- Gezondheid: aandoeningen komen voor in ongeveer de frequenties van de huisartsenpraktijk en stijgen met de leeftijd (hoge bloeddruk, diabetes, cholesterol, astma, COPD, depressie, artrose en meer). 33% heeft geen chronische aandoening: er zijn dus ook gezonde mensen, kinderen en jongvolwassenen, met hooguit een acute infectie in het voorbije jaar.
- Ongeveer 15% van de namen is van andere herkomst, in verhouding met de bevolking.
- Let op: 100 records is weinig. In kleine deelgroepen (bijvoorbeeld één leeftijdscategorie) zijn de aantallen benaderend. De set is representatief in grote lijnen, niet om er conclusies uit te trekken.

4. DE TABELLEN (koppel ze via patient_id)
- patienten (100 rijen): één rij per patiënt: naam, geslacht, geboortedatum, adres, rookstatus, lengte, gewicht.
- diagnoses (239 rijen): chronische en acute diagnoses met ICPC-2-code en Nederlandse tekst.
- medicatie (162 rijen): voorgeschreven geneesmiddelen met ATC-code, dosering en indicatie.
- metingen (188 rijen): bloeddruk, hartslag, gewicht en enkele labowaarden.
- afspraken (445 rijen): consulten met vrije tekst over de klacht, in gewoon Nederlands.
- patienten_plat (CSV, 100 rijen): alles samengevat in één bestand, handig voor wie met één tabel wil starten.
- kolomuitleg: uitleg bij elke kolom, met een voorbeeld.
- antwoordsleutel: de lijst van alle bewuste fouten (zie punt 5). Niet kijken als je zelf op zoek wil gaan.
De codes (ICPC-2 en ATC) zijn indicatief.

5. BEWUSTE ONNETTIGHEDEN
Echte dossiers zijn nooit netjes, en een toepassing die alleen met perfecte data werkt, faalt in de praktijk. Daarom zitten er bewust fouten in de data: 45 in totaal (ongeveer 4% van de rijen). Types:
  - Engelse schrijfwijze
  - afkortingen en kleine letters
  - afwijkende notatie
  - ander datumformaat
  - datum in woorden
  - dubbele patiënt
  - dubbele rij
  - extra spatie achteraan
  - inconsistente hoofdletters
  - inconsistente schrijfwijze
  - inconsistente waarde
  - logische inconsistentie (afgerond in de toekomst)
  - ontbrekende waarde
  - onwaarschijnlijke waarde (komma verschoven)
  - onwaarschijnlijke waarde (typefout)
  - synoniem in plaats van standaardterm
  - tekst in plaats van getal
  - tikfout
  - verkeerde eenheid (gram)
  - waarden omgewisseld
Wie de fouten zelf wil ontdekken, kijkt niet in het tabblad/bestand "antwoordsleutel". Wie wil controleren of de eigen toepassing ze opvangt, gebruikt het wel.

6. PRAKTISCH
- Excel-bestand: LEESMIJ, de tabellen, kolomuitleg en antwoordsleutel als tabbladen.
- CSV-bestanden: komma-gescheiden, UTF-8 (met BOM). Opent Excel het bestand in één kolom? Kies dan Gegevens > Uit tekst/CSV en stel het scheidingsteken op komma in.
- Datums staan als JJJJ-MM-DD, behalve waar dat een bewuste fout is.
- Vrij te gebruiken om te testen, te oefenen en te delen, ook na de build-dag. Er staat geen enkele echte persoon in.

Care & Code: careandcode.be
