On this page
1. Inleiding
Dit document beschrijft de verwachte ontwikkelingen van het DataSuite platform op een tijdschaal van 5 jaar. Drivers voor deze ontwikkelingen zijn zowel intern, bijvoorbeeld de ICT strategie of de Rijkswaterstaat Enterprise Architectuur (REA2025), als extern, bijvoorbeeld ontwikkeling van AI, markttrends, Greenplum’s positie t.o.v. concurrerende platformen, en relevante EU/NL‑regelgeving.
De volgende drivers kunnen worden onderscheiden:
- Ontwikkeling Datadriven werken binnen RWS
- De beweging van de industrie richting open lakehouse (zie strategische doelstellingen)
- Vendor lockin, relatie Broadcomm & stijgende licentiekosten
- Noodzaak van high availability, 24/7 support en reliability
- (Data)soevereiniteit, RWS wil te allen tijde onbeperkt toegang tot en de beschikking hebben over zijn data.
- Toenemende vraag naar data science en Artificial Intelligence (AI) waaronder ook machine learning
- Strenger wordende security kaders.
2. Strategische Doelstellingen (2026–2030)
Het Greenplum-platform vormt het centrale datawarehouse en analyse platform voor beleidsanalyse, rapportage en datagedreven besluitvorming binnen de organisatie.
Belangrijkste doelstellingen voor de komende vijf jaar:
- Versterken en ondersteunen van data gedreven werken en verbeteren van data-toegankelijkheid voor beleidsanalyse.
- Waarborgen van de beschikbaarheid van een schaalbare, veilige en toekomstbestendige Datawarehouse en MPP-omgeving (MPP = Massively-Parralel-Processing).
- Integratie met bestaande datawarehouses, datalakes, GIS-tooling en BI‑tooling.
- Verbeteren van performance, beschikbaarheid en beheersbaarheid.
- Verminderen van 'vendor lock-in'.
- Moderniseren van data-architectuur door DataSuite in te zetten en verder door te ontwikkelen als Analytics omgeving.
3. Huidige Situatieanalyse
3.1 Functioneel
Momenteel wordt met Greenplum een Datawarehouse geleverd, zie onder.
| Kenmerk | Database | Datawarehouse | Datalake | Lakehouse | Datalakehouse |
|---|---|---|---|---|---|
| Doel | Transacties & basisanalyses | Zware analytische workloads (BI) | Ruwe, flexibele opslag | BI + ML + streaming op één opslag | Enterprise breed analytisch ecosysteem |
| Data‑type | Gestructureerd | Gestructureerd (kolommendata) | Alle typen (raw) | Alle typen als tabellen | Alle typen + governance + lineage |
| ACID | Ja | Ja (analytic optimized) | Nee | Ja (via Delta/Iceberg/Hudi) | Ja |
| Opslagvorm | Blok‑/bestandssysteem in DB | Kolomgebaseerde opslag, MPP | Bestanden (S3, HDFS) | Bestanden + metadata‑laag | Idem lakehouse + enterprise tooling |
| Compute | DB‑engine | MPP of cloud‑compute | Veelzijdig (los gekoppeld) | Losse engines (Spark, Trino, etc.) | Volledige orchestratie van compute‑engines |
| Kostenniveau | Middel | Hoog | Laag | Gemengd | Gemengd |
| Use‑cases | Operationeel, kleine BI | Enterprise BI, rapportages | ML, ruwe opslag, exploratie | BI + ML + streaming | Grote organisaties: data‑productie, catalogus, governance |
Database = Nette archiefkast PostgreSQL
Datawarehouse = Zeer goed georganiseerde bibliotheek met veel zoekcapaciteit Greenplum
Datalake = Opslagloods met alle soorten dozen door elkaar S3, Minio
Lakehouse = Opslagloods + bibliotheekfunctionaliteit op de loods Iceberg/Delta/Hudi
Datalakehouse = Volledig data‑campus: loods + bibliotheek + catalogus + proces‑ en governance‑structuur Snowflake/Databricks/
Functioneel wordt de Greenplum/Datasuite omgeving momenteel gebruikt voor:
- Opslag en verwerking van grote datasets,
- Complexe SQL-analyses(*),
- ETL-processen,
- Verwerking IoT datastromen,
- Verzamelomgeving CTD(Collect)
- Goedkope, snelle opslag.
3.2 Technisch
De huidige omgeving bestaat uit:
MPP cluster gebaseerd op Greenplum Database, onderliggend OS: Linux
Relationele basis: PostgreSQL architectuur
Gescheiden master node en segment nodes
Een productie omgeving op bare-metals en een gevirtualiseerde OTA-omgeving
3.3 Organisatie
Rollen: te veel DBA rol, functioneel beheer van de omgeving niet ingericht, architectuur analytics omgeving die gebruikt wordt voor goedkope snelle storage, security.
Kennisniveau gebruikers te laag, bijscholing noodzakelijk.
- Invullen rol tech-lead door interne medewerker
5. 5‑Jaren Roadmap
De roadmap voor het DataSuite platform is er in 2 vormen:
- een gedetailleerde versie in de vorm van de bekende gekleurd slang voor de komende 2 jaar, zie Roadmap Data Suite
- een algemenere voor de komende 5 jaar, zie hieronder.
- Jaar 1 (2026) – Platform volledig naar Bare-metal, voorbereidingen treffen voor verandering leverancier, POC S3 storage
- Jaar 2 (2027) – Migratie naar nieuwe leverancier, leveren nieuwe functionaliteiten(s3, RabbitMQ)
- Jaar 3 (2028) – Implementatie compatibiliteit Cloud-Native formaten, IAM integratie
- Jaar 4 (2029) – Integratie met on premise AI en data science
- Jaar 5 (2030) – Platform is gereed voor cloud-native formaten
- 2026 – Evaluatie & Inventarisatie.
- Gevirtualiseerde OTA vervangen door Bare-metals
-Funtionele uitvraag voor support op de MPP omgeving
- In beheer name RabbitMQ
- Onderzoeken off-loaden naar S3 storage
- 2027 – Migratie & Vernieuwing.
- Migratie naar nieuwe support leverancier MPP functionaliteit
- Migratie RabbitMQ naar Cloudboostr/Open Shift en levering message-queuing functionaliteit
- Off-load mogelijkheid 'cold-storage' en eventueel ook 'warm-storage', focus deze omgeving op 'hot storage'.
- Onderzoeken integratie Greenplum met Cloud-Native formats
- 2028 – Optimalisatie & Integratie.
- Uitbreiding Analytics functionaliteit
- Integratie andere platformen (BI&GIS)
- Integratie met Cloud-Native formats
- 2029 – Innovatie & automatisering.
- 2030 – Volledig Cloud-Native
Overzicht afhankelijkheden:
- Levering van bare-metals, IRN Datacenter
- Inrichting dienstverlening S3 storage, IRN Datacenter
- Verloop inkoopproces functionele uitvraag en reacties van de markt
- Voldoende financiën
- Beschikbaarheid handjes
6. Governance, Organisatie & Beheer
- Personele bezetting
- Servicelevels
7. Security & Compliance
Omgeving moet altijd Bio-compliant zijn
- BIO2
- Exceptions
8. Risicoanalyse & Mitigatie
- Vendor lock‑in → voorkeur open‑source, open formaten, periodieke markttoets
- Kennisveroudering → structurele training, opensource community betrokkenheid
- Interne kennis → achtervang regelen voor PO/PM
- Complexiteit toename → standaarden & governance
- Security risico’s → hardening, patchbeleid, maken bedreigingsanalyse
- Veroudering van hardware → lifecycle planning.
9. KPI’s & Succesfactoren
- Platform uptime ≥ 99,9%
- Performance: verbeteren
- Aantal (grote) incidenten per jaar naar beneden
- Datakwaliteit: % geslaagde validatieregels
- Governance: auditbevindingen (BIO/AVG) ≤ 2 per jaar
- Reductie vendor‑afhankelijkheden
10. Evaluatie & Bijstelling
- Halfjaarlijkse technische review.
- Jaarlijkse gebruikersenquête.
- Tweejaarlijkse marktverkenning en actualisatie advies.
Roadmap update in overleg met architectuurboard en stuurgroep
Bijlagen
Datasoevereiniteit betekent voor Rijkswaterstaat dat zij volledige zeggenschap, controle en verantwoordelijkheid behoudt over alle gegevens die zij verwerkt, opslaat en uitwisselt, ongeacht waar die data zich fysiek bevindt of welke (cloud)dienstverlener wordt gebruikt.
In de praktijk houdt dit in dat:
Wet- en regelgeving leidend is
Rijkswaterstaat moet altijd kunnen waarborgen dat gegevens worden verwerkt volgens de Nederlandse wet (bijv. Archiefwet, Wet open overheid, Wpg) en Europese kaders zoals de AVG/GDPR.Data niet onder ongewenste buitenlandse jurisdictie mag vallen
Dit betekent dat de overheid moet voorkomen dat buitenlandse wetgeving (zoals de Amerikaanse CLOUD Act) toegang afdwingt tot Nederlandse overheidsdata.Data altijd beschikbaar, integer en vertrouwelijk blijft
Rijkswaterstaat moet technische en organisatorische maatregelen kunnen afdwingen om continuïteit, beveiliging en auditbaarheid te garanderen.Keuzevrijheid en controle over cloud en leveranciers
Data moet kunnen worden verplaatst, afgeschermd of verwijderd op eigen initiatief, zonder lock-in of afhankelijkheid van een leverancier.Transparantie en toezicht mogelijk zijn
De overheid moet altijd kunnen aantonen wie toegang heeft tot data, waar deze staat opgeslagen en hoe deze wordt beveiligd.
Data science is het vakgebied dat zich bezighoudt met het systematisch verzamelen, beheren, analyseren en interpreteren van gegevens, met als doel om nieuwe inzichten te verkrijgen, voorspellingen te doen en datagedreven beslissingen te ondersteunen. Het combineert methoden en technieken uit statistiek, wiskunde, informatica, machine learning en domeinkennis om waarde te halen uit gestructureerde en ongestructureerde data.
Hot, Warm en Cold Storage
| Kenmerk | Hot Storage | Warm Storage | Cold Storage |
|---|---|---|---|
| Toegangssnelheid | Zeer snel | Gemiddeld | Traag |
| Gebruik | Actieve, vaak gebruikte data | Regelmatig gebruikte data | Zelden opgevraagde data / archief |
| Kosten | Hoog | Gemiddeld | Laag |
| Voorbeelden van inzet | Databases, real‑time apps | Back‑ups, analytics-data | Compliance‑archief, historisch databehoud |
Mirror provenance
- Mirror source
- confluence/spaces/INFRAARCH/pages/226270649/page.metadata.json
- Storage source
- confluence/spaces/INFRAARCH/pages/226270649/page.storage.xhtml
- Access
- Committed snapshot only