Confluence workbench mirror

Vijf jarenplan DataSuite

Guarded rendering from the committed top-level `confluence/` mirror. No live source, personal data, or write action is available.

Kind
PAGE
Version
16
Labels
0
Children
0
On this page
  1. 1. Inleiding
  2. 2. Strategische Doelstellingen (2026–2030)
  3. 3. Huidige Situatieanalyse
  4. 3.1 Functioneel
  5. 5. 5‑Jaren Roadmap
  6. 6. Governance, Organisatie & Beheer
  7. 7. Security & Compliance
  8. 8. Risicoanalyse & Mitigatie
  9. 9. KPI’s & Succesfactoren
  10. 10. Evaluatie & Bijstelling
  11. Bijlagen

1. Inleiding

Dit document beschrijft de verwachte ontwikkelingen van het DataSuite platform op een tijdschaal van 5 jaar. Drivers voor deze ontwikkelingen zijn zowel intern, bijvoorbeeld de ICT strategie of de Rijkswaterstaat Enterprise Architectuur (REA2025), als extern, bijvoorbeeld ontwikkeling van AI, markttrends, Greenplum’s positie t.o.v. concurrerende platformen, en relevante EU/NL‑regelgeving.

De volgende drivers kunnen worden onderscheiden:

  • Ontwikkeling Datadriven werken binnen RWS
  • De beweging van de industrie richting open lakehouse (zie strategische doelstellingen)
  • Vendor lockin, relatie Broadcomm & stijgende licentiekosten
  • Noodzaak van high availability, 24/7 support en reliability
  • (Data)soevereiniteit, RWS wil te allen tijde onbeperkt toegang tot en de beschikking hebben over zijn data.
  • Toenemende vraag naar data science en Artificial Intelligence (AI) waaronder ook machine learning
  • Strenger wordende security kaders.

2. Strategische Doelstellingen (2026–2030)

Het Greenplum-platform vormt het centrale datawarehouse en analyse platform voor beleidsanalyse, rapportage en datagedreven besluitvorming binnen de organisatie.

Belangrijkste doelstellingen voor de komende vijf jaar:

  • Versterken en ondersteunen van data gedreven werken en verbeteren van data-toegankelijkheid voor beleidsanalyse.
  • Waarborgen van de beschikbaarheid van een schaalbare, veilige en toekomstbestendige Datawarehouse en MPP-omgeving (MPP = Massively-Parralel-Processing).
  • Integratie met bestaande datawarehouses, datalakes, GIS-tooling en BI‑tooling.
  • Verbeteren van performance, beschikbaarheid en beheersbaarheid.
  • Verminderen van 'vendor lock-in'.
  • Moderniseren van data-architectuur door DataSuite in te zetten en verder door te ontwikkelen als Analytics omgeving.

3. Huidige Situatieanalyse

3.1 Functioneel

Momenteel wordt met Greenplum een Datawarehouse geleverd, zie onder. 

KenmerkDatabaseDatawarehouseDatalakeLakehouseDatalakehouse
DoelTransacties & basisanalysesZware analytische workloads (BI)Ruwe, flexibele opslagBI + ML + streaming op één opslagEnterprise breed analytisch ecosysteem
Data‑typeGestructureerdGestructureerd (kolommendata)Alle typen (raw)Alle typen als tabellenAlle typen + governance + lineage
ACIDJaJa (analytic optimized)NeeJa (via Delta/Iceberg/Hudi)Ja
OpslagvormBlok‑/bestandssysteem in DBKolomgebaseerde opslag, MPPBestanden (S3, HDFS)Bestanden + metadata‑laagIdem lakehouse + enterprise tooling
ComputeDB‑engineMPP of cloud‑computeVeelzijdig (los gekoppeld)Losse engines (Spark, Trino, etc.)Volledige orchestratie van compute‑engines
KostenniveauMiddelHoogLaagGemengdGemengd
Use‑casesOperationeel, kleine BIEnterprise BI, rapportagesML, ruwe opslag, exploratieBI + ML + streamingGrote organisaties: data‑productie, catalogus, governance


Database = Nette archiefkast                                                                                                                                                                          PostgreSQL

Datawarehouse = Zeer goed georganiseerde bibliotheek met veel zoekcapaciteit                                                                                          Greenplum

Datalake = Opslagloods met alle soorten dozen door elkaar                                                                                                                           S3, Minio  

Lakehouse = Opslagloods + bibliotheekfunctionaliteit op de loods                                                                                                                 Iceberg/Delta/Hudi

Datalakehouse = Volledig data‑campus: loods + bibliotheek + catalogus + proces‑ en governance‑structuur                                              Snowflake/Databricks/


Functioneel wordt de Greenplum/Datasuite omgeving momenteel gebruikt voor:

  1. Opslag en verwerking van grote datasets,
  2. Complexe SQL-analyses(*), 
  3. ETL-processen,
  4. Verwerking IoT datastromen,
  5. Verzamelomgeving CTD(Collect) 
  6. Goedkope, snelle opslag.


3.2 Technisch

De huidige omgeving bestaat uit:

MPP cluster gebaseerd op Greenplum Database, onderliggend OS: Linux

Relationele basis: PostgreSQL architectuur

Gescheiden master node en segment nodes

Een  productie omgeving op bare-metals en een gevirtualiseerde OTA-omgeving

3.3 Organisatie

Rollen:  te veel DBA rol, functioneel beheer van de omgeving niet ingericht, architectuur analytics omgeving die gebruikt wordt voor goedkope snelle storage, security.

Kennisniveau gebruikers te laag, bijscholing noodzakelijk.

  • Invullen rol tech-lead door interne medewerker

5. 5‑Jaren Roadmap

De roadmap voor het DataSuite platform is er in 2 vormen:

  1. een gedetailleerde versie in de vorm van de bekende gekleurd slang voor de komende 2 jaar, zie Roadmap Data Suite
  2. een algemenere voor de komende 5 jaar, zie hieronder.
  1. Jaar 1 (2026) – Platform volledig naar Bare-metal, voorbereidingen treffen voor verandering leverancier, POC S3 storage
  2. Jaar 2 (2027) – Migratie naar nieuwe leverancier, leveren nieuwe functionaliteiten(s3, RabbitMQ)
  3. Jaar 3 (2028) – Implementatie compatibiliteit Cloud-Native formaten, IAM integratie
  4. Jaar 4 (2029) – Integratie met on premise AI en data science
  5. Jaar 5 (2030) – Platform is gereed voor cloud-native formaten
  • 2026 – Evaluatie & Inventarisatie.

- Gevirtualiseerde OTA vervangen door Bare-metals

-Funtionele uitvraag voor support op de MPP omgeving

In beheer name RabbitMQ

- Onderzoeken off-loaden naar S3 storage

  • 2027 – Migratie & Vernieuwing.

- Migratie naar nieuwe support leverancier MPP functionaliteit

- Migratie RabbitMQ naar Cloudboostr/Open Shift en levering message-queuing functionaliteit

- Off-load mogelijkheid 'cold-storage' en eventueel ook 'warm-storage', focus deze omgeving op 'hot storage'.

- Onderzoeken integratie Greenplum met Cloud-Native formats

  • 2028 – Optimalisatie & Integratie.

- Uitbreiding Analytics functionaliteit

- Integratie andere platformen (BI&GIS)

- Integratie met Cloud-Native formats

  • 2029 – Innovatie & automatisering.
  • 2030 – Volledig Cloud-Native


Overzicht afhankelijkheden:

  1.  Levering van bare-metals, IRN Datacenter
  2.  Inrichting dienstverlening S3 storage, IRN Datacenter
  3.  Verloop inkoopproces functionele uitvraag en reacties van de markt
  4.  Voldoende financiën
  5. Beschikbaarheid handjes
  6.  

6. Governance, Organisatie & Beheer

  • Personele bezetting
  • Servicelevels


7. Security & Compliance

Omgeving moet altijd Bio-compliant zijn 

  • BIO2
  • Exceptions

8. Risicoanalyse & Mitigatie

  • Vendor lock‑in → voorkeur open‑source, open formaten, periodieke markttoets
  • Kennisveroudering → structurele training, opensource community betrokkenheid
  • Interne kennis → achtervang regelen voor PO/PM
  • Complexiteit toename → standaarden & governance
  • Security risico’s → hardening, patchbeleid, maken bedreigingsanalyse
  • Veroudering van hardware → lifecycle planning.

9. KPI’s & Succesfactoren

  • Platform uptime ≥ 99,9%
  • Performance: verbeteren
  • Aantal (grote) incidenten per jaar naar beneden
  • Datakwaliteit: % geslaagde validatieregels
  • Governance: auditbevindingen (BIO/AVG) ≤ 2 per jaar
  • Reductie vendor‑afhankelijkheden

10. Evaluatie & Bijstelling

  • Halfjaarlijkse technische review.
  • Jaarlijkse gebruikersenquête.
  • Tweejaarlijkse marktverkenning en actualisatie advies.

Roadmap update in overleg met architectuurboard en stuurgroep


Bijlagen

Datasoevereiniteit betekent voor Rijkswaterstaat dat zij volledige zeggenschap, controle en verantwoordelijkheid behoudt over alle gegevens die zij verwerkt, opslaat en uitwisselt, ongeacht waar die data zich fysiek bevindt of welke (cloud)dienstverlener wordt gebruikt.

In de praktijk houdt dit in dat:

  1. Wet- en regelgeving leidend is
    Rijkswaterstaat moet altijd kunnen waarborgen dat gegevens worden verwerkt volgens de Nederlandse wet (bijv. Archiefwet, Wet open overheid, Wpg) en Europese kaders zoals de AVG/GDPR.

  2. Data niet onder ongewenste buitenlandse jurisdictie mag vallen
    Dit betekent dat de overheid moet voorkomen dat buitenlandse wetgeving (zoals de Amerikaanse CLOUD Act) toegang afdwingt tot Nederlandse overheidsdata.

  3. Data altijd beschikbaar, integer en vertrouwelijk blijft
    Rijkswaterstaat moet technische en organisatorische maatregelen kunnen afdwingen om continuïteit, beveiliging en auditbaarheid te garanderen.

  4. Keuzevrijheid en controle over cloud en leveranciers
    Data moet kunnen worden verplaatst, afgeschermd of verwijderd op eigen initiatief, zonder lock-in of afhankelijkheid van een leverancier.

  5. Transparantie en toezicht mogelijk zijn
    De overheid moet altijd kunnen aantonen wie toegang heeft tot data, waar deze staat opgeslagen en hoe deze wordt beveiligd.

Data science is het vakgebied dat zich bezighoudt met het systematisch verzamelen, beheren, analyseren en interpreteren van gegevens, met als doel om nieuwe inzichten te verkrijgen, voorspellingen te doen en datagedreven beslissingen te ondersteunen. Het combineert methoden en technieken uit statistiek, wiskunde, informatica, machine learning en domeinkennis om waarde te halen uit gestructureerde en ongestructureerde data.

Hot, Warm en Cold Storage

KenmerkHot StorageWarm StorageCold Storage
ToegangssnelheidZeer snelGemiddeldTraag
GebruikActieve, vaak gebruikte dataRegelmatig gebruikte dataZelden opgevraagde data / archief
KostenHoogGemiddeldLaag
Voorbeelden van inzetDatabases, real‑time appsBack‑ups, analytics-dataCompliance‑archief, historisch databehoud


Mirror provenance
Mirror source
confluence/spaces/INFRAARCH/pages/226270649/page.metadata.json
Storage source
confluence/spaces/INFRAARCH/pages/226270649/page.storage.xhtml
Access
Committed snapshot only