Confluence workbench mirror

Input Functionele uitvraag

Guarded rendering from the committed top-level `confluence/` mirror. No live source, personal data, or write action is available.

Kind
PAGE
Version
1
Labels
0
Children
0
On this page
  1. MPP Data Warehouses (relationeel + analytics)
  2. Open-source en PostgreSQL-afgeleiden
  3. Data Lakes & Lakehouse-platformen
  4. Specialistische Vector & Search Databases (voor AI/semantiek)
  5. Traditionele MPP/OLAP databases
  6. Specificaties huidig HLD
  7. Functionele specificaties
  8. Non-Functionele Requirements
  9. Systeem beperkingen
  10. Toespitsing
  11. Functionele Eisen voor Datawarehouseplatform
  12. Acceptatiecriteria

Marktanalyse omgeving Greenplum:

Greenplum 7 positioneert zich als een massively parallel processing (MPP) data warehouse/database met:

  1. AI/vector search,
  2. geospatiale analyse,
  3. row-level security,
  4. JSON/semistructured data,
  5. partitiebeheer

Er zijn een aantal concurrerende of vergelijkbare producten die (gedeeltelijk of volledig) dezelfde functionaliteiten bieden.

MPP Data Warehouses (relationeel + analytics)

  • Amazon Redshift
    • MPP architectuur, sterk geïntegreerd in AWS.
    • Ondersteunt JSON, semi-gestructureerde data, partitionering.
    • Geavanceerde resource management (WLM).
    • Integraties voor geospatiale data (via extensies en integratie met AWS GIS).
    • Nog beperkte native vector search; wel via integraties met pgvector of Amazon OpenSearch.
  • Google BigQuery
    • Serverless MPP data warehouse.
    • Ondersteunt partitionering, clustering, JSON, semistructured data.
    • AI-integratie via Vertex AI en ingebouwde ML-functies.
    • Beperkte geospatiale mogelijkheden (maar wel GIS-functies ingebouwd).
    • Vector search in 2023 geïntroduceerd voor semantisch zoeken.
  • Snowflake
    • Cloud-native data warehouse.
    • Automatisch schaalbare opslag & compute.
    • Ondersteunt semi-gestructureerde data (JSON, Avro, Parquet).
    • Extensies voor geospatiale analyse (GEOGRAPHY type, GIS-functies).
    • Nieuw: Snowflake Cortex voor LLM-integratie en vector embeddings.
    • Row-level security policies en data masking.

Open-source en PostgreSQL-afgeleiden

  • PostgreSQL + extensies
    • Met extensies als PostGIS, pgVector, Citus kan je een vergelijkbare stack bouwen:
      • PostGIS → geospatiale analyse
      • pgVector → vector embeddings & semantische search
      • Citus → MPP/distributie van data
    • PostgreSQL 16/17 ondersteunt al veel van de partitionering en JSON-mogelijkheden die Greenplum 7 ook biedt.
  • Citus (Microsoft Azure Cosmos DB for PostgreSQL)
    • PostgreSQL-distributie voor MPP workloads.
    • Ondersteunt JSONB, full-text search, vector embeddings.
    • Geospatiale analyse met PostGIS.
    • Multi-tenant sharding, resource-beheer en parallel query execution.

Data Lakes & Lakehouse-platformen

  • Databricks (Delta Lake + MLflow)
    • Lakehouse-architectuur (combinatie van data warehouse en data lake).
    • Ondersteunt semi-gestructureerde data (JSON, Parquet, ORC).
    • Geospatiale functies via Spark SQL en integraties.
    • Sterk in vector search, ML/AI integratie.
    • Row-level security mogelijk via Unity Catalog.
  • Apache Hive / Presto / Trino
    • SQL-engines bovenop data lakes (HDFS, S3).
    • Ondersteunen partitionering, semi-gestructureerde data, JSON.
    • Minder sterk in vector search of geospatiale analyse (wel via plugins).

Specialistische Vector & Search Databases (voor AI/semantiek)

  • Elasticsearch / OpenSearch
    • Sterk in full-text search en semantisch zoeken.
    • Vector search ingebouwd.
    • Minder geschikt voor complexe SQL/MMP workloads, wel goed als aanvulling.
  • Pinecone, Weaviate, Milvus
    • Pure vector databases, gericht op AI/semantische search.
    • Ondersteunen hybrid search (keywords + embeddings).
    • Geen relationele of MPP warehouse functionaliteit.

Traditionele MPP/OLAP databases

  • Teradata Vantage
    • MPP data warehouse.
    • Ondersteunt partitionering, JSON, geospatiale analyse, row-level security.
    • Sterk in enterprise-grade workload management.
    • Minder AI/vector search (meer integraties nodig).
  • Oracle Exadata / Autonomous Data Warehouse
    • Sterk in partitiebeheer, JSON, geospatiale analyse (Oracle Spatial).
    • Row-level security al jaren ingebouwd.
    • Vector search in 2023 toegevoegd aan Oracle Database 23c.
  • SAP HANA
    • In-memory database met OLAP en OLTP functionaliteit.
    • Ondersteunt geospatiale analyse, JSON, AI/ML integratie.
    • Partitionering en row-level security zijn aanwezig.
    • Vector search in recente releases beschikbaar.


Conclusie:
De directe open-source concurrenten zijn PostgreSQL + extensies en Citus.
De cloud-native alternatieven zijn Snowflake, BigQuery, Redshift en Databricks.
Voor AI/vector search concurreren ook Elasticsearch, Pinecone, Weaviate.
In de enterprise hoek vergelijkbaar zijn Teradata, Oracle, SAP HANA.


Specificaties huidig HLD

Functionele specificaties

ID

Essentieel

Omschrijving

Motivatie

Voldaan

FR-BD-01

Ja

Data Governance

Om de bekendheid, de bereikbaarheid en de bruikbaarheid van data te vergroten en om vraag en aanbod bij elkaar te brengen, dient data governance te worden toegepast

Ja

Inregelen volgens huidige standaarden binnen de applicaties(zie CTD portal)

FR-BD-02

Ja

Ondersteun SQL bewerkingen

Zorg voor een moderne en robuuste basis middels compatibiliteit en betrouwbaarheid voor een breed scala aan SQL-gebaseerde bewerkingen.

Ja, door Integratie met Postgres 12

FR-BD-03

Ja

Schaalbare oplossing

De omgeving moet kunnen inspelen op een toenemende vraag en aanbod van data en moet toekomst vast worden neergezet.

Ja

Standaard dienst.

FR-BD-04

Ja

Flexibele toegang tot gegevens

De data moet op flexibele manieren worden ontsloten naar applicaties in de data centers.

Ja

Greenplum ontsluit via aangesloten applicaties

FR-BD-05

Ja

Open Data beleid

‘Open data’ moet beschikbaar komen/zijn voor (externe, niet RWS) gebruikers.

Ja

Greenplum ontsluit via aangesloten applicaties

FR-BD-06

Ja

Duurzame Toegankelijkheid

Gegevens moeten (gaan) voldoen aan duurzame toegankelijkheid waarbij naast toegankelijkheid tot gegevens tevens het beleid tot bewaartermijnen, vernietiging en overdracht moet worden gevolgd.


Ja

Standaard dienst.

FR-BD-07

Ja

Geospatial analyse

Oplossing moet ook Geospatial analyses mogelijk maken.

Ja

Met de integratie van PostGIS 3

FR-BD-08

Ja

Ongestructureerde data

Ondersteun de analyse van ongestructureerde data zoals afbeeldingen en video's.

Ja

FR-BD-09

Ja

Disaster Recovery

Ondersteun meerdere datacenters voor een efficiëntere dataherstel na systeemstoringen.​

Ja

FR-BD-10

Ja

Resource beheer

Ondersteun het effectief verdelen van werkdrukken, waardoor de prestaties zelfs onder zware belasting op peil blijven.

Ja

FR-BD-11

Ja

Rij niveau beveiliging

Voeg rij-niveau machtigingen toe, wat een fijnmazigere toegangscontrole biedt naast de bestaande rol-gebaseerde beveiliging en machtigingen op tabel- en kolomniveau.

Ja

FR-BD-12

Ja

Datafederatie

Bied mogelijkheden voor datafederatie, datasets uit bronnen zoals Amazon S3, Hadoop en relationele databases moeten parallel kunnen worden bevraagd.

Ja

FR-BD-13

Ja

Indexering

Ondersteuning voor meerdere indexsoorten, zoals B-tree, Hash, Bitmap en AI-gestuurde vectorindices. Dit om queryprestaties te optimaliseren voor zowel gestructureerde als ongestructureerde data​.


Ja



Non-Functionele Requirements

Beschikbaarheid

ID

Essentieel

Titel

Omschrijving

Voldaan

BE-BD-01

Ja

Service Level Productie: standaard beschikbaar

Standaard beschikbaarheid.

Een standaard beschikbare omgeving moet voldoen aan de volgende requirements:

·    95% Standaard beschikbaarheid

·    Enkelvoudige aansluiting

Ja


BE-BD-02

Ja

Service Level Non-productie: standaard beschikbaar

Standaard beschikbaarheid.

Een standaard beschikbare omgeving moet voldoen aan de volgende requirements:

·    99,5% Standaard beschikbaarheid

·    Enkelvoudige aansluiting

Ja


BE-BD-03

Ja

Service Level Dual Datacenter(LMW)

Active - Active

Ja


Capaciteit

ID

Essentieel

Titel

Omschrijving

Voldaan

CA-BD-01

Ja

Greenplum,
8 segment hosts

Met de initiële afname (zie CA-GP-05) wordt verwacht dat dit afdoende is voor de gehele oplossing, de core licenties gelden voor de management nodes.

Ja

CA-BD-02

Ja

Greenplum, Geheugen: 512GB per segment host en master node

Met de initiële afname (zie CA-GP-05)  wordt verwacht dat dit afdoende is voor de gehele oplossing

Ja

CA-BD-03

Ja

Geheugen: 1024GB per server

Met de initiële afname (zie CA-GP-05)  wordt verwacht dat dit afdoende is voor de gehele oplossing

Ja

CA-BD-04

Ja

Pivotal BDS,

Operating Systeem partitie: totaal 256GB per node RAID 1

Met de initiële afname (zie CA-GP-05)  wordt verwacht dat dit afdoende is voor de gehele oplossing per node

Ja

CA-BD-05

Ja

Opslag: 2x 400 Tb

Toename sensordata.


Ja

CA-BD-06

Ja

Transactie volumes: onbekend

Zal tijdens initieel gebruik gemeten worden om een baseline te creëren

Ja

Performance

ID

Essentieel

Titel

Omschrijving

Voldaan

Pe-BD-01

Ja

Alle segment nodes gelijke capaciteit geven als bouwblok

Om een goed gebalanceerd GreenPlum cluster te hebben dienen alle segment nodes de zelfde resources (CPU/MEM/disk) te krijgen.

Ja

Inregelen in de infra


Security.

ID

Essentieel

Titel

Omschrijving

Voldaan

SE-BD-01

Ja

Standaard security

De omgeving moet minimaal voldoen aan standaard RWS security eisen. Dit gebeurt door het “security by design” proces.

Ja

Standaard dienst.

SE-BD-02

Ja

BIO-Compliant

Wettelijk moet het platform aan de BIO eisen voldoen. Normen selectie wordt ingevuld en de eventuele exceptie procedure gevolgd.

Let op applicaties die gebruik maken van de platformen moeten voor de niet platform onderdelen en de eigen data nog het BIO proces doorlopen.

Tijdens implementatie inregelen.

SE-BD-03

Nee

Risico Reductie Overzicht

Het is goed om een risico reductie overzicht te hebben om de mitigatie van risico’s te onderbouwen tot een aanvaardbaar rest risico.

Nee

SE-BD-04

Ja

Data security

·    Data moet geclassificeerd worden/zijn zodat data alleen uitgegeven kan worden op behoefte.

·    Het platform voorziet in data die ook gebruikt kunnen worden door derden. Het is noodzakelijk open data en besloten data gescheiden te houden.

·    Gevoelige data mag alleen aan geautoriseerde personen/instanties worden vrijgegeven.

Ja, zie OB-006

SE-BD-05

Ja

Toegang tot het platform/gegevens

·    Toegang tot de systemen moet gecontroleerd zijn

·    Rollen moeten gedefinieerd worden, in bv AD (role based access)

Ja

Toegang op basis van Kerberos (Active Directory).


SE-BD-06

Ja

Toegang tot het platform/gegevens

Security logging moet zijn ingeregeld

Ja, logging inregelen en koppelen aan SIEM (Splunk)



Operationeel

ID

Essentieel

Titel

Omschrijving

Voldaan

OP-BD-01

Ja

Geen aanvullende requirements

Volgt de RWS standaarden

Ja

Standaard dienst.

 

Back-up en Recovery

ID

Essentieel

Titel

Omschrijving

Voldaan

BR-BD-01

Ja

Alleen OS

Data Greenplum PROD uitsluiten van backup/restore.

Alleen het OS moet worden opgenomen in de standaard Snapshots en/of Backup/Restore voorziening. De overige data van greenplum PROD omgeving dient expliciet te worden uitgesloten van de standaard Snapshots en/of Backup/Restore voorziening.

Ja


Non Run-Time Requirements

ID

Essentieel

Titel

Omschrijving

Voldaan

NR-BD-01

Ja

Lifecycle management moet zijn ingeregeld

De systemen moeten voldoen aan de laatste (security) patches.

Ja

Standaard dienst.

NR-BD-02

Ja

Schaalbaarheid moet mogelijk zijn


De systeem moeten horizontaal en verticaal schaalbaar zijn

Ja, horizontaal schaalbaar dmv uitbreiding segment hosts

NR-BD-03

Ja

Disaster Recovery

Niet van toepassing voor standaard beschikbaarheid.

Ja


Systeem beperkingen

Beperking vanuit de Business

ID

Essentieel

Titel

Omschrijving

Voldaan

BUS-BD-01

Ja

Gekozen platform is Greenplum 7

Er is vanuit de business gekozen voor Greenplum 7 voor Data Suite

Ja

BUS-BD-02

Ja

GIS extensie is nodig

De CBIS applicatie heeft ook GEO informatie die in Greenplum opgeslagen dient te worden. Om dit mogelijk te maken moet de PostGIS extensie geïmplementeerd worden.

Ja, library implementeren op master


BUS-BD-03

Nee

R Data science package nodig voor Datalab

Om goed data analyses te maken heeft Greenplum een data science packages die het mogelijk maken om R of Python data science  uit te voeren op de opgeslagen data. Het datalab gebruikt op dit moment de R package. Gebruik van puur R en Python is security technisch momenteel onmogelijk binnen het RWS netwerk?!

Nee, SAS oplossing aanwezig



Technische standaarden

ID

Essentieel

Titel

Omschrijving

Voldaan

TES-BD-01

Ja

Virtuele OTA & BM P in 2 zones/datacenters

Bare metals voor segment hosts P , rest is virtueel VM’s voor OTA

Ja

Technische beperkingen

ID

Essentieel

Titel

Omschrijving

Voldaan

TEC-BD-01

Ja

Gebruik Standaard Building Blocks

Er moet gebruik gemaakt worden van de standard infra building blocks en/of diensten.


Ja, nieuwe hardware bouwsteen voor Greenplum afgesproken


\


Toespitsing

Functionele Eisen voor Datawarehouseplatform

Algemeen

Het te selecteren platform moet voldoen aan de volgende functionele specificaties en randvoorwaarden. Het doel is het realiseren van een schaalbare, veilige en toekomstbestendige datawarehouse-omgeving met ondersteuning voor diverse datatypes en analytische workloads.


Functionele Eisen (must-have)

Domein

Functionele eis

Toelichting

Architectuur & Basis

Het platform is gebaseerd op een massively parallel processing (MPP) architectuur.

Vereist om schaalbaar te kunnen werken met zeer grote datasets (>100 TB).


Het platform is gebaseerd op een open-source RDBMS en is volledig ANSI SQL-compatibel.

Voorkomen van vendor lock-in, benutten van PostgreSQL-ecosysteem.

Datatypes & Extensies

Ondersteuning voor relationele, semi-gestructureerde (JSON/XML/arrays) en ongestructureerde data (vector embeddings, tekst, beelden, video).

Eén platform voor alle data.


Native ondersteuning voor geospatiale data-analyse via een GIS-extensie.

Vereist voor locatiedata en geografische analyses.


Uitbreidbaarheid via PostgreSQL-extensies.

Flexibel uitbreiden met community/extensie-functionaliteit.

Partitionering & Indexering

Declaratieve RANGE-, LIST- en HASH-partitionering.

Flexibel data sharden en segmenteren.


Ondersteuning voor meerdere indexstrategieën, incl. B-Tree, Bitmap, BRIN, geospatiale indexen, vector indexen.

Voor optimale query performance.

Beveiliging & Governance

Ondersteuning voor row-level security en dynamische data-masking.

Cruciaal voor multi-user en privacygevoelige omgevingen.


Volledige integratie met bestaande identity- & accessmanagement (LDAP/OAuth/SAML).

Voor centraal gebruikersbeheer.

Deployment & Flexibiliteit

Het platform kan worden uitgerold op bare-metal, virtualisatie (vSphere), private cloud en public cloud.

Voorkomen van cloud lock-in, hybride strategie.


Ondersteuning voor multi-datacenter disaster recovery via log-archivering of replicatie.

Voor hoge beschikbaarheid en RPO/RTO-eisen.

AI & Zoekfunctionaliteit

Ondersteuning voor vector embeddings en semantische zoekopdrachten naast klassieke SQL-queries.

Noodzakelijk voor AI-gedreven use cases.


Ondersteuning voor hybrid search (keywords + embeddings).

Combinatie van klassieke BI en moderne AI-search.

Workload Management

Mogelijkheid tot fijnmazig resource management: CPU, geheugen, disk I/O throttling per workload/gebruiker.

Voor voorspelbare performance in multi-tenant scenario’s.

Openheid & Ecosysteem

Het platform is open-source (bij voorkeur Apache-licentie) en ondersteunt actieve community-ontwikkeling.

Transparantie, innovatie, vermijding van lock-in.


Wenselijke eisen (nice-to-have)

  • Ondersteuning voor UPSERT (MERGE) in SQL.
  • Mogelijkheid tot geavanceerde optimizer hints en automatische indexkeuze.
  • Ondersteuning voor generated columns (afgeleide berekende kolommen).
  • Monitoring & observability geïntegreerd via standaardtools (Prometheus, Grafana, etc.).


Acceptatiecriteria

Het platform wordt als passend beschouwd indien:

  1. Het voldoet aan alle must-have eisen.
  2. Prijs technisch de meest voordelige aanbieding.
  3. Het zo veel mogelijk voldoet aan de wenselijke eisen.
  4. Het platform bewezen schaalbaar is bij minimaal 100 TB analytische workloads in productieomgevingen.
  5. Minimaal 5 referenties kan overleggen van vergelijkbare organisaties met vergelijkbare use cases.


Uitvraag

Een uitvraag sturen richting Greenplum, door de nadruk te leggen op de eigenschappen waarin Greenplum zich onderscheidt of waar het bijzonder sterk is.

Voor het positioneren van Greenplum de nadruk leggen op:

  1. Open-source PostgreSQL MPP basis (brede SQL/extensie compatibiliteit)
  2. Rich datatype support (relationeel, JSON, geospatiaal, vector embeddings)
  3. Geavanceerde partitionering & indexing
  4. Row-level security & governance
  5. Hybride/multi-cloud deployment + disaster recovery
  6. AI/semantische search functionaliteit in SQL-omgeving
  7. Resource management voor enterprise multi-tenancy
  8. Vendor lock-in vermijden (open-source licentie, brede community)


  • Massively Parallel Processing (MPP) met PostgreSQL-ecosysteem
    • Vraag expliciet naar een open-source gebaseerde MPP database die volledig ANSI SQL spreekt.
    • Benadruk dat je PostgreSQL-compatibiliteit wilt, zodat je kunt profiteren van de community, extensies en ontwikkelaarsskills.

Dit elimineert al meteen veel propriëtaire cloud-only oplossingen.


  • Brede datatypes & extensies in één platform
    • Ondersteuning voor relationeel + semi-gestructureerd (JSON/XML/arrays) + ongestructureerd (vector embeddings, tekst, images, video).
    • Native integratie van PostGIS voor geospatiale analyse.
    • Uitbreidbaarheid via PostgreSQL-extensies (pgVector, hyperloglog, fuzzy matching, enz.).

Hiermee onderscheidt Greenplum zich van klassieke warehouses (Redshift, Teradata) die vaak minder flexibel zijn.


  • Geavanceerde partitionering & indexing
    • Vraag naar declaratieve partitionering met RANGE, LIST en HASH.
    • Ondersteuning voor meerdere indexstrategieën: BRIN, Bitmap, geospatiale indexen, vector indexen.

Hier is Greenplum sterk omdat het de brede PostgreSQL indexing-mogelijkheden in een MPP context brengt.


  • Row-level security & governance
    • Specifiek eisen: beveiliging op rij-niveau, masking en multi-tenant scheiding.
    • Dit is cruciaal voor multi-user analytics en streng gereguleerde sectoren (financieel, overheid, zorg).

Greenplum heeft dit natively, waar sommige andere MPP warehouses dit beperkter hebben.


  • Hybride & multi-cloud deployment flexibiliteit
    • Vraag niet alleen om cloud-native SaaS, maar ook on-premises, bare-metal en VMware/vSphere integratie.
    • Ondersteuning voor hybride en multi-datacenter disaster recovery (log archiving, DR-strategie).

Greenplum is hier uniek t.o.v. Snowflake/BigQuery/Redshift, die cloud-only zijn.


  • Geïntegreerde AI & semantische zoekfunctionaliteit
    • Vraag naar native vector embeddings & semantische search gecombineerd met klassieke SQL-analytics.
    • Hybride search (keyword + embedding) in één engine.

Greenplum 7 onderscheidt zich door AI/semantische zoekfunctionaliteit binnen een MPP warehouse.


  • Resource Management & Workload Isolation
    • Eisen voor fijnmazige resource allocatie: CPU, geheugen, I/O throttling.
    • Multi-workload concurrency met voorspelbare performance.

Dit is belangrijk in omgevingen waar meerdere teams/domeinen dezelfde omgeving delen.


  • Open Source & Vendor Neutrality
    • Vraag naar geen lock-in: open source, brede PostgreSQL-compatibiliteit en mogelijkheid tot self-managed of vendor-supported.

Greenplum is open-source (Apache 2.0), wat je als harde eis kunt formuleren als je vendor lock-in wilt vermijden.





Mirror provenance
Mirror source
confluence/spaces/INFRAARCH/pages/194882367/page.metadata.json
Storage source
confluence/spaces/INFRAARCH/pages/194882367/page.storage.xhtml
Access
Committed snapshot only