On this page
Dienstbeschrijving
De dienst AI Cluster optimaliseert een Kubernetes‑cluster voor AI/ML‑taken met GPU’s en geavanceerd resourcebeheer. De dienst levert een beheerd platform voor training, fine‑tuning en inference (batch/real‑time), inclusief notebooks, pipelines, model serving en data‑/security‑controls. RWS positioneert OpenShift AI als het primaire MLOps/MLOps‑laag bovenop OpenShift.
Doel en scope
In scope: GPU‑enablement (drivers/operators), queueing & scheduling, distributed training (NCCL/MPI/Ray‑achtig), model serving, notebooks/pipelines, dataset‑/artifactbeheer, policy‑as‑code, observability/FinOps en edge‑inference.
Niet in scope: ontwikkeling van basis‑AI‑modellen buiten platformdoeleinden, commerciële modellicenties/hosting buiten RWS‑beleid.
Waardepropositie
Prestatie & densiteit: optimale benutting van GPU/CPU/RAM met veilige sharing (MIG/vGPU waar passend).
Snel naar waarde: gestandaardiseerde ‘golden paths’ voor notebooks→pipeline→serving.
Veilig & compliant: supply‑chain‑borging voor images/model‑artefacten, RBAC/isolatie en audit‑evidence.
Hybride & edge‑klaar: inference dicht bij de bron; disconnected profielen met mirrors.
Dienstonderdelen
GPU‑platformlaag: GPU‑drivers/operators, Node Feature Discovery (NFD), device plugins.
AI‑werklaaggereedschap: OpenShift AI (notebooks, pipelines, model serving/registry), KServe voor inference, queueing/priority.
Data & storage: snelle storageklassen, object storage, dataset lifecycle en NVMe‑scratch.
Security & compliance: image/model signing, secrets/PKI, netwerksegmentatie en audit.
Observability & FinOps: GPU/DCGM‑metrics, SLO’s, kosten/energie‑inzichten.
Functionele Specificaties
Onderstaande eisen beschrijven wat de dienst levert. AC = acceptatiecriteria.
GPU‑enablement & hardware
FS‑GPU‑001 GPU Operator & drivers
Eis: Installatie en beheer van GPU‑drivers via vendor‑operator (waaronder NVIDIA/AMD/Intel) inclusief DCGM‑exporter en device plugins.
AC: Nieuwe GPU‑node Ready ≤ 15 min; DCGM‑metrics zichtbaar; driverversies geaudit.FS‑GPU‑002 NFD & labeling
Eis: Node Feature Discovery (NFD) labelt CPU/GPU/NIC‑kenmerken en exposeert capabilities (MIG/vGPU/RDMA).
AC: 100% nodes gelabeld ≤ 5 min na join; scheduling gebruikt labels.FS‑GPU‑003 MIG/vGPU & isolatie
Eis: Optionele MIG/vGPU profielen met harde isolatie en quota per tenant.
AC: Geen cross‑tenant interferentie in tests; utilisation binnen ingestelde band.
Scheduling, queueing & resourcebeheer
FS‑SCH‑001 GPU‑aware scheduling
Eis: Scheduling op GPU‑resourceclasses en affiniteit/anti‑affinity; topology spread.
AC: 0% misplaatsingen in canary; P95 wachttijd binnen target bij normaal aanbod.FS‑SCH‑002 Job‑queueing & fairness
Eis: Queueing/priority (bijv. Kueue/Volcano‑achtig) met fair‑share en preemption‑regels.
AC: SLA op wachttijden gehaald; geen starvation.FS‑SCH‑003 Rightsizing & auto‑tuning
Eis: Periodieke aanbevelingen voor requests/limits, batch‑slots en num_workers.
AC: ≥ 90% aanbevelingen verwerkt binnen 30 dagen; kosten/latency verbetert aantoonbaar.
AI/MLOps‑laag (OpenShift AI)
FS‑AI‑001 Notebooks & werkruimten
Eis: Multi‑tenant notebook servers met GPU‑profiles, persistent home en image catalogs.
AC: P95 opstarttijd ≤ 60 s; 0 plaintext secrets in images.FS‑AI‑002 Pipelines & reproducibility
Eis: Declaratieve pipelines met artifact‑tracking; runs herhaalbaar via Git/parameters.
AC: Run is reproduceerbaar met gelijk resultaat (binnen tolerantie) en herkomst‑trace aanwezig.FS‑AI‑003 Model serving (KServe)
Eis: Realtime/batch serving met canary, autoscaling en scale‑to‑zero; GPU‑serving waar nodig.
AC: P95 latency binnen SLO; rollback < 2 min; cold‑start ≤ 5 s (referentie‑model).FS‑AI‑004 Model registry & governance
Eis: Registratie van modellen, versies, metadata en policies (retentie/gebruik/labels).
AC: 100% productie‑modellen geregistreerd; audit‑log volledig.
Data, storage & netwerk
FS‑DATA‑001 Storageprofielen
Eis: High‑throughput block/file, object storage en NVMe‑scratch voor staging; encryptie at‑rest.
AC: IO‑benchmarks binnen SLO; PVC‑binding slaagt; cleanup na job.FS‑DATA‑002 Datalocaliteit & caching
Eis: Dataset‑caching en pre‑stage naar nodes; beleid voor grote artefacten.
AC: TTFB/training‑warmup verbetert ≥ 20% t.o.v. baseline.FS‑NET‑001 RDMA/GPUDirect (optioneel)
Eis: Ondersteuning voor RDMA/GPUDirect en SR‑IOV voor distributed training.
AC: Throughput/latency haalt profiel‑targets; isolatie bevestigd.
Security, supply chain & privacy
FS‑SEC‑001 Image/model signing
Eis: Gesigneerde container‑ en model‑artefacten; SBOM/attestaties verplicht.
AC: Niet‑ondertekende artefacten geweigerd; evidence beschikbaar.FS‑SEC‑002 IAM/RBAC & secrets
Eis: SSO/RBAC per tenant; secrets via KMS/Vault; workload identity waar beschikbaar.
AC: 0 plaintext secrets; periodieke recertificatie rechten.FS‑SEC‑003 Netwerk & data‑policies
Eis: Default‑deny NetworkPolicies, egress‑controle en dataclassificatie‑labels.
AC: Pentest zonder kritieke bevindingen; labeling compleet.
Observability, SLO’s & FinOps
FS‑OBS‑001 GPU/AI‑dashboards
Eis: Dashboards met GPU‑utilisation, memory, ECC‑errors, job‑wachttijden en model‑latency.
AC: Telemetrie‑gap < 60 s; MTTD < 5 min; retentie ≥ 13 mnd.FS‑FIN‑001 Kosten/energie
Eis: Integratie met Kostbeheer (OpenCost voor allocatie; Kepler voor kWh) en budgetten/alerts per tenant/job.
AC: Maandrapport automatisch; afwijkingen >10% gemarkeerd.
Edge/disconnected & DR
FS‑EDGE‑001 Edge‑inference
Eis: Model serving op edge‑sites met lokale mirrors; delayed sync.
AC: Geen dataverlies bij 48 uur offline; resync < 15 min.FS‑DR‑001 Artefacten & reproducibility
Eis: Back‑up/retentie van modellen/artefacten en herhaalbare pipelines; DR‑runbooks.
AC: DR‑test slaagt ≥ 99%; RTO/RPO conform app‑tier.
Roadmaps
Mijlpaal 1
Baseline OpenShift AI: installatie en eerste tenants; GPU Operator + NFD; notebook‑catalogus; KServe voor inference; dashboards (DCGM, latency) en policy‑bundels (BIO/CIS).
Data & storage: NVMe‑scratchprofielen; object storage voor artefacten/datasets; rechten/labels ingericht.
Mijlpaal 2
Productie‑adoptie: multi‑tenant notebooks/pipelines; job‑queueing/fairness; distributed training (NCCL/MPI/Ray‑achtig); FinOps‑koppeling (OpenCost/Kepler).
Model governance: registry/verplichte metadata; canary/rollback‑patronen en SLO’s per dienst.
Mijlpaal 3
Geavanceerde optimalisatie: MIG/vGPU‑sharing; RDMA/GPUDirect profielen; predictive autoscaling en rightsizing‑PR’s.
Edge‑inference: gestandaardiseerde profielen en offline distributie.
Mijlpaal 4
Volwassenheidsfase: self‑tuning AI‑cluster met policy‑optimalisatie, federatieve scenario’s (waar toegestaan) en standaard evidence‑pakketten.
Golden paths: referentie‑architecturen voor training/inference en data‑pijplijnen per domein.
SAK | Waarom van toepassing (kort) | ABB-referentie (FS) |
|---|---|---|
Identity & Access Management v1.1 | SSO/RBAC per tenant, JIT/PAM voor beheer, volledige audittrail bij notebooks/pipelines/serving. | FS-SEC-002, FS-AI-001/002/003/004 |
Remote Access Management v1.0 | Beveiligde toegang tot admin-paden, notebooks en serving-endpoints met MFA/PAM en sessielogging. | FS-SEC-002, FS-OBS-001 |
Cryptografie Management v1.1 | TLS/mTLS, keys/certs via KMS/Vault, image- én model-signing/attestaties met rotatie. | FS-SEC-001, FS-SEC-002 |
Secure Software & System Lifecycle v1.0 | Declaratieve pipelines, reproducibility, Git-herkomst en gecontroleerde promoties/rollbacks. | FS-AI-002, FS-AI-003, FS-DR-001 |
Vulnerability Management v1.1 | CVE-scans/gating op container- en model-artefacten vóór productie; SBOM-dekking. | FS-SEC-001 |
Patch Management v1.1 | Gecontroleerde updates van GPU-drivers/operators en AI-runtimes met rollback. | FS-GPU-001, FS-AI-003 |
Technical Compliance Management v1.1 | Policy-as-code (BIO/AVG/CIS), netwerk/datacontroles en aantoonbare compliance/evidence. | FS-SEC-003, FS-SEC-001, FS-OBS-001 |
Security Monitoring v1.1 | DCGM/GPU-metrics, job-wachttijden en model-latency naar observability/SIEM; alerts & dashboards. | FS-OBS-001 |
Content Security Management v1.1 | Governance over SBOMs, model registry/metadata en audit-exports met retentie. | FS-AI-004, FS-SEC-001, FS-OBS-001 |
Disaster Recovery v1.1 | Back-up/retentie van modellen/artefacten en herstelbare pipelines; getest DR-runbook. | FS-DR-001 |
Isolatie v1.1 | Tenant-isolatie via MIG/vGPU, default-deny NetworkPolicies en egress-controle. | FS-GPU-003, FS-SEC-003 |
MK-koppelvlakken v1.1 | Integraties met CMDB/ITSM/Kostbeheer en (edge)-distributie; lifecycle-sporen. | FS-AI-004, FS-FIN-001, FS-EDGE-001 |
Endpoint Security v1.0 | (Waar passend) EDR/host-hardening op GPU/CPU-nodes met centrale zichtbaarheid. | FS-OBS-001 |
Threat Intelligence v1.0 | Vendor-advisories (drivers/firmware) sturen driver-matrix, gating en uitrolvensters. | FS-GPU-001, FS-SEC-001 |
Landingslocaties
Waar de architectuuronderdelen landen binnen de infrastructuur, dit kan bijvoorbeeld een externe commerciële cloud zijn, een private cloud of een Rijkscloud. Hiervoor wordt de definitie in de ICT Strategie gebruikt.
Beschikbare SBBs
Een overzicht van de oplossingen die beschikbaar zijn vanuit dit ABB en de beschrijving van de diensten die daarmee worden geleverd. Vul dit in wanneer de SBBs bekend zijn.
Koppelvlakken
Interfaces en afhankelijkheden tussen verschillende architectuurelementen. Dit zijn bijvoorbeeld de protocollen die kunnen worden gebruikt door andere bouwblokken die gebruik maken van het ABB.
Afhankelijkheden
Beschrijving waar dit ABB van afhankelijk is of welke ABBs afhankelijk zijn van het ABB. Dit geldt ook voor de verschillende serviceketens. Geef dit aan met links naar de architectuur elementen.
EIRA Koppeling
Dit bouwblok is gekoppeld binnen de EIRA aan: Vul hier de EIRA koppeling in.
Een overzicht van alle relevante EIRA bouwblokken staan hier: EIRA Technology & Physical
Mirror provenance
- Mirror source
- confluence/spaces/INFRAARCH/pages/194878898/page.metadata.json
- Storage source
- confluence/spaces/INFRAARCH/pages/194878898/page.storage.xhtml
- Access
- Committed snapshot only