Confluence workbench mirror

ABB: 2.2.0.7 AI Cluster

Guarded rendering from the committed top-level `confluence/` mirror. No live source, personal data, or write action is available.

Kind
ABB
Version
2
Labels
0
Children
0
On this page
  1. Dienstbeschrijving
  2. Doel en scope
  3. Waardepropositie
  4. Dienstonderdelen
  5. Functionele Specificaties
  6. GPU‑enablement & hardware
  7. Scheduling, queueing & resourcebeheer
  8. AI/MLOps‑laag (OpenShift AI)
  9. Data, storage & netwerk
  10. Security, supply chain & privacy
  11. Observability, SLO’s & FinOps
  12. Edge/disconnected & DR

Dienstbeschrijving

De dienst AI Cluster optimaliseert een Kubernetes‑cluster voor AI/ML‑taken met GPU’s en geavanceerd resourcebeheer. De dienst levert een beheerd platform voor training, fine‑tuning en inference (batch/real‑time), inclusief notebooks, pipelines, model serving en data‑/security‑controls. RWS positioneert OpenShift AI als het primaire MLOps/MLOps‑laag bovenop OpenShift.

Doel en scope

  • In scope: GPU‑enablement (drivers/operators), queueing & scheduling, distributed training (NCCL/MPI/Ray‑achtig), model serving, notebooks/pipelines, dataset‑/artifactbeheer, policy‑as‑code, observability/FinOps en edge‑inference.

  • Niet in scope: ontwikkeling van basis‑AI‑modellen buiten platformdoeleinden, commerciële modellicenties/hosting buiten RWS‑beleid.

Waardepropositie

  • Prestatie & densiteit: optimale benutting van GPU/CPU/RAM met veilige sharing (MIG/vGPU waar passend).

  • Snel naar waarde: gestandaardiseerde ‘golden paths’ voor notebooks→pipeline→serving.

  • Veilig & compliant: supply‑chain‑borging voor images/model‑artefacten, RBAC/isolatie en audit‑evidence.

  • Hybride & edge‑klaar: inference dicht bij de bron; disconnected profielen met mirrors.

Dienstonderdelen

  1. GPU‑platformlaag: GPU‑drivers/operators, Node Feature Discovery (NFD), device plugins.

  2. AI‑werklaaggereedschap: OpenShift AI (notebooks, pipelines, model serving/registry), KServe voor inference, queueing/priority.

  3. Data & storage: snelle storageklassen, object storage, dataset lifecycle en NVMe‑scratch.

  4. Security & compliance: image/model signing, secrets/PKI, netwerksegmentatie en audit.

  5. Observability & FinOps: GPU/DCGM‑metrics, SLO’s, kosten/energie‑inzichten.

Functionele Specificaties

Onderstaande eisen beschrijven wat de dienst levert. AC = acceptatiecriteria.

GPU‑enablement & hardware

  • FS‑GPU‑001 GPU Operator & drivers
    Eis: Installatie en beheer van GPU‑drivers via vendor‑operator (waaronder NVIDIA/AMD/Intel) inclusief DCGM‑exporter en device plugins.
    AC: Nieuwe GPU‑node Ready ≤ 15 min; DCGM‑metrics zichtbaar; driverversies geaudit.

  • FS‑GPU‑002 NFD & labeling
    Eis: Node Feature Discovery (NFD) labelt CPU/GPU/NIC‑kenmerken en exposeert capabilities (MIG/vGPU/RDMA).
    AC: 100% nodes gelabeld ≤ 5 min na join; scheduling gebruikt labels.

  • FS‑GPU‑003 MIG/vGPU & isolatie
    Eis: Optionele MIG/vGPU profielen met harde isolatie en quota per tenant.
    AC: Geen cross‑tenant interferentie in tests; utilisation binnen ingestelde band.

Scheduling, queueing & resourcebeheer

  • FS‑SCH‑001 GPU‑aware scheduling
    Eis: Scheduling op GPU‑resourceclasses en affiniteit/anti‑affinity; topology spread.
    AC: 0% misplaatsingen in canary; P95 wachttijd binnen target bij normaal aanbod.

  • FS‑SCH‑002 Job‑queueing & fairness
    Eis: Queueing/priority (bijv. Kueue/Volcano‑achtig) met fair‑share en preemption‑regels.
    AC: SLA op wachttijden gehaald; geen starvation.

  • FS‑SCH‑003 Rightsizing & auto‑tuning
    Eis: Periodieke aanbevelingen voor requests/limits, batch‑slots en num_workers.
    AC: ≥ 90% aanbevelingen verwerkt binnen 30 dagen; kosten/latency verbetert aantoonbaar.

AI/MLOps‑laag (OpenShift AI)

  • FS‑AI‑001 Notebooks & werkruimten
    Eis: Multi‑tenant notebook servers met GPU‑profiles, persistent home en image catalogs.
    AC: P95 opstarttijd ≤ 60 s; 0 plaintext secrets in images.

  • FS‑AI‑002 Pipelines & reproducibility
    Eis: Declaratieve pipelines met artifact‑tracking; runs herhaalbaar via Git/parameters.
    AC: Run is reproduceerbaar met gelijk resultaat (binnen tolerantie) en herkomst‑trace aanwezig.

  • FS‑AI‑003 Model serving (KServe)
    Eis: Realtime/batch serving met canary, autoscaling en scale‑to‑zero; GPU‑serving waar nodig.
    AC: P95 latency binnen SLO; rollback < 2 min; cold‑start ≤ 5 s (referentie‑model).

  • FS‑AI‑004 Model registry & governance
    Eis: Registratie van modellen, versies, metadata en policies (retentie/gebruik/labels).
    AC: 100% productie‑modellen geregistreerd; audit‑log volledig.

Data, storage & netwerk

  • FS‑DATA‑001 Storageprofielen
    Eis: High‑throughput block/file, object storage en NVMe‑scratch voor staging; encryptie at‑rest.
    AC: IO‑benchmarks binnen SLO; PVC‑binding slaagt; cleanup na job.

  • FS‑DATA‑002 Datalocaliteit & caching
    Eis: Dataset‑caching en pre‑stage naar nodes; beleid voor grote artefacten.
    AC: TTFB/training‑warmup verbetert ≥ 20% t.o.v. baseline.

  • FS‑NET‑001 RDMA/GPUDirect (optioneel)
    Eis: Ondersteuning voor RDMA/GPUDirect en SR‑IOV voor distributed training.
    AC: Throughput/latency haalt profiel‑targets; isolatie bevestigd.

Security, supply chain & privacy

  • FS‑SEC‑001 Image/model signing
    Eis: Gesigneerde container‑ en model‑artefacten; SBOM/attestaties verplicht.
    AC: Niet‑ondertekende artefacten geweigerd; evidence beschikbaar.

  • FS‑SEC‑002 IAM/RBAC & secrets
    Eis: SSO/RBAC per tenant; secrets via KMS/Vault; workload identity waar beschikbaar.
    AC: 0 plaintext secrets; periodieke recertificatie rechten.

  • FS‑SEC‑003 Netwerk & data‑policies
    Eis: Default‑deny NetworkPolicies, egress‑controle en dataclassificatie‑labels.
    AC: Pentest zonder kritieke bevindingen; labeling compleet.

Observability, SLO’s & FinOps

  • FS‑OBS‑001 GPU/AI‑dashboards
    Eis: Dashboards met GPU‑utilisation, memory, ECC‑errors, job‑wachttijden en model‑latency.
    AC: Telemetrie‑gap < 60 s; MTTD < 5 min; retentie ≥ 13 mnd.

  • FS‑FIN‑001 Kosten/energie
    Eis: Integratie met Kostbeheer (OpenCost voor allocatie; Kepler voor kWh) en budgetten/alerts per tenant/job.
    AC: Maandrapport automatisch; afwijkingen >10% gemarkeerd.

Edge/disconnected & DR

  • FS‑EDGE‑001 Edge‑inference
    Eis: Model serving op edge‑sites met lokale mirrors; delayed sync.
    AC: Geen dataverlies bij 48 uur offline; resync < 15 min.

  • FS‑DR‑001 Artefacten & reproducibility
    Eis: Back‑up/retentie van modellen/artefacten en herhaalbare pipelines; DR‑runbooks.
    AC: DR‑test slaagt ≥ 99%; RTO/RPO conform app‑tier.

Roadmaps

Mijlpaal 1

  • Baseline OpenShift AI: installatie en eerste tenants; GPU Operator + NFD; notebook‑catalogus; KServe voor inference; dashboards (DCGM, latency) en policy‑bundels (BIO/CIS).

  • Data & storage: NVMe‑scratchprofielen; object storage voor artefacten/datasets; rechten/labels ingericht.

Mijlpaal 2

  • Productie‑adoptie: multi‑tenant notebooks/pipelines; job‑queueing/fairness; distributed training (NCCL/MPI/Ray‑achtig); FinOps‑koppeling (OpenCost/Kepler).

  • Model governance: registry/verplichte metadata; canary/rollback‑patronen en SLO’s per dienst.

Mijlpaal 3

  • Geavanceerde optimalisatie: MIG/vGPU‑sharing; RDMA/GPUDirect profielen; predictive autoscaling en rightsizing‑PR’s.

  • Edge‑inference: gestandaardiseerde profielen en offline distributie.

Mijlpaal 4

  • Volwassenheidsfase: self‑tuning AI‑cluster met policy‑optimalisatie, federatieve scenario’s (waar toegestaan) en standaard evidence‑pakketten.

  • Golden paths: referentie‑architecturen voor training/inference en data‑pijplijnen per domein.

SAK

Waarom van toepassing (kort)

ABB-referentie (FS)

Identity & Access Management v1.1

SSO/RBAC per tenant, JIT/PAM voor beheer, volledige audittrail bij notebooks/pipelines/serving.

FS-SEC-002, FS-AI-001/002/003/004

Remote Access Management v1.0

Beveiligde toegang tot admin-paden, notebooks en serving-endpoints met MFA/PAM en sessielogging.

FS-SEC-002, FS-OBS-001

Cryptografie Management v1.1

TLS/mTLS, keys/certs via KMS/Vault, image- én model-signing/attestaties met rotatie.

FS-SEC-001, FS-SEC-002

Secure Software & System Lifecycle v1.0

Declaratieve pipelines, reproducibility, Git-herkomst en gecontroleerde promoties/rollbacks.

FS-AI-002, FS-AI-003, FS-DR-001

Vulnerability Management v1.1

CVE-scans/gating op container- en model-artefacten vóór productie; SBOM-dekking.

FS-SEC-001

Patch Management v1.1

Gecontroleerde updates van GPU-drivers/operators en AI-runtimes met rollback.

FS-GPU-001, FS-AI-003

Technical Compliance Management v1.1

Policy-as-code (BIO/AVG/CIS), netwerk/datacontroles en aantoonbare compliance/evidence.

FS-SEC-003, FS-SEC-001, FS-OBS-001

Security Monitoring v1.1

DCGM/GPU-metrics, job-wachttijden en model-latency naar observability/SIEM; alerts & dashboards.

FS-OBS-001

Content Security Management v1.1

Governance over SBOMs, model registry/metadata en audit-exports met retentie.

FS-AI-004, FS-SEC-001, FS-OBS-001

Disaster Recovery v1.1

Back-up/retentie van modellen/artefacten en herstelbare pipelines; getest DR-runbook.

FS-DR-001

Isolatie v1.1

Tenant-isolatie via MIG/vGPU, default-deny NetworkPolicies en egress-controle.

FS-GPU-003, FS-SEC-003

MK-koppelvlakken v1.1

Integraties met CMDB/ITSM/Kostbeheer en (edge)-distributie; lifecycle-sporen.

FS-AI-004, FS-FIN-001, FS-EDGE-001

Endpoint Security v1.0

(Waar passend) EDR/host-hardening op GPU/CPU-nodes met centrale zichtbaarheid.

FS-OBS-001

Threat Intelligence v1.0

Vendor-advisories (drivers/firmware) sturen driver-matrix, gating en uitrolvensters.

FS-GPU-001, FS-SEC-001


 


Landingslocaties

Waar de architectuuronderdelen landen binnen de infrastructuur, dit kan bijvoorbeeld een externe commerciële cloud zijn, een private cloud of een Rijkscloud. Hiervoor wordt de definitie in de ICT Strategie gebruikt.

Beschikbare SBBs 

Een overzicht van de oplossingen die beschikbaar zijn vanuit dit ABB en de beschrijving van de diensten die daarmee worden geleverd. Vul dit in wanneer de SBBs bekend zijn.

Koppelvlakken

Interfaces en afhankelijkheden tussen verschillende architectuurelementen. Dit zijn bijvoorbeeld de protocollen die kunnen worden gebruikt door andere bouwblokken die gebruik maken van het ABB.


Afhankelijkheden

Beschrijving waar dit ABB van afhankelijk is of welke ABBs afhankelijk zijn van het ABB. Dit geldt ook voor de verschillende serviceketens. Geef dit aan met links naar de architectuur elementen.

EIRA Koppeling

Dit bouwblok is gekoppeld binnen de EIRA aan: Vul hier de EIRA koppeling in.

Een overzicht van alle relevante EIRA bouwblokken staan hier: EIRA Technology & Physical


Mirror provenance
Mirror source
confluence/spaces/INFRAARCH/pages/194878898/page.metadata.json
Storage source
confluence/spaces/INFRAARCH/pages/194878898/page.storage.xhtml
Access
Committed snapshot only