Confluence workbench mirror

ABB: 2.1.9 High-Performance Accelerated Computing (HPC)

Guarded rendering from the committed top-level `confluence/` mirror. No live source, personal data, or write action is available.

Kind
ABB
Version
2
Labels
0
Children
0
On this page
  1. Dienstbeschrijving
  2. Doel en scope
  3. Waardepropositie
  4. Dienstonderdelen
  5. Servicelevels (richtwaarden)
  6. Functionele Specificaties
  7. Hardwarepools, labels & plaatsing
  8. Operators, drivers & runtime
  9. Scheduling, quotas & service‑modellen
  10. Data, storage & netwerk
  11. VDI met GPU
  12. Observability, security & FinOps

Dienstbeschrijving

De dienst High-Performance Accelerated Computing (HPC) biedt krachtige rekenkracht (GPU/CPU) voor intensieve workloads zoals AI/ML-trainings- en inferentietaken, data-analyse, visualisatie, simulatie en modellering. De dienst is containergebaseerd op Kubernetes/OpenShift en ondersteunt GPU-operators/drivers(NVIDIA/AMD/Intel), DGX-class nodes en VDI’s met GPU voor interactieve 3D/GIS/CAD‑scenario’s.

Doel en scope

  • In scope: GPU/CPU‑nodepools (DC/edge), device plugins/operators, driver- en firmwarebeheer, resource classes/quotas, high‑performance networking (RDMA/RoCEv2/InfiniBand waar beschikbaar), high‑throughput storage (NVMe/scratch), en observability/FinOps.

  • Niet in scope: applicatiecode/algoritmes, klassieke HPC‑batch zonder Kubernetes (bijv. pure bare‑metal Slurm), en niet‑goedgekeurde on‑prem AI appliances buiten standaard hardwareprofielen.

Waardepropositie

  • Prestatie & schaal: geoptimaliseerde GPU/CPU‑pools, MIG/vGPU/time‑slicing en snelle IO/NET.

  • Veilig & compliant: policy‑as‑code, gesigneerde drivers/images, isolatie per tenant, BIO/AVG‑conform.

  • Snel naar productie: golden paths voor AI/ML (notebooks, jobs, serving) en VDI‑workspaces met GPU.

  • Transparant: kosten- en verbruiksinzichten per namespace/tenant; SLO/KPI‑dashboards.

Dienstonderdelen

  1. Compute‑pools: GPU‑geaccelereerde en CPU‑intensieve nodepools (o.a. DGX/Instinct/Intel GPU).

  2. Operators & drivers: vendor device plugins en GPU Operators (NVIDIA/AMD/Intel) inclusief DCGM/telemetrie.

  3. Data & storage: NVMe‑scratch, parallel/hoog‑throughput filesystems, integratie met SmartFiles/S3.

  4. Netwerk: 25–100GbE, RDMA/RoCEv2/InfiniBand waar beschikbaar, pod‑niveau QoS en NUMA‑bewuste plaatsing.

  5. VDI met GPU: virtuele desktops/apps met vGPU/passthrough voor interactieve workloads.

  6. Observability/FinOps: metriek, profiling, energie/temperatuur‑signalen en charge/showback.

  7. Security/compliance: image signing/SBOM, secrets via KMS/Vault, isolatie (MIG/vGPU), SIEM‑logging.

Servicelevels (richtwaarden)

KenmerkRichtwaarde
Beschikbaarheid platform≥ 99,9% (excl. aangekondigd onderhoud)
GPU‑job wachtrij P50/P95 (bij normale bezetting)< 2 / < 10 min
Driver/stack update naar productie≤ 10 werkdagen (na validatie)
Telemetrie‑latentie (GPU health/DCGM)≤ 60 s

Functionele Specificaties

Onderstaande eisen beschrijven wat de dienst levert. AC = acceptatiecriteria.

Hardwarepools, labels & plaatsing

  • FS‑HW‑001 Node features & labels
    Eis: Automatische labeling via NFD (GPU‑type, vRAM, compute capability, NIC/RDMA, NUMA, storage).
    AC: Labels beschikbaar ≤ 5 min na node‑join; 0% misplaatsing in canary‑tests.

  • FS‑HW‑002 Poolprofielen & isolatie
    Eis: GPU‑pools (train/infer, MIG/vGPU, low‑latency) en CPU‑HPC‑pools met taints/affinity.
    AC: Workloads landen uitsluitend op compatibele pools; P95 latency binnen afgesproken SLO.

  • FS‑HW‑003 MIG/vGPU/time‑slicing
    Eis: Ondersteuning voor MIG‑partities, vGPU‑profielen en (waar zinvol) time‑slicing.
    AC: Isolatie‑tests tonen geen cross‑tenant resource‑leaks; performance binnen 10% van profiel‑SLO.

Operators, drivers & runtime

  • FS‑DRV‑001 GPU Operators (NVIDIA/AMD/Intel)
    Eis: Beheer van drivers, device plugins en runtime‑bibliotheken via vendor GPU Operators.
    AC: Rollout/rollback zonder downtime van niet‑betrokken workloads; health‑checks groen.

  • FS‑DRV‑002 Driver‑/kernel‑matrix
    Eis: Gekwalificeerde combinaties (driver + kernel + container runtime/CUDA/ROCm/oneAPI).
    AC: Preflight blokkeert mismatch; 100% herleidbaarheid van driverstack per workload.

  • FS‑DRV‑003 Container images & frameworks
    Eis: Goedgekeurde, gesigneerde AI/ML‑images (bijv. PyTorch/TensorFlow/ONNX Runtime) met SBOM.
    AC: Geen kritieke CVE’s (CVSS ≥ 7) bij release; SBOM publiek binnen RWS.

Scheduling, quotas & service‑modellen

  • FS‑SCH‑001 Resource classes
    Eis: Standaard resource requests/limits voor GPU/CPU/RAM, inclusief vendor‑resources (device plugins).
    AC: Admission policies weigeren onbeperkte requests; quota per tenant enforced.

  • FS‑SCH‑002 Batch/queue integratie
    Eis: Ondersteuning voor batch/queue (bijv. Kueue‑achtig) en prioriteiten/pre‑emption.
    AC: Jobs met hogere prioriteit starten binnen afgesproken window; pre‑emptie logt root‑cause.

  • FS‑SCH‑003 Job‑/serving‑patronen
    Eis: Golden paths voor notebooks (Jupyter), batch jobs en model serving (REST/gRPC).
    AC: Templates in Git; smoke‑tests slagen vóór promotie naar PRD.

Data, storage & netwerk

  • FS‑DATA‑001 NVMe scratch & parallel I/O
    Eis: Per‑pod scratch met hoge IOPS en (optioneel) parallel filesystem voor grootschalige data.
    AC: P95 IO‑latency binnen SLO; cleans up na job‑einde.

  • FS‑NET‑001 RDMA/RoCE/IB
    Eis: Optionele RDMA‑paden, jumbo MTU, CPU‑offload waar ondersteund.
    AC: Bandbreedte/latency‑tests halen target; fallback naar TCP wanneer nodig.

VDI met GPU

  • FS‑VDI‑001 vGPU/passthrough profielen
    Eis: VDI‑platform met vGPU‑/passthrough‑profielen voor GIS/CAD/visualisatie.
    AC: P95 frame latency binnen SLO; profielen koppelbaar aan tenant/app‑policy.

  • FS‑VDI‑002 Beeld/stream beveiliging
    Eis: TLS‑versleuteling, scherm‑watermerk (optioneel), clipboard/USB‑policies.
    AC: Compliance‑scan zonder kritieke bevindingen; SIEM‑events bij policy‑overtreding.

Observability, security & FinOps

  • FS‑OBS‑001 GPU‑telemetrie
    Eis: Metrics (utilization, memory, temperature, power) via DCGM/tegenreferenties; dashboards en alerts.
    AC: Telemetrie‑gap < 60 s; alert‑MTTD < 5 min voor kritieke events.

  • FS‑SEC‑001 Supply chain & secrets
    Eis: Image signing/attestaties, driver‑hash‑validatie, secrets via KMS/Vault.
    AC: Deploy zonder geldige handtekening wordt geblokkeerd; 0 plaintext secrets.

  • FS‑FIN‑001 Kosteninzicht
    Eis: Showback/chargeback per tenant (GPU‑tijd, CPU‑tijd, storage, egress).
    AC: Maandrapport automatisch; afwijkingen >10% ten opzichte van forecast gemarkeerd.

Edge/OT‑geschiktheid

  • FS‑EDGE‑001 Disconnected profiel
    Eis: Lokale mirrors/caches en beperkte WAN‑modus voor inferentie aan de rand.
    AC: Model serving blijft functioneren ≥ 48 uur zonder WAN; resync na herstel.

Roadmaps

Mijlpaal 1

  • Pilot NVIDIA GPU Operator op geselecteerde clusters, inclusief DCGM/telemetrie en basis MIG‑profielen.

  • DGX‑nodes ingebed in GPU‑pool; gouden images voor AI/ML frameworks met signing/SBOM.

  • VDI met GPU: pilot vGPU/passthrough‑profielen voor GIS/CAD/3D in Twin‑DC.

Mijlpaal 2

  • AMD/Intel GPU‑ondersteuning: uitrol van AMD ROCm‑stack en Intel GPU Operator/oneAPI waar hardware dit ondersteunt.

  • RDMA/RoCEv2 enablement op HPC‑pools; NVMe‑scratch standaardiseren; batch/queue (Kueue‑achtig) introduceren.

  • Uitrol golden paths voor notebooks, batch en serving; FinOps‑dashboards.

Mijlpaal 3

  • Fleet‑brede orchestration: multi‑cluster GPU scheduling, automatische canary‑driverrollouts en rollback.

  • VDI‑opschaling met profielbeheer en policy‑gedreven toewijzing; energie‑/temperatuurbewuste scheduling.

Mijlpaal 4

  • Volwassenheidsfase: voorspellende planning (demand forecasting), self‑healing drivers/stacks, en vendor‑agnostische policy‑profielen.

  • Uitbreiding naar edge‑inferentie met disconnected profielen en model lifecycle‑automatisering.

 

SAK

Waarom van toepassing (kort)

ABB-referentie (FS)

Identity & Access Management v1.1

RBAC/SSO/MFA voor beheer van GPU-operators, pools en quotas; JIT/PAM voor admin-taken; alle acties herleidbaar.

FS-DRV-001, FS-SCH-001/002, FS-OBS-001

Remote Access Management v1.0

Beveiligde toegang (MFA/PAM) tot GPU-VDI en admin-paden; sessielogging/audit.

FS-VDI-001/002, FS-OBS-001

Cryptografie Management v1.1

TLS/mTLS voor services/telemetrie; signing/attestatie van drivers/images; sleutel-/cert-rotatie via KMS/HSM.

FS-SEC-001, FS-DRV-003

Content Security Management v1.1

Image-scanning & SBOM; policy-gating op handtekening/attestaties; audit-evidence.

FS-DRV-003, FS-SEC-001

Secure Software & System Lifecycle v1.0

Golden paths voor notebooks/batch/serving in Git; pipelines met preflight (driver/kernel-matrix) en approvals.

FS-SCH-003, FS-DRV-002

Vulnerability Management v1.1

Continue CVE-scans op AI/ML-images en driver-stacks; auto-gating vóór productie.

FS-DRV-003, FS-SEC-001

Patch Management v1.1

Gecontroleerde driver/kernel/runtime rollouts/rollback; update naar productie ≤ 10 werkdagen na validatie.

FS-DRV-001, FS-DRV-002

Technical Compliance Management v1.1

Policy-as-code voor poolprofielen, isolatie en SLO’s; compliance-rapportage en exceptions.

FS-HW-002/003, FS-SCH-001, FS-OBS-001

Security Monitoring v1.1

DCGM/GPU-telemetrie (utilization, temp, power) + alerts naar SIEM; MTTD ≤ 5 min.

FS-OBS-001, Servicelevels (detectie)

Isolatie v1.1

Tenant-isolatie via MIG/vGPU/time-slicing en netwerksegmentatie voor HPC-pools.

FS-HW-002/003, FS-NET-001

MK-koppelvlakken v1.1

Edge/OT-integraties (mirrors, beperkte WAN), CMDB/DDI-koppeling en offline-tolerantie voor inferentie.

FS-EDGE-001, FS-OBS-001

Endpoint Security v1.0

EDR/OS-firewall op GPU/CPU-nodes (waar performance-technisch toegestaan) met zichtbaarheid in dashboards.

FS-OBS-001

Threat Intelligence v1.0

Vendor advisories (GPU drivers/firmware) sturen driver-matrix/preflight en patch-prioriteit.

FS-DRV-002, FS-SEC-001


Landingslocaties

Waar de architectuuronderdelen landen binnen de infrastructuur, dit kan bijvoorbeeld een externe commerciële cloud zijn, een private cloud of een Rijkscloud. Hiervoor wordt de definitie in de ICT Strategie gebruikt.

Beschikbare SBBs 

Een overzicht van de oplossingen die beschikbaar zijn vanuit dit ABB en de beschrijving van de diensten die daarmee worden geleverd. Vul dit in wanneer de SBBs bekend zijn.

Koppelvlakken

Interfaces en afhankelijkheden tussen verschillende architectuurelementen. Dit zijn bijvoorbeeld de protocollen die kunnen worden gebruikt door andere bouwblokken die gebruik maken van het ABB.


Afhankelijkheden

Beschrijving waar dit ABB van afhankelijk is of welke ABBs afhankelijk zijn van het ABB. Dit geldt ook voor de verschillende serviceketens. Geef dit aan met links naar de architectuur elementen.

EIRA Koppeling

Dit bouwblok is gekoppeld binnen de EIRA aan: Vul hier de EIRA koppeling in.

Een overzicht van alle relevante EIRA bouwblokken staan hier: EIRA Technology & Physical


Mirror provenance
Mirror source
confluence/spaces/INFRAARCH/pages/194875779/page.metadata.json
Storage source
confluence/spaces/INFRAARCH/pages/194875779/page.storage.xhtml
Access
Committed snapshot only