Direct naar de inhoud
Beveiligingsnieuws

GPUThor Rowhammer en ECC: wat je moet weten

GPUThor Rowhammer

Rowhammer is al langer een bekende aanvalsklasse, maar met GPUThor Rowhammer krijgt het probleem een nieuwe dimensie: onderzoekers laten zien dat een bepaalde variant ook NVIDIA-workstation-GPU’s met GDDR6-memorie kan raken op een manier die foutcorrectie ondergraaft. Dat maakt de aanval niet alleen relevant voor pure research, maar ook voor organisaties die GPU’s inzetten met onbetrouwbare of gedeelde workloads.

De onderzoekers beschrijven hoe zij met een lange reeks “hammering” bit flips kunnen veroorzaken, hoe de foutcorrectie (ECC) misleid kan raken en hoe dat vervolgens kan leiden tot denial-of-service (DoS) en zelfs privilege-escalatie richting een root shell.

Wat is GPUThor Rowhammer?

GPUThor Rowhammer is de naam van de aanval die is ontwikkeld door onderzoekers van de University of Toronto. In hun aanpak wordt het DRAM-gedrag op GPU-niveau misbruikt: specifieke rijen (rows) in het geheugen worden fors geactiveerd, terwijl aangrenzende rijen als “victim” worden betrokken. Door die herhaling ontstaat een kans op fouten in de opgeslagen data.

De onderzoekers hebben hun testcampagnes uitgevoerd op vier NVIDIA Ampere-class kaarten met GDDR6, waarbij ze telkens vier DRAM-banken aanpakten en daar per bank 24 uur mee doorgingen. Op die manier konden ze bit flips op elke onderzochte kaart waarnemen wanneer ECC niet of niet effectief was ingeschakeld.

Welke GPU’s zijn getest?

Uit de rapportage blijkt dat de volgende NVIDIA RTX modellen kwetsbaar zijn bevonden:

  • RTX A6000 (48 GB GDDR6)
  • RTX A5000 (24 GB GDDR6)
  • RTX A4500 (20 GB GDDR6)
  • RTX A4000 (16 GB GDDR6)

Daarnaast benoemen de onderzoekers dat hun patronen op andere NVIDIA-geheugenvarianten geen bit flips opleverden in de tests, zoals op een RTX 4090 (met GDDR6X) en enkele kaarten met andere geheugentechnologieën. Ze koppelen dat aan verschillen in TRR-implementaties (Target Row Refresh) tussen generaties en geheugentypes.

Waarom werkt dit Rowhammer-aanvalspatroon extra goed?

Wat GPUThor Rowhammer onderscheidt van eerdere GPU Rowhammer-varianten is de manier waarop het “hameren” wordt verdeeld over geheugenrijen. Waar eerdere aanvallen aggressor- en decoy-rijen ongeveer even vaak activeerden, zetten de onderzoekers bij GPUThor nadrukkelijk sterker in op de rij die naast de victim ligt.

Dat non-uniform hammering helpt om de verdediging die gericht is op het dempen van Rowhammer-effecten—zoals TRR—minder effectief te laten reageren. De onderzoekers beschrijven bovendien dat de TRR op deze GDDR6-onderdelen mogelijk niet elke refresh-interval precies één keer activeert, maar ongeveer eens per 72 refresh-intervals. Op basis daarvan bouwden ze een patroon van zes intervallen.

ECC omzeilen: van bit flips naar escalatie

Een cruciaal onderdeel van het verhaal is ECC. NVIDIA adviseert ECC als mitigatie tegen GPU Rowhammer. De onderzoekers stellen echter dat ECC in deze context de barrière niet volledig wegneemt.

Quantiteit van fouten zonder ECC

In de campagnes met ECC uit rapporteerden de onderzoekers aantallen van 72.000 tot 377.000 bit flips per gigabyte op basis van de uitgevoerde tests. De RTX A5000 bleek het meest gevoelig: 377.552 flips per gigabyte. Dat is aanzienlijk hoger dan eerdere GPU Rowhammer-resultaten uit eerdere publicaties van dezelfde onderzoeksgroep.

Silent data corruption door mis-correctie

Verder gaan ze in op de kwaliteit van de gecorrigeerde of gedetecteerde fouten. De ECC op deze GPU’s is SECDED: single-error-correct, double-error-detect. Dat betekent: één flipped bit wordt gecorrigeerd, en twee fouten worden detecteerbaar geacht. In de bevindingen van de onderzoekers loopt het echter mis wanneer er meerdere bitfouten optreden: ze vonden situaties waarin de ECC mis-correct uitvoert en daarbij leidt tot silent data corruption (SDC).

Met ECC aan rapporteerden ze ook detectable, uncorrectable errors (DUE) tijdens hun experimenten. Een DUE veroorzaakt dat alle kernels op de kaart worden afgebroken, waardoor de GPU tijdelijk onbruikbaar wordt totdat er een reset plaatsvindt—een vorm van DoS.

Privilege escalation en root-toegang: zo komt het exploitpad eruit

Na het veroorzaken van de fouten koppelden de onderzoekers het effect aan een escalatie richting host-privileges. Volgens de beschrijving hergebruikten ze exploitcode van hun eerdere werk rond GPU-beveiliging en page-table privilege escalation.

In grote lijnen verloopt het pad als volgt: page tables worden eerst “klaargezet” zodat er een kwetsbare toestand ontstaat. Vervolgens worden naburige geheugenrijen gehamerd om het page-frame number van een entry te beschadigen. Daarna start een tweede kernel, die door die gemanipuleerde entry toegang krijgt tot geheugen buiten het oorspronkelijke proces.

Rol van IOMMU en type fouten

De onderzoekers beschrijven dat de route naar escalatie afhangt van het type fout dat optreedt en of de IOMMU is ingeschakeld:

  • Met de gebruikte aanpak leidde triple-bit SDC tot root op de host bij ingeschakelde IOMMU.
  • Met double-bit DUE bereikten ze privilege-escalatie op systemen waar de IOMMU uit staat.

Ze benadrukken bovendien een interessant detail: DUE’s worden volgens hun bevindingen “lazily” verwerkt in NVIDIA-GPU’s. Daardoor ontstaat een kort tijdvenster van ongeveer ~10 milliseconden tussen detectie en het afbreken van de GPU. In die korte periode kan de corrupte data al zijn geconsumeerd door de attacker’s kernel.

Wanneer wordt dit realistisch? Rol van GPU-tenant en CUDA-toegang

Volgens de onderzoekers hangt het welslagen af van de mogelijkheid om een onprivileged CUDA kernel op de doel-GPU te starten. Dat kan in de praktijk betekenen dat een aanvaller in staat is om als co-tenant op een gedeelde kaart te draaien, of op een machine waar hij wel CUDA-code kan uitvoeren maar geen volledige trust heeft over de workloads.

Dat maakt de aanbevelingen vooral relevant voor omgevingen met gedeelde GPU’s—zoals sommige cloud- of on-premises setups waar verschillende gebruikers of teams dezelfde hardware delen.

ECC blijft nuttig, maar is niet genoeg

De onderzoekers geven aan dat ECC de aanval nog steeds bemoeilijkt. Hun boodschap is echter helder: ECC kan niet langer worden gezien als een afdoende verdediging tegen deze specifieke variant van Rowhammer.

Ze schrijven ook dat er geen directe patch bekend is die GPUThor Rowhammer volledig adresseert. Voor een complete fix verwachten ze verbeteringen op hardwareniveau, zoals sterkere multi-bit foutcorrectie en extra in-DRAM verdedigingsmechanismen (bijvoorbeeld vernieuwingsmanagement of per-row activation counting) in toekomstige GPU-generaties.

Praktische richtlijnen voor organisaties

Hoewel GPUThor Rowhammer geen “klassieke” kwetsbaarheid met één patch is, kunnen teams wel maatregelen treffen om het aanvalsscenario te verkleinen. De onderzoekers adviseren onder meer:

  • Vermijd cross-tenant GPU-sharing waar mogelijk.
  • Monitor ECC error counters zodat afwijkingen sneller opvallen.
  • Beperk ontrusted CUDA-workloads (zowel qua permissies als qua isolatie).

Daarbij past ook een bredere reflex voor GPU-gedreven omgevingen: behandel GPU computing niet als “tweede-orde” risico. Als een aanvaller toegang krijgt tot de juiste uitvoeringstoegang (bijvoorbeeld via niet-vertrouwde code), kan de impact richting systeemintegriteit toenemen.

Verwante thema’s: waarom dit in het bredere beveiligingsbeeld past

GPU-aanvallen zoals Rowhammer wijzen op een fundamentele uitdaging: softwarematige isolatie stopt soms niet bij de hardwarelaag. Dat sluit aan bij andere security-onderwerpen waar onderzoekers aantonen dat aanvallen via onverwachte paden (zoals data-integriteit, privilege boundaries of mitigaties die bij nader inzien tekortschieten) tot grotere gevolgen leiden.

Wie zich verdiept in hoe beveiligingsteams mitigaties en detectie moeten herijken in het licht van misbruik, kan ook lezen over eerder werk rond aanvalstechnieken en verdedigingskeuzes, bijvoorbeeld:

Stand van zaken: geen CVE, geen bekende patch, geen publieke exploit gemeld

De onderzoekers rapporteren dat GPUThor Rowhammer geen CVE-identifier heeft en dat er geen in-the-wild exploitation is gemeld tot en met de publicatiedatum. Ook ontbreekt er volgens de bron een patch die de aanval direct voorkomt.

Wel geven ze aan dat de beveiligingsbevindingen in een eerder stadium zijn gedeeld met NVIDIA en ook met grote cloud- en platformpartijen. Daarnaast is er sprake van een embargo en een geplande publieke release van de aanvalscode op 15 november 2026, samen met presentatie van de paper op een academische conferentie.

Conclusie

GPUThor Rowhammer laat zien hoe ver een aanvaller kan gaan als hij toegang krijgt tot het juiste type GPU-uitvoering. Waar ECC tot nu toe vaak als belangrijke mitigatie gold, tonen de onderzoekers aan dat de combinatie van non-uniform hammering, foutgedrag in ECC en timing in de verwerking van DUE’s tot zowel DoS als privilege-escalatie kan leiden.

Voor organisaties betekent dit vooral: denk opnieuw over GPU-isolatie, controleer ECC-gerelateerde signalen en beperk ontrusted CUDA-workloads—zeker in omgevingen waar GPU’s gedeeld worden. ECC blijft waardevol, maar het is geen eindpunt meer in de verdediging.

Bron: https://thehackernews.com/2026/08/gputhor-rowhammer-defeats-ecc-on-nvidia.html