Direct naar de inhoud
Beveiligingsnieuws

AI distillation-aanvallen uitgelegd: zo werkt Claude-evasion

AI distillation-aanvallen

Recente dreigingsinformatie van Anthropic laat zien hoe staat-gerelateerde hackers AI distillation-aanvallen inzetten (of vergelijkbare automatisering rond model- en detectiegedreven aanpassing) om malware sneller ondetecteerbaar te maken. Het gaat niet alleen om “AI gebruiken als hulpmiddel”, maar om het versnellen van de complete cyclus waarin aanvallers detectie proberen te omzeilen—terwijl verdedigers telkens opnieuw moeten bijsturen.

In dit artikel zetten we de kern op een rij: wat er volgens Anthropic gebeurde, welke doelen de aanvaller nastreefde en waarom organisaties extra scherp moeten zijn op zowel traditionele inlog- en supplychain-risico’s als op AI-API’s en agentintegraties.

Wat Anthropic meldt over Midnight Blizzard

Anthropic rapporteert dat het een cyberespionage-operatie heeft verstoord waarvan de tradecraft en doelen overeenkomen met de Russische state-nexus actor die wordt gevolgd als Midnight Blizzard. De activiteiten die Anthropic identificeerde en stopte, liepen volgens het rapport van december 2025 tot augustus 2026.

Een belangrijk onderdeel is de manier waarop de aanvaller de reactie op detectie versnelde. Anthropic stelt dat de actor Claude gebruikte om te meten hoe goed malware detectie door beveiligingsproducten wist te ontwijken. Wanneer een tool werd “gevlagd”, zouden AI-agents het stuk malware vervolgens automatisch aanpassen en opnieuw opbouwen, waarna het opnieuw werd ingezet. Dat proces herhaalt zich totdat het resultaat niet langer zichtbaar is voor de defensie-stack.

Waarom de detectielus verschuift naar verdedigers

Historisch moesten aanvallers vaak wachten op nieuwe detectieregels of handtekeningen. Zodra verdedigers nieuwe signalen publiceerden, moesten aanvallers hun tooling opnieuw schrijven—een traag en vaak handmatig traject. Anthropic benadrukt dat automatisering met AI de tijd tussen “detectie komt op” en “aanval past zich aan” kleiner maakt.

Het resultaat: de kosten van de detectie-omzeilcyclus schuiven volgens Anthropic vaker naar de verdediger. Niet omdat aanvallers ineens “magisch” onkwetsbaar worden, maar omdat ze met AI sneller kunnen itereren dan teams reageren met nieuwe detectie, hunting en mitigaties.

Meer dan malware: brede targeting en uitvoering

Volgens het rapport richtte Midnight Blizzard zich op meer dan 20 organisaties. Onder de slachtoffers vielen onder meer Oekraïense en Europese overheidsinstellingen, defensie- en inlichtingendiensten, ambassades en denktanks. Aanvullende targeting strekte zich volgens Anthropic ook uit richting het Midden-Oosten en Azië.

Anthropic noemt daarnaast concrete supplychain- en infrastructuursporen. Zo zouden aanvallers mailboxes hebben geexfiltreerd van twee fabrikanten van drone-onderdelen. Ook werd volgens het rapport een complete proprietary software development kit gestolen voor een drone vision-systeem. Daarna werd er meerdere dagen tijd besteed aan reverse-engineering van onder meer de architectuur, bill of materials en leveranciersafhankelijkheden.

Hotel-Wi-Fi als distributiekanaal: DNS-hijacking

Een ander prominent detail uit het rapport is dat de actor minstens drie hospitality-vendors zou hebben gecompromitteerd die hotelgastenhosted Wi-Fi aanbieden. Daarbij zouden gestolen admin-credentials zijn gebruikt om gastverkeer om te leiden via DNS-hijacking.

Dit sluit aan bij eerdere publicaties: Microsoft documenteerde deze levermethode al in juli onder de naam CaptiveCrunch en koppelde die aan Midnight Blizzard. Voor organisaties betekent dit dat “beveiligde netwerken” niet alleen gaat over eigen infrastructuur, maar ook over de partners en omgevingen waar gebruikers doorheen moeten.

WhatsApp-compromis via companion devices

Anthropic beschrijft ook een aanpak om WhatsApp-accounts over te nemen. De actor zou slachtoffers hebben gebonden door WhatsApp te koppelen als “companion device” via headless browsers. Tegelijk zouden read receipts onderdrukt zijn om export van gesprekken minder zichtbaar te maken.

Volgens het rapport zijn ten minste twee voormalige hooggeplaatste Oekraïense functionarissen via deze route benaderd.

AI niet alleen als wapen, maar ook als doelwit

Naast wat Anthropic beschrijft als dreigingsgebruik rond AI-modellen, wijst het rapport op een bredere trend: actoren richten zich niet alleen op het gebruik van AI, maar ook op AI-credentials en AI-infrastructuur. Met andere woorden: de “sleutels” tot modellen, evaluatieomgevingen en agentintegraties worden zelf een aanvalsvector.

Frauduleuze Claude-resellerservice en accountcredential-afvang

Anthropic noemt een groep (gevolgd als GTG-50021) die een frauduleuze resellerdienst draaide. Die dienst zou betalende klanten stilletjes doorproxy’en naar een ander model, terwijl een meegeleverde clientapp de accountgegevens van Anthropic zou verzamelen voor doorverkoop.

Dit laat zien hoe belangrijk het is om niet alleen te kijken naar “wat is het model”, maar ook naar wie er tooling aanbiedt en welke apps er worden meegeleverd.

Prompt injection tegen een AI-evaluatiesandbox

Een duidelijker en directer case betreft GTG-50020, een Russisch sprekende groep met een financieel motief. Anthropic zegt dat de actor prompt injection gebruikte tegen de eigen geautomatiseerde evaluatiesandbox van een AI-leverancier. Daardoor zou de sandbox productie-API-sleutels hebben afgegeven van meerdere providers.

Vervolgens gebruikte de aanvaller die gestolen sleutels om verder te opereren en startte hij—volgens Anthropic—een campagne richting ongeveer 30 AI-bedrijven gedurende enkele dagen. De expliciete intentie was het verkrijgen van toegang tot een pre-release Claude-model. In pogingen daartoe zou geen succes zijn geboekt.

Wat organisaties moeten leren: AI-sleutels verdienen dezelfde zorg

Anthropic trekt een duidelijke conclusie: organisaties zouden AI API-keys en agentintegraties met dezelfde ernst moeten behandelen als productiecredentials. Gestolen AI-toegang kan volgens het rapport meerdere voordelen opleveren: herverkoopwaarde, extra rekenkracht voor eigen operaties en—door attributie aan legitieme sleutelhouders—minder zicht op misbruik.

Concreet betekent dit voor security teams dat ze hun controles moeten verbreden. Niet alleen endpoints, mailstromen en traditionele accounts tellen mee, maar ook de registraties van API-integraties, de secrets die door evaluatiesystemen lopen en de processen rondom het toekennen, roteren en monitoren van AI-toegang.

Onderdeel van een grotere misbruikcatalogus

De bevindingen van Anthropic maken deel uit van een ruimer rapport met zeven categorieën van misbruik die het bedrijf zegt te hebben verstoord, inclusief invloedoperaties, surveillance en misbruik rond biologische en conventionele wapens. Anthropic koppelt dat laatste bovendien aan afzonderlijk Frontier Red Team-onderzoek over wat AI-modellen kunnen voor intelligentiegericht richten en ontwikkeling van conventionele wapens.

De rode draad: zodra AI op schaal beschikbaar is, groeit ook het bereik van aanvallen. En als de verdediging niet alleen “detecteert”, maar ook tempo en iteraties verlaagt, ontstaat er opnieuw ruimte voor effectieve tegenmaatregelen.

Praktische aandachtspunten om de schadecyclus te verkleinen

Als je dit vertaalt naar dagelijkse beveiligingspraktijk, draaien de kernpunten om snelheid, zichtbaarheid en governance:

  • Monitor AI-integraties en API-sleutels met dezelfde logging- en alertingprincipes als productieaccounts.
  • Beperk iteratie- en evaluatieroutes: houd sandboxen en evaluatieomgevingen strak gescheiden en met minimale rechten.
  • Let op supplychain-achtige routes, inclusief third parties zoals hospitality-netwerken en softwareketens rond gespecialiseerde systemen.
  • Verbeter response-tempo door detectie sneller te vertalen naar hunting, blokkades en mitigaties—zodat attackers minder tijd hebben om opnieuw te proberen.

Dat is precies wat Anthropic met de “verschuiving van de detectielus” wil benadrukken: wie alleen reageert zodra een signatuur verschijnt, kan achter de feiten aanlopen. Wie ook vooruit denkt—en de volledige keten van creatie, testen, deployen en detectie onder controle houdt—staat beter voorbereid.

Conclusie: AI versnelt, maar verdediging kan ook tempo winnen

Anthropic beschrijft hoe Midnight Blizzard Claude zou hebben gebruikt om malware-detectie te doorbreken via een iteratieve keten: meten, aanpassen, heropbouwen en herdeployen totdat beveiligingsproducten het niet langer herkennen. Dat maakt de aanval niet “ineens onbreekbaar”, maar wel gevaarlijker door tempo.

De belangrijkste les is daarom breder dan malware alleen. AI distillation-aanvallen (en verwante automatiseringsaanpakken) tonen dat verdedigers tijdig moeten sturen op detectie, maar óók op de beveiliging van AI-credentials, agentintegraties en evaluatieomgevingen. Wanneer je die basis op orde hebt, verklein je de kans dat een aanvaller de cyclus sneller kan sluiten dan jij kunt reageren.

Lees ook: AI distillation-aanvallen uitgelegd voor meer achtergrond over het mechanisme achter dit soort automatisering en de impact op verdediging.

Bron: https://www.securityweek.com/anthropic-says-russian-hackers-used-claude-ai-to-automate-malware-evasion/