Direct naar de inhoud
Software Supply Chain Security

Microsoft AI-gedragscode: grenzen voor cyberaanvallen

Microsoft AI-gedragscode

Microsoft heeft een concept AI-gedragscode gedeeld voor zijn MAI-modellen. Het document zet uiteen waar de modellen wel en niet mee mogen helpen, met extra nadruk op het voorkomen van misbruik voor cyberaanvallen. Daarmee probeert Microsoft een duidelijke scheidslijn te trekken tussen kennis over aanvallen en het praktisch mogelijk maken ervan.

De publicatie is bedoeld als startpunt: Microsoft opent een consultatieronde en wil de uiteindelijke versie later dit jaar verfijnen. In de tussentijd laat de conceptcode zien hoe Microsoft denkt over veiligheid, controle en “command & control” bij AI-systemen.

Wat de Microsoft AI-gedragscode precies wil begrenzen

De kern van de conceptcode is dat MAI-modellen worden geblokkeerd om inhoud te produceren die een daadwerkelijke cyberaanval kan ondersteunen. Volgens Microsoft geldt dat ongeacht hoe een verzoek wordt geformuleerd. Met andere woorden: ook als een vraag wordt verpakt als “onderzoek” of “educatie”, kan de uitkomst alsnog worden tegengehouden.

De code noemt o.a. de volgende categorieën waarvoor modellen geen werkende hulp mogen geven:

  • Functionerende exploitcode
  • Aanvalstools en tooling die rechtstreeks inzetbaar wordt
  • Plannings- en richtmethoden die gericht zijn op het uitvoeren van aanvallen
  • Inbraakprocedures
  • Technieken voor het omzeilen van beveiliging
  • Operationele begeleiding die de uitvoering van een aanval verbetert

Microsoft zet daarbij een inhoudelijke grens: het model mag begrijpen wat er speelt en ook ondersteunen bij verdediging, maar niet de praktische “bouwstenen” aanleveren die een aanval makkelijker maken.

Absolute Constraints: waarom omzeilen niet de bedoeling is

Microsoft beschrijft een onderdeel dat het Absolute Constraints noemt. Dit zijn veiligheidsmaatregelen die niet door partijen die de modellen inzetten, of door eindgebruikers, eenvoudig kunnen worden teruggedraaid. Met die aanpak probeert Microsoft te voorkomen dat beleid of gebruikersinstructies de beveiligingsregels alsnog uithollen.

In de praktijk betekent dit dat er onderscheid wordt gemaakt tussen twee situaties: (1) uitleg en begrip van aanvallen versus (2) het effectief faciliteren van het uitvoeren ervan. Voor Microsoft is alleen de eerste route toegestaan binnen de veiligheidsgrenzen.

Waar wel ruimte is: legitieme defensie en beveiligingsonderzoek

De code benadrukt dat MAI-modellen binnen de toegestane grenzen kunnen helpen met verdedigingswerk. Dat omvat volgens Microsoft onder meer:

  • Het ontdekken en analyseren van kwetsbaarheden
  • Analyse van malware
  • Het ontwikkelen en testen van proof-of-concept exploitvarianten, zolang dat binnen de defensieve context past
  • Algemeen educatief materiaal over hoe aanvallen werken

Door deze voorbeelden maakt Microsoft duidelijk dat het niet gaat om het blokkeren van cybersecuritykennis, maar om het voorkomen dat die kennis omslaat naar uitvoerbare aanvalshulp.

Keten van command: bepaalt wie “gezag” heeft over het model

Een tweede belangrijk thema in de conceptcode gaat over informatie die buiten het model om wordt aangeleverd. Microsoft stelt dat de “autoriteit” over het gedrag van het model alleen via een keten van command loopt.

Die keten bestaat volgens het document uit meerdere lagen:

  • Het code-of-conduct document zelf
  • Beleid dat door de organisaties die het model inzetten is vastgesteld (de “operators”)
  • Voorkeuren van individuele gebruikers

Daartegenover staat dat output van andere systemen, bestandsinhoud, webpagina’s of berichten van andere AI-tools niet vanzelf gelden als instructie met voldoende gezag. Alleen als er expliciet is gedelegeerd binnen de keten, en zonder de Absolute Constraints te overschrijden, kan zo’n informatie invloed hebben.

Verder verwacht Microsoft dat het model verdachte inhoud herkent en relevante partijen waarschuwt. Daarmee richt de code zich niet alleen op directe aanvalshulp, maar ook op indirecte manipulatie via “buitenlandse” content.

Agenten “op de korte lijn”: regels voor permissies en delegatie

Naast de inhoudelijke grenzen rondom cyberaanvallen bevat de conceptcode ook afspraken over de risico’s van AI-systemen die met echte bevoegdheden handelen. Microsoft wil dat MAI-modellen opereren binnen het bereik dat gebruikers of operators redelijkerwijs hebben gevraagd.

Een belangrijk principe is daarbij minimum privilege: zelfs als een model systeem-level toegang krijgt, moet het handelen beperkt blijven. Microsoft noemt daarbij het vermijden van onnodige systemen en data, het voorrang geven aan acties die terug te draaien zijn, en het markeren van activiteiten met blijvende of brede impact.

Ook legt de code vast dat modellen hun eigen toegang niet mogen uitbreiden. Daarnaast gelden vergelijkbare regels voor delegatie: als een MAI-model werk doorgeeft aan sub-agenten of andere AI-systemen, moeten die ten minste dezelfde beperkingen en scope volgen.

Tot slot moeten sub-agenten stop-work of shutdown verzoeken respecteren. Daarmee wordt het “afbreekmechanisme” onderdeel van de veiligheidsarchitectuur, in plaats van een optionele extra stap.

Uitzonderingen: defensie is breed, maar niet onbeperkt

De conceptcode erkent ook dat de standaarden niet in elke context hetzelfde kunnen uitpakken. Microsoft noemt domeinen zoals defensieve cybersecurity, openbare veiligheid, nationale veiligheid en dubbelgebruik in wetenschappelijk onderzoek. Voor een klein aantal use cases kan het volgens Microsoft zijn dat extra mogelijkheden nodig zijn die de standaardinstellingen niet toestaan.

Als zulke situaties zich voordoen, wil Microsoft een strengere beoordeling toepassen via geautoriseerde Microsoft-kanalen. Daarbij gaat het om extra toetsing van veiligheid, juridische consequenties en rechten van betrokkenen, mede omdat het risico op negatieve effecten in deze domeinen hoger kan zijn.

Concept, consultatie en voorbeeldreacties

Microsoft geeft aan dat de huidige MAI-modellen nog niet op het concept zijn getraind. Daarom start de organisatie met een publieke consultatieperiode van zes weken, zodat buitenstaanders feedback kunnen geven. Microsoft wil de herziene versie later dit jaar publiceren om richtlijnen te leveren voor ontwikkeling in 2027.

Microsoft zegt ook input te hebben verwerkt vanuit verschillende expertises: AI-onderzoek, recht, ethiek, filosofie, taalkunde en publiek beleid. Daarnaast noemt het bedrijf betrokkenheid van business leaders en focusgroepen.

In een appendix staan bovendien negen voorbeelden van “aligned” en “misaligned” antwoorden. Die illustreren hoe het model zich volgens Microsoft zou moeten gedragen. In de beschreven voorbeelden komen onder meer terug: een model dat zonder autorisatie bestandsuitwisselingen terugdraait, en een model dat in een familiesituatie tijdens een gezondheidscrisis onterecht geruststelling geeft. Zulke casussen moeten het interpretatiekader verduidelijken.

Waarom dit relevant is voor organisaties en security teams

Voor bedrijven die AI-systemen inzetten in hun workflows, is de Microsoft AI-gedragscode vooral praktisch: ze laat zien hoe regels kunnen worden ontworpen om misbruik te voorkomen. Met name de combinatie van Absolute Constraints, keten van command en minimum-privilege is een herkenbaar patroon voor governance en risicobeheersing.

Dat sluit aan bij een bredere trend: security teams krijgen steeds vaker te maken met AI-agenten die niet alleen tekst genereren, maar ook acties uitvoeren. Hoe beter scope en toestemming zijn afgebakend, hoe kleiner de kans dat een model “doorschiet” richting ongewenst gedrag.

Als je intern AI-agenten of security-assistenten wilt laten werken, helpt het om dezelfde vragen te stellen als Microsoft lijkt te adresseren:

  • Welke taken mogen het model of de agent uitvoeren, en welke expliciet niet?
  • Wie bepaalt de autoriteit van instructies, en hoe voorkom je dat externe content die autoriteit krijgt?
  • Onder welke permissies draait het systeem, en hoe wordt escalatie geblokkeerd?
  • Hoe werkt een stop- of shutdown-actie precies door naar sub-agenten?

Wil je dit verder doortrekken naar incidenten en wat er mis kan gaan wanneer AI of tooling verkeerd wordt ingezet? Dan kan ook de achtergrond bij cyberrisico’s rondom AI-agenten nuttig zijn, bijvoorbeeld in AI agenten beveiligen: balans tussen controle en waarde.

Snelle check: hoe teams zich kunnen voorbereiden

Hoewel de code nog conceptueel is, kun je als organisatie alvast praktische stappen zetten die passen bij het idee achter de Microsoft AI-gedragscode. Denk aan beleid, logging en toetsing van uitkomsten.

  • Maak scope expliciet: beschrijf per use case welke categorieën input en output wel en niet toegestaan zijn.
  • Leg delegatie vast: zorg dat sub-agenten dezelfde beperkingen volgen en dat stop-orders niet “verloren” raken.
  • Gebruik minimum privilege: geef systemen alleen de rechten die nodig zijn, niet meer.
  • Beoordeel risico op context: sommige domeinen vragen om strengere beoordeling en extra juridische/ethische afstemming.

Zo kun je voorkomen dat een model weliswaar “helpful” probeert te zijn, maar daardoor toch informatie of acties produceert die buiten het defensieve doel vallen.

Conclusie

De Microsoft AI-gedragscode legt in conceptvorm duidelijke grenzen vast voor MAI-modellen: geen werkende exploitcode of aanvalstools, en controlemechanismen die moeten verhinderen dat die regels via instructies of externe content worden omzeild. Tegelijk wil Microsoft ruimte laten voor legitieme cybersecuritydefensie en verantwoord onderzoek.

Nu is het aan de consultatie en de uiteindelijke publicatie om te bepalen hoe deze principes in detail worden vormgegeven. Voor organisaties die AI gebruiken, biedt het document vooral een bruikbaar kader om governance, permissies en agentgedrag vooraf goed af te bakenen.

Bron: https://www.securityweek.com/microsoft-ai-code-of-conduct-sets-cyberattack-boundaries-chain-of-command-safety-constraints/