Autonome agentic AI versnelt besluitvorming en automatiseert acties. Maar juist die combinatie maakt organisaties kwetsbaar voor het moment waarop een agent “doorschiet” en ongewenst gedrag vertoont. Het is lastig om dit te ondervangen met de klassieke cybersecurity-logica die vooral leunt op regels, menselijke interpretatie en het afschrikken door gevolgen.
Een nieuwe benadering duikt op: rogue AI-agenten blokkeren door niet te vertrouwen op uitlijning (alignment) van het model, maar door tijdens uitvoering preventief af te dwingen wat wel en niet mag. Outerlimit, een bedrijf uit New York dat recent uit stealth is gekomen, werkt aan een decentrale beveiligings- en autorisatielaag die identiteit, rechten en toegestane acties in één controlepunt samenbrengt.
Waarom agentic AI niet “bang” is voor governance
In traditionele IT- en beveiligingspraktijken wordt veiligheid vaak bereikt door menselijke acties te beperken via wetten, beleid of regels. In de cybersecuritywereld werkt dat doorgaans als een soort “governance met gevolgen”: wie de regels overtreedt, krijgt een sanctie, bijvoorbeeld in de vorm van disciplinaire maatregelen of het verlies van toegang.
Maar autonome agents functioneren volgens een ander principe. Ze hanteren geen moreel kompas en hebben geen concept van straf of reputatieschade. Hun gedrag hangt in de praktijk af van wat ze zijn opgedragen, hoe hun interne logica samenwerkt met de context, en hoe ze tools gebruiken om resultaten te beïnvloeden. Met andere woorden: je kunt niet simpelweg dezelfde afschrikstrategie toepassen op machine-gedreven beslissingen.
Dat wordt extra relevant zodra bedrijven agents inzetten met brede toegang tot bedrijfsidentiteiten, credentials en systemen. Hoe complexer de taak, hoe lastiger het wordt om de grenzen van “toegestane acties” in één keer scherp te definiëren.
Outerlimit: ontdekken, observeren en afdwingen
Outerlimit beschrijft zijn aanpak als een tripartiet model: discover, observe en enforce. Het idee is om de agent niet alleen te “beoordelen” vooraf, maar om hem tijdens gebruik systematisch te sturen binnen vooraf vastgelegde kaders.
- Discover: de beveiligingslaag lokaliseert agenten in het systeem.
- Observe: de omgeving kijkt naar het gedrag van die agent.
- Enforce: de laag handhaaft een vooraf bepaalde policy met toegestane en verboden autonome acties.
Cruciaal hierbij is de focus op de fase waarin een agent daadwerkelijk actie wil ondernemen. In plaats van vooral te proberen het agentgedrag te “leren” of te corrigeren via alignment, draait de beveiliging om het afdwingen van rechten en voorwaarden wanneer het misbruikrisico zich kan materialiseren.
Geen alignment als voorwaarde: beleid stuurt de uitvoering
Outerlimit stelt dat de beveiliging niet afhankelijk is van de vraag of een agent “uitgelijnd” is met het beoogde doel of juist afwijkt. Een misaligned agent kan nog steeds proberen iets buiten de policy te doen, maar omdat het om een tool gaat, wordt de impact onderworpen aan de policy die is gespecificeerd.
De kern zit in het vermogen om te garanderen dat een agent, wanneer die een token krijgt, niet zomaar meer kan dan het token toestaat. In de beschrijving van Outerlimit gaat het dan om het kunnen vastleggen en bewijzen van onder andere de scope, locatie en voorwaarden waaronder het token gebruikt mag worden.
Deze insteek is bedoeld om het klassieke “alignment-probleem” te omzeilen. In plaats van te vertrouwen op wat het model waarschijnlijk doet, schuift de controle naar de vraag: welke acties zijn technisch toegestaan op het moment dat de agent probeert te handelen?
Waarom preventief afdwingen “één stap voor” kan zijn
Agentic AI werkt op machine-snelheid. Dat maakt het lastig om achteraf in te grijpen met detectie- of responseprocessen die te laat komen. Outerlimit positioneert zijn aanpak daarom als effectief “één stap vooruit”, omdat de policyhandhaving gelijke tred houdt met de snelheid van de agent en zo schadelijke acties kan blokkeren voordat ze plaatsvinden.
Het resultaat is een verschuiving in de gedachtegang van cybersecurity. Waar beveiliging vroeger vaak draait om vrees voor gevolgen, draait het bij deze preventieve aanpak om het voorkomen van schade binnen de toegestane actielimieten.
Wat dit betekent voor enterprise AI
Veel organisaties adopteren autonome agents om sneller te beslissen en activiteiten te automatiseren. Tegelijkertijd worden die agents ingezet voor taken die steeds meer context en toegang tot resources vereisen. Dat vergroot de impact als er iets misgaat.
Outerlimit verwoordt het breder: de volgende fase van enterprise AI moet volgens hen niet alleen een race zijn naar het bouwen van de meeste agents, maar naar het veilig kunnen inzetten van agentdeployments. Daarbij wordt vertrouwen een beperkende factor zodra intelligentie commoditized wordt.
In de praktijk betekent dit dat bedrijven niet alleen moeten kijken naar modelkwaliteit of governance op papier, maar naar een beveiligingsarchitectuur die autorisatie en actie samenbrengt rond de uitvoering. Met andere woorden: minder nadruk op “wat de agent zou moeten doen”, meer nadruk op “wat de agent mag doen”.
Vergelijk met governance-aanpak en eerdere incidentlessen
De verschuiving naar preventie sluit aan bij een bredere trend in de beveiligingswereld: governance is belangrijk, maar alleen regels opschrijven is niet genoeg als systemen zelfstandig acties kunnen initiëren. In recente berichtgeving rond agentic AI en kwetsbaarheden zien we ook hoe makkelijk workflows kunnen worden misleid of omzeild.
Als je wilt begrijpen waarom bredere agentic workflows risico’s kunnen introduceren, kan dit artikel je helpen als aanvulling: AI-agents en zijwaartse beweging herijkt. Daarin ligt de nadruk op hoe agenten zich kunnen bewegen zodra ze toegang krijgen tot omgevingen.
Daarnaast toont het onderwerp “beveiliging rond uitvoering” ook overeenkomsten met hoe je bij andere systemen zoveel mogelijk moet sturen op waar en wanneer tokens/permissions kunnen worden gebruikt. Wie vooral geïnteresseerd is in het bredere patroon van beveiligingscontrole op technische grenzen, kan ook kijken naar OT-netwerken niet echt geïsoleerd, omdat dit soort inzichten laat zien dat vertrouwen op segmentatie of beleid alleen niet automatisch veiligheid garandeert.
Praktisch: waar organisaties op moeten letten
Los van de exacte technologie is de kernboodschap voor security teams helder. Als je autonome agenten inzet, wil je dat je kunt aantonen en afdwingen:
- Welke identiteit een agent gebruikt bij het uitvoeren van acties.
- Welke autorisaties gelden voor tools, tokens en toegangspunten.
- Onder welke voorwaarden acties wel of niet mogen plaatsvinden.
- Hoe snel die afdwinging werkt ten opzichte van de snelheid van de agent.
Zo voorkom je dat “het ging toch goed” een argument wordt. Je gaat richting een beveiligingsmodel dat werkt met bewijs, policyhandhaving en afbakening van impact.
Conclusie: van afschrikking naar preventie
Rogue AI-agenten blokkeren vraagt om een andere mindset dan klassieke cybersecurity. Omdat agentic AI geen begrip heeft van regels of gevolgen, werkt governance alleen vaak niet genoeg. Outerlimit kiest daarom voor een architectuur waarin agenten worden ontdekt, gedrag wordt geobserveerd en een policy van toegestane acties bij uitvoering wordt afgedwongen.
De belofte is simpel maar krachtig: zelfs als een agent afwijkt, kan de uitvoering binnen de vooraf gedefinieerde grenzen worden gehouden. Voor organisaties die agenten inzetten met toegang tot identiteit en credentials is dat een logische stap richting veiligere enterprise AI.
Bron: https://www.securityweek.com/outerlimit-raises-16-million-to-stop-rogue-ai-agents-from-causing-harm/
