Anthropic rolt een nieuwe stap uit in AI modelbeveiliging door de defensieve mogelijkheden van zijn geavanceerde AI-modellen breder beschikbaar te maken. Niet door meer directe interactie met het model toe te staan, maar door het werk te verplaatsen naar beveiligingsinterfaces, waar de output strak wordt afgebakend.
De update bouwt voort op eerdere initiatieven zoals Project Glasswing, en koppelt nieuwe toegangsmogelijkheden aan een programma voor cyberverificatie en een open source financieringsronde van $35 miljoen. Het doel is hetzelfde als altijd: tijd geven aan verdedigers om kwetsbaarheden te vinden en te verhelpen, voordat vergelijkbare capaciteiten breed beschikbaar worden of misbruikt kunnen worden door kwaadwillenden.
Waarom Anthropic stuurt op beperkte toegang
Volgens Anthropic is het meest risicovolle scenario direct, onbeperkt toegang geven tot een model. Dat risico neemt volgens het bedrijf sterk af wanneer gebruikers geen vrij modelgesprek krijgen, maar uitsluitend specifieke defensieve resultaten.
Daarom is de recente aanpak ontworpen rond een “guardrails”-principe: teams krijgen wel ondersteuning bij verdediging, maar niet de mogelijkheid om het model op een willekeurige manier te benutten. In de praktijk betekent dit dat gebruikers via systemen werken die de modeloutput beperken tot zaken als een lijst met voorgestelde patches of een security-alert.
Mythos 5 beschikbaar voor defensie, niet voor directe interactie
De kern van de uitbreiding draait om Mythos 5. Anthropic benadrukt dat eindgebruikers niet zelf met Mythos hoeven te interacteren. In plaats daarvan lopen verzoeken via doelgerichte interfaces die het model op de achtergrond draaien en vervolgens alleen een gedefinieerde output teruggeven.
In eerdere fase werd een kleine groep organisaties vroeg toegang gegeven tot Claude Mythos Preview en de opvolger Mythos 5. Anthropic positioneerde dat als een manier om defenders te laten oefenen en kwetsbaarheden vroeg te corrigeren, terwijl de capaciteiten nog niet op grote schaal voor misbruik beschikbaar zijn.
Daarnaast beschreef het bedrijf dat Claude Fable 5 breed beschikbaar wordt gehouden met beperkingen op dual-use cyberwerk. Ook dat is onderdeel van dezelfde veiligheidsvisie: bruikbaarheid voor verdediging, zonder het openen van deuren voor misbruik.
Integraties in security operations en incident response
Voor teams betekent dit vooral: Mythos 5 wordt ingebouwd in werkprocessen die ze al gebruiken. Anthropic werkt met cybersecuritypartners om Mythos 5 te verwerken in tools voor onder andere security operations, incident response en detectie.
Het gaat daarbij om omgevingen waar veel organisaties al dagelijks opereren—bijvoorbeeld voor ziekenhuizen, nutsbedrijven, financiële instellingen en in de software supply chain. Door te integreren in bestaande tooling blijft de drempel lager en kunnen teams sneller de output vertalen naar acties.
Ook hier geldt het uitgangspunt van AI modelbeveiliging: de interface levert resultaten die passen binnen een afgesproken scope, inclusief controles die misbruik moeten voorkomen.
Claude Security scant met Mythos 5 (code die je zelf bezit)
Een belangrijk onderdeel van de update is Claude Security. Dit product, dat momenteel in publieke beta is voor Claude Enterprise-klanten, gebruikt Mythos 5 om code scans uit te voeren.
Concreet wordt elke bevinding gepresenteerd met een CWE-categorie, plus inschattingen van vertrouwen en ernst. Vervolgens geeft de scanner ook een voorgestelde fix. Maar het uiteindelijke “deploy”-moment blijft menselijk en gecontroleerd.
Geen ruwe modeloutput, wel toetsbare bevindingen
Anthropic zegt nadrukkelijk dat Claude Security niet werkt met het teruggeven van “raw outputs” zonder context. In plaats daarvan levert het gedetailleerde bevindingen op basis van de code die de gebruiker zelf aanlevert.
Belangrijk is ook de workflow: een fix moet nog worden uitgevoerd via Claude Code en pas daarna—na goedkeuring door een mens—worden uitgerold. Op die manier wordt de AI-ondersteuning gekoppeld aan bestaande beheerprocessen en besluitvorming.
Als je breder wilt kijken naar hoe organisaties omgaan met risico’s rond AI-veiligheid en sandboxing, kan dit artikel van belang zijn: AI modelbeveiliging met sandboxing: leer van CameraSwarm.
Defender Advantage Fund: $35 miljoen voor open source
Naast product- en integratie-updates lanceert Anthropic het Defender Advantage Fund (0xDAF). Daarvoor stelt het $35 miljoen beschikbaar in Claude-credits. De credits zijn bedoeld voor organisaties die open source maintainers helpen hun projecten te beveiligen.
Dit bouwt voort op eerder gegeven steun, waaronder $4 miljoen aan directe donaties en extra ondersteuning via Project Glasswing. Anthropic noemt ook gecoördineerde inspanningen zoals Akrites en Gold Eagle als onderdeel van die eerdere route.
Waar de grants voor kunnen worden ingezet
De financiering is gericht op praktische security-werkzaamheden, zoals:
- het patchen van live kwetsbaarheden;
- het bouwen van scanning- en patchingprocessen die andere projecten kunnen hergebruiken;
- het onderzoeken van beveiligingsbenaderingen die bestand zijn tegen hele klassen van aanvallen.
Anthropic start volgens de berichtgeving met een beperkt aantal grotere pilot grants. Daarmee kan het eerst gericht leren en opschalen wanneer de aanpak werkt.
Voor organisaties die open source als onderdeel van hun software supply chain gebruiken, is dit thema extra relevant. Als je wilt doorlezen over risico’s in ketens en supply chain-aanvallen, is trojanized npm-pakketten en de impact op Linux-implantaten een goede aanvulling.
Cyber Verification Program breidt uit voor triage en validatie
Anthropic breidt ook het Cyber Verification Program uit. Dit programma geeft al “vetted organizations” verminderde safeguards op Claude Opus en Sonnet voor geautoriseerd securitywerk.
In de komende weken wil het bedrijf die dekking uitbreiden naar bredere dual-use capabilities op die modellen—met name voor taken rond kwetsbaarheid triaging en validatie. Daarna volgt toegang op Mythos-klasse niveau.
Teams die hiermee aan de slag willen kunnen volgens Anthropic nu al aanvragen. Verdere details over het bredere uitrolmoment worden in dezelfde berichtgeving gekoppeld aan de aankomende weken.
Project Glasswing blijft doorgaan met focus op kritieke infrastructuur
Ten slotte zegt Anthropic door te gaan met Project Glasswing, ook in samenwerking met overheidsinstanties. De focus ligt op organisaties die kritieke infrastructuur beveiligen en die voldoen aan strikte eisen rond security controls.
Ook hier sluit de aanpak aan op AI modelbeveiliging: dezelfde capaciteiten worden aangeboden, maar binnen een gecontroleerd kader. Daardoor kunnen verdedigers beter voorbereid zijn terwijl directe, onbeperkte modeltoegang niet het uitgangspunt is.
Wat betekent dit voor securityteams?
Deze uitbreiding draait om één praktische boodschap: defenders krijgen meer mogelijkheden om sneller tot concrete acties te komen, zonder dat het model “open” wordt voor willekeurig gebruik. Met Mythos 5 via beveiligingsinterfaces, Claude Security als scanlaag en een mens-in-de-loop goedkeuringsstap ontstaat een route die past bij bestaande security processen.
Voor teams die de software supply chain beheren of op incident response draaien, is vooral de combinatie interessant: integraties in dagelijkse tooling plus gestructureerde bevindingen (CWE, ernst, confidence en fixes). Daarnaast zorgt het open source fonds ervoor dat kwetsbaarheidsremediatie en herbruikbare scanning/patchprocessen niet alleen bij grote organisaties blijven.
Wil je de brede lijn rond veilig inzetten van AI voor verdediging verder volgen? Houd dan vooral in de gaten hoe het Cyber Verification Program zich uitbreidt en hoe de interfaces rond Mythos-klasse toegang zich in tools voor detection en response doorontwikkelen.
