Anthropic zegt dat het zeven China-gebaseerde AI-labs heeft geïdentificeerd die Claude distillatieaanvallen uitvoerden op een industriële schaal. Volgens het bedrijf ging het om ongeautoriseerde pogingen om modelcapaciteiten te onttrekken en die vervolgens te gebruiken om eigen modellen te trainen.
Het nieuws raakt aan een belangrijk onderscheid: kennisdistillatie kan legitiem zijn, maar in dit geval gaat het om een aanpak waarbij antwoorden en redeneringen uit Claude worden verzameld zonder toestemming—met omwegen zoals proxy-netwerken, valse accounts en mogelijk gestolen toegang.
Wat is distillatie, en waarom is het in dit geval gevaarlijk?
Kennisdistillatie is op zichzelf een gangbare machine learning-methode. Daarbij fungeert een groter en krachtiger model als een soort “leraar” om een kleiner of sneller “leerling”-model te trainen, zodat die leerling vergelijkbare vaardigheden leert.
Anthropic spreekt echter van illicit distillation: het gaat dan om campagnes die covert proberen om modelkennis te kopiëren zonder autorisatie. In plaats van een gecontroleerd trainingsproces zou men gesprekken en modeluitvoer verzamelen en die inzetten als trainingsmateriaal voor een ander model.
Welke labs zouden betrokken zijn?
Volgens Anthropic kwamen de ongeautoriseerde activiteiten van zeven labs. Het gaat om organisaties die volgens Anthropic-lijst betrokken waren bij de campagnes: Alibaba, Moonshot, DeepSeek, Z.ai (aka Zhipu) en MiniMax. Het bedrijf beschrijft daarnaast in totaal meerdere gerelateerde “GTG”-campagnes die in de periode vanaf februari 2026 zijn waargenomen.
Door de schaal en terugkerende patronen ziet Anthropic het niet als losse incidenten, maar als een systematische industrie-aanpak om Claude-capabilities te oogsten.
Hoe werken Claude distillatieaanvallen volgens Anthropic?
Anthropic beschrijft meerdere tactieken die in combinatie werden gebruikt. De kern draait om het verzamelen van uitwisselingen met Claude—en met name redeneringssporen—die daarna als trainingdata worden ingezet.
Proxy’s en een netwerk van valse accounts
Een terugkerend element is dat labs toegang tot Claude kregen via proxy services, ook wel transfer- of relay-stations genoemd. Volgens Anthropic creëren die systemen duizenden nieuwe accounts met fictieve identiteiten. Daarbij zouden ook valse of gestolen betaalmiddelen (zoals creditcards) en illegaal verkregen API-keys worden ingezet.
Het effect: verzoeken lijken afkomstig van andere identiteiten, waardoor toegangsbescherming minder effectief wordt en de aanvallers meer data kunnen verzamelen.
Opnieuw routeren van klantverzoeken
In sommige gevallen gingen labs niet alleen “zelf” om gesprekken, maar zouden ze klantverzoeken intern hebben omgeleid. Anthropic stelt bijvoorbeeld dat Moonshot verzoeken omleidde naar Claude in plaats van ze door Kimi te verwerken, waarna reacties opnieuw aan gebruikers werden getoond.
Een deel van die interacties zou vervolgens zijn opgeslagen om een CoT-model (chain-of-thought) te trainen.
Data inkopen via resellers
Anthropic noemt ook een dataketen: ongeautoriseerde labs zouden transcripties van gesprekken met Amerikaanse frontier-modellen verkrijgen via derde partijen. Die resellers zouden de proxy-netwerken bedienen en gesprekken opslaan zonder medeweten of instemming van gebruikers.
Voorbeelden van waargenomen campagnes (GTG)
Anthropic noemt verschillende campagnes met unieke IDs en geeft per campagne een indicatie van volume en periode. De exacte details lopen uiteen, maar de rode draad is steeds: grote aantallen uitwisselingen, vaak met het oog op het extraheren en hergebruiken van redeneringsinformatie.
- GTG-16005: 151 miljoen uitwisselingen gezien tussen mei en juli 2026. Anthropic beschrijft dit als de grootste distillatieaanval die het ooit heeft gemeten, met een piek van ongeveer 3 miljoen exchanges per dag en duizenden frauduleuze accounts.
- GTG-16002: 23 miljoen uitwisselingen tussen mei en juli 2026. Volgens Anthropic speelde Moonshot hierbij een rol door Claude-reacties te gebruiken en een deel daarvan op te slaan voor CoT-training.
- GTG-16001: meer dan 12,1 miljoen uitwisselingen over 14 dagen in juli 2026, waarbij DeepSeek requests zou hebben gerouteerd zonder klanten te informeren.
- GTG-16006: meer dan 3,4 miljoen uitwisselingen over 17 dagen in juni en juli 2026. Anthropic stelt dat Zhipu een CoT-extractiepipeline gebruikte en Claude-redeneringstraces door Claude opnieuw “replayde” om modellen te trainen.
- GTG-16008: meer dan 400.000 uitwisselingen over 20 dagen in maart en april 2026, waarbij Xiaomi gesprekken en coding-sessies zou hebben gereplayed naar Claude via specifieke coding-harnasses.
- GTG-16012: SenseTime zou transcripties hebben gekocht van gebruikersuitwisselingen met Claude via datavendors.
- GTG-16003: MiniMax zou een eigen proxy-netwerkdienst hebben gebouwd via een shell company, mogelijk met het doel om exchanges tussen gebruikers en Amerikaanse modellen te verzamelen.
Anthropic legt uit dat de proliferatie van proxy’s een soort “secondaire markt” heeft gecreëerd: labs kunnen harvested exchanges kopen of anderszins verwerven.
Welke tegenmaatregelen nam Anthropic?
Om Claude distillatieaanvallen moeilijker te maken, zegt Anthropic verschillende beveiligingsmaatregelen en modelwijzigingen te hebben toegepast.
Toegang beperken bij ontbrekende identiteitsverificatie
Anthropic stelt dat het reselleraccounts of accounts die opereren vanuit niet-ondersteunde regio’s (zoals China, Iran en Rusland) kan blokkeren wanneer gebruikers niet slagen in identiteitsverificatie.
Modelantwoord beter beschermen tegen “stolen transcript” training
Daarnaast zou Claude zijn aangepast zodat het interne redenering samenvat vóórdat het een antwoord geeft. Dat maakt gestolen transcripties minder bruikbaar voor vervolgtraining.
“Preserved thinking” en het versleutelen van redenering
Verder verwijst Anthropic naar “preserved thinking” (bij versie Fable 5.1). Volgens het bedrijf voorkomt dit dat nieuwe API-accounts het systeemprompt, tools of berichten kunnen wijzigen die voorafgaan aan Claude’s redenering in multi-turn gesprekken.
Omdat die redenering volgens Anthropic is versleuteld, wordt het lastiger voor aanvallers om de context te manipuleren om Claude gevoelige informatie te laten onthullen.
Waarom dit breder gaat dan één model
Deze case laat zien dat AI-beveiliging niet alleen gaat over het voorkomen van directe misbruikpogingen, maar ook over datastromen: wie heeft toegang tot welke gesprekken, waar worden ze opgeslagen, en hoe worden ze later gebruikt.
Als proxy-netwerken en account-infrastructuur op grote schaal beschikbaar zijn, ontstaat er een ecosystem waarin ongeautoriseerde training kan worden opgeschaald—zelfs als het primaire model steeds extra technische beschermingen krijgt.
Voor organisaties betekent dit dat aandacht voor data governance, logging en toegang tot AI-integraties steeds belangrijker wordt. Zie ook de bredere context rond AI-incidenten en governance in onze artikelen over AI-aanvallen met distillation-achtige risico’s, zoals wat je nu kunt doen tegen AI distillation-aanvallen.
Praktische aandachtspunten voor teams
Ook al richt dit nieuws zich op Claude en Anthropic, het is nuttig om de onderliggende patronen te vertalen naar je eigen omgeving. Denk daarbij niet alleen aan modelinstellingen, maar ook aan hoe je omgaat met toegang tot AI-diensten.
- Beperk toegang en controleer identiteit: sta alleen gecontroleerde accounts toe, en herzie verificatieprocessen regelmatig.
- Let op proxy- en relay-achtige tussenlagen: als verkeer via tussenpartijen loopt, kan dat lastiger te herleiden zijn. Zorg voor zichtbaarheid.
- Monitor anomalieën in gebruik: hoge volumes, herhaalde patronen of onverwachte herkomst kunnen een indicatie zijn van ongeautoriseerde extractie.
- Ga zorgvuldig om met transcripties: bepaal welke gespreksdata wordt opgeslagen, wie erbij kan, en met welk doel.
Conclusie
Anthropic zegt dat zeven China-gebaseerde labs betrokken waren bij Claude distillatieaanvallen op industriële schaal. Volgens het bedrijf maakten aanvallers gebruik van proxy-netwerken, valse accounts en het verzamelen van interacties en redeneringsinformatie om modelcapaciteiten te kopiëren en vervolgens te trainen.
De reactie van Anthropic bestaat uit toegangsblokkades, verbeterde bescherming van interne redenering en aanpassingen aan de API-omgeving. Voor organisaties is dit vooral een signaal: AI-beveiliging draait steeds vaker om het beschermen van datastromen en het herkennen van schaalbare extractiepatronen.
Bron: https://thehackernews.com/2026/09/anthropic-says-seven-china-based-ai.html
