Verborgen prompts in Word kunnen Microsoft 365 Copilot in de war sturen. Een PoC laat zien dat een Word-bestand niet alleen tekst bevat, maar ook instructies die tijdens het Copilot-proces worden meegenomen. Vervolgens kan Copilot diezelfde instructies weer opnemen in het einddocument, waardoor de manipulatie zich in opeenvolgende drafts herhaalt.
Het nieuws komt van onderzoeker Håkon Måløy, die de techniek op 28 juli openbaar maakte. Hij meldde het eerder aan Microsoft en beschrijft hoe de aanval niet draait om klassieke malware, maar om misbruik van het schrijf- en bewerkingsgedrag van Copilot.
Wat zijn verborgen prompts in Word?
Het concept is eenvoudig maar riskant: in de brontekst van een Word-document kunnen onzichtbare of nauwelijks opvallende instructies verstopt zitten. Wanneer Copilot die tekst verwerkt—bijvoorbeeld bij het genereren van een verslag of het bewerken daarvan—kan het model die instructies ten onrechte behandelen als onderdeel van de gebruikersvraag.
In de PoC was de uitkomst niet alleen inhoudelijk aangepast, maar ook opvallend “consistent”: Copilot kopieerde de prompt opnieuw naar het gegenereerde document. Daardoor leek het alsof het systeem de bronlogica volgde, terwijl er in werkelijkheid extra instructies werden meegegeven.
Waarom Microsoft Copilot dit kan doen
Volgens Måløy loopt de keten via twee stappen die samen misgaan. Ten eerste gebruikt Copilot bronbestanden om een concept te maken: het leest de aangeleverde documenten om te bepalen wat relevant is. Ten tweede kan Copilot bij het schrijven instructies uit die bron verkeerd interpreteren als echte opdrachten.
In zijn test werkte het mechanisme door tot in de output. Niet alleen werden getallen beïnvloed; ook de instructies zelf kwamen terug in het nieuwe bestand. In de demonstratie werden financiële cijfers bijvoorbeeld gehalveerd, en de prompt werd in de tekst “meegenomen” op een manier die voor de gebruiker niet meteen zichtbaar was.
Niet zero-click en geen malware
Een belangrijk detail: dit is geen aanval die ongemerkt draait zonder handelingen van de gebruiker. Het vereist dat iemand een Copilot-draft of -edit-actie uitvoert. Daarnaast moet het kwaadaardige document in de context van het model terechtkomen.
Concreet beschrijft Måløy twee manieren waarop dat kan gebeuren: als bijlage die aan Copilot wordt aangeboden, of als bron die via Work IQ is geselecteerd in Microsoft 365 Copilot. Work IQ is de intelligentie-engine die bepaalt wat relevant is voor de taak.
Ook is er geen sprake van conventionele malware. De impact komt door manipulatie van de taal- en schrijflogica: Copilot verwerkt de instructies en neemt die vervolgens over in het resultaat.
Zo herhaalt de aanval zich bij volgende sessies
De exploit is niet alleen één keer “raak”. In het proof of concept werd een intern gegenereerd document als drager gebruikt voor een tweede Copilot-schrijfsessie. Daarin leidde het opnieuw uitvoeren van drafting of editing tot hetzelfde gedrag.
Dit betekent dat de instructies via documenttekst en Copilot’s eigen schrijfgedrag kunnen doorsijpelen. Zodra Copilot de instructies kopieert naar een nieuw, intern document, verdwijnt de oorspronkelijke bron uit de context van de volgende stap. Måløy ziet dat als een reden waarom het lastiger kan worden om de herkomst te achterhalen: de provenance trail raakt als het ware onderbroken.
Wat Microsoft heeft bevestigd en welke mitigaties zijn ingezet
Volgens Måløy bevestigde Microsoft het gerapporteerde gedrag op 31 maart. Daarna zouden twee mitigaties zijn uitgerold. De eerste zou het gebruik van de oorspronkelijke promptbewoording blokkeren. De tweede zou een onderliggende modelwijziging bevatten: een upgrade naar GPT-5.5.
Måløy stelt dat de volledige keten daarna nog functioneerde met aangepaste instructies op de volgende dag, toen GPT-5.6 werd gebruikt. Ook op 28 juli kon de aanval nog worden nagebootst. Zijn conclusie luidt daarom dat de kwetsbaarheidsklasse op het moment van publicatie nog te exploiteren is.
Waarom Word-informatie kan “doorlekken” naar het model
Een opvallende technische verklaring is dat Word kleur- en lettergrootte-informatie kan strippen voordat tekst naar het grote taalmodel wordt gestuurd. Daardoor blijven mogelijke instructies “wit-op-wit” of onopvallend in het document, maar zijn ze wel leesbaar voor het model.
Måløy beschrijft verder dat een deel van de payload het documentinhoudelijk veranderde, terwijl een ander deel Copilot instrueerde om de instructies te kopiëren en te verbergen. Daarbij werd de aanval gepresenteerd als iets als bron-tracking en leesbaarheidsvereisten.
Bescherming: wat kun je nu doen?
Er is geen melding dat de techniek al op grote schaal in het wild wordt misbruikt. Ook ontbreekt volgens Måløy de volledige payload in de disclosure, wat helpt om directe overname te beperken. Toch wijst hij op praktische maatregelen die je direct kunt toepassen.
- Behandel externe documenten als niet-vertrouwd.
- Bekijk bijlagen voordat je start met genereren of bewerken met Copilot.
- Controleer Copilot-gegenereerde of -aangepaste bestanden voordat je ze hergebruikt of deelt.
Daarnaast geeft Microsoft aan dat runtime safeguard-achtige mechanismen kunnen helpen tegen geïnjecteerde instructies vanuit “grounded content”. Måløy en Microsoft noemen ook classifier-gerelateerde blokkades tegen jailbreak en cross-prompt injection, al is niet duidelijk of dit in elk scenario beschikbaar is.
Verder rapporteert Defender for Office 365 mail-flow inspectie voor inkomende e-mail. Toch stelt Måløy dat er geen klantgerichte remediatie is die het probleem volledig oplost. Zijn redenering: het model moet de door de aanvaller gecontroleerde content verwerken om te beoordelen of die kwaadwillend is—dus die content participeert in de inspectie zelf.
Conclusie
Verborgen prompts in Word kunnen Microsoft Copilot for Word laten herschrijven op manieren die niet overeenkomen met de bedoeling van de gebruiker. De kern is dat Copilot broninstructies kan interpreteren als relevante opdracht, en die instructies vervolgens kan meenemen in nieuwe documenten.
Totdat de beveiliging volledig “afdekt”, blijft de beste verdediging menselijk én procesmatig: wees kritisch op bronbestanden, controleer output voordat je die vertrouwt, en behandel documenten van buiten je eigen omgeving als potentieel risicovol.
Bron: https://thehackernews.com/2026/07/microsoft-copilot-for-word-can-copy.html
